03 / AI OPS PLAYBOOK
讓 AI 參與維運,但不要讓它接管真相
LLM 擅長理解語言、連結脈絡與整理假設;系統狀態、權限與 production 變更,則應留在可驗證、可追蹤的工程控制面。
DESIGN PRINCIPLE
把 LLM 放在理解層,把真相留在系統層。
一個可靠的 AI Ops 流程,不會把模型輸出直接當成 production 事實。它會保留原始告警、logs、deploy events 與 runbook 作為證據,讓模型負責摘要、分類與提出可查證的假設。
不可由模型改寫的原始訊號。
允許不確定,但必須引用證據。
權限、可逆性與 audit trail 決定能做什麼。
MATURITY PATH
從唯讀輔助,逐步走向受控自動化
- LEVEL 1
Summarize
整理告警、時間線與影響,不產生任何變更。
- LEVEL 2
Recommend
依 runbook 建議唯讀查證與下一步,由人類執行。
- LEVEL 3
Prepare
產生變更計畫、指令與 rollback plan,等待明確核准。
- LEVEL 4
Act within policy
只對低風險、可逆、範圍受限的動作自動執行。
GUARDRAILS
上線前至少回答這七個問題
模型能讀到哪些資料?敏感資訊如何遮蔽?
每個結論能否追溯到原始證據?
哪些工具永遠唯讀?哪些動作需要核准?
操作失敗或答錯時,能否快速回復?
權限是否以最小範圍、短效 token 發放?
Prompt、模型、輸入與工具呼叫是否完整留痕?
如何用固定案例持續測試品質與安全退化?
LESSONS FROM SHIPPED SYSTEMS
把原則做成系統後,才看得到真正的取捨。
在 AI-SRE 與 RelayOps 的實作中,最有效的架構不是讓 agent 擁有最多自由,而是讓 deterministic prefetch、bounded investigation 與 deterministic governance 各自負責清楚的一段。
引用不足就降 confidence;資料矛盾就列出 unknowns。
先證明查得準,再以 policy、核准與 post-check 開放受限動作。
權限、denylist、簽章與 secret gate 不交給語言模型判斷。
用 chaos、對抗案例與真實對話回歸,驗證安全與品質退化。
COPY-READY PROMPT
唯讀 Alert Triage Prompt
你是 production SRE 的唯讀 triage assistant。 任務: 根據 alerts、logs、deploy events 與 runbooks,提出事故初步判讀。 安全規則: - 不執行指令、不呼叫變更 API、不宣稱已修復 - 只能引用提供的資料 - 將輸出分成 VERIFIED FACTS / HYPOTHESES / UNKNOWNS - 每個 hypothesis 都要附支持證據、反證與下一個唯讀查證動作 - 涉及回滾、擴容、流量切換時,只能產生建議並標示需要人工核准 輸出: Severity / Blast radius / Timeline / Top hypotheses / Read-only checks / Suggested owner / Stakeholder update
MEASURE THE SYSTEM
不要只量回答速度,也要量可靠性。
關鍵敘述中,有多少能正確指回原始證據?
值班工程師接受或採用建議的比例。
從事故開始到第一個可驗證假設所需時間。
被 policy 阻擋、越權或缺少核准的建議比例。