← AI FIELD NOTES

03 / AI OPS PLAYBOOK

讓 AI 參與維運,但不要讓它接管真相

LLM 擅長理解語言、連結脈絡與整理假設;系統狀態、權限與 production 變更,則應留在可驗證、可追蹤的工程控制面。

IAN JUANUPDATED 2026.07.268 MIN READ

DESIGN PRINCIPLE

把 LLM 放在理解層,把真相留在系統層。

一個可靠的 AI Ops 流程,不會把模型輸出直接當成 production 事實。它會保留原始告警、logs、deploy events 與 runbook 作為證據,讓模型負責摘要、分類與提出可查證的假設。

01 / EVIDENCEAlerts · Logs · Traces · Deploys

不可由模型改寫的原始訊號。

02 / REASONINGLLM triage · Summaries · Hypotheses

允許不確定,但必須引用證據。

03 / CONTROLPolicy · Approval · Automation

權限、可逆性與 audit trail 決定能做什麼。

MATURITY PATH

從唯讀輔助,逐步走向受控自動化

  1. LEVEL 1

    Summarize

    整理告警、時間線與影響,不產生任何變更。

  2. LEVEL 2

    Recommend

    依 runbook 建議唯讀查證與下一步,由人類執行。

  3. LEVEL 3

    Prepare

    產生變更計畫、指令與 rollback plan,等待明確核准。

  4. LEVEL 4

    Act within policy

    只對低風險、可逆、範圍受限的動作自動執行。

GUARDRAILS

上線前至少回答這七個問題

01

模型能讀到哪些資料?敏感資訊如何遮蔽?

02

每個結論能否追溯到原始證據?

03

哪些工具永遠唯讀?哪些動作需要核准?

04

操作失敗或答錯時,能否快速回復?

05

權限是否以最小範圍、短效 token 發放?

06

Prompt、模型、輸入與工具呼叫是否完整留痕?

07

如何用固定案例持續測試品質與安全退化?

LESSONS FROM SHIPPED SYSTEMS

把原則做成系統後,才看得到真正的取捨。

在 AI-SRE 與 RelayOps 的實作中,最有效的架構不是讓 agent 擁有最多自由,而是讓 deterministic prefetch、bounded investigation 與 deterministic governance 各自負責清楚的一段。

Evidence before confidence

引用不足就降 confidence;資料矛盾就列出 unknowns。

Read-only before remediation

先證明查得準,再以 policy、核准與 post-check 開放受限動作。

Deterministic safety

權限、denylist、簽章與 secret gate 不交給語言模型判斷。

Scenarios over demos

用 chaos、對抗案例與真實對話回歸,驗證安全與品質退化。

AI-SRE 深度案例 ↗RelayOps 深度案例 ↗

COPY-READY PROMPT

唯讀 Alert Triage Prompt

你是 production SRE 的唯讀 triage assistant。

任務:
根據 alerts、logs、deploy events 與 runbooks,提出事故初步判讀。

安全規則:
- 不執行指令、不呼叫變更 API、不宣稱已修復
- 只能引用提供的資料
- 將輸出分成 VERIFIED FACTS / HYPOTHESES / UNKNOWNS
- 每個 hypothesis 都要附支持證據、反證與下一個唯讀查證動作
- 涉及回滾、擴容、流量切換時,只能產生建議並標示需要人工核准

輸出:
Severity / Blast radius / Timeline / Top hypotheses / Read-only checks / Suggested owner / Stakeholder update

MEASURE THE SYSTEM

不要只量回答速度,也要量可靠性。

Evidence precision

關鍵敘述中,有多少能正確指回原始證據?

Triage acceptance

值班工程師接受或採用建議的比例。

Time to first useful hypothesis

從事故開始到第一個可驗證假設所需時間。

Unsafe action rate

被 policy 阻擋、越權或缺少核准的建議比例。