← 回到旗艦系統

01 / FLAGSHIP SYSTEM

AI-SRE:把事故處理做成可治理的 AI 系統

不是讓 LLM 自由操作 production,而是把證據、推理、權限、核准與修復後驗證組成一條可觀測的閉環。

PUBLIC CASE STUDY / 數字均有專案測試或操作紀錄支撐,但適用範圍不同:23 是 13 個標準場景加 10 個複雜場景;$6.5→$2.5 是 nonprod 相近事件量下觀察到的每日成本原始值,不換算成百分比;27–30 秒只代表三次 complex rollback drill,不是通用 MTTR 或 SLA。

139AUTOMATED TESTS
2313 STANDARD + 10 COMPLEX CHAOS
$6.5→$2.5DAILY NONPROD AI COST / COMPARABLE VOLUME
27–30s3 COMPLEX ROLLBACK DRILLS

THE PROBLEM

自主不是先移除人,而是先讓每個決策都能被證明。

傳統告警流程把大量時間花在拼湊脈絡:最近部署了什麼、錯誤從哪裡開始、 哪些服務受影響、下一個唯讀查證動作是什麼。LLM 能加速理解,但它本身不是 production truth,也不應決定權限。

我把系統設計成 evidence-first pipeline。模型負責提出與排序假設; 真實狀態來自工具查證;能否執行則由 deterministic control plane、 hard denylist 與 human approval 決定。

SYSTEM ARCHITECTURE

從 alert 到 verified recovery 的六段式閉環

01Normalize

告警正規化、去重與事件分類

02Investigate

RCA、blast radius 與安全分析並行

03Verify

以唯讀工具交叉驗證模型提出的假設

04Govern

deterministic policy 決定允許、拒絕或升級

05Approve & Act

人工核准後,只執行範圍受限且可回復的動作

06Prove

post-check、完整 audit trail 與持續回歸測試

ENGINEERING PRINCIPLES

讓 AI 有用,也讓它知道哪裡不能越界。

01 / EVIDENCE

結論必須能回到訊號

RCA、blast radius 與建議都保留 citation;查不到就降 confidence, 而不是把流暢文字當成事實。

02 / GOVERNANCE

模型不決定權限

動作經 deterministic rules、簽章與 denylist 檢查;驗證失敗時 fail closed。

03 / HUMAN CONTROL

高風險變更保留明確核准

系統提供證據、影響範圍與 rollback plan,讓值班工程師做出有脈絡的 approve / reject。

04 / VERIFICATION

執行不是終點

每次 remediation 都有 bounded scope、post-check 與 audit trail,修復結果必須再次由系統狀態證明。

VALIDATION

用 chaos、對抗測試與成本數據驗證整個系統。

13

標準 chaos scenarios,持續驗證診斷、治理與 cleanup。

10

複雜全流程 scenarios,涵蓋執行、拒絕與恢復驗證。

0.90

受控架構比較中的整體 citation validity。

0

混合式架構在受控對抗案例中的 false-confidence。

139 項測試已在本次網站審核時重新執行並全數通過。Chaos、成本與恢復時間 來自特定 nonprod、離線或受控案例,用來驗證架構取捨,不代表所有事件、 服務或 production 環境都能得到相同結果。

MY ROLE

我負責把研究問題變成 production engineering。

  • 多代理調度與 evidence-grounded RCA 架構
  • deterministic policy、approval 與安全控制面
  • Kubernetes / GitOps remediation 與 post-check
  • chaos scenario、對抗案例與 regression framework
  • 可觀測性、成本分析與逐步 rollout

NEXT CASE STUDY

同一套安全思維,如何變成工程知識代理?

閱讀 RelayOps 案例 ↗