THE PROBLEM
自主不是先移除人,而是先讓每個決策都能被證明。
傳統告警流程把大量時間花在拼湊脈絡:最近部署了什麼、錯誤從哪裡開始、 哪些服務受影響、下一個唯讀查證動作是什麼。LLM 能加速理解,但它本身不是 production truth,也不應決定權限。
我把系統設計成 evidence-first pipeline。模型負責提出與排序假設; 真實狀態來自工具查證;能否執行則由 deterministic control plane、 hard denylist 與 human approval 決定。
SYSTEM ARCHITECTURE
從 alert 到 verified recovery 的六段式閉環
告警正規化、去重與事件分類
RCA、blast radius 與安全分析並行
以唯讀工具交叉驗證模型提出的假設
deterministic policy 決定允許、拒絕或升級
人工核准後,只執行範圍受限且可回復的動作
post-check、完整 audit trail 與持續回歸測試
ENGINEERING PRINCIPLES
讓 AI 有用,也讓它知道哪裡不能越界。
結論必須能回到訊號
RCA、blast radius 與建議都保留 citation;查不到就降 confidence, 而不是把流暢文字當成事實。
模型不決定權限
動作經 deterministic rules、簽章與 denylist 檢查;驗證失敗時 fail closed。
高風險變更保留明確核准
系統提供證據、影響範圍與 rollback plan,讓值班工程師做出有脈絡的 approve / reject。
執行不是終點
每次 remediation 都有 bounded scope、post-check 與 audit trail,修復結果必須再次由系統狀態證明。
VALIDATION
用 chaos、對抗測試與成本數據驗證整個系統。
標準 chaos scenarios,持續驗證診斷、治理與 cleanup。
複雜全流程 scenarios,涵蓋執行、拒絕與恢復驗證。
受控架構比較中的整體 citation validity。
混合式架構在受控對抗案例中的 false-confidence。
139 項測試已在本次網站審核時重新執行並全數通過。Chaos、成本與恢復時間 來自特定 nonprod、離線或受控案例,用來驗證架構取捨,不代表所有事件、 服務或 production 環境都能得到相同結果。
MY ROLE
我負責把研究問題變成 production engineering。
- 多代理調度與 evidence-grounded RCA 架構
- deterministic policy、approval 與安全控制面
- Kubernetes / GitOps remediation 與 post-check
- chaos scenario、對抗案例與 regression framework
- 可觀測性、成本分析與逐步 rollout
NEXT CASE STUDY