深色模式
SLO 在事故中作用
摘要:事故时最难的不是修,而是“修到什么程度、投入多少人力”。错误预算提供了客观标尺:预算还充足可以稳妥处理,预算快耗尽就要 break-glass 不惜代价止损。
适用环境
- 已定义 SLO 并能量化剩余预算
- 有事故响应/沟通机制
操作步骤
1. 事故初期:用预算定响应级别
text
剩余预算 > 50% → 按常规流程处理,不熬夜
剩余预算 < 20% → 升 Sev1,全员投入,启动止损
预算 = 0 → 触发错误预算政策(冻结发布、专项攻关)1
2
3
2
3
2. 沟通时用预算说话
text
“本次故障已消耗本月 60% 错误预算,建议立即降级非核心功能保主链路。”
—— 比“很严重”更有说服力,也更易获得业务方授权。1
2
2
3. 止损决策:保护预算
text
当修复成本高、影响可控时,优先“降级/限流”保住剩余预算,
而非硬扛全量恢复。1
2
2
4. 事后复盘闭环
text
事故复盘必须更新 SLO 文档:根因、预算消耗、改进项、owner(见 SLO 报表与复盘)1
DANGER
事故中拿“老板说必须修好”压人而无视预算,会过度投入却没保住真正重要的链路;预算是沟通取舍的共同语言。
验证
text
复盘时核对:事故消耗预算数与监控记录是否一致,决策是否基于预算而非拍脑袋1
常见坑
WARNING
- 事故中只看故障不看预算,容易在低影响故障上过度投入,高影响反而资源不足。
- 复盘不把预算消耗归档,下次同类事故无历史参照,重复交学费。