监控完善不能用指标数量衡量。真正的问题是:关键用户路径的每一种主要失败模式,是否都有及时、可信、可行动的信号。
建立覆盖矩阵
按用户旅程列出入口、服务、队列、数据库和外部依赖,再为每个组件记录可用性、延迟、错误、饱和度和变更信号。
| 故障场景 | 用户信号 | 内部信号 | 告警 | Runbook |
|---|---|---|---|---|
| DNS 解析失败 | 黑盒失败 | DNS 返回码 | 有 | 有 |
| 队列积压 | 任务延迟 | backlog age | 有 | 缺失 |
| 证书到期 | TLS 失败 | 剩余天数 | 有 | 有 |
从历史事故反推
检查过去事故中第一个人工发现的信号。如果用户反馈早于监控,说明检测覆盖或阈值存在缺口。
主动制造小故障
在隔离环境停止依赖、注入延迟、填满磁盘或使证书失效,观察告警是否出现、是否路由正确、Runbook 是否有效。
定期清理
审计不仅增加监控,也要删除无人处理的告警和失效看板。每个关键告警都应有负责人、测试时间和最近一次验证结果。