监控盲区审计:找到“没有告警”的故障路径

通过依赖地图、故障假设和信号覆盖矩阵,系统检查监控缺口。

文章目录 · 4 节

监控完善不能用指标数量衡量。真正的问题是:关键用户路径的每一种主要失败模式,是否都有及时、可信、可行动的信号。

建立覆盖矩阵

按用户旅程列出入口、服务、队列、数据库和外部依赖,再为每个组件记录可用性、延迟、错误、饱和度和变更信号。

故障场景用户信号内部信号告警Runbook
DNS 解析失败黑盒失败DNS 返回码
队列积压任务延迟backlog age缺失
证书到期TLS 失败剩余天数

从历史事故反推

检查过去事故中第一个人工发现的信号。如果用户反馈早于监控,说明检测覆盖或阈值存在缺口。

主动制造小故障

在隔离环境停止依赖、注入延迟、填满磁盘或使证书失效,观察告警是否出现、是否路由正确、Runbook 是否有效。

定期清理

审计不仅增加监控,也要删除无人处理的告警和失效看板。每个关键告警都应有负责人、测试时间和最近一次验证结果。