生产看板的第一任务是回答“用户是否受影响、影响在哪里、是否还在扩大”。把所有可用指标放进一个页面,只会增加认知负担。
第一屏只放关键判断
按服务展示流量、错误率、延迟分位数和饱和度,并显示 SLO 与当前错误预算。部署、配置变更和事故标记要叠加到时间轴。
保持维度一致
所有图表使用相同时间范围和环境变量。单位、颜色和阈值保持统一,红色只表示需要行动的异常,不要作为装饰色。
支持逐层下钻
第一层看业务与服务,第二层看依赖和实例,第三层链接到日志与 trace。使用 Data Link 带上时间范围和服务标签,减少重复输入。
避免常见陷阱
- Y 轴自动缩放让轻微波动看起来剧烈
- 平均延迟掩盖尾延迟
- 单值面板没有时间趋势和阈值解释
- 图表查询过重,事故时反而拖垮 Prometheus
发布检查
用正常、低流量、故障和无数据四种场景验证看板。无数据必须与零值区分,并显示数据更新时间。