服务内部指标正常,不代表用户真的能访问。黑盒探测从外部发起请求,可以覆盖 DNS、路由、TLS、负载均衡和应用响应的完整路径。
定义探测模块
modules:
http_2xx:
prober: http
timeout: 5s
http:
preferred_ip_protocol: ip4
valid_status_codes: [200]
探测点应分布在用户所在网络和关键地域。只在集群内部探测,无法发现公网 DNS 或边缘网络问题。
关注阶段耗时
除 probe_success 外,还要观察 DNS、连接、TLS 和处理各阶段耗时。证书到期时间、TLS 版本和重定向链也是重要信号。
避免误报
探测 URL 应稳定、低成本且不依赖登录。单次失败不立即分页,结合多个探测点和持续时间判断。探测系统本身也需要独立健康监控。
与白盒指标关联
黑盒失败而白盒正常时,优先检查入口路径;两者都失败则进入服务和依赖排查。看板上应把两类信号放在同一时间轴。