CASE 01
持续迭代
K8s 运维自动化工具集
面向 7×24 小时生产集群的诊断与观测工作流
一套完整的 Kubernetes 集群运维自动化工具,包含故障诊断、性能监控、日志聚合等功能。
- DATE
- TYPE
- OPS TOOLING
案例归档
ENGINEERING WORK / 2
从告警上下文到集群诊断,记录如何把重复劳动变成可验证的系统能力。
面向 7×24 小时生产集群的诊断与观测工作流
一套完整的 Kubernetes 集群运维自动化工具,包含故障诊断、性能监控、日志聚合等功能。
聚合告警上下文,缩短根因定位路径
基于 AI 的运维告警分析系统,自动识别告警模式,提供故障根因分析和建议。