ENGINEERING WORK / 2

项目与实践

从告警上下文到集群诊断,记录如何把重复劳动变成可验证的系统能力。

CASE 01
持续迭代

K8s 运维自动化工具集

面向 7×24 小时生产集群的诊断与观测工作流

一套完整的 Kubernetes 集群运维自动化工具,包含故障诊断、性能监控、日志聚合等功能。

Kubernetes自动化运维工具
DATE
TYPE
OPS TOOLING
CASE 02
概念验证

智能告警分析系统

聚合告警上下文,缩短根因定位路径

基于 AI 的运维告警分析系统,自动识别告警模式,提供故障根因分析和建议。

AI监控告警
DATE
TYPE
OPS TOOLING