SRE 事故响应:从告警到复盘的指挥系统
建立一套清晰的事故分级、角色分工、沟通节奏与复盘机制,让团队在高压现场保持一致行动。
从运行队列、不可中断睡眠和容器限额三个方向理解 Load Average,快速区分 CPU、I/O 与调度问题。
区分页缓存、进程泄漏和 cgroup 限额,使用系统与进程级指标定位 OOM 的真实触发原因。
使用 iostat、pidstat 和块设备信息定位磁盘延迟,区分吞吐饱和、队列堆积与文件系统问题。
通过连接状态、监听队列和临时端口范围定位 TCP 建连失败,避免用错误的内核参数掩盖问题。
沿着本地缓存、递归解析、权威 DNS 和网络路径逐层定位解析失败与间歇性超时。
KNOWLEDGE INDEX
从集群、网络、可观测性到 AI Ops,沿着真实工作流组织内容。