SRE 事故响应:从告警到复盘的指挥系统
建立一套清晰的事故分级、角色分工、沟通节奏与复盘机制,让团队在高压现场保持一致行动。
设备插件、驱动与容器运行时决定 GPU 工作负载能否运行。按节点资源、插件日志、驱动状态与显存占用逐层定位调度失败和显存泄漏。
journald 日志无节制增长会快速耗尽 /var 分区。用真空清理应急止损,再通过 SystemMaxUse、速率限制与集中转发建立可持续的日志策略。
Kubernetes 1.34(O' WaW)将 DRA 与 KMS v2 带到 GA,同时带来卷扩容失败恢复、AdminNetworkPolicy 与审计注解等值得运维关注的特性。
大 Key 造成阻塞与内存压力,热 Key 造成请求倾斜。用慢日志、bigkeys 扫描与客户端统计定位问题,并给出拆分、压缩与本地缓存的治理路径。
记录 Proxmox VE 上 Intel X710-DA2 拒绝第三方 SFP+ 模块的排障过程,覆盖日志定位、模块兼容性检查、NVM 变更风险与上线验证。
KNOWLEDGE INDEX
从集群、网络、可观测性到 AI Ops,沿着真实工作流组织内容。