系统与故障
Linux 性能、资源瓶颈、生产故障复盘与可执行 Runbook。
ABOUT THIS SITE
一个专注于系统运维、SRE 与 AI Ops 的长期技术记录。
这里写的不是标准答案,而是生产环境里真正做过的判断:怎样缩短定位路径,怎样把告警变得可行动,怎样让系统在变化中保持可解释。
Linux 性能、资源瓶颈、生产故障复盘与可执行 Runbook。
Kubernetes、网络、存储、调度与集群生命周期管理。
指标、日志、追踪与告警策略,以及如何降低无效信号。
本地模型、RAG、智能诊断和大模型在运维工作流中的边界。
EDITORIAL METHOD
先保存现场、时间线和环境差异。
用指标与日志排除不成立的假设。
把一次修复整理成可复用的决策路径。
KEEP IN SYNC