ABOUT THIS SITE

关于这本运维笔记

一个专注于系统运维、SRE 与 AI Ops 的长期技术记录。

这里写的不是标准答案,而是生产环境里真正做过的判断:怎样缩短定位路径,怎样把告警变得可行动,怎样让系统在变化中保持可解释。

关注领域

FOCUS AREAS
01

系统与故障

Linux 性能、资源瓶颈、生产故障复盘与可执行 Runbook。

02

云原生平台

Kubernetes、网络、存储、调度与集群生命周期管理。

03

可观测性

指标、日志、追踪与告警策略,以及如何降低无效信号。

04

AI Ops

本地模型、RAG、智能诊断和大模型在运维工作流中的边界。

EDITORIAL METHOD

每篇内容都从一个具体问题开始

  1. INPUT复现现象

    先保存现场、时间线和环境差异。

  2. TRACE建立证据链

    用指标与日志排除不成立的假设。

  3. OUTPUT沉淀方法

    把一次修复整理成可复用的决策路径。

KEEP IN SYNC

从最新记录继续