FIELD NOTES / 70
文章归档
按问题域检索生产实践、故障复盘与工具方法。
- 故障排查 1 分钟阅读
SRE 事故响应:从告警到复盘的指挥系统
建立一套清晰的事故分级、角色分工、沟通节奏与复盘机制,让团队在高压现场保持一致行动。
- 故障排查 1 分钟阅读
Linux Load Average 异常排查:别只盯着 CPU
从运行队列、不可中断睡眠和容器限额三个方向理解 Load Average,快速区分 CPU、I/O 与调度问题。
- 故障排查 1 分钟阅读
Linux 内存泄漏与 OOM:从现象定位到进程证据
区分页缓存、进程泄漏和 cgroup 限额,使用系统与进程级指标定位 OOM 的真实触发原因。
- 故障排查 1 分钟阅读
磁盘 I/O 延迟排查:从 iowait 找到慢设备
使用 iostat、pidstat 和块设备信息定位磁盘延迟,区分吞吐饱和、队列堆积与文件系统问题。
- 故障排查 1 分钟阅读
TCP 连接状态排查:TIME_WAIT、SYN_RECV 与端口耗尽
通过连接状态、监听队列和临时端口范围定位 TCP 建连失败,避免用错误的内核参数掩盖问题。
- 故障排查 1 分钟阅读
DNS 解析故障定位:从应用超时到权威记录
沿着本地缓存、递归解析、权威 DNS 和网络路径逐层定位解析失败与间歇性超时。
- 故障排查 1 分钟阅读
systemd 服务启动失败:依赖、权限与重启风暴排查
从 unit 状态、日志、依赖关系和安全限制定位 systemd 服务无法启动或反复重启的问题。
- 故障排查 1 分钟阅读
日志取证:如何还原一条可信的故障时间线
统一时间基准、关联请求标识并区分事实与推测,用日志建立可复核的事故证据链。
- SRE 1 分钟阅读
容量规划:用资源基线替代拍脑袋扩容
从业务驱动指标、资源利用率和增长趋势建立容量模型,为扩容窗口和安全余量提供依据。
- SRE 1 分钟阅读
On-call 交接:让值班上下文不在换班时丢失
建立简洁的值班交接格式,覆盖未解决告警、近期变更、风险窗口与升级联系人。
- Kubernetes 1 分钟阅读
Kubernetes API Server 503:控制面故障排查路径
从负载均衡、API Server 健康检查、etcd 延迟和聚合 API 逐层定位控制面 503。
- Kubernetes 1 分钟阅读
etcd 延迟治理:压缩、碎片整理与磁盘检查
通过 endpoint status、性能指标和存储配额识别 etcd 延迟,安全执行压缩与碎片整理。
- Kubernetes 1 分钟阅读
Kubernetes Node NotReady:从心跳到运行时逐层排查
检查 Node Condition、Lease、kubelet、容器运行时和节点资源,快速定位 NotReady 原因。
- Kubernetes 1 分钟阅读
Pod Pending:调度失败的证据链与处理顺序
从调度事件、资源请求、亲和性、污点和存储绑定定位 Pod 长时间 Pending。
- Kubernetes 1 分钟阅读
CoreDNS 解析异常:Kubernetes 集群内 DNS 排查
从 Pod DNS 配置、CoreDNS 日志、上游解析器和 ndots 行为定位集群内解析超时。
- Kubernetes 1 分钟阅读
Kubernetes Ingress 502/504:从入口到 Pod 的排查路径
区分 502 与 504 的含义,检查 Ingress 配置、Service Endpoint、协议和上游超时。
- Kubernetes 1 分钟阅读
ImagePullBackOff:镜像拉取失败的系统排查
从镜像名称、仓库认证、节点网络、架构和运行时缓存定位 ImagePullBackOff。
- Kubernetes 1 分钟阅读
PodDisruptionBudget:维护窗口中的可用性边界
正确设置 PDB,避免节点维护无法驱逐或驱逐后业务容量不足。
- Kubernetes 1 分钟阅读
Kubernetes 升级检查清单:从兼容性到回滚边界
覆盖 API 弃用、控制面、节点、插件和业务验证,降低 Kubernetes 升级风险。
- Kubernetes 1 分钟阅读
Kubernetes 多租户:命名空间不是完整安全边界
从身份、网络、资源、策略和节点隔离设计 Kubernetes 多租户边界。
- 可观测性 1 分钟阅读
SLI、SLO 与错误预算:把可靠性目标变成决策工具
从用户体验选择 SLI,设置可执行的 SLO,并用错误预算约束发布和稳定性投入。
- 可观测性 1 分钟阅读
Prometheus 高基数治理:找到最贵的标签组合
识别时间序列爆炸来源,治理无界标签并建立基数预算,避免 Prometheus 内存和查询性能恶化。
- 可观测性 1 分钟阅读
PromQL 告警规则设计:从指标异常到可行动告警
设计有持续时间、上下文和业务含义的 PromQL 告警,减少瞬时噪声与重复通知。
- 可观测性 1 分钟阅读
Alertmanager 路由、分组与抑制:控制告警风暴
通过稳定标签、分组窗口和抑制规则,把同一事故的告警收敛成可处理的通知。
- 可观测性 1 分钟阅读
Grafana 生产看板:围绕决策而不是指标堆叠
用用户体验、流量、错误、延迟和饱和度组织生产看板,让值班人员快速判断影响。
- 可观测性 1 分钟阅读
OpenTelemetry 链路追踪:生产落地的采样与上下文
统一 Trace Context,设计采样策略并控制属性基数,让链路追踪真正服务故障定位。
- 可观测性 1 分钟阅读
日志成本治理:保留诊断价值,删除无效噪声
通过分级、采样、字段治理和生命周期策略控制日志成本,同时保留事故所需证据。
- 可观测性 1 分钟阅读
Blackbox Exporter:从用户视角做 HTTP、TCP 与证书探测
使用黑盒探测验证外部可达性、DNS、TLS 与响应时间,补足服务内部指标的盲区。
- 可观测性 1 分钟阅读
多窗口错误预算燃烧率告警:兼顾速度与准确性
使用长短窗口组合检测错误预算快速消耗,减少固定错误率阈值带来的噪声。
- 可观测性 1 分钟阅读
监控盲区审计:找到“没有告警”的故障路径
通过依赖地图、故障假设和信号覆盖矩阵,系统检查监控缺口。
- DevOps 1 分钟阅读
GitOps 配置漂移:检测、归因与安全回收
识别集群实际状态与 Git 期望状态的差异,区分紧急操作、控制器默认值和真实漂移。
- DevOps 1 分钟阅读
Argo CD 渐进式同步:控制资源顺序与失败半径
使用 sync wave、健康检查与分批应用降低大规模 GitOps 发布风险。
- DevOps 1 分钟阅读
金丝雀发布:指标、分流与自动止损
设计可比较的基线与金丝雀指标,控制流量阶梯并在风险扩大前自动停止。
- DevOps 1 分钟阅读
可回滚发布设计:在上线前定义退出路径
从制品、配置、数据库和流量四个层面建立可靠回滚能力。
- DevOps 1 分钟阅读
Terraform State:远程锁、敏感数据与恢复策略
安全管理 Terraform State,避免并发写入、敏感信息泄露和状态损坏。
- 云原生安全 1 分钟阅读
生产密钥轮换:实现双密钥、灰度切换与可审计撤销
设计不中断服务的密钥轮换流程,覆盖生成、分发、切换、撤销和异常回滚。
- 云原生安全 1 分钟阅读
容器镜像瘦身:同时降低传输成本与攻击面
使用多阶段构建、固定基础镜像和依赖清理缩小镜像,并保持可调试性与供应链可追踪。
- DevOps 1 分钟阅读
CI 缓存与可复现构建:加速但不污染结果
设计稳定缓存键、依赖锁和制品校验,避免 CI 缓存引入难以复现的构建差异。
- 云原生安全 1 分钟阅读
Falco 运行时检测:从规则命中到可处理事件
使用 Falco 监控容器异常系统调用,控制规则噪声并与响应流程衔接。
- SRE 1 分钟阅读
备份恢复演练:用恢复结果验证 RPO 与 RTO
设计可重复的恢复演练,验证数据完整性、依赖顺序和业务恢复时间。
- AI Ops 1 分钟阅读
LLM 告警摘要 Prompt:从堆砌日志到行动建议
设计结构化告警摘要 Prompt,约束证据、置信度和下一步动作,降低模型幻觉。
- AI Ops 1 分钟阅读
事故知识库 RAG:让历史复盘真正可检索
把复盘、Runbook 和架构文档构建成带权限与时效性的事故 RAG 知识库。
- AI Ops 1 分钟阅读
本地运维模型评测:不要只比较聊天体验
用故障分类、命令安全、结构化输出和资源成本评测本地大模型的运维适用性。
- AI Ops 1 分钟阅读
AI Runbook 护栏:把建议与生产执行安全隔离
使用权限、参数校验、预演、审批和回滚机制控制 AI 驱动的运维动作。
- AI Ops 1 分钟阅读
LLM 应用可观测性:延迟、Token、质量与追踪
为 LLM 应用建立请求链路、Token 成本、检索质量和安全事件监控。
- 云原生安全 1 分钟阅读
运维数据脱敏:日志、Trace 与 AI 上下文的安全边界
识别运维数据中的凭据与个人信息,在采集、存储和模型调用前执行一致脱敏。
- SRE 1 分钟阅读
TLS 证书到期治理:发现、续签与生效验证
建立证书资产清单、分级到期告警和续签验证,避免自动续签成功但服务仍使用旧证书。
- 故障排查 1 分钟阅读
NTP 时钟漂移:那些看似随机的认证与日志故障
定位节点时钟漂移引发的证书、Token、分布式锁和日志乱序问题。
- SRE 1 分钟阅读
跨地域故障切换:流量、数据与依赖的一致演练
设计跨地域切换顺序,验证 DNS、数据复制、外部依赖和回切流程。
- SRE 1 分钟阅读
混沌工程演练:从假设到可控失败
用明确假设、影响半径和停止条件设计安全的混沌实验,验证系统真实韧性。
- AI Ops 4 分钟阅读
k8sgpt:用 AI 自动诊断 Kubernetes 集群问题
k8sgpt 是一个开源的 K8s 智能诊断工具,能自动分析集群问题并给出修复建议。本文介绍安装配置、与本地 LLM 集成,以及在生产环境的最佳实践。
- 云原生安全 5 分钟阅读
云原生供应链安全:SBOM、SLSA 与 Sigstore 实战
软件供应链攻击已成为头号安全威胁。本文介绍如何在 CI/CD 流水线中集成 SBOM 生成、SLSA 合规、Cosign 镜像签名,构建可信的软件交付链。
- AI Ops 6 分钟阅读
LLMOps 实践:生产环境大模型服务的全生命周期管理
随着 LLM 应用从 PoC 走向生产,如何稳定运行 AI 服务成为新挑战。本文介绍 LLMOps 核心实践,包括可观测性、Prompt 版本管理、成本控制和安全护栏。
- Kubernetes 4 分钟阅读
Kubernetes 1.33 新特性解析:原地扩缩容、Gateway API GA 与安全增强
Kubernetes 1.33 带来多项重磅 GA 特性,包括 In-place Pod Resize、Gateway API 正式稳定、User Namespace 增强。本文逐一解析对生产运维的影响。
- AI Ops 3 分钟阅读
DeepSeek R1 与 Qwen3:开源大模型重塑 AI 格局
2025 年开源大模型迎来爆发,DeepSeek R1 和 Qwen3 以极低成本对标顶级闭源模型。本文分析技术突破、运维工程师如何选型,以及私有化部署的实践建议。
- 云原生网络 6 分钟阅读
Cilium + Hubble 替换 Istio:服务网格的 eBPF 革命
Istio 的复杂性和性能开销让很多团队望而却步。基于 eBPF 的 Cilium Service Mesh 提供了更轻量的替代方案。本文对比两者差异,并给出从 Istio 迁移到 Cilium 的实战指南。
- 云原生网络 4 分钟阅读
eBPF 与 Cilium 实战:告别 iptables,拥抱云原生网络
eBPF 是 2025 年云原生最具影响力的底层技术。本文介绍 eBPF 原理、Cilium 部署实战,以及如何用 Hubble 实现 L7 级别的网络可观测性。
- AI Ops 9 分钟阅读
DeepSeek/Qwen 在 Kubernetes 上的生产级部署指南
如何在 Kubernetes 集群上稳定运行 DeepSeek R1 或 Qwen3 大模型?本文覆盖 GPU 资源调度、vLLM 推理引擎、自动扩缩容、监控告警的完整生产方案。
- AI Ops 6 分钟阅读
MCP 协议详解:给 AI Agent 装上标准接口
Model Context Protocol(MCP)是 Anthropic 推出的 AI 工具集成标准,本文深入解析其架构原理,并实战构建一个能操作 Kubernetes 集群的 MCP Server。
- AI Ops 5 分钟阅读
RAG 系统构建实践:给大模型接入私有知识库
从零构建 RAG(检索增强生成)系统,将内部文档、Runbook、Wiki 接入大模型,实现智能知识问答。
- Kubernetes 4 分钟阅读
Kubernetes 存储管理:PV、PVC 与 StorageClass 实战
深入理解 K8s 存储体系,掌握 PersistentVolume、PVC 动态供给、StorageClass 配置及常见存储方案选型。
- 自动化 5 分钟阅读
Shell 脚本自动化运维:从入门到实用
掌握运维常用 Shell 脚本技巧,包括日志分析、批量操作、定时任务、告警脚本等实用场景。
- Kubernetes 4 分钟阅读
Kubernetes HPA 与 VPA:自动扩缩容实战
深入讲解 K8s 水平扩缩容(HPA)和垂直扩缩容(VPA)的配置与调优,实现应用资源的自动化管理。
- AI Ops 5 分钟阅读
AI 辅助运维:用 LLM 自动化故障诊断工作流
探索如何将大语言模型集成到运维工作流中,实现告警自动分析、根因推断、修复建议生成,提升 MTTR。
- DevOps 4 分钟阅读
CI/CD 流水线设计:GitLab CI 最佳实践
从零设计一套生产级 GitLab CI/CD 流水线,涵盖代码检查、测试、构建、部署全流程,以及缓存优化和安全扫描。
- Kubernetes 3 分钟阅读
Kubernetes 网络策略:NetworkPolicy 实战指南
深入理解 K8s NetworkPolicy,通过实际案例掌握微服务间网络隔离、零信任网络的配置方法。
- AI Ops 3 分钟阅读
大模型私有化部署实践:Ollama + Open WebUI 完整指南
在本地或私有服务器上部署开源大模型,实现数据不出内网的 AI 能力,涵盖 Ollama 部署、模型管理和 WebUI 配置。
- 可观测性 4 分钟阅读
Prometheus + Grafana 监控体系从零搭建
手把手搭建基于 Prometheus 和 Grafana 的完整监控告警体系,覆盖指标采集、存储、可视化和告警配置。
- 故障排查 3 分钟阅读
Kubernetes 故障排查手册:Pod 异常状态全解析
系统梳理 K8s 中 Pod 各种异常状态的原因与解决方法,包括 CrashLoopBackOff、OOMKilled、Pending 等。
- 故障排查 2 分钟阅读
Linux 系统性能排查:从 CPU 到磁盘的完整方法论
系统性介绍 Linux 性能问题排查的思路与工具,涵盖 CPU、内存、磁盘 I/O、网络四个维度。
没有找到匹配文章。