FIELD NOTES / 121
文章归档
按问题域检索生产实践、故障复盘与工具方法。
- 故障排查9 分钟阅读
Intel X710 SFP+ Unsupported Module 排障:从 LED 不亮到 NVM 解锁
记录 Proxmox VE 上 Intel X710-DA2 拒绝第三方 SFP+ 模块的排障过程,覆盖日志定位、模块兼容性检查、NVM 变更风险与上线验证。
- 故障排查1 分钟阅读
SRE 事故响应:从告警到复盘的指挥系统
建立一套清晰的事故分级、角色分工、沟通节奏与复盘机制,让团队在高压现场保持一致行动。
- 故障排查1 分钟阅读
Linux Load Average 异常排查:别只盯着 CPU
从运行队列、不可中断睡眠和容器限额三个方向理解 Load Average,快速区分 CPU、I/O 与调度问题。
- 故障排查1 分钟阅读
Linux 内存泄漏与 OOM:从现象定位到进程证据
区分页缓存、进程泄漏和 cgroup 限额,使用系统与进程级指标定位 OOM 的真实触发原因。
- 故障排查1 分钟阅读
磁盘 I/O 延迟排查:从 iowait 找到慢设备
使用 iostat、pidstat 和块设备信息定位磁盘延迟,区分吞吐饱和、队列堆积与文件系统问题。
- 故障排查1 分钟阅读
TCP 连接状态排查:TIME_WAIT、SYN_RECV 与端口耗尽
通过连接状态、监听队列和临时端口范围定位 TCP 建连失败,避免用错误的内核参数掩盖问题。
- 故障排查1 分钟阅读
DNS 解析故障定位:从应用超时到权威记录
沿着本地缓存、递归解析、权威 DNS 和网络路径逐层定位解析失败与间歇性超时。
- 故障排查1 分钟阅读
systemd 服务启动失败:依赖、权限与重启风暴排查
从 unit 状态、日志、依赖关系和安全限制定位 systemd 服务无法启动或反复重启的问题。
- 故障排查1 分钟阅读
日志取证:如何还原一条可信的故障时间线
统一时间基准、关联请求标识并区分事实与推测,用日志建立可复核的事故证据链。
- SRE1 分钟阅读
容量规划:用资源基线替代拍脑袋扩容
从业务驱动指标、资源利用率和增长趋势建立容量模型,为扩容窗口和安全余量提供依据。
- SRE1 分钟阅读
On-call 交接:让值班上下文不在换班时丢失
建立简洁的值班交接格式,覆盖未解决告警、近期变更、风险窗口与升级联系人。
- Kubernetes1 分钟阅读
Kubernetes API Server 503:控制面故障排查路径
从负载均衡、API Server 健康检查、etcd 延迟和聚合 API 逐层定位控制面 503。
- Kubernetes1 分钟阅读
etcd 延迟治理:压缩、碎片整理与磁盘检查
通过 endpoint status、性能指标和存储配额识别 etcd 延迟,安全执行压缩与碎片整理。
- Kubernetes1 分钟阅读
Kubernetes Node NotReady:从心跳到运行时逐层排查
检查 Node Condition、Lease、kubelet、容器运行时和节点资源,快速定位 NotReady 原因。
- Kubernetes1 分钟阅读
Pod Pending:调度失败的证据链与处理顺序
从调度事件、资源请求、亲和性、污点和存储绑定定位 Pod 长时间 Pending。
- Kubernetes1 分钟阅读
CoreDNS 解析异常:Kubernetes 集群内 DNS 排查
从 Pod DNS 配置、CoreDNS 日志、上游解析器和 ndots 行为定位集群内解析超时。
- Kubernetes1 分钟阅读
Kubernetes Ingress 502/504:从入口到 Pod 的排查路径
区分 502 与 504 的含义,检查 Ingress 配置、Service Endpoint、协议和上游超时。
- Kubernetes1 分钟阅读
ImagePullBackOff:镜像拉取失败的系统排查
从镜像名称、仓库认证、节点网络、架构和运行时缓存定位 ImagePullBackOff。
- Kubernetes1 分钟阅读
PodDisruptionBudget:维护窗口中的可用性边界
正确设置 PDB,避免节点维护无法驱逐或驱逐后业务容量不足。
- Kubernetes1 分钟阅读
Kubernetes 升级检查清单:从兼容性到回滚边界
覆盖 API 弃用、控制面、节点、插件和业务验证,降低 Kubernetes 升级风险。
- Kubernetes1 分钟阅读
Kubernetes 多租户:命名空间不是完整安全边界
从身份、网络、资源、策略和节点隔离设计 Kubernetes 多租户边界。
- 可观测性1 分钟阅读
SLI、SLO 与错误预算:把可靠性目标变成决策工具
从用户体验选择 SLI,设置可执行的 SLO,并用错误预算约束发布和稳定性投入。
- 可观测性1 分钟阅读
Prometheus 高基数治理:找到最贵的标签组合
识别时间序列爆炸来源,治理无界标签并建立基数预算,避免 Prometheus 内存和查询性能恶化。
- 可观测性1 分钟阅读
PromQL 告警规则设计:从指标异常到可行动告警
设计有持续时间、上下文和业务含义的 PromQL 告警,减少瞬时噪声与重复通知。
- 可观测性1 分钟阅读
Alertmanager 路由、分组与抑制:控制告警风暴
通过稳定标签、分组窗口和抑制规则,把同一事故的告警收敛成可处理的通知。
- 可观测性1 分钟阅读
Grafana 生产看板:围绕决策而不是指标堆叠
用用户体验、流量、错误、延迟和饱和度组织生产看板,让值班人员快速判断影响。
- 可观测性1 分钟阅读
OpenTelemetry 链路追踪:生产落地的采样与上下文
统一 Trace Context,设计采样策略并控制属性基数,让链路追踪真正服务故障定位。
- 可观测性1 分钟阅读
日志成本治理:保留诊断价值,删除无效噪声
通过分级、采样、字段治理和生命周期策略控制日志成本,同时保留事故所需证据。
- 可观测性1 分钟阅读
Blackbox Exporter:从用户视角做 HTTP、TCP 与证书探测
使用黑盒探测验证外部可达性、DNS、TLS 与响应时间,补足服务内部指标的盲区。
- 可观测性1 分钟阅读
多窗口错误预算燃烧率告警:兼顾速度与准确性
使用长短窗口组合检测错误预算快速消耗,减少固定错误率阈值带来的噪声。
- 可观测性1 分钟阅读
监控盲区审计:找到“没有告警”的故障路径
通过依赖地图、故障假设和信号覆盖矩阵,系统检查监控缺口。
- DevOps1 分钟阅读
GitOps 配置漂移:检测、归因与安全回收
识别集群实际状态与 Git 期望状态的差异,区分紧急操作、控制器默认值和真实漂移。
- DevOps1 分钟阅读
Argo CD 渐进式同步:控制资源顺序与失败半径
使用 sync wave、健康检查与分批应用降低大规模 GitOps 发布风险。
- DevOps1 分钟阅读
金丝雀发布:指标、分流与自动止损
设计可比较的基线与金丝雀指标,控制流量阶梯并在风险扩大前自动停止。
- DevOps1 分钟阅读
可回滚发布设计:在上线前定义退出路径
从制品、配置、数据库和流量四个层面建立可靠回滚能力。
- DevOps1 分钟阅读
Terraform State:远程锁、敏感数据与恢复策略
安全管理 Terraform State,避免并发写入、敏感信息泄露和状态损坏。
- 云原生安全1 分钟阅读
生产密钥轮换:实现双密钥、灰度切换与可审计撤销
设计不中断服务的密钥轮换流程,覆盖生成、分发、切换、撤销和异常回滚。
- 云原生安全1 分钟阅读
容器镜像瘦身:同时降低传输成本与攻击面
使用多阶段构建、固定基础镜像和依赖清理缩小镜像,并保持可调试性与供应链可追踪。
- DevOps1 分钟阅读
CI 缓存与可复现构建:加速但不污染结果
设计稳定缓存键、依赖锁和制品校验,避免 CI 缓存引入难以复现的构建差异。
- 云原生安全1 分钟阅读
Falco 运行时检测:从规则命中到可处理事件
使用 Falco 监控容器异常系统调用,控制规则噪声并与响应流程衔接。
- SRE1 分钟阅读
备份恢复演练:用恢复结果验证 RPO 与 RTO
设计可重复的恢复演练,验证数据完整性、依赖顺序和业务恢复时间。
- AI Ops1 分钟阅读
LLM 告警摘要 Prompt:从堆砌日志到行动建议
设计结构化告警摘要 Prompt,约束证据、置信度和下一步动作,降低模型幻觉。
- AI Ops1 分钟阅读
事故知识库 RAG:让历史复盘真正可检索
把复盘、Runbook 和架构文档构建成带权限与时效性的事故 RAG 知识库。
- AI Ops1 分钟阅读
本地运维模型评测:不要只比较聊天体验
用故障分类、命令安全、结构化输出和资源成本评测本地大模型的运维适用性。
- AI Ops1 分钟阅读
AI Runbook 护栏:把建议与生产执行安全隔离
使用权限、参数校验、预演、审批和回滚机制控制 AI 驱动的运维动作。
- AI Ops1 分钟阅读
LLM 应用可观测性:延迟、Token、质量与追踪
为 LLM 应用建立请求链路、Token 成本、检索质量和安全事件监控。
- 云原生安全1 分钟阅读
运维数据脱敏:日志、Trace 与 AI 上下文的安全边界
识别运维数据中的凭据与个人信息,在采集、存储和模型调用前执行一致脱敏。
- SRE1 分钟阅读
TLS 证书到期治理:发现、续签与生效验证
建立证书资产清单、分级到期告警和续签验证,避免自动续签成功但服务仍使用旧证书。
- 故障排查1 分钟阅读
NTP 时钟漂移:那些看似随机的认证与日志故障
定位节点时钟漂移引发的证书、Token、分布式锁和日志乱序问题。
- SRE1 分钟阅读
跨地域故障切换:流量、数据与依赖的一致演练
设计跨地域切换顺序,验证 DNS、数据复制、外部依赖和回切流程。
- SRE1 分钟阅读
混沌工程演练:从假设到可控失败
用明确假设、影响半径和停止条件设计安全的混沌实验,验证系统真实韧性。
- 故障排查1 分钟阅读
Linux CPU 异常:区分 steal、softirq 与上下文切换
用 mpstat、vmstat 和 perf 拆解虚拟化争抢、网络软中断与调度开销,避免把所有 CPU 高峰都归因于业务代码。
- 故障排查1 分钟阅读
文件描述符耗尽排查:从 Too many open files 找到泄漏点
系统化检查进程、用户与内核三层文件描述符限制,并定位连接或文件句柄泄漏。
- 故障排查1 分钟阅读
磁盘还有空间却无法写入:inode 耗尽排查
识别 inode 用尽、定位小文件热点,并设计兼顾恢复速度与长期治理的处理方案。
- 故障排查1 分钟阅读
僵尸进程与 fork 失败:从进程表定位父进程责任
解释僵尸进程为何出现,如何定位未回收子进程的父进程,以及 fork 失败时应检查的系统限制。
- 故障排查1 分钟阅读
Kernel soft lockup 排查:识别长时间占用 CPU 的内核路径
从内核日志、堆栈和系统压力判断 soft lockup 的触发源,并给出生产环境的稳妥处置顺序。
- 故障排查1 分钟阅读
MTU 不一致排查:能连通却传不动大包
通过禁止分片探测、路径 MTU 与隧道开销分析,定位 VPN、容器网络和云网络中的黑洞问题。
- 故障排查1 分钟阅读
conntrack 表耗尽:连接正常建立前为何就被丢弃
定位 nf_conntrack 表容量、连接状态和哈希压力,处理高并发网络中的新连接丢包。
- 故障排查1 分钟阅读
BGP 路由抖动排查:从邻居状态到前缀变更
通过会话日志、前缀更新和链路指标区分邻居重置、策略变更与底层网络不稳定。
- 故障排查1 分钟阅读
Linux 丢包定位:从网卡到应用逐层缩小范围
结合 ethtool、内核统计、qdisc 与抓包判断丢包发生在物理层、协议栈、防火墙还是应用队列。
- 故障排查1 分钟阅读
JVM GC 停顿排查:从日志判断内存压力与回收效率
利用 GC 日志、堆占用和分配速率区分正常停顿、对象晋升、内存泄漏与堆外压力。
- Kubernetes2 分钟阅读
Kubernetes RBAC Forbidden 排查:确认谁在访问什么
从请求身份、资源作用域和角色绑定三方面定位 Forbidden,并用最小权限原则完成修复。
- Kubernetes2 分钟阅读
Admission Webhook 故障:API 写请求为何集体超时
从 webhook 配置、Service 端点、TLS 与失败策略定位 Kubernetes 准入链路故障。
- Kubernetes2 分钟阅读
CRD 资源被 Finalizer 卡住:安全解除删除阻塞
理解 Kubernetes Finalizer 的清理语义,定位控制器故障并避免强删造成外部资源泄漏。
- Kubernetes1 分钟阅读
StatefulSet 滚动发布:按顺序升级有状态服务
解释 OrderedReady、partition 与健康检查的配合方式,让数据库和队列升级可观察、可暂停、可回退。
- Kubernetes2 分钟阅读
PVC 挂载失败排查:从绑定到节点挂载逐层定位
区分 PVC Pending、Attach 失败与 Mount 失败,检查 StorageClass、CSI、拓扑和文件系统。
- Kubernetes2 分钟阅读
kube-proxy 与 IPVS 故障:Service 有地址却无法访问
检查 Service、EndpointSlice、IPVS 规则和 conntrack,定位 Kubernetes 服务转发链路异常。
- Kubernetes2 分钟阅读
NetworkPolicy 调试:用最小测试矩阵定位拒绝规则
从 CNI 能力、标签选择器和入出站方向验证网络策略,减少“规则看起来正确但仍不通”的问题。
- Kubernetes2 分钟阅读
HPA 不扩容排查:指标、请求值与伸缩行为
检查 Metrics API、资源 requests、目标计算和 stabilization window,定位 HPA 不动作或反复抖动。
- Kubernetes2 分钟阅读
Cluster Autoscaler 不扩节点:从不可调度原因开始
分析 Pending Pod、节点组配置、调度约束与云配额,定位集群自动扩容未触发或扩容失败。
- Kubernetes1 分钟阅读
Namespace 长期 Terminating:发现残留资源与 API 故障
检查命名空间条件、不可用 APIService 和资源 finalizer,安全处理 Kubernetes 命名空间删除阻塞。
- 可观测性1 分钟阅读
RED 与 USE 方法:为服务和资源建立排障入口
用 RED 观察请求体验,用 USE 检查资源瓶颈,并把两套方法连接成可执行的故障定位路径。
- 可观测性1 分钟阅读
指标命名规范:让 Prometheus 数据可读、可聚合
规范指标前缀、单位、类型和标签,避免命名歧义与高基数给长期运维留下成本。
- 可观测性1 分钟阅读
Prometheus Recording Rules:用预计算稳定复杂查询
设计记录规则的命名、聚合层级和评估周期,降低仪表盘与告警的实时查询成本。
- 可观测性2 分钟阅读
Prometheus Federation 与 Remote Write:如何选择跨集群汇聚
比较联邦查询与远程写入的数据流、可靠性和成本,设计多集群监控的分层架构。
- 可观测性1 分钟阅读
链路追踪采样:在诊断价值与成本之间取平衡
比较头部采样与尾部采样,按错误、延迟和业务属性保留高价值 Trace,同时控制数据量。
- 可观测性1 分钟阅读
日志解析管道设计:从原始文本到可靠字段
规范结构化日志、解析失败处理、时间戳与字段治理,让日志既可查询又不因格式漂移丢失。
- 可观测性1 分钟阅读
Synthetic Monitoring:用主动探测覆盖真实用户之前
设计分层合成监控,从 DNS、TLS、HTTP 到关键业务流程,控制探测频率与误报。
- 可观测性1 分钟阅读
事件关联:把告警、变更与拓扑串成故障时间线
用统一时间、实体标识和因果约束关联多源事件,降低告警风暴中的人工筛选成本。
- 可观测性1 分钟阅读
可观测数据保留策略:按诊断价值分配成本
为指标、日志和链路设计热温冷分层、降采样与删除策略,在合规前提下控制长期存储。
- SRE1 分钟阅读
Runbook 质量评审:确保值班人员真的能执行
从触发条件、权限、验证和回滚评审运维手册,并通过演练发现过期命令与隐含知识。
- DevOps1 分钟阅读
Platform Engineering Golden Path:把最佳实践做成默认路径
围绕服务模板、自助能力和反馈指标设计 Golden Path,让团队更快交付而不牺牲安全与可运维性。
- DevOps2 分钟阅读
Helm 发布与回滚:在模板之外管理变更风险
通过 dry-run、原子升级、历史记录和数据兼容约束,让 Helm 发布具备可验证的回滚路径。
- DevOps1 分钟阅读
Kustomize Overlay 管理:控制环境差异而不复制清单
通过 base、components、patches 和构建校验组织 Kubernetes 环境配置,减少 overlay 漂移。
- 云原生安全1 分钟阅读
OPA Policy as Code:让合规检查可测试、可灰度
设计可解释的 Rego 策略、单元测试和审计模式,把安全要求安全地接入 CI 与准入控制。
- DevOps1 分钟阅读
Feature Flag 治理:让开关成为短期控制面
规范功能开关的类型、生命周期、权限与降级行为,避免长期旗标堆积形成隐藏配置系统。
- DevOps1 分钟阅读
数据库零停机迁移:用 Expand and Contract 控制兼容窗口
将 schema 变更拆成扩展、回填、切换与收缩阶段,保证新旧应用版本可并行运行和安全回退。
- 故障排查1 分钟阅读
消息队列积压处理:先判断生产突增还是消费退化
通过入队速率、消费速率、消息年龄和失败分布诊断积压,并安全提升消费能力。
- Kubernetes1 分钟阅读
Kubernetes CronJob 可靠性:避免漏跑、重跑与堆积
配置并发策略、截止时间、时区和幂等性,让周期任务在控制器延迟与故障恢复后仍可预测。
- DevOps1 分钟阅读
蓝绿发布:把流量切换与版本部署分开
设计双环境部署、预热验证、原子切流和回退窗口,处理数据库与长连接等共享状态风险。
- DevOps1 分钟阅读
依赖自动升级:从机器人 PR 到可控合并
通过分组、风险分级、锁文件校验和渐进发布,让依赖更新持续发生而不制造审查噪声。
- 云原生安全1 分钟阅读
Kubernetes Audit Log:记录谁对集群做了什么
设计审计策略、阶段与保留链路,在控制数据量的同时覆盖高风险 API 操作。
- 云原生安全1 分钟阅读
ServiceAccount Token 安全:缩短寿命并限制使用边界
使用投射令牌、最小 RBAC 与 audience 校验,降低 Kubernetes 工作负载凭证泄露后的影响。
- 故障排查1 分钟阅读
mTLS 握手失败排查:证书、信任链与身份匹配
利用 openssl 和代理日志区分证书过期、CA 不信任、SAN 错误、协议不兼容与客户端证书缺失。
- 云原生安全1 分钟阅读
DDoS 与限流:按资源成本建立多层防线
区分容量型、协议型和应用层攻击,在边缘、网关与服务内部实施可观测的限流与降级。
- 云原生安全1 分钟阅读
CVSS、EPSS 与漏洞优先级:从严重度走向真实风险
结合漏洞严重度、利用概率、资产暴露与业务影响建立修复队列,避免仅按 CVSS 排序。
- AI Ops1 分钟阅读
AI 变更风险评审:让模型建议停在审批之前
为 AI 生成的运维变更建立证据、影响分析、策略校验和人工批准,防止错误建议直接进入生产。
- AI Ops1 分钟阅读
AI 日志聚类:从错误洪峰中提取稳定模式
结合模板解析、向量聚类和人工反馈压缩重复日志,同时保留稀有错误与可解释样本。
- SRE1 分钟阅读
事故等级设计:用业务影响驱动响应强度
根据用户影响、范围、持续时间与数据风险定义事故等级,并连接值班、沟通和升级机制。
- SRE1 分钟阅读
Toil 度量与治理:把重复运维劳动变成改进队列
识别手工、重复、可自动化且随规模增长的工作,并用时间数据选择最有价值的治理项目。
- SRE1 分钟阅读
复盘行动项跟踪:从“加强监控”到可验收改进
为事故复盘行动项定义 owner、截止时间、风险来源和验收证据,避免改进计划停留在文档中。
- AI Ops4 分钟阅读
k8sgpt:用 AI 自动诊断 Kubernetes 集群问题
k8sgpt 是一个开源的 K8s 智能诊断工具,能自动分析集群问题并给出修复建议。本文介绍安装配置、与本地 LLM 集成,以及在生产环境的最佳实践。
- 云原生安全5 分钟阅读
云原生供应链安全:SBOM、SLSA 与 Sigstore 实战
软件供应链攻击已成为头号安全威胁。本文介绍如何在 CI/CD 流水线中集成 SBOM 生成、SLSA 合规、Cosign 镜像签名,构建可信的软件交付链。
- AI Ops6 分钟阅读
LLMOps 实践:生产环境大模型服务的全生命周期管理
随着 LLM 应用从 PoC 走向生产,如何稳定运行 AI 服务成为新挑战。本文介绍 LLMOps 核心实践,包括可观测性、Prompt 版本管理、成本控制和安全护栏。
- Kubernetes4 分钟阅读
Kubernetes 1.33 新特性解析:原地扩缩容、Gateway API GA 与安全增强
Kubernetes 1.33 带来多项重磅 GA 特性,包括 In-place Pod Resize、Gateway API 正式稳定、User Namespace 增强。本文逐一解析对生产运维的影响。
- AI Ops3 分钟阅读
DeepSeek R1 与 Qwen3:开源大模型重塑 AI 格局
2025 年开源大模型迎来爆发,DeepSeek R1 和 Qwen3 以极低成本对标顶级闭源模型。本文分析技术突破、运维工程师如何选型,以及私有化部署的实践建议。
- 云原生网络6 分钟阅读
Cilium + Hubble 替换 Istio:服务网格的 eBPF 革命
Istio 的复杂性和性能开销让很多团队望而却步。基于 eBPF 的 Cilium Service Mesh 提供了更轻量的替代方案。本文对比两者差异,并给出从 Istio 迁移到 Cilium 的实战指南。
- 云原生网络4 分钟阅读
eBPF 与 Cilium 实战:告别 iptables,拥抱云原生网络
eBPF 是 2025 年云原生最具影响力的底层技术。本文介绍 eBPF 原理、Cilium 部署实战,以及如何用 Hubble 实现 L7 级别的网络可观测性。
- AI Ops9 分钟阅读
DeepSeek/Qwen 在 Kubernetes 上的生产级部署指南
如何在 Kubernetes 集群上稳定运行 DeepSeek R1 或 Qwen3 大模型?本文覆盖 GPU 资源调度、vLLM 推理引擎、自动扩缩容、监控告警的完整生产方案。
- AI Ops6 分钟阅读
MCP 协议详解:给 AI Agent 装上标准接口
Model Context Protocol(MCP)是 Anthropic 推出的 AI 工具集成标准,本文深入解析其架构原理,并实战构建一个能操作 Kubernetes 集群的 MCP Server。
- AI Ops5 分钟阅读
RAG 系统构建实践:给大模型接入私有知识库
从零构建 RAG(检索增强生成)系统,将内部文档、Runbook、Wiki 接入大模型,实现智能知识问答。
- Kubernetes4 分钟阅读
Kubernetes 存储管理:PV、PVC 与 StorageClass 实战
深入理解 K8s 存储体系,掌握 PersistentVolume、PVC 动态供给、StorageClass 配置及常见存储方案选型。
- 自动化5 分钟阅读
Shell 脚本自动化运维:从入门到实用
掌握运维常用 Shell 脚本技巧,包括日志分析、批量操作、定时任务、告警脚本等实用场景。
- Kubernetes4 分钟阅读
Kubernetes HPA 与 VPA:自动扩缩容实战
深入讲解 K8s 水平扩缩容(HPA)和垂直扩缩容(VPA)的配置与调优,实现应用资源的自动化管理。
- AI Ops5 分钟阅读
AI 辅助运维:用 LLM 自动化故障诊断工作流
探索如何将大语言模型集成到运维工作流中,实现告警自动分析、根因推断、修复建议生成,提升 MTTR。
- DevOps4 分钟阅读
CI/CD 流水线设计:GitLab CI 最佳实践
从零设计一套生产级 GitLab CI/CD 流水线,涵盖代码检查、测试、构建、部署全流程,以及缓存优化和安全扫描。
- Kubernetes3 分钟阅读
Kubernetes 网络策略:NetworkPolicy 实战指南
深入理解 K8s NetworkPolicy,通过实际案例掌握微服务间网络隔离、零信任网络的配置方法。
- AI Ops3 分钟阅读
大模型私有化部署实践:Ollama + Open WebUI 完整指南
在本地或私有服务器上部署开源大模型,实现数据不出内网的 AI 能力,涵盖 Ollama 部署、模型管理和 WebUI 配置。
- 可观测性4 分钟阅读
Prometheus + Grafana 监控体系从零搭建
手把手搭建基于 Prometheus 和 Grafana 的完整监控告警体系,覆盖指标采集、存储、可视化和告警配置。
- 故障排查3 分钟阅读
Kubernetes 故障排查手册:Pod 异常状态全解析
系统梳理 K8s 中 Pod 各种异常状态的原因与解决方法,包括 CrashLoopBackOff、OOMKilled、Pending 等。
- 故障排查2 分钟阅读
Linux 系统性能排查:从 CPU 到磁盘的完整方法论
系统性介绍 Linux 性能问题排查的思路与工具,涵盖 CPU、内存、磁盘 I/O、网络四个维度。
没有找到匹配文章。