本地运维模型评测:不要只比较聊天体验

用故障分类、命令安全、结构化输出和资源成本评测本地大模型的运维适用性。

文章目录 · 5 节

运维模型选型不能只看通用榜单。生产场景更关心它能否保持事实边界、理解日志、输出稳定 schema,并拒绝危险操作。

建立任务集

任务至少覆盖告警分类、日志归纳、根因假设、Runbook 检索、命令解释和结构化字段抽取。每类准备正常、模糊和恶意输入。

关键指标

  • 事实一致性与引用正确率
  • Top-K 根因召回率
  • JSON schema 通过率
  • 危险命令建议率
  • 首 token 与完整响应延迟
  • 单次请求显存、能耗和成本

使用盲测

隐藏模型名称并随机输出顺序,让有值班经验的工程师按统一标准评分。自动指标用于筛选,人工评审决定建议是否可执行。

压测真实上下文

测试长日志、中文与英文混合、重复告警和上下文接近上限的场景。吞吐测试要包含并发和 KV cache,而不是只跑单请求。

发布门槛

模型或量化方式更新后必须回归。无法通过安全集的模型只能用于离线摘要,不能进入自动化动作链路。