运维模型选型不能只看通用榜单。生产场景更关心它能否保持事实边界、理解日志、输出稳定 schema,并拒绝危险操作。
建立任务集
任务至少覆盖告警分类、日志归纳、根因假设、Runbook 检索、命令解释和结构化字段抽取。每类准备正常、模糊和恶意输入。
关键指标
- 事实一致性与引用正确率
- Top-K 根因召回率
- JSON schema 通过率
- 危险命令建议率
- 首 token 与完整响应延迟
- 单次请求显存、能耗和成本
使用盲测
隐藏模型名称并随机输出顺序,让有值班经验的工程师按统一标准评分。自动指标用于筛选,人工评审决定建议是否可执行。
压测真实上下文
测试长日志、中文与英文混合、重复告警和上下文接近上限的场景。吞吐测试要包含并发和 KV cache,而不是只跑单请求。
发布门槛
模型或量化方式更新后必须回归。无法通过安全集的模型只能用于离线摘要,不能进入自动化动作链路。