只监控 HTTP 200 无法说明 LLM 应用是否可用。响应可能成功返回,但内容为空、引用错误、超时降级或成本异常。
建立请求链路
Trace 应覆盖网关、Prompt 构建、检索、重排、模型调用和后处理。记录模型版本、Prompt 版本、采样参数和缓存命中,但不要记录敏感原文。
四类指标
- 性能:首 token、完整响应、排队和检索延迟。
- 成本:输入输出 Token、缓存节省和每任务成本。
- 质量:引用命中、结构化输出通过率和人工反馈。
- 安全:越权检索、敏感字段泄露和护栏拒绝。
区分模型与系统问题
模型延迟正常而总延迟升高时,检查检索和排队。Token 突增通常来自上下文构建或重试,不应直接归因于模型供应商。
使用抽样评审
对脱敏后的输出做定期人工评审,并把低质量样本加入回归集。线上指标发现趋势,离线评测解释质量原因,两者缺一不可。