LLM 应用可观测性:延迟、Token、质量与追踪

为 LLM 应用建立请求链路、Token 成本、检索质量和安全事件监控。

文章目录 · 4 节

只监控 HTTP 200 无法说明 LLM 应用是否可用。响应可能成功返回,但内容为空、引用错误、超时降级或成本异常。

建立请求链路

Trace 应覆盖网关、Prompt 构建、检索、重排、模型调用和后处理。记录模型版本、Prompt 版本、采样参数和缓存命中,但不要记录敏感原文。

四类指标

  1. 性能:首 token、完整响应、排队和检索延迟。
  2. 成本:输入输出 Token、缓存节省和每任务成本。
  3. 质量:引用命中、结构化输出通过率和人工反馈。
  4. 安全:越权检索、敏感字段泄露和护栏拒绝。

区分模型与系统问题

模型延迟正常而总延迟升高时,检查检索和排队。Token 突增通常来自上下文构建或重试,不应直接归因于模型供应商。

使用抽样评审

对脱敏后的输出做定期人工评审,并把低质量样本加入回归集。线上指标发现趋势,离线评测解释质量原因,两者缺一不可。