
🧠 记忆锚点:一次请求要把指标、链路、日志和评测关联起来,同时观察可靠性、性能、质量与成本。
💡 答案要点
核心监控指标:
| 类别 | 指标 | 告警阈值 |
|---|---|---|
| 性能 | P50/P90/P99 延迟 | P99 > 10s |
| 成本 | 每日 Token 消耗 | 超过预算 20% |
| 质量 | 用户满意度(点赞率) | < 80% |
| 稳定性 | 错误率(API 失败率) | > 5% |
| 体验 | 首字延迟(TTFT) | > 3s |
追踪内容:
- 完整请求链路:Prompt → Response → Token 消耗
- 工具调用记录:Agent 调用了哪些工具、参数、结果
- 用户反馈:点赞/点踩、举报、重新生成
- 异常检测:幻觉、敏感内容、超时
工具推荐:
- LangSmith(LangChain 官方)
- Arize Phoenix(开源)
- 自建:ELK + 自定义埋点
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "我在项目中搭建了完整的监控体系,核心是三个看板:成本看板(实时 Token 消耗)、质量看板(RAGAS 指标趋势)、体验看板(延迟和满意度)。有一次成本突然飙升,通过追踪发现是一个 Prompt 泄露了系统指令,导致模型输出了大量无效内容。"