Skip to content
🔗 分享本题
查看我的学习进度 →

26 模块 Q17 教学图:上线后应该怎样观测和定位 AI 系统问题?

🧠 图解记忆:需要把一次用户任务关联成端到端 Trace:请求分类 → 检索 → 模型 → 工具 → 最终状态 → 用户反馈;点击图片可查看原图。

💡 答案要点

需要把一次用户任务关联成端到端 Trace:请求分类 → 检索 → 模型 → 工具 → 最终状态 → 用户反馈。

至少监控:

  • 流量、成功率、P50/P95/P99、队列和下游错误;
  • token、模型、缓存、工具调用和单任务成本;
  • 检索无结果、低支持度、工具参数错误、循环超限和人工接管;
  • 按客户、版本、意图、语言、风险级别的质量切片;
  • 配置、Prompt、模型、索引和代码版本。

日志要可采样和脱敏。排障顺序是先定位失败层,再用可重放样本复现,最后将真实故障转成回归测试。参考 Agent 可观测性

📚 参考:LangSmith:生产问题定位(tracing)