"我会从三个层面建立 Agent 监控体系: 第一层:任务级指标——用 trace_id 串联每个任务的全链路,记录成功率、P99 延迟、Token 消耗。工具调用用拦截器自动埋点,失败率 > 5% 触发告警。 第二层:模型级指标——监控 TTFT(首 Token 时间 < 1s)、幻觉风险分数(用 NLI Entailment 模型,> 0.5 告警)、循环检测(3次相同状态自动熔断)。 第三层:成本指标——语义缓存命中率、模型路由比例、日/周/月成本趋势。超预算 80% 触发升级告警。 工具链:LangSmith 做链路追踪 + Prometheus 做指标聚合 + Grafana 做可视化 + PagerDuty 做告警。这套体系让我负责的 Agent 服务 SLA 稳定在 99.2%。"