面试优先顺序(通用 AI 应用开发岗位):Q1、Q3、Q4、Q6、Q7、Q8、Q11、Q12、Q14、Q15、Q17。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐ 更新: 2026-04-09 考点: LangSmith、Arize Phoenix、OpenTelemetry、Prometheus、可观测性架构、指标设计、成本监控
2026年,Agent 应用从"能跑通"升级到"能运维"。面试中 15-20% 的问题围绕生产可观测性展开,考察维度包括:
- 正确性监控:任务成功率、幻觉率、工具调用准确率
- 性能监控:TTFT、端到端延迟、Token 消耗
- 成本监控:每次任务成本、ROI 分析
- 安全监控:Prompt 注入、越狱攻击、数据泄露
"光会搭 LangChain Demo 已经完全不够用了。面试官最想听的是:线上遇到过什么问题,怎么权衡解决的。" —— 2026 面经总结
| 话题 | 核心要点 |
|---|---|
| 可观测性三大支柱 | Logging(结构化日志)+ Tracing(OpenTelemetry)+ Metrics(Prometheus) |
| LangSmith | LangChain 官方,5 分钟接入,支持 Prompt 版本对比和 LLM-as-Judge |
| Arize Phoenix | 开源自托管,数据完全私有,框架无关,支持离线评估 |
| 成本监控 | 语义缓存 30-50% + 模型路由 30-40% + 上下文压缩 40-90% |
| 异常检测 | 循环检测(hash 去重)+ 上下文膨胀检测(80% 窗口阈值)+ 幻觉风险(NLI Entailment) |
| SLA 指标 | 成功率 95%、P99 延迟 30s、Token 日增幅 20% 告警 |
| A/B 测试 | Hash 分桶 + chi2 检验 + p<0.05 推广 |
| Agent vs 微服务 | 多了 LLM 输出质量追踪、上下文膨胀监控、工具调用树追踪 |
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
Agent 可观测性平台选型
- Q10 · Opik、Maxim AI、Latitude 三大2026新锐平台各有什么特点?如何选型?
- ⭐ Q11 · 为什么说"Agent可观测性≠传统LLM监控"?Agent轨迹追踪有哪些独特挑战?
- ⭐ Q12 · OpenTelemetry 在 Agent 系统中的完整接入实战
- Q13 · Grafana Dashboard 设计:Agent 监控面板关键指标
- ⭐ Q14 · 多 Agent 系统的分布式追踪:TraceID 传递与关联
- ⭐ Q15 · 生产环境 Agent 成本超支告警:预算控制最佳实践
- Q16 · SLA 违约复盘模板:从告警到根因分析的完整流程
- ⭐ Q17 · Agent 日志结构化设计:如何让日志可搜索、可分析?
- Q18 · 一次回答出错,怎么从结果反查模型、知识、Skill、工具和 Agent 节点?(全链路根因反查)
Voice Agent 评估新框架:EVA(Q9)
核心监控指标体系
- ⭐ Q1 · 如何建立 Agent 的可观测性体系?有哪些核心指标?
- Q2 · 如何用 LangSmith 做 Agent 调试?有哪些高级用法?
- ⭐ Q3 · 如何监控 Agent 的 Token 消耗和成本?有哪些优化策略?
- ⭐ Q4 · 如何检测 Agent 的行为异常?循环、幻觉、死循环如何发现?
- Q5 · 如何用 Arize Phoenix 做开源可观测性?和 LangSmith 有什么区别?
- ⭐ Q6 · 如何设计 Agent 的 SLA 和告警规则?有哪些关键阈值?
- ⭐ Q7 · 如何做 Agent 的 A/B 测试?有哪些评估指标?