🧠 图解记忆:Agent 既要评结果,也要评轨迹、成本与真实世界副作用;点击图片可查看原图。
**不能只看最终答案,要看轨迹:** 工具调对了没、参数传对了没、失败后有没有兜底。评测维度: 工具调用准确率、多轮任务完成率、兜底成功率、成本。
落地方法: 把"期望的调用序列"写进用例,跑批后对比实际调用轨迹。
加分项: 提到"状态自检 harness"——Agent 每步都输出结构化日志,评测时回放日志就能定位是哪一步错了。
示例(伪代码):
用例: "帮我订明天去上海的机票"
期望轨迹: [search_flights(city=上海, date=明天), book_flight(flight_id)]
实际轨迹: [search_flights(city=上海, date=明天), search_flights(city=上海, date=明天), book_flight(flight_id)]
判定: 工具调用准确率 2/3(第二次 search_flights 为冗余调用)→ 需优化面试话术:
"Agent 评测不能只看最终答案,我会把期望的工具调用序列写进用例,跑批后对比实际轨迹,看工具调对没、参数传对没、失败有没有兜底,再加成本维度。Agent 每步输出结构化日志,评测时回放日志就能定位是哪一步错了。"
关联主答案:Agent 评估指标与 A/B 测试见 23 · Agent 可观测性 Q7。
