🧠 图解记忆:Evaluator 本身也是 LLM,可能误判;点击图片可查看原图。
💡 答案要点
五大工程挑战:
挑战1:评估器准确率
- Evaluator 本身也是 LLM,可能误判
- 解决:用多维度打分而非单一判断
挑战2:反思死循环
- Agent 反反复复无法收敛
- 解决:设置最大循环次数 + 收敛判断
挑战3:Token 成本爆炸
- 反思循环的多次 LLM 调用 → 成本暴增
- 解决:分层评估,简单任务用小模型,复杂任务才调大模型
挑战4:记忆存储与检索
- Reflexion 记忆太多检索变慢
- 解决:用向量数据库存储 + 按类型分类
挑战5:何时触发反思
- 反思不是免费的,何时该触发?
- 解决:基于规则 + 基于置信度双保险
面试话术:
"生产级反思 Agent 的核心是平衡'质量'和'成本'。五大工程坑:评估器可能误判(用多维度代替单判断)、反思死循环(设 max_iter + 收敛判断)、Token 成本爆炸(分层评估简单任务用小模型)、记忆检索慢(向量数据库)、触发时机(规则+置信度双保险)。我的经验是:先用 Reflexion 简单实现看效果,瓶颈出现再逐个优化。"
版本: v2.6 | 更新: 2026-04-07 | by 二狗子 🐕
