Skip to content
🔗 分享本题
查看我的学习进度 →

快速 Agent 模型承担高频主流程并将少数复杂步骤路由给强模型

🧠 图解记忆: Agent 会多轮调用模型,单次延迟和成本会被循环放大,所以应让快模型承担主流程、强模型处理少数高难步骤。

💡 答案要点

为什么需要路由:

多模态 Agent 往往包含感知、意图判断、工具选择、工具执行和结果生成,多次模型调用会把单次延迟和成本累加。合理做法不是默认全部调用最强模型,而是按步骤风险和难度路由。

步骤常见策略不能省略的保护
VAD、OCR、分类、简单抽取专用模型或低延迟模型置信度、输入质量检测
普通对话与工具参数生成快模型承担主流程Schema 校验、权限和超时
复杂视觉推理或高风险决策路由到更强模型或人工证据、复核、审计日志
连续音视频流式/增量处理背压、打断、帧采样和状态同步

路由依据:

  • 输入模态、长度、分辨率和实时性要求;
  • 任务复杂度、模型置信信号与历史失败模式;
  • 决策风险、可逆性和是否允许人工接管;
  • 模型在自有数据上的质量、TTFT、端到端 P95/P99 与单任务成本。

面试话术:

"低延迟多模态 Agent 的关键是端到端预算和分层路由。先把感知、决策、工具和生成各阶段的耗时拆开,让专用或快速模型处理高频低风险步骤,复杂或高风险样本升级到强模型或人工。路由器要有可解释规则、质量回归集和降级路径,并用真实会话测任务成功率、打断响应、P95/P99 和成本,而不是直接照搬厂商给出的单模型速度倍数。"