🧠 图解记忆: Agent 会多轮调用模型,单次延迟和成本会被循环放大,所以应让快模型承担主流程、强模型处理少数高难步骤。
💡 答案要点
为什么需要路由:
多模态 Agent 往往包含感知、意图判断、工具选择、工具执行和结果生成,多次模型调用会把单次延迟和成本累加。合理做法不是默认全部调用最强模型,而是按步骤风险和难度路由。
| 步骤 | 常见策略 | 不能省略的保护 |
|---|---|---|
| VAD、OCR、分类、简单抽取 | 专用模型或低延迟模型 | 置信度、输入质量检测 |
| 普通对话与工具参数生成 | 快模型承担主流程 | Schema 校验、权限和超时 |
| 复杂视觉推理或高风险决策 | 路由到更强模型或人工 | 证据、复核、审计日志 |
| 连续音视频 | 流式/增量处理 | 背压、打断、帧采样和状态同步 |
路由依据:
- 输入模态、长度、分辨率和实时性要求;
- 任务复杂度、模型置信信号与历史失败模式;
- 决策风险、可逆性和是否允许人工接管;
- 模型在自有数据上的质量、TTFT、端到端 P95/P99 与单任务成本。
面试话术:
"低延迟多模态 Agent 的关键是端到端预算和分层路由。先把感知、决策、工具和生成各阶段的耗时拆开,让专用或快速模型处理高频低风险步骤,复杂或高风险样本升级到强模型或人工。路由器要有可解释规则、质量回归集和降级路径,并用真实会话测任务成功率、打断响应、P95/P99 和成本,而不是直接照搬厂商给出的单模型速度倍数。"
