Skip to content
🔗 分享本题
查看我的学习进度 →

动态编排先评估复杂度与可并行性再受数量 Token 时限预算约束扇出并经 Judge 聚合早停

🧠 图解记忆: 动态编排不是越多越好,而是在质量收益超过协调成本时有限扇出并及时停止。

考点: 多Agent架构、测试时计算扩展、Orchestrator-SubAgent 模式、推理成本控制

核心答案

GPT-5.6 是 2026 年 6-7 月 OpenAI 发布的三层模型家族(不是单一模型):

型号定位特点
Sol旗舰最强推理/编码/安全能力,价格 $30/1M tokens
Terra平衡对标 GPT-5.5 性能,成本约一半,生产默认选择
Luna轻量最低价格,高吞吐/成本敏感场景

Sol 附带两个新的推理控制项(这是真正的架构变化):

1. max 推理档位:单 Agent 的"更深度推理"
   → 在 low/medium/high 之上新增,给同一个模型更多思考时间
   → 一条更长的链式推理,本质还是"单 Agent 深挖"

2. ultra 模式:多 Agent 编排(Multi-Agent Orchestration)
   → 不是新模型,是 Sol 的编排模式
   → 运行时由模型自己动态创建多个子 Agent 并行工作
   → 完成后合并输出

Ultra 模式的工作原理(面试必讲)

传统单线程推理(非 ultra):
  用户请求 → [规划 → 执行 → 检查 → 迭代] × N 步 → 输出
  ⚠️ 任务一大,单条上下文链就会:丢上下文 / 子目标来回横跳

Ultra 模式:
  用户请求 → Orchestrator(主 Agent)
              ├── 拆解任务 → 子任务 A → 子 Agent 1(独立上下文+独立推理预算)
              ├── 拆解任务 → 子任务 B → 子 Agent 2(并行执行)
              ├── 拆解任务 → 子任务 C → 子 Agent 3(并行执行)
              └── 汇总 → 合并结果 → 最终答案

关键设计:每个子 Agent 拥有自己的上下文窗口和推理预算(reasoning budget),互不干扰。 这解决了单 Agent 长任务的核心痛点——单条上下文链会随着步数增长而"注意力稀释"、丢失早期关键信息。

基准表现(2026 年 7 月官方数据)

  • Agents' Last Exam:Sol Ultra 以 13.1 分优势碾压 Anthropic Claude Fable 5
  • Terminal-Bench 2.1(终端操作):88.8 → 91.9
  • 网络安全场景:ultra 模式协调 4 个并行 Agent 通过 Programmatic Tool Calling 运行轻量代码,Token 消耗降低 1/3

Ultra vs Claude Managed Agents(Anthropic 的对应方案)

对比维度OpenAI Sol UltraClaude Managed Agents
思路主 Agent 动态 spawn 子 Agent主 Agent(Fable 5)作为 manager 委托给 Sonnet 5 执行
上下文策略每子 Agent 独立上下文隔离子 Agent 缓存,消除重复上下文成本
成本表现价格较高($30/1M)92% SWE-Bench Pro 能力 @ 63% 价格
Web 自动化未披露96% 基准达成,成本更低

使用限制(面试加分点)

  • Ultra 模式目前是政府安全审查门控的预览版,仅 API/Codex 可用,未进 ChatGPT
  • ultra 会扇出多个子 Agent,成本不低——只适合高难度、可并行的长程任务
  • 不是所有任务都该开 ultra:简单问题开 ultra 是浪费 token

面试话术:

"GPT-5.6 Ultra 的本质不是新模型,而是'测试时计算扩展(Test-Time Compute Scaling)'的新形态。以前扩展测试时计算是给一个模型更多思考时间(max 档),ultra 则是从'单链深挖'变成'多 Agent 并行扇出'——由模型自己当 Orchestrator 动态拆解任务、生成子 Agent、合并结果。这回答了多 Agent 面试题里最关键的问题:'什么时候该用多 Agent?'答案是:任务可并行、单链会丢上下文的时候。我在实际项目中控制成本的原则是——简单任务用单 Agent 深链,复杂长程任务才开多 Agent 编排,避免无脑扇出导致 token 成本爆炸。面试官如果问'多 Agent 的边界',用 Sol Ultra 的例子回答最有说服力:OpenAI 自己也是把它当成一个可选的推理档位,而不是默认架构。"

延伸阅读:


版本: v3.128 | 更新: 2026-08-10 | by 二狗子 🐕


📚 参考:LangGraph:多 Agent 编排(supervisor/swarm 模式)