🧠 图解记忆: 最终成绩由模型与 Agent 脚手架共同决定:模型负责推理,脚手架负责上下文、工具和反馈。
💡 答案要点
2026年5月 SWE-bench Verified 最新榜单(benchlm.ai 2026-05-05):
| 排名 | 模型 | SWE-bench Verified | 备注 |
|---|---|---|---|
| 🥇 1 | Claude Mythos Preview | 93.9% | 2026年5月登顶,超越所有已知模型 |
| 🥈 2 | Claude Opus 4.7 (Adaptive) | 87.6% | +7pt from Opus 4.6(80.8%) |
| 🥉 3 | GPT-5.3 Codex | 85% | OpenAI 代码专用模型 |
| 4 | GPT-5.4 | ~82% | GPT-5家族代码能力 |
| 5 | Gemini 3.1 Pro | 80.6% | 价格$2/$12,60%低于Opus |
| 6 | Claude Sonnet 4.6 | 79.6% | 中端主力 |
| 7 | MiniMax M2.5 | 80.2% | 开源,自进化Agent |
| 8 | Kimi K2.5 | 76.8% | 国产 |
| 9 | DeepSeek V3.2 | 72-74% | 开源性价比 |
关键变化:
Claude Mythos Preview 93.9% 登顶
- 但 Anthropic 选择不公开发布(网络安全能力过强)
- 仅通过 Project Glasswing 给网络安全公司使用
- 代表 AI 安全的"负责任克制"新范式
Claude Opus 4.7 跳跃式提升(80.8% → 87.6%,+7pt)
- "Adaptive"版本引入动态推理策略
- SWE-bench Pro 达到 87.6%(vs Gemini 3.1 Pro 54.2%)
- 7pt 提升意味着每100个bug能多修复7个
开源模型快速追赶
- MiniMax M2.5 达 80.2%,开源最高
- Qwen3-Coder-Next、GLM-5 形成竞争
- DeepSeek V3.2 达 72-74%
为什么 SWE-bench 2026年更重要:
SWE-bench = 真实 GitHub Issue 修复能力
不是:
- 人工构造的简单编程题
- 教科书级的算法题
而是:
- Django(850题)、Sympy(386题)、scikit-learn(229题)
- 真实开源项目,真实bug,真实PR
- 需要理解整个代码库、多文件修改、测试验证核心洞察:Agent Scaffold 比模型本身更重要
2026年Berkeley论文揭示:
| 发现 | 数据 |
|---|---|
| 同一模型不同 scaffold 差异 | 高达 17个百分点 |
| scaffold 质量决定上限 | 再强的模型用烂 scaffold 也白搭 |
| Claude Code 80.8% | = Opus 4.5 + 优秀 scaffold |
| 其他工具可能低于预期 | 模型强不等于工具强 |
为什么差异这么大?
Scaffold = Agent 的"操作系统"
好的 scaffold:
- 正确拆解任务(理解Issue → 定位文件 → 改代码 → 跑测试)
- 有效的上下文管理(不丢信息、不超限)
- 准确的测试验证(避免假通过)
差的 scaffold:
- 任务拆解错误(改错文件)
- 上下文丢失(看了后面忘前面)
- 测试验证失败(把错误代码当正确)面试话术:
"2026年5月 SWE-bench 最新数据:Claude Mythos Preview 93.9% 登顶,但因安全原因不公开发布;Claude Opus 4.7 达 87.6%,较上一代提升 7pt。但最重要的洞察不是分数,而是'17个百分点差距'——同一模型用不同 scaffold 评测,结果差异高达 17pt。这意味着:选 AI 编程工具不只是选模型,更是选 scaffold 的工程质量。我在面试时会强调:我选择 Claude Code 是因为它的 scaffold 设计最成熟,不是只看模型分数。"
生产级选型建议:
| 场景 | 推荐 | 理由 |
|---|---|---|
| 企业级代码修复 | Claude Code / Codex | scaffold 成熟,87%+ 解决率 |
| 长上下文项目 | Claude Code | 200K上下文,优秀记忆管理 |
| 成本敏感 | Gemini 3.1 Pro | 80.6%达标,价格低60% |
| 开源本地部署 | MiniMax M2.5 | 80.2%开源,自进化 |
