🧠 图解记忆: 基准各测一段能力:代码修复、终端操作与多模态界面不能用单一分数替代。
💡 答案要点
2026年SWE-bench的重要更新:
SWE-bench Multimodal(新发布):
| 维度 | 说明 |
|---|---|
| 核心变化 | Issue描述中包含图片(如UI截图、错误界面) |
| 评测难度 | 需要理解图像+代码+文字的跨模态能力 |
| 适用场景 | 前端Bug修复、视觉相关问题 |
为什么重要:
- 传统SWE-bench只评测纯文本能力
- 实际开发中大量问题需要看图理解(如"这个按钮位置不对")
- SWE-bench Multimodal填补了这个空白
Terminal-Bench(新评测):
| 维度 | 说明 |
|---|---|
| 核心 | 评测AI在真实终端环境中的任务完成能力 |
| 与SWE-bench的区别 | SWE-bench评测代码修复,Terminal-Bench评测命令行操作 |
| 涵盖任务 | git操作、文件编辑、构建运行、调试排错 |
2026年3月Terminal-Bench最新数据:
- GPT-5.4 Thinking:75.1%(通用模型终端任务第一)
- GPT-5.3-Codex:77.3%(Codex系列最强)
Terminal-Bench任务示例:
"用git rebase将feature分支变基到main上,然后解决冲突,最后跑测试"
→ AI需要:执行git命令→解决冲突→运行测试→验证结果2026年AI编程评测全景:
| 评测 | 评测内容 | 侧重能力 |
|---|---|---|
| HumanEval | Python函数补全 | 基础代码生成 |
| SWE-bench | GitHub Issue代码修复 | 真实Bug修复 |
| SWE-bench Multimodal | 带图片的GitHub Issue | 视觉+代码联合理解 |
| SWE-Rebench | SWE-bench代码复现成功率 | 模型"重写后能否跑通" |
| Terminal-Bench | 终端命令行任务 | DevOps/运维能力 |
| LiveCodeBench | 多版本持续评测 | 防止数据污染 |
| Aider Polyglot | 多语言代码编辑 | 跨语言泛化能力 |
| FLTEval | Flutter移动端代码评测 | 跨平台移动开发 |
| React Native Evals | React Native应用评测 | 移动端UI开发 |
各评测关系:
HumanEval(最简单)
↓
SWE-bench(真实代码修复)
↓
SWE-Rebench(SWE-bench的修复能跑通吗?)
SWE-bench Multimodal(加入视觉理解)
Terminal-Bench(加入命令行操作)
Aider Polyglot(跨语言泛化)
FLTEval/React Native(移动端专属)面试话术:
"2026年AI编程评测已经形成完整体系:HumanEval测基础、SWE-bench测真实Bug修复、SWE-Rebench测修复能否跑通、SWE-bench Multimodal加入视觉理解、Terminal-Bench测DevOps能力、Aider Polyglot测跨语言泛化。SWE-Rebench特别值得关注——它解决的是'SWE-bench通过但代码跑不通'的问题,代表了从'能修复'到'能工作'的质量跨越。"
