Skip to content
🔗 分享本题
查看我的学习进度 →

AI编程工具专题第9题机制与工程取舍图解

🧠 图解记忆: 基准各测一段能力:代码修复、终端操作与多模态界面不能用单一分数替代。

💡 答案要点

2026年SWE-bench的重要更新:

SWE-bench Multimodal(新发布):

维度说明
核心变化Issue描述中包含图片(如UI截图、错误界面)
评测难度需要理解图像+代码+文字的跨模态能力
适用场景前端Bug修复、视觉相关问题

为什么重要:

  • 传统SWE-bench只评测纯文本能力
  • 实际开发中大量问题需要看图理解(如"这个按钮位置不对")
  • SWE-bench Multimodal填补了这个空白

Terminal-Bench(新评测):

维度说明
核心评测AI在真实终端环境中的任务完成能力
与SWE-bench的区别SWE-bench评测代码修复,Terminal-Bench评测命令行操作
涵盖任务git操作、文件编辑、构建运行、调试排错

2026年3月Terminal-Bench最新数据:

  • GPT-5.4 Thinking:75.1%(通用模型终端任务第一)
  • GPT-5.3-Codex:77.3%(Codex系列最强)

Terminal-Bench任务示例:

"用git rebase将feature分支变基到main上,然后解决冲突,最后跑测试"
→ AI需要:执行git命令→解决冲突→运行测试→验证结果

2026年AI编程评测全景:

评测评测内容侧重能力
HumanEvalPython函数补全基础代码生成
SWE-benchGitHub Issue代码修复真实Bug修复
SWE-bench Multimodal带图片的GitHub Issue视觉+代码联合理解
SWE-RebenchSWE-bench代码复现成功率模型"重写后能否跑通"
Terminal-Bench终端命令行任务DevOps/运维能力
LiveCodeBench多版本持续评测防止数据污染
Aider Polyglot多语言代码编辑跨语言泛化能力
FLTEvalFlutter移动端代码评测跨平台移动开发
React Native EvalsReact Native应用评测移动端UI开发

各评测关系:

HumanEval(最简单)

SWE-bench(真实代码修复)

SWE-Rebench(SWE-bench的修复能跑通吗?)
SWE-bench Multimodal(加入视觉理解)
Terminal-Bench(加入命令行操作)
Aider Polyglot(跨语言泛化)
FLTEval/React Native(移动端专属)

面试话术:

"2026年AI编程评测已经形成完整体系:HumanEval测基础、SWE-bench测真实Bug修复、SWE-Rebench测修复能否跑通、SWE-bench Multimodal加入视觉理解、Terminal-Bench测DevOps能力、Aider Polyglot测跨语言泛化。SWE-Rebench特别值得关注——它解决的是'SWE-bench通过但代码跑不通'的问题,代表了从'能修复'到'能工作'的质量跨越。"