Skip to content
🔗 分享本题
查看我的学习进度 →

AI编程工具专题第8题机制与工程取舍图解

🧠 图解记忆: SWE-bench 的关键是把真实 Issue 交给 Agent,并用仓库测试验证补丁是否真正解决问题。

💡 答案要点

SWE-bench = Software Engineering Benchmark

核心思想: 用真实的 GitHub Issue 测试 AI 解决实际问题能力

构建流程:

1. 从 GitHub 选取真实 Issue(如 "Fix login bug #1234")
2. 提取 Issue 的描述和复现步骤
3. 找到对应的 Pull Request(包含修复方案)
4. 用 Issue + PR 的 ground truth 评估 AI 生成的修复代码
5. 判断 AI 的修复是否与真实 PR 等价

评估指标:

指标说明含义
Pass@1一次生成的成功率一次性解决问题的能力
Pass@1010 次生成中至少一次成功模型生成多样性
Fix Rate能正确识别问题并修复的比例完整的软件工程能力

主流模型 SWE-bench 表现:

模型Pass@1
GPT-4(2023)~2%
Claude 3.5 Sonnet~15%
Claude Code(2024)~50%
CWM(2025)65.8%
Claude Sonnet 4.6(2026年3月)~79.6%
Gemini 3.1 Pro(2026年2月)~80.6%

为什么 SWE-bench 重要:

  • 比 HumanEval 更接近真实软件开发场景
  • 需要完整理解代码库、复现问题、编写修复
  • 是目前最具挑战性的代码智能评测基准

面试话术:

"SWE-bench 是代码智能的'终极评测',因为它用的是真实 GitHub Issue,不是人工构造的简单题。2025 年 CWM 在 SWE-bench 达到 65.8% 通过率,标志着 AI 编程进入实用阶段。"

📚 参考:SWE-bench: Can Language Models Resolve Real-World GitHub Issues(原论文)