🧠 图解记忆: SWE-bench 的关键是把真实 Issue 交给 Agent,并用仓库测试验证补丁是否真正解决问题。
💡 答案要点
SWE-bench = Software Engineering Benchmark
核心思想: 用真实的 GitHub Issue 测试 AI 解决实际问题能力
构建流程:
1. 从 GitHub 选取真实 Issue(如 "Fix login bug #1234")
2. 提取 Issue 的描述和复现步骤
3. 找到对应的 Pull Request(包含修复方案)
4. 用 Issue + PR 的 ground truth 评估 AI 生成的修复代码
5. 判断 AI 的修复是否与真实 PR 等价评估指标:
| 指标 | 说明 | 含义 |
|---|---|---|
| Pass@1 | 一次生成的成功率 | 一次性解决问题的能力 |
| Pass@10 | 10 次生成中至少一次成功 | 模型生成多样性 |
| Fix Rate | 能正确识别问题并修复的比例 | 完整的软件工程能力 |
主流模型 SWE-bench 表现:
| 模型 | Pass@1 |
|---|---|
| GPT-4(2023) | ~2% |
| Claude 3.5 Sonnet | ~15% |
| Claude Code(2024) | ~50% |
| CWM(2025) | 65.8% |
| Claude Sonnet 4.6(2026年3月) | ~79.6% |
| Gemini 3.1 Pro(2026年2月) | ~80.6% |
为什么 SWE-bench 重要:
- 比 HumanEval 更接近真实软件开发场景
- 需要完整理解代码库、复现问题、编写修复
- 是目前最具挑战性的代码智能评测基准
面试话术:
"SWE-bench 是代码智能的'终极评测',因为它用的是真实 GitHub Issue,不是人工构造的简单题。2025 年 CWM 在 SWE-bench 达到 65.8% 通过率,标志着 AI 编程进入实用阶段。"
📚 参考:SWE-bench: Can Language Models Resolve Real-World GitHub Issues(原论文)
