🧠 图解记忆: 评测不能只看答对率,还要同时验证上下文、执行闭环、可控性、成本与安全。
💡 答案要点
核心能力:
| 能力 | 说明 | 示例 |
|---|---|---|
| 代码补全 | 根据上下文预测下一段代码 | GitHub Copilot Tab |
| 代码生成 | 根据自然语言生成完整代码 | "写一个用户认证 API" |
| 代码审查 | 自动 Review 代码问题 | Cursor Review Mode |
| Bug 修复 | 自动定位和修复 Bug | SWE-bench 评测 |
| 代码重构 | 多文件协同重构 | Cursor Composer |
| 自主探索 | 理解代码库并完成复杂任务 | Claude Code Dev Mode |
| 执行轨迹 | 理解代码执行过程 | CWM 模型 |
关键评测指标:
| 指标 | 说明 | 达标线 |
|---|---|---|
| Pass@k | k 次尝试中至少成功一次的概率 | Pass@1 > 60% |
| SWE-bench | 真实 GitHub Issue 修复率 | > 60% |
| HumanEval | Python 代码生成通过率 | > 80% |
| MBPP | Python 多选测试通过率 | > 70% |
Pass@k 计算:
对于每个问题,生成 k 个答案
如果至少有一个正确 → 该题计 1 分
Pass@1 = 做对的题数 / 总题数
Pass@10 = k 次内做对的题数 / 总题数面试话术:
"SWE-bench 是最接近真实场景的评测,它用真实的 GitHub Issue 和 PR 测试模型解决实际问题能力。2026 年 3 月 Claude Opus 4.5 在 SWE-bench Verified 通过率达到 80.9%(最高分),Claude Code 达 80.8%。重要洞察:同一模型用不同 Agent Scaffold 评测,结果差异高达 17 个百分点,说明"脚手架比模型更重要"。"
