
🧠 记忆锚点:安全基准要测发现、复现和修复的完整过程;题目需防污染,结果要由可执行证据验证。
💡 答案要点
N-Day-Bench 核心设计:
N-Day-Bench 是衡量前沿 LLM 在真实代码库中发现已知安全漏洞能力的基准测试,每月更新测试用例,避免训练数据污染。
与传统基准的区别:
| 维度 | 传统安全基准 | N-Day-Bench |
|---|---|---|
| 测试集 | 固定不变,数月后泄露入训练数据 | 每月刷新,保持"新鲜" |
| 漏洞来源 | 合成代码或小型项目 | GitHub 安全公告,真实代码库,10k+ stars |
| 评估方式 | 直接给补丁或提示 | 从 sink hints 出发,自主追踪漏洞 |
| 步骤限制 | 无限制或宽松 | 每案例 24 步 shell 探索 |
| 可重现性 | 分数可能反映"背答案" | 公开 traces,盲评Judge打分 |
三 Agent 评估架构:
Curator(构建答案键)→ Finder(模型测试)→ Judge(盲评打分)关键结论(2026年4月 Leaderboard):
- 当前最强模型:GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro
- 开源模型表现:GLM-5.1、Kimi K2.5 在代码漏洞发现上有竞争力
- 漏洞发现 ≠ 对齐良好,两者能力可独立存在
面试话术:
"N-Day-Bench 是 2026 年 AI 安全评估的重要突破——它用月度刷新的真实 GitHub 漏洞来衡量模型的'实战能力',避免传统基准的'背答案'问题。对 AI 应用开发者来说,这个基准揭示了一个重要事实:漏洞发现能力和对齐质量是独立发展的,一个模型可以很强但不对齐,也可以对齐但能力有限。我的判断是:2026 年的安全评估必须从'能力测试'升级到'实战测试',N-Day-Bench 提供了这种可能性。"
延伸阅读:
- N-Day-Bench 官网:https://ndaybench.winfunc.com
- Live Traces:公开可查,每个模型的探索路径完全透明