Skip to content
🔗 分享本题
查看我的学习进度 →

漏洞发现基准从代码探索、动态测试到复现证据和补丁验证的真实闭环图

🧠 记忆锚点:安全基准要测发现、复现和修复的完整过程;题目需防污染,结果要由可执行证据验证。

💡 答案要点

N-Day-Bench 核心设计:

N-Day-Bench 是衡量前沿 LLM 在真实代码库中发现已知安全漏洞能力的基准测试,每月更新测试用例,避免训练数据污染。

与传统基准的区别:

维度传统安全基准N-Day-Bench
测试集固定不变,数月后泄露入训练数据每月刷新,保持"新鲜"
漏洞来源合成代码或小型项目GitHub 安全公告,真实代码库,10k+ stars
评估方式直接给补丁或提示从 sink hints 出发,自主追踪漏洞
步骤限制无限制或宽松每案例 24 步 shell 探索
可重现性分数可能反映"背答案"公开 traces,盲评Judge打分

三 Agent 评估架构:

Curator(构建答案键)→ Finder(模型测试)→ Judge(盲评打分)

关键结论(2026年4月 Leaderboard):

  • 当前最强模型:GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro
  • 开源模型表现:GLM-5.1、Kimi K2.5 在代码漏洞发现上有竞争力
  • 漏洞发现 ≠ 对齐良好,两者能力可独立存在

面试话术:

"N-Day-Bench 是 2026 年 AI 安全评估的重要突破——它用月度刷新的真实 GitHub 漏洞来衡量模型的'实战能力',避免传统基准的'背答案'问题。对 AI 应用开发者来说,这个基准揭示了一个重要事实:漏洞发现能力和对齐质量是独立发展的,一个模型可以很强但不对齐,也可以对齐但能力有限。我的判断是:2026 年的安全评估必须从'能力测试'升级到'实战测试',N-Day-Bench 提供了这种可能性。"

延伸阅读: