Skip to content
🔗 分享本题
查看我的学习进度 →

从威胁模型构建红队测试集、攻击家族隔离、隐藏盲测和回归闭环图

🧠 记忆锚点:红队集来自威胁模型,不是随机越狱句;按攻击家族隔离,隐藏盲测,失败样本进入回归而非泄漏答案。

💡 答案要点

测试集应来自真实事故、威胁模型、领域专家和系统化变体生成,并按攻击类型、语言、模态、工具权限和影响分层。开发集用于调规则;保留集由独立人员管理,只在发布门禁运行;线上新攻击经过脱敏后回流。

不要只报告“拦截率”。还要报告正常请求误拒率、攻击成功率、敏感数据泄漏率、危险工具执行率及绕过后的影响。若团队反复根据同一保留集调 Prompt,保留集已经失效,需要轮换或建立新的盲测集。

📚 参考:Microsoft PyRIT(AI 红队测试框架)