Skip to content
🔗 分享本题
查看我的学习进度 →

授权模型蒸馏压缩与黑盒自适应查询进行未授权能力提取的对比图

🧠 记忆锚点:普通蒸馏有授权并服务于压缩,蒸馏攻击通过大量自适应查询提取能力;防御靠身份、配额、异常与证据。

考点: AI 安全、模型知识产权保护、蒸馏原理、API 滥用防护(2026 年 8 月热点)

核心答案

模型蒸馏(Knowledge Distillation):用小模型(学生)学习大模型(教师)的输出,是常见的模型压缩/迁移技术。

蒸馏攻击(Distillation Attack)——也叫对抗性蒸馏:

攻击者不是模型提供方,通过大量查询目标模型的 API,用返回结果训练自己的模型,从而"偷走"商业模型的能力。

与普通蒸馏的本质区别(面试核心):

对比维度普通蒸馏蒸馏攻击/对抗性蒸馏
教师归属自己或已授权模型第三方商业模型(未授权)
授权状态模型提供商同意模型提供商未同意
目的压缩/迁移/部署窃取能力、复制商业价值
法律性质正常技术违反服务条款、侵犯知识产权

关键认知:区别不在训练方法,而在教师模型归属和授权状态。 同样的 API 查询 + 微调流程,授权了就是蒸馏,没授权就是攻击。

蒸馏攻击的三种形态

1. 模型提取攻击(Model Extraction)
   → 大量查询 API → 用输入-输出对训练替代模型
   → 目标:复刻商业模型的核心能力

2. 功能窃取(Functional Stealing)
   → 针对特定能力(如代码生成、安全分析)定向提取
   → 用领域内数据引导教师模型输出高质量样本

3. 数据重构(Training Data Extraction)
   → 通过精心构造的 prompt 诱导模型吐出训练数据
   → 更接近数据泄露,隐私风险更高

2026 年新背景:蒸馏攻击为何成为焦点

  • 头部模型能力差距缩小,"偷模型"比"训练模型"成本低几个数量级
  • EU AI Act 要求 GPAI 提供者披露训练数据摘要 + 版权政策,蒸馏攻击的合规问题被放大
  • 企业 RAG/Agent 应用大量使用商业 API,接口即攻击面

防御方案(工程落地)

python
# 防御示例:API 层检测异常查询模式
from collections import Counter

class DistillationGuard:
    def __init__(self, threshold_per_hour=1000, entropy_threshold=0.9):
        self.threshold_per_hour = threshold_per_hour
        self.entropy_threshold = entropy_threshold
        self.query_log = Counter()

    def check(self, user_id, prompt):
        # 1. 频率检测:单用户高频查询触发告警
        self.query_log[user_id] += 1
        if self.query_log[user_id] > self.threshold_per_hour:
            self.alert(f"用户 {user_id} 疑似模型提取攻击")
            return False

        # 2. 多样性检测:prompt 模板高度重复 = 提取特征
        # 3. 输出采样扰动:对 logits 加噪,降低提取精度
        # 4. 水印:在输出中嵌入不可见水印,被盗用时可溯源
        return True

    def alert(self, msg):
        # 接入告警系统 + 自动限流 + 要求 KYC 认证
        pass

多层防御体系:

层级措施
API 层频率限制、并发控制、KYC 实名、按量阶梯定价
检测层查询模式分析(频次/多样性/相似度)、异常行为告警
模型层输出扰动、logits 加噪、采样随机化
溯源层输出水印(Watermarking)、指纹标记
法律层服务条款约束 + EU AI Act 版权披露义务

面试话术:

"蒸馏攻击是 2026 年 AI 安全的高频新考点,核心是区分'蒸馏'和'攻击':技术手段几乎一样,差别在教师模型是否授权——我是模型方,你拿我的 API 输出训练你自己的模型,这就是对抗性蒸馏。面试时我会展开讲三层:第一,攻击形态——模型提取、功能窃取、数据重构;第二,为什么现在火——模型能力差距缩小,偷比训便宜,而且 EU AI Act 的训练数据披露义务让这个问题从技术问题变成合规问题;第三,防御——API 频率限制、查询模式检测、输出扰动加噪、水印溯源。这个问题的价值在于它把模型安全、API 设计、合规三个维度串起来了,能答好说明你既有安全意识又有工程落地能力。"

延伸阅读:


版本: v3.128 | 更新: 2026-08-10 | by 二狗子 🐕