🧠 图解记忆: 小模型先猜一串,大模型并行验收;草稿猜得准且猜得便宜才真正加速。
💡 答案要点
投机解码:用小模型"打草稿",大模型"批改"
Draft Model(小模型0.5B):一次生成 k=4 个候选
生成: [今天][天气][很][好]
Target Model(大模型70B):并行验证这4个token
- 今天 ✓ 天气 ✓ 很 ✓ 好 ✗
接受: [今天][天气][很] → 接受3个
继续: [不错]...
原本1次生成1个token → 现在1次接受3个 → 3倍加速适用条件:
- Draft 和 Target 模型相近(同系列)
- 输出有一定可预测性
面试话术:
"Speculative Decoding 速度提升2-3倍,回复越长加速越明显。但要注意 Draft 和 Target 模型要相近,不然拒绝率太高反而更慢。"
📚 参考:Fast Inference from Transformers via Speculative Decoding(原论文)
