Skip to content
🔗 分享本题
查看我的学习进度 →

推理框架专题第14题核心机制与工程取舍图解

🧠 图解记忆: 小模型先猜一串,大模型并行验收;草稿猜得准且猜得便宜才真正加速。

💡 答案要点

投机解码:用小模型"打草稿",大模型"批改"

Draft Model(小模型0.5B):一次生成 k=4 个候选
生成: [今天][天气][很][好]

Target Model(大模型70B):并行验证这4个token
- 今天 ✓  天气 ✓  很 ✓  好 ✗

接受: [今天][天气][很] → 接受3个
继续: [不错]...

原本1次生成1个token → 现在1次接受3个 → 3倍加速

适用条件:

  • Draft 和 Target 模型相近(同系列)
  • 输出有一定可预测性

面试话术:

"Speculative Decoding 速度提升2-3倍,回复越长加速越明显。但要注意 Draft 和 Target 模型要相近,不然拒绝率太高反而更慢。"

📚 参考:Fast Inference from Transformers via Speculative Decoding(原论文)