记忆点:小模型并行起草,大模型一次验证聚合,不是先瞎猜再逐句查证。
💡 答案要点
30 秒回答
Speculative RAG 不是“先大胆猜,再逐句查证”。原论文的方法是:把检索文档分成多个子集,由较小的专用模型并行生成带依据的候选草稿,再由较大的通用模型一次性比较和验证这些草稿,输出最终答案。并行草稿减少了单次上下文长度,大模型只做一次聚合验证,因此有机会同时改善质量和延迟。
核心流程
text
Query
↓
检索候选文档并划分为多个子集
↓
小型 specialist LM 并行生成多个 draft + rationale
↓
大型 generalist LM 比较证据、验证候选并选择/合成答案为什么可能有效
- 每个草稿只阅读文档子集,降低长上下文中的注意力干扰;
- 不同子集产生多样候选,减少单一检索排序造成的偏差;
- 草稿阶段可并行,并把大模型调用压缩为一次验证;
- specialist/generalist 的模型组合允许在质量、延迟和成本之间调节。
与其他方法的区别
| 方法 | 核心动作 | 主要代价 |
|---|---|---|
| Claim verification | 对成品答案逐条检查证据 | 断言提取和多次验证调用 |
| CoVe | 生成验证问题、独立回答、重写 | 多轮调用与自验证偏差 |
| Speculative RAG | 小模型并行草稿,大模型统一验证 | 需要额外 specialist 模型和并行调度 |
工程验证
不要照搬论文数字。应在相同检索结果和生成预算下比较:任务准确率、faithfulness、TTFT、端到端延迟、总输入/输出 token、GPU/API 成本,以及并行失败时的降级行为。
原论文: Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
