Skip to content
🔗 分享本题
查看我的学习进度 →

Speculative RAG 动漫知识图:检索证据被分组,小模型基于各组证据并行起草,大模型一次验证聚合最终答案

记忆点:小模型并行起草,大模型一次验证聚合,不是先瞎猜再逐句查证。

💡 答案要点

30 秒回答

Speculative RAG 不是“先大胆猜,再逐句查证”。原论文的方法是:把检索文档分成多个子集,由较小的专用模型并行生成带依据的候选草稿,再由较大的通用模型一次性比较和验证这些草稿,输出最终答案。并行草稿减少了单次上下文长度,大模型只做一次聚合验证,因此有机会同时改善质量和延迟。

核心流程

text
Query

检索候选文档并划分为多个子集

小型 specialist LM 并行生成多个 draft + rationale

大型 generalist LM 比较证据、验证候选并选择/合成答案

为什么可能有效

  1. 每个草稿只阅读文档子集,降低长上下文中的注意力干扰;
  2. 不同子集产生多样候选,减少单一检索排序造成的偏差;
  3. 草稿阶段可并行,并把大模型调用压缩为一次验证;
  4. specialist/generalist 的模型组合允许在质量、延迟和成本之间调节。

与其他方法的区别

方法核心动作主要代价
Claim verification对成品答案逐条检查证据断言提取和多次验证调用
CoVe生成验证问题、独立回答、重写多轮调用与自验证偏差
Speculative RAG小模型并行草稿,大模型统一验证需要额外 specialist 模型和并行调度

工程验证

不要照搬论文数字。应在相同检索结果和生成预算下比较:任务准确率、faithfulness、TTFT、端到端延迟、总输入/输出 token、GPU/API 成本,以及并行失败时的降级行为。

原论文: Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting