Skip to content
🔗 分享本题
查看我的学习进度 →

查询改写、混合召回、ANN 粗排、Cross-Encoder 精排和 Top-K 的检索优化漏斗

🧠 图解记忆: 先用混合召回扩大覆盖,再用 Rerank 提精度,用 ANN、量化和缓存控延迟。

💡 答案要点

精度优化:

方案说明效果
Rerank用 Cross-Encoder 重新排序精度提升 10-20%
混合检索向量 + 关键词(BM25)召回率提升 15%
Multi-Query生成多个查询变体召回率提升 10%
更好的 EmbeddingBGE-M3、text-embedding-3精度提升 5-10%

速度优化:

方案说明效果
HNSW 索引图结构索引100ms → 10ms
减少 k 值只返回 top-3延迟降低 30%
量化向量压缩(FP32→INT8)内存减少 4 倍
GPU 加速并行计算速度提升 5-10 倍

面试话术:

"检索优化要先按查询类型建立基线,再分别验证混合检索、rerank 和 ANN 参数。混合检索改善词项与语义互补,rerank 用额外延迟换排序质量,HNSW 调参在召回、延迟和内存间取舍。最终数据只报告本人可复现实验的模型、数据集、硬件和并发条件。"