🧠 图解记忆: 先用混合召回扩大覆盖,再用 Rerank 提精度,用 ANN、量化和缓存控延迟。
💡 答案要点
精度优化:
| 方案 | 说明 | 效果 |
|---|---|---|
| Rerank | 用 Cross-Encoder 重新排序 | 精度提升 10-20% |
| 混合检索 | 向量 + 关键词(BM25) | 召回率提升 15% |
| Multi-Query | 生成多个查询变体 | 召回率提升 10% |
| 更好的 Embedding | BGE-M3、text-embedding-3 | 精度提升 5-10% |
速度优化:
| 方案 | 说明 | 效果 |
|---|---|---|
| HNSW 索引 | 图结构索引 | 100ms → 10ms |
| 减少 k 值 | 只返回 top-3 | 延迟降低 30% |
| 量化 | 向量压缩(FP32→INT8) | 内存减少 4 倍 |
| GPU 加速 | 并行计算 | 速度提升 5-10 倍 |
面试话术:
"检索优化要先按查询类型建立基线,再分别验证混合检索、rerank 和 ANN 参数。混合检索改善词项与语义互补,rerank 用额外延迟换排序质量,HNSW 调参在召回、延迟和内存间取舍。最终数据只报告本人可复现实验的模型、数据集、硬件和并发条件。"
