| 索引 | 原理关键词 | 速度 | 精度 | 内存 | 数据量 |
|---|---|---|---|---|---|
| HNSW | 多层图 + 贪心 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 高 | <1000 万 |
| IVF | 聚类 + 分桶 | ⭐⭐⭐ | ⭐⭐⭐⭐ | 中 | 100 万 -1 亿 |
| IVF-PQ | IVF+ 压缩 | ⭐⭐⭐⭐ | ⭐⭐⭐ | 低 | 100 万 -1 亿 |
| LSH | 哈希 + 桶 | ⭐⭐⭐⭐ | ⭐⭐ | 低 | >1 亿 |
| Flat | 暴力搜索 | ⭐ | ⭐⭐⭐⭐⭐ | 中 | <1 万 |
混合检索融合
| 方法 | 原理 | 优缺点 | Recall提升 |
|---|---|---|---|
| 加权融合 | α×V + (1-α)×B | 需归一化,调参复杂 | +6% |
| RRF | Σ1/(k+rank) | 简单鲁棒,首选⭐ | +12% |
| 加权RRF | Σw/(k+rank) | 动态权重,效果最好 | +15% |
选型口诀:
小数据用 Flat,大数据用 IVF, 要速度用 HNSW,要内存用 PQ, 超大规模用 LSH,实时插入 HNSW。 混合检索用RRF,简单高效k=60!