面试优先顺序(通用 AI 应用开发岗位):Q1、Q2、Q3、Q4、Q5、Q8、Q13。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐⭐ 更新: 2026-03-02 考点: 向量索引原理、性能对比、选型指南
标准回答:
"向量数据库主流索引有五种:HNSW、IVF、IVF-PQ、LSH、Flat。
HNSW 是多层图结构,速度最快精度最高,但内存占用大,适合千万级以下数据。 IVF 是先聚类再搜索,适合大数据量,但精度有损失。 IVF-PQ 在 IVF 基础上加向量压缩,内存占用极低,适合超大数据量。 LSH 用哈希方法,速度最快但精度最低。 Flat 是暴力搜索,精度 100% 但只适合小数据量。
示例表达(仅在能用本人经历或可复现实验佐证时使用): 我在项目中用 HNSW,因为数据量 50 万条,内存充足,追求低延迟。"
进阶回答:
"选型时我考虑三个维度:数据量、内存、精度要求。
数据量<100 万用 HNSW,延迟<10ms,Recall>95%。 100 万 -1000 万用 IVF-PQ,内存减少 100 倍,Recall 80-85%。
1000 万用 LSH 或分片。
另外还要考虑实时性:HNSW 支持实时插入,IVF 需要定期重建索引。"
| 日期 | 更新内容 |
|---|---|
| 2026-03-02 | 新增向量数据库索引详解专题 |
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
专题:Late Interaction 检索(ColBERTv2、ColPali、ColQwen)
专题:向量数据库选型深度对比(Pinecone / Milvus / Qdrant / Weaviate)
- ⭐ Q5 · Pinecone、Milvus、Qdrant 三类向量数据库方案怎么选?
- Q6 · 什么是向量数据库的“混合搜索”?为什么重要?
- Q7 · 什么是 DiskANN?它解决了什么问题?和 HNSW 怎么选?
专题:向量索引生产运维与监控
专题:托管与自建向量数据库选型
更新记录
- ⭐ Q3 · 为什么需要两阶段检索(向量检索 + Rerank)?ColBERT Late Interaction 模型详解
- ⭐ Q4 · HNSW 生产调参实战:M/ef/efConstruction 如何选择?有哪些性能陷阱?
核心面试题
补充高频题(2025-2026 全网最新)
- Q11 · DiskANN 如何利用磁盘与内存实现大规模 ANN 检索?
- Q12 · 什么是二进制量化(Binary Quantization)?它和 PQ 有什么区别?
- ⭐ Q13 · 何时选择 pgvector?如何做向量与业务条件混合检索?
- Q14 · 向量数据库迁移如何避免停机和检索回退?
- Q15 · 什么是 Context Poisoning(上下文污染)?RAG 知识库如何防御?