记忆点:Embedding 把语义变成可比较的坐标,不同模型的向量不能直接混用。
💡 答案要点
Embedding = 把文本转成向量(一串数字)
1536 维 = 用 1536 个特征描述这段文本
类比:
描述"张三"这个人:
传统方式:
"张三,男,30 岁,北京人,程序员,喜欢篮球"
向量方式(简化版):
[
性别:0.9, // 接近 1 = 男,接近 0 = 女
年龄:0.3, // 0-1 归一化,0.3 ≈ 30 岁
地域:0.8, // 接近 1 = 北方,接近 0 = 南方
职业:0.95, // 接近 1 = 技术岗
爱好:0.7, // 接近 1 = 运动型
... // 继续到 1536 维
]余弦相似度:
- 算两个向量"方向"有多接近
- 1 = 完全同向(语义几乎一样)
- 0 = 垂直(语义无关)
- -1 = 完全反向(语义相反)
面试话术:
"Embedding 是语义的数学表示。我用余弦相似度衡量相关性,用 HNSW 索引加速检索。"
