🧠 图解记忆:GPT-4V的视觉理解流程;点击图片可查看原图。
💡 答案要点
GPT-4V的视觉理解流程:
用户上传图片
↓
Step 1: 图像预处理
→ 缩放到固定分辨率(如1000×1000)
→ 切分成小块(patch)
→ 每个patch转换为token
Step 2: 视觉编码
→ Vision Transformer (ViT) 处理patch序列
→ 输出视觉特征向量
Step 3: 模态对齐
→ 视觉特征通过投影层映射到文本token空间
→ 与文本token拼接
Step 4: LLM推理
→ 统一的Transformer处理多模态输入
→ 生成文本输出和纯文本LLM的关键区别:
| 维度 | 纯文本LLM | GPT-4V等多模态LLM |
|---|---|---|
| 输入处理 | Tokenizer文本分词 | 视觉编码器+投影层 |
| 注意力 | 纯文本自注意力 | 跨模态交叉注意力 |
| 预训练 | 大量文本数据 | 图文对数据对齐 |
| 幻觉类型 | 文本捏造事实 | 可能"看错"图像细节 |
| 能力边界 | 文本理解生成 | + 视觉感知理解 |
GPT-4V的局限性和应对:
| 局限性 | 示例 | 缓解方案 |
|---|---|---|
| 视觉细节忽略 | 数字"1"和字母"l"混淆 | 高分辨率输入、多角度确认 |
| 空间位置弱 | "左边"vs"右边"判断错误 | 显式询问坐标 |
| 依赖训练数据 | 不常见的专业图表 | 提供更多上下文 |
| 中文OCR弱 | 中文识别准确率低于英文 | 用专业OCR预处理 |
面试话术:
"GPT-4V本质上是'视觉特征+LLM推理'的结合,不是真正的端到端视觉理解。强项是语义理解和推理,弱项是精确数值读取。我做UI测试时发现,对齐问题用GPT-4V很准,但像素级定位误差大,所以用目标检测模型辅助。"
