🧠 图解记忆:范式1:Cross-Attention架构(LLM as Controller);点击图片可查看原图。
💡 答案要点
两种主流架构范式:
范式1:Cross-Attention架构(LLM as Controller)
图像 → 视觉编码器(冻结) → 线性投影 → LLM(Controller)
↓
用户文本 ← LLM生成 ← 跨注意力交互 ← 视觉特征代表:LLaVA、Qwen-VL 特点:轻量级,视觉编码器冻结,训练效率高
范式2:原生多模态架构(End-to-End)
图像 + 文本 → 统一token序列 → 原生Transformer → 输出代表:GPT-4o、Gemini 2.0 特点:端到端训练,模态融合更深,性能更强
LLaVA架构详解:
┌─────────────────────────────────────────────────────┐
│ LLaVA 架构 │
├─────────────────────────────────────────────────────┤
│ 图像输入 │
│ ↓ │
│ CLIP ViT-L/14(冻结)→ 视觉特征 [H×W×1024] │
│ ↓ │
│ 线性投影层(可训练)→ 视觉token序列 [N×4096] │
│ ↓ │
│ 用户文本 → Tokenizer → 文本token序列 │
│ ↓ │
│ Vicuna LLM(指令微调)→ 跨模态注意力 │
│ ↓ │
│ 输出文本回答 │
└─────────────────────────────────────────────────────┘关键组件:
| 组件 | 作用 | 常见选择 |
|---|---|---|
| 视觉编码器 | 提取图像特征 | CLIP ViT、SigLIP、EVA-CLIP |
| 投影层 | 视觉→文本空间映射 | 线性层/MLP/Perceiver Resampler |
| LLM基座 | 理解和生成 | Vicuna、Qwen、Llama |
| 对齐训练 | 模态对齐 | LLaVA-1.5使用MLP投影 |
面试话术:
"LLaVA的核心是'冻住视觉编码器,只训练投影层',这样训练成本低。GPT-4o是端到端原生多模态,视觉和文本token在同一空间融合,效果更好但训练成本高。"
