Skip to content
🔗 分享本题
查看我的学习进度 →

21 模块 Q3 教学图:视觉语言模型的核心架构是怎样的?

🧠 图解记忆:范式1:Cross-Attention架构(LLM as Controller);点击图片可查看原图。

💡 答案要点

两种主流架构范式:

范式1:Cross-Attention架构(LLM as Controller)

图像 → 视觉编码器(冻结) → 线性投影 → LLM(Controller)

用户文本 ← LLM生成 ← 跨注意力交互 ← 视觉特征

代表:LLaVA、Qwen-VL 特点:轻量级,视觉编码器冻结,训练效率高

范式2:原生多模态架构(End-to-End)

图像 + 文本 → 统一token序列 → 原生Transformer → 输出

代表:GPT-4o、Gemini 2.0 特点:端到端训练,模态融合更深,性能更强

LLaVA架构详解:

┌─────────────────────────────────────────────────────┐
│                    LLaVA 架构                        │
├─────────────────────────────────────────────────────┤
│  图像输入                                            │
│    ↓                                                │
│  CLIP ViT-L/14(冻结)→ 视觉特征 [H×W×1024]         │
│    ↓                                                │
│  线性投影层(可训练)→ 视觉token序列 [N×4096]         │
│    ↓                                                │
│  用户文本 → Tokenizer → 文本token序列                 │
│    ↓                                                │
│  Vicuna LLM(指令微调)→ 跨模态注意力               │
│    ↓                                                │
│  输出文本回答                                         │
└─────────────────────────────────────────────────────┘

关键组件:

组件作用常见选择
视觉编码器提取图像特征CLIP ViT、SigLIP、EVA-CLIP
投影层视觉→文本空间映射线性层/MLP/Perceiver Resampler
LLM基座理解和生成Vicuna、Qwen、Llama
对齐训练模态对齐LLaVA-1.5使用MLP投影

面试话术:

"LLaVA的核心是'冻住视觉编码器,只训练投影层',这样训练成本低。GPT-4o是端到端原生多模态,视觉和文本token在同一空间融合,效果更好但训练成本高。"

📚 参考:LLaVA:Visual Encoder + LLM 的连接范式