🧠 图解记忆:多模态的价值不在于简单叠加输入,而在于把不同感官信号对齐到统一语义后完成理解、检索与生成;点击图片可查看原图。
💡 答案要点
多模态学习 = 让模型同时理解多种数据类型(图像、文本、音频、视频)
单模态 vs 多模态:
| 模态 | 单模态 | 多模态 |
|---|---|---|
| 文本 | GPT:只看文字 | GPT-4V:看图+文字 |
| 图像 | ResNet:只看图 | CLIP:图+文字对齐 |
| 音频 | Whisper:只听声音 | AudioLM:声音+文字 |
为什么需要多模态?
更丰富的理解
单模态: 看图 → "一个动物" 看文字 → "猫的特征" 多模态: 看图+文字 → "这是一只橘猫,正在睡觉"跨模态检索
文本检索图片: 输入:"夕阳下的海滩" 输出:相关图片 图片检索文本: 输入:一张海滩照片 输出:"这是美丽的夕阳海滩..."生成任务
看图说话(Image Captioning) 文生图(Text-to-Image) 视频理解(Video QA)
多模态的挑战:
| 挑战 | 说明 | 解决方案 |
|---|---|---|
| 模态对齐 | 图像和文本如何关联? | 对比学习(CLIP) |
| 模态融合 | 如何结合不同模态? | 交叉注意力(BLIP) |
| 数据获取 | 图文对数据标注成本高 | 网络爬取(LAION) |
| 计算成本 | 多模态模型参数量大 | 模型压缩、蒸馏 |
主流多模态任务:
多模态学习
├── 理解任务
│ ├── 图像字幕(Image Captioning)
│ ├── 视觉问答(VQA)
│ ├── 视觉推理(Visual Reasoning)
│ └── 跨模态检索(Cross-Modal Retrieval)
│
└── 生成任务
├── 文生图(Text-to-Image)
├── 图生文(Image-to-Text)
├── 视频生成(Video Generation)
└── 音频生成(Audio Generation)面试话术:
"多模态学习让 AI 像人一样,能同时看、听、读。单模态是盲人摸象,多模态才能全面理解。CLIP 用对比学习对齐图文,GPT-4V 能看图回答问题。"
📚 参考:CLIP(多模态对比学习开山之作)
