| 概念 | 一句话解释 |
|---|---|
| 多模态学习 | 让模型同时理解图像、文本、音频等多种数据 |
| 模态对齐 | 将不同模态映射到同一语义空间 |
| 跨模态检索 | 输入一种模态,检索另一种模态 |
| Zero-shot | 不需要训练,直接分类任意类别 |
CLIP
| 概念 | 一句话解释 |
|---|---|
| CLIP | 用对比学习对齐图文,支持 Zero-shot |
| 对比损失 | 让匹配的图文相似,不匹配的不相似 |
| Prompt 模板 | "a photo of a {class}"提升分类效果 |
BLIP
| 概念 | 一句话解释 |
|---|---|
| BLIP | 理解+生成,支持检索、字幕、VQA |
| ITC+ITM+LM | 三个训练目标:对比+匹配+生成 |
| CapFilt | 用模型生成字幕并过滤数据,自举学习 |
| Q-Former | 可学习 Query 提取视觉信息,连接视觉和语言 |
| 生图子模型 | Stable Diffusion/DALL-E/Flux,Prompt→图像 |
| 生图多样性 | temperature/CFG参数+负向提示词+多种子采样 |
| 生图评估 | FID定量+CLIP-Score语义相似度+人工评测 |