Skip to content
🔗 分享本题
查看我的学习进度 →
概念一句话解释
多模态学习让模型同时理解图像、文本、音频等多种数据
模态对齐将不同模态映射到同一语义空间
跨模态检索输入一种模态,检索另一种模态
Zero-shot不需要训练,直接分类任意类别

CLIP

概念一句话解释
CLIP用对比学习对齐图文,支持 Zero-shot
对比损失让匹配的图文相似,不匹配的不相似
Prompt 模板"a photo of a {class}"提升分类效果

BLIP

概念一句话解释
BLIP理解+生成,支持检索、字幕、VQA
ITC+ITM+LM三个训练目标:对比+匹配+生成
CapFilt用模型生成字幕并过滤数据,自举学习
Q-Former可学习 Query 提取视觉信息,连接视觉和语言
生图子模型Stable Diffusion/DALL-E/Flux,Prompt→图像
生图多样性temperature/CFG参数+负向提示词+多种子采样
生图评估FID定量+CLIP-Score语义相似度+人工评测