🧠 图解记忆:多模态模型没有一个万能分数,检索看排序召回、理解看答案正确性、生成同时看质量与跨模态对齐;点击图片可查看原图。
💡 答案要点
评估维度:
1. 跨模态检索(Image-Text Retrieval):
| 指标 | 说明 | 计算方式 |
|---|---|---|
| R@1 | Top-1 召回率 | 正确结果在第1位的比例 |
| R@5 | Top-5 召回率 | 正确结果在前5位的比例 |
| R@10 | Top-10 召回率 | 正确结果在前10位的比例 |
示例(Flickr30K):
任务:给定图片,从 1000 个候选文本中找出匹配的
CLIP 结果:
R@1 = 88.0%(第1位就找对)
R@5 = 98.7%(前5位能找对)
R@10 = 99.4%(前10位能找对)2. 视觉问答(VQA):
| 指标 | 说明 |
|---|---|
| 准确率 | 答案完全匹配的比例 |
| CIDEr | 与人类答案的相似度 |
3. 图像字幕(Image Captioning):
| 指标 | 说明 | 范围 |
|---|---|---|
| BLEU | n-gram 重叠度 | 0-1 |
| METEOR | 考虑同义词的匹配 | 0-1 |
| CIDEr | 共识度量 | 0-10 |
| SPICE | 语义匹配 | 0-1 |
4. 文生图(Text-to-Image):
| 指标 | 说明 |
|---|---|
| FID | 生成图像与真实图像的分布距离(越小越好) |
| CLIP Score | 生成图像与文本的匹配度 |
| 人工评分 | 专家打分(质量、相关性) |
综合评估(COCO Benchmark):
| 模型 | VQA Acc | Caption CIDEr | Retrieval R@1 |
|---|---|---|---|
| CLIP | - | - | 58.4% |
| BLIP | 78.3% | 136.7 | 82.3% |
| BLIP-2 | 82.4% | 144.5 | 85.9% |
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "多模态评估要看多个维度。检索任务看 R@K,问答看准确率,字幕看 CIDEr。我在项目中用 CLIP Score 评估文生图质量,结合人工抽检确保效果。"
📚 参考:MME:多模态 LLM 综合评测基准
