Skip to content
🔗 分享本题
查看我的学习进度 →

多模态评估图解:检索、理解和生成任务分别映射到匹配的评价指标

🧠 图解记忆:多模态模型没有一个万能分数,检索看排序召回、理解看答案正确性、生成同时看质量与跨模态对齐;点击图片可查看原图。

💡 答案要点

评估维度:

1. 跨模态检索(Image-Text Retrieval):

指标说明计算方式
R@1Top-1 召回率正确结果在第1位的比例
R@5Top-5 召回率正确结果在前5位的比例
R@10Top-10 召回率正确结果在前10位的比例

示例(Flickr30K):

任务:给定图片,从 1000 个候选文本中找出匹配的

CLIP 结果:
  R@1 = 88.0%(第1位就找对)
  R@5 = 98.7%(前5位能找对)
  R@10 = 99.4%(前10位能找对)

2. 视觉问答(VQA):

指标说明
准确率答案完全匹配的比例
CIDEr与人类答案的相似度

3. 图像字幕(Image Captioning):

指标说明范围
BLEUn-gram 重叠度0-1
METEOR考虑同义词的匹配0-1
CIDEr共识度量0-10
SPICE语义匹配0-1

4. 文生图(Text-to-Image):

指标说明
FID生成图像与真实图像的分布距离(越小越好)
CLIP Score生成图像与文本的匹配度
人工评分专家打分(质量、相关性)

综合评估(COCO Benchmark):

模型VQA AccCaption CIDErRetrieval R@1
CLIP--58.4%
BLIP78.3%136.782.3%
BLIP-282.4%144.585.9%

面试话术:

示例表达(仅在能用本人经历或可复现实验佐证时使用): "多模态评估要看多个维度。检索任务看 R@K,问答看准确率,字幕看 CIDEr。我在项目中用 CLIP Score 评估文生图质量,结合人工抽检确保效果。"

📚 参考:MME:多模态 LLM 综合评测基准