Skip to content
🔗 分享本题
查看我的学习进度 →

21 模块 Q1 教学图:什么是多模态Agent?和单模态Agent有什么区别?

🧠 图解记忆:多模态Agent = 能感知和理解多种模态(文本、图像、视频、音频)并采取行动的Agent;点击图片可查看原图。

💡 答案要点

多模态Agent = 能感知和理解多种模态(文本、图像、视频、音频)并采取行动的Agent

核心区别:

维度单模态Agent多模态Agent
输入仅文本文本+图像+视频+音频
感知能力语义理解视觉语义+时空理解
典型场景客服对话、代码生成视觉问答、文档理解、视频分析
技术难度⭐⭐⭐⭐⭐⭐⭐⭐

架构对比:

单模态Agent:
用户文本 → LLM(大脑) → 工具调用 → 文本回复

多模态Agent:
用户文本+图片 → 视觉编码器 → LLM(大脑) → 工具调用 → 跨模态回复
     ↓                    ↑
  视觉特征              视觉动作

为什么需要多模态Agent?

  1. 真实世界是多模态的 — 人类交流不仅靠文字,还靠图片、图表、视频
  2. 商业场景需求 — 发票识别、产品质检、医疗影像分析
  3. 交互体验升级 — 截图提问、拍照解题、手绘转代码

主流多模态Agent场景:

多模态Agent应用场景
├── 视觉问答(VQA)— 看图回答问题
├── 文档理解 — 发票/合同/报表自动分析
├── 视觉导航 — 看图操控界面/机器人
├── 视频理解 — 视频摘要、异常检测
└── 跨模态生成 — 图生文、文生图、视频生成

面试话术:

示例表达(仅在能用本人经历或可复现实验佐证时使用): "多模态Agent的核心是多模态理解+Agent决策。我在项目中实现了'截图提问Agent':用户截一张错误截图,Agent识别错误类型、自动搜索解决方案、生成修复代码,端到端完成bug修复。"

📚 参考:Anthropic:Computer Use(多模态 GUI Agent)