🧠 图解记忆:多模态Agent = 能感知和理解多种模态(文本、图像、视频、音频)并采取行动的Agent;点击图片可查看原图。
💡 答案要点
多模态Agent = 能感知和理解多种模态(文本、图像、视频、音频)并采取行动的Agent
核心区别:
| 维度 | 单模态Agent | 多模态Agent |
|---|---|---|
| 输入 | 仅文本 | 文本+图像+视频+音频 |
| 感知能力 | 语义理解 | 视觉语义+时空理解 |
| 典型场景 | 客服对话、代码生成 | 视觉问答、文档理解、视频分析 |
| 技术难度 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
架构对比:
单模态Agent:
用户文本 → LLM(大脑) → 工具调用 → 文本回复
多模态Agent:
用户文本+图片 → 视觉编码器 → LLM(大脑) → 工具调用 → 跨模态回复
↓ ↑
视觉特征 视觉动作为什么需要多模态Agent?
- 真实世界是多模态的 — 人类交流不仅靠文字,还靠图片、图表、视频
- 商业场景需求 — 发票识别、产品质检、医疗影像分析
- 交互体验升级 — 截图提问、拍照解题、手绘转代码
主流多模态Agent场景:
多模态Agent应用场景
├── 视觉问答(VQA)— 看图回答问题
├── 文档理解 — 发票/合同/报表自动分析
├── 视觉导航 — 看图操控界面/机器人
├── 视频理解 — 视频摘要、异常检测
└── 跨模态生成 — 图生文、文生图、视频生成面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "多模态Agent的核心是多模态理解+Agent决策。我在项目中实现了'截图提问Agent':用户截一张错误截图,Agent识别错误类型、自动搜索解决方案、生成修复代码,端到端完成bug修复。"
