面试优先顺序(通用 AI 应用开发岗位):Q1、Q3、Q5、Q6、Q8、Q9、Q10、Q11、Q14、Q15。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐⭐ 更新: 2026-04-08 考点: GPT-4V、Gemini、LLaVA、视觉Agent、Document AI、Video Agent
| 概念 | 一句话解释 |
|---|---|
| 多模态Agent | 能感知图像、视频并采取行动的Agent |
| LLaVA架构 | CLIP冻结+投影层+LLM,微调成本低 |
| Perceiver Resampler | 用可学习query压缩视觉token |
| 视觉工具集 | 截图/OCR/目标检测/点击等执行能力 |
| 多图处理 | 独立编码+顺序拼接,原生多图更好 |
| 多模态RAG | 图像OCR描述+跨模态检索+融合生成 |
| 视频Agent | 帧采样+时序建模+事件理解 |
| 企业多模态 | 编排层+工具层+基础设施三层架构 |
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
GUI Agent 与 Computer Use
- ⭐ Q14 · 什么是GUI Agent?为什么2026年"Computer Use"成为多模态Agent的核心战场?
- ⭐ Q15 · Mobile-Agent-v3和AppAgent有什么区别?移动端GUI Agent有哪些独特挑战?