Skip to content

面试优先顺序(通用 AI 应用开发岗位):Q1、Q3、Q5、Q6、Q8、Q9、Q10、Q11、Q14、Q15。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。

难度: ⭐⭐⭐⭐⭐ 更新: 2026-04-08 考点: GPT-4V、Gemini、LLaVA、视觉Agent、Document AI、Video Agent


概念一句话解释
多模态Agent能感知图像、视频并采取行动的Agent
LLaVA架构CLIP冻结+投影层+LLM,微调成本低
Perceiver Resampler用可学习query压缩视觉token
视觉工具集截图/OCR/目标检测/点击等执行能力
多图处理独立编码+顺序拼接,原生多图更好
多模态RAG图像OCR描述+跨模态检索+融合生成
视频Agent帧采样+时序建模+事件理解
企业多模态编排层+工具层+基础设施三层架构

题目目录(按原文档学习顺序,⭐ = 面试高频优先题)

GUI Agent 与 Computer Use

NVIDIA Nemotron 3与GTC 2026多模态Agent新突破(2026年4月新增)

Qwen3-VL 架构案例

企业级实战案例

多模态Agent基础概念

文档理解与OCR-Agent

视觉工具与Agent设计

视觉语言模型核心原理

视频理解与时序Agent

参考资料