面试优先顺序(通用 AI 应用开发岗位):Q1、Q2、Q3、Q7、Q8、Q9、Q10、Q14、Q15。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐ 更新: 2026-04-15 考点: CLIP、BLIP、多模态理解、图文生成、Gemma 4、端侧部署
| 日期 | 更新内容 |
|---|---|
| 2026-04-15 | 新增 Q16 Gemma 4(Google DeepMind 2026年4月发布,PLE/Shared KV Cache/MoE架构,端侧多模态突破) |
| 2026-03-05 | 新增多模态大模型面试题 8 道 |
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
BLIP模型
CLIP模型
Gemma 4 架构案例
Vision-Language Agent 评估
全模态模型案例
- Q16 · Qwen3.5-Omni 是什么?Thinker-Talker 架构和 Hybrid-Attention MoE 有何创新?为什么"全模态"是2026年的重要方向?
- Q17 · NVIDIA Nemotron 3 Nano Omni 是什么?为什么"端侧全模态"是2026年的重要方向?
- Q18 · 如何用模型路由设计低延迟多模态 Agent?
多模态基础
应用实战
- ⭐ Q7 · 如何用多模态模型做图文检索系统?
- ⭐ Q8 · 如何评估和优化多模态 RAG 系统?
- ⭐ Q9 · LLaVA 如何工作?视觉 Encoder 如何连接 LLM?
- ⭐ Q10 · 多模态 RAG 如何实现?图文混合检索怎么做?