Skip to content
🔗 分享本题
查看我的学习进度 →

🧠 图解记忆:单一架构通吃所有任务,统一比分裂更高效。

💡 答案要点

架构演化简史:

2017: Encoder-Decoder → 机器翻译
  +-- Encoder-only (BERT,2018) → NLU称霸
  +-- Decoder-only (GPT,2018) → 文本生成
2020: GPT-3展示scaled-up Decoder-only超越BERT
2022-至今: Decoder-Only全面接管
  LLaMA→Mistral→Qwen→Gemma→Yi→全Decoder-only

五大核心原因:

  1. 统一架构=统一训练:同一个模型一个prompt覆盖分类/摘要/QA/对话,只需维护一套参数
  2. 自回归训练的免费并行信号:一次forward就获所有位置的监督信号,不需要MLM特殊mask或NSP第二句话任务
  3. In-Context Learning天然载体:causal mask决定了单向推进模式,非常适合few-shot learning
  4. 推理效率优势(流式输出):Pre-fill并行计算KV Cache,Decode串行逐token生成速度快
  5. 多模态扩展兼容性:所有模态拼成一条序列用同一decoder处理,GPT-4o/Claude/Gemini都走这条路

面试加分项: GPT-3是Decoder-only超越BERT转折点、理解多模态融合的统一性优势

面试话术:

"Decoder-Only之所以成为绝对主流,核心原因是统一——同一个模型用同一个预训练目标覆盖所有任务。加上in-context learning天然适合因果解码、流式体验好、多模态需要一个统一的序列容器,三个优势叠加导致行业加速converged到decoder-only。"