🧠 图解记忆:单一架构通吃所有任务,统一比分裂更高效。
💡 答案要点
架构演化简史:
2017: Encoder-Decoder → 机器翻译
+-- Encoder-only (BERT,2018) → NLU称霸
+-- Decoder-only (GPT,2018) → 文本生成
2020: GPT-3展示scaled-up Decoder-only超越BERT
2022-至今: Decoder-Only全面接管
LLaMA→Mistral→Qwen→Gemma→Yi→全Decoder-only五大核心原因:
- 统一架构=统一训练:同一个模型一个prompt覆盖分类/摘要/QA/对话,只需维护一套参数
- 自回归训练的免费并行信号:一次forward就获所有位置的监督信号,不需要MLM特殊mask或NSP第二句话任务
- In-Context Learning天然载体:causal mask决定了单向推进模式,非常适合few-shot learning
- 推理效率优势(流式输出):Pre-fill并行计算KV Cache,Decode串行逐token生成速度快
- 多模态扩展兼容性:所有模态拼成一条序列用同一decoder处理,GPT-4o/Claude/Gemini都走这条路
面试加分项: GPT-3是Decoder-only超越BERT转折点、理解多模态融合的统一性优势
面试话术:
"Decoder-Only之所以成为绝对主流,核心原因是统一——同一个模型用同一个预训练目标覆盖所有任务。加上in-context learning天然适合因果解码、流式体验好、多模态需要一个统一的序列容器,三个优势叠加导致行业加速converged到decoder-only。"