🧠 图解记忆:理解看编码,转换看双栈,开放生成常用 Decoder-only;点击图片可查看原图。
三类架构对比
| 架构 | 代表模型 | 特点 | 现状 |
|---|---|---|---|
| Encoder-only | BERT | 双向理解,适合分类/检索 | 被 LLM 时代边缘化 |
| Encoder-Decoder | T5、BART | 编码+解码,适合翻译摘要 | 部分场景仍用 |
| Decoder-only | GPT、LLaMA、Qwen、DeepSeek | 自回归单向生成 | 主流(ChatGPT 系) |
Decoder-only 胜出的原因
- 训练目标统一:预训练(next-token prediction)与推理(续写)一致,无需任务适配
- 架构简单:单一 Transformer 栈,工程优化(KV Cache、量化)更聚焦
- 扩展性好:decoder 在超大参数量下的 scaling law 表现更优
- 生态成熟:InstructGPT/RLHF 等对齐技术都是围绕 decoder-only 建立
- In-context Learning 强:统一 autoregressive 目标下少样本学习能力更突出
面试话术
"主流 LLM 选择 Decoder-only,核心是预训练和推理目标统一:都是预测下一个 Token。相比 BERT 需要任务头、T5 需要任务模板,Decoder-only 架构简单、扩展性好、对齐技术成熟,在 Scaling Law 下表现最优,所以 ChatGPT 系模型都走这条路。"
