Skip to content
🔗 分享本题
查看我的学习进度 →

Transformer 架构对比动漫知识图:Encoder-only 擅长理解表征,Encoder-Decoder 擅长条件转换,Decoder-only 用因果注意力统一下一词预测和开放生成

🧠 图解记忆:理解看编码,转换看双栈,开放生成常用 Decoder-only;点击图片可查看原图。

三类架构对比

架构代表模型特点现状
Encoder-onlyBERT双向理解,适合分类/检索被 LLM 时代边缘化
Encoder-DecoderT5、BART编码+解码,适合翻译摘要部分场景仍用
Decoder-onlyGPT、LLaMA、Qwen、DeepSeek自回归单向生成主流(ChatGPT 系)

Decoder-only 胜出的原因

  1. 训练目标统一:预训练(next-token prediction)与推理(续写)一致,无需任务适配
  2. 架构简单:单一 Transformer 栈,工程优化(KV Cache、量化)更聚焦
  3. 扩展性好:decoder 在超大参数量下的 scaling law 表现更优
  4. 生态成熟:InstructGPT/RLHF 等对齐技术都是围绕 decoder-only 建立
  5. In-context Learning 强:统一 autoregressive 目标下少样本学习能力更突出

面试话术

"主流 LLM 选择 Decoder-only,核心是预训练和推理目标统一:都是预测下一个 Token。相比 BERT 需要任务头、T5 需要任务模板,Decoder-only 架构简单、扩展性好、对齐技术成熟,在 Scaling Law 下表现最优,所以 ChatGPT 系模型都走这条路。"


📚 参考:Language Models are Few-Shot Learners(GPT-3 论文)