Skip to content
🔗 分享本题
查看我的学习进度 →

Transformer 与 SSM 混合架构动漫知识图:Transformer 擅长全局关系但注意力成本随长度平方增长,SSM 以选择性状态做线性序列建模,混合层发挥二者互补能力

🧠 图解记忆:注意力负责全局交互,SSM 负责线性长程状态;点击图片可查看原图。

💡 答案要点

为什么值得了解:

SSM、Mamba 及注意力/SSM 混合架构是长序列建模的重要研究方向。不要把未公开的闭源模型内部结构当作已确认事实;面试重点应放在计算复杂度、状态压缩、并行训练和信息检索能力的取舍。


SSM(状态空间模型)是什么:

SSM将序列建模视为一个"状态转移系统":

输入序列 x(t) → 状态空间模型 → 输出序列 y(t)

              隐状态 h(t)

核心方程(连续形式):
  h'(t) = Ah(t) + Bx(t)     ← 状态更新
  y(t)   = Ch(t) + Dx(t)    ← 输出生成

离散化后(实际计算形式):
  h_t = Ah_{t-1} + Bx_t     ← 线性 recurrence
  y_t = Ch_t
特性TransformerSSM(Mamba)
计算复杂度O(n²) 自注意力O(n) 线性 recurrence
长序列处理显存瓶颈天然支持长序列
并行训练容易(矩阵运算)需要并行算法优化
推理速度慢(需要完整注意力)快(固定状态转移)
信息访问方式可直接做 token 间内容寻址历史被压入状态,随机回看能力受结构影响

Mamba的核心创新:Selection Mechanism(选择性机制)

传统SSM对所有输入用相同的静态矩阵——这和"不根据输入调整"的CNN一样,限制了表达能力。

Mamba的关键洞察:让SSM的参数变成输入的函数

静态 SSM:      h_t = Ah_{t-1} + Bx_t     ← A、B 不变
Mamba(选择性):h_t = A(x_t)h_{t-1} + B(x_t)x_t  ← 输入决定参数

→ 模型能"选择性遗忘"无关信息,"选择性记住"关键信息
→ 类似于LSTM的门控机制,但参数更少

为什么需要Transformer + SSM混合架构:

┌─────────────────────────────────────────────────┐
│          2026年大模型混合架构                    │
├─────────────────────────────────────────────────┤
│  Transformer层:擅长全局注意力                   │
│  → 复杂推理、多跳关系、长距离依赖                │
│  → 瓶颈:O(n²) 显存,n越长越贵                  │
├─────────────────────────────────────────────────┤
│  SSM层:擅长线性长程依赖                         │
│  → 简单模式识别、长程记忆、归纳偏置              │
│  → 瓶颈:表达复杂推理关系不如Transformer        │
├─────────────────────────────────────────────────┤
│  混合结果:                                      │
│  → 降低部分长序列层的计算或状态成本              │
│  → 保留若干注意力层的内容寻址能力                │
│  → 效果、吞吐和延迟仍需按模型与硬件验证          │
└─────────────────────────────────────────────────┘

判断一个混合架构时要问:

问题原因
哪些层使用注意力、哪些层使用 SSM?决定全局内容寻址与线性扫描的比例
训练阶段能否并行扫描?理论复杂度不等于硬件实际吞吐
推理要保存哪些状态?决定长上下文显存和每 token 带宽
在检索、复制、长程依赖任务上表现如何?固定大小状态可能形成信息瓶颈

面试话术:

"SSM 通过递推状态在线性扫描中压缩历史,避免每层都构造完整的两两注意力;注意力则擅长按内容直接访问上下文。混合架构希望兼顾二者,但不能据此保证质量不降或速度必然更快。我会看层配比、状态大小、训练并行算法,并在长程检索与目标硬件上验证。"


⭐ 面试加分项:

  • 能画出Mamba block的结构图(SSM + 线性投影 + 激活函数)
  • 理解Mamba的硬件感知并行性(通过并行扫描算法解决recurrence的并行难题)
  • 知道SSM和CNN/RNN的本质区别(SSM是连续系统离散化,参数是动态的)