🧠 图解记忆:注意力负责全局交互,SSM 负责线性长程状态;点击图片可查看原图。
💡 答案要点
为什么值得了解:
SSM、Mamba 及注意力/SSM 混合架构是长序列建模的重要研究方向。不要把未公开的闭源模型内部结构当作已确认事实;面试重点应放在计算复杂度、状态压缩、并行训练和信息检索能力的取舍。
SSM(状态空间模型)是什么:
SSM将序列建模视为一个"状态转移系统":
输入序列 x(t) → 状态空间模型 → 输出序列 y(t)
↑
隐状态 h(t)
核心方程(连续形式):
h'(t) = Ah(t) + Bx(t) ← 状态更新
y(t) = Ch(t) + Dx(t) ← 输出生成
离散化后(实际计算形式):
h_t = Ah_{t-1} + Bx_t ← 线性 recurrence
y_t = Ch_t| 特性 | Transformer | SSM(Mamba) |
|---|---|---|
| 计算复杂度 | O(n²) 自注意力 | O(n) 线性 recurrence |
| 长序列处理 | 显存瓶颈 | 天然支持长序列 |
| 并行训练 | 容易(矩阵运算) | 需要并行算法优化 |
| 推理速度 | 慢(需要完整注意力) | 快(固定状态转移) |
| 信息访问方式 | 可直接做 token 间内容寻址 | 历史被压入状态,随机回看能力受结构影响 |
Mamba的核心创新:Selection Mechanism(选择性机制)
传统SSM对所有输入用相同的静态矩阵——这和"不根据输入调整"的CNN一样,限制了表达能力。
Mamba的关键洞察:让SSM的参数变成输入的函数
静态 SSM: h_t = Ah_{t-1} + Bx_t ← A、B 不变
Mamba(选择性):h_t = A(x_t)h_{t-1} + B(x_t)x_t ← 输入决定参数
→ 模型能"选择性遗忘"无关信息,"选择性记住"关键信息
→ 类似于LSTM的门控机制,但参数更少为什么需要Transformer + SSM混合架构:
┌─────────────────────────────────────────────────┐
│ 2026年大模型混合架构 │
├─────────────────────────────────────────────────┤
│ Transformer层:擅长全局注意力 │
│ → 复杂推理、多跳关系、长距离依赖 │
│ → 瓶颈:O(n²) 显存,n越长越贵 │
├─────────────────────────────────────────────────┤
│ SSM层:擅长线性长程依赖 │
│ → 简单模式识别、长程记忆、归纳偏置 │
│ → 瓶颈:表达复杂推理关系不如Transformer │
├─────────────────────────────────────────────────┤
│ 混合结果: │
│ → 降低部分长序列层的计算或状态成本 │
│ → 保留若干注意力层的内容寻址能力 │
│ → 效果、吞吐和延迟仍需按模型与硬件验证 │
└─────────────────────────────────────────────────┘判断一个混合架构时要问:
| 问题 | 原因 |
|---|---|
| 哪些层使用注意力、哪些层使用 SSM? | 决定全局内容寻址与线性扫描的比例 |
| 训练阶段能否并行扫描? | 理论复杂度不等于硬件实际吞吐 |
| 推理要保存哪些状态? | 决定长上下文显存和每 token 带宽 |
| 在检索、复制、长程依赖任务上表现如何? | 固定大小状态可能形成信息瓶颈 |
面试话术:
"SSM 通过递推状态在线性扫描中压缩历史,避免每层都构造完整的两两注意力;注意力则擅长按内容直接访问上下文。混合架构希望兼顾二者,但不能据此保证质量不降或速度必然更快。我会看层配比、状态大小、训练并行算法,并在长程检索与目标硬件上验证。"
⭐ 面试加分项:
- 能画出Mamba block的结构图(SSM + 线性投影 + 激活函数)
- 理解Mamba的硬件感知并行性(通过并行扫描算法解决recurrence的并行难题)
- 知道SSM和CNN/RNN的本质区别(SSM是连续系统离散化,参数是动态的)
