🧠 图解记忆: PagedAttention 不直接加速算子,它用更少浪费换更多并发,再把 GPU 喂得更满。
💡 答案要点
核心原因:解决显存碎片化问题
- 传统方案若按最大长度预留连续 KV Cache,会产生预留浪费和碎片
- PagedAttention:逻辑块映射到可非连续物理块,按需分配
- 同等显存下通常能容纳更多有效 KV 数据和并发序列
分页块管理:减少碎片与过度预留
+ 连续批处理:完成的序列退出,新请求动态加入
= 提升可承载并发和吞吐;幅度由负载与实现决定面试话术:
"就像内存管理从固定分区变成分页。固定分区会产生内存碎片,分页管理按需分配,内存利用率大幅提升。PagedAttention 正是这个思想在 GPU 显存管理上的应用。"
