Skip to content
🔗 分享本题
查看我的学习进度 →

推理框架专题第11题核心机制与工程取舍图解

🧠 图解记忆: PagedAttention 不直接加速算子,它用更少浪费换更多并发,再把 GPU 喂得更满。

💡 答案要点

核心原因:解决显存碎片化问题

  • 传统方案若按最大长度预留连续 KV Cache,会产生预留浪费和碎片
  • PagedAttention:逻辑块映射到可非连续物理块,按需分配
  • 同等显存下通常能容纳更多有效 KV 数据和并发序列
分页块管理:减少碎片与过度预留
+ 连续批处理:完成的序列退出,新请求动态加入
= 提升可承载并发和吞吐;幅度由负载与实现决定

面试话术:

"就像内存管理从固定分区变成分页。固定分区会产生内存碎片,分页管理按需分配,内存利用率大幅提升。PagedAttention 正是这个思想在 GPU 显存管理上的应用。"