Skip to content
🔗 分享本题
查看我的学习进度 →

推理框架专题第4题核心机制与工程取舍图解

🧠 图解记忆: 权重是底座,KV 随并发和长度增长;三框架差异主要在分配、复用和图级规划。

💡 答案要点
框架技术特点
vLLMPagedAttention(分页式)逻辑块映射到可非连续物理块,按需分配
SGLangRadixAttention(基数树)前缀复用,跨请求共享,自动缓存淘汰
TensorRT-LLMPaged KV Cache + In-flight Batching显存优化 + 动态批处理

面试话术:

"三者都在优化 KV Cache 和调度,但侧重点不同:vLLM 用分页块管理降低碎片;SGLang 用 Radix Tree 组织并复用共享前缀;TensorRT-LLM 结合分页 KV Cache、批调度和 NVIDIA 平台优化。谁更省显存要在相同模型、精度和负载下测,不能脱离条件给固定排名。"