🧠 图解记忆: 权重是底座,KV 随并发和长度增长;三框架差异主要在分配、复用和图级规划。
💡 答案要点
| 框架 | 技术 | 特点 |
|---|---|---|
| vLLM | PagedAttention(分页式) | 逻辑块映射到可非连续物理块,按需分配 |
| SGLang | RadixAttention(基数树) | 前缀复用,跨请求共享,自动缓存淘汰 |
| TensorRT-LLM | Paged KV Cache + In-flight Batching | 显存优化 + 动态批处理 |
面试话术:
"三者都在优化 KV Cache 和调度,但侧重点不同:vLLM 用分页块管理降低碎片;SGLang 用 Radix Tree 组织并复用共享前缀;TensorRT-LLM 结合分页 KV Cache、批调度和 NVIDIA 平台优化。谁更省显存要在相同模型、精度和负载下测,不能脱离条件给固定排名。"
