🧠 图解记忆: 量化不只压权重,还要看激活和 KV;省显存能否提速取决于内核、硬件与质量。
💡 答案要点
量化支持对比:
| 量化方案 | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| FP8 | ❌ | ❌ | ✅(H100/L40S专属) |
| INT4 | ✅(AWQ/GPTQ) | ✅(AWQ/GPTQ) | ✅ |
| AWQ | ✅ | ✅ | ✅ |
量化性能提升(AWQ INT4,LLaMA-2-7B on A100):
| 框架 | FP16 | INT4 | 提升 |
|---|---|---|---|
| vLLM | 2500 tok/s | 4200 tok/s | 1.7× |
| SGLang | 3800 tok/s | 5800 tok/s | 1.5× |
| TensorRT-LLM | 4200 tok/s | 6500 tok/s | 1.5× |
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "量化是生产环境的标配。INT4 量化后 7B 模型可以从 16GB 降到 8GB,RTX 4090 都能跑。但量化有精度损失,我一般先用 vLLM 的 AWQ 量化,实测精度损失<1%,性能提升 1.5×。"
