🧠 图解记忆: TensorRT-LLM 用更深的硬件定制换极致性能,也用构建复杂度和灵活性付费。
💡 答案要点
极致性能的来源:
- 内核融合:减少显存访问次数
- FP8 量化:硬件级支持,显存带宽翻倍(H100/L40S)
- TensorRT 编译器优化:算子融合、图优化,比 PyTorch 快 2-5 倍
局限:
| 局限 | 说明 |
|---|---|
| 仅支持 NVIDIA | 苹果AMD都不支持 |
| 模型需编译 | 转换需额外时间(10-60分钟) |
| 调试困难 | 黑盒优化,出错难排查 |
面试话术:
"TensorRT-LLM 的极致性能来自内核融合和硬件级优化,H100上能做到比vLLM快2-3倍。但它的局限也很明显:只支持NVIDIA,模型需要预编译。我的建议是:POC用vLLM快速验证,生产环境用TensorRT-LLM优化。"
