
🧠 记忆锚点:TTFT 看首 token,ITL/TPOT 看流式速度,吞吐要分请求与 token;用尾延迟和质量约束优化。
💡 答案要点
- TTFT(Time to First Token):从请求进入到首个 Token 返回,受排队、Prefill 和调度影响;
- TPOT(Time per Output Token):生成阶段平均每个输出 Token 的耗时;
- ITL(Inter-Token Latency):相邻 Token 的间隔,P95/P99 能反映流式输出是否卡顿;
- 吞吐:必须区分 requests/s、input tok/s 和 output tok/s;
- 端到端延迟:同时受到输入长度、输出长度、工具调用和网络影响。
提高批量大小通常增加吞吐,但可能恶化 TTFT;Chunked Prefill 能减少长 Prefill 对其他请求的阻塞,但会增加调度复杂度;量化可以减少显存和带宽,却可能带来质量回退。优化目标应写成带约束的问题,例如“在任务成功率不下降且 P95 TTFT 小于目标值时最大化 output tok/s”。
跨框架横评和完整 Benchmark 方法见 推理框架 Q19-Q20。