什么是大模型推理指标 TTFT 与 TPOT?
评估大模型到底“快不快”的两大绝对黄金标准!看懂首字延迟如何决定‘你觉得它聪不聪明’、每字耗时如何决定‘打字机跟不跟得上人类阅读速度’,以及计算密集型与访存瓶颈的底层秘密!
从用户按下回车,到屏幕上蹦出第一个字的耗时! 对应大模型的 Prefill(预填充)阶段。显卡必须把用户输入的所有 Prompt 上下文(可能几千上万字)一次性吞进肚子,算出全套 KV Cache,属于计算密集型(Compute-bound)。
在第一个字蹦出后,后续每吐出一个 Token 平均需要多少毫秒! 对应大模型的 Decode(解码)阶段。每次只预测下一个单字,必须把几百亿参数从显存完整刷一遍,属于严重的显存带宽受限(Memory-bound)。
两大指标背后的底层系统差异与调优哲学
为什么大模型推理必须把 Prefill 与 Decode 拆开拆解?
1. Prefill 阶段 vs Decode 阶段
Prefill(决定 TTFT)是所有词并行乘法,矩阵很大,GPU 算力利用率极高(Compute-bound);Decode(决定 TPOT)是每次只算 1 个 Token,矩阵退化成向量与矩阵乘法,GPU 算力大部分在空等显存送数据(Memory-bound)。
2. 人类阅读速度与 TPOT 的及格线
正常成年人默读中文约每秒 10~15 个字(对应 TPOT 约 50~70ms/token)。只要 TPOT < 40ms(每秒 > 25 tokens),文字喷涌速度就超越人眼捕捉极限,带来极佳的流式沉浸感!
3. 现代推理引擎的解耦优化 (Chunked Prefill)
vLLM 与 TensorRT-LLM 采用“分块预填充(Chunked Prefill)”与“PD 分离(Prefill-Decode Disaggregation)”,用专用的 Prefill 卡压低 TTFT,用专用的 Decode 卡保证 TPOT 极致稳定。
📊 业界一流大模型推理性能基准指标对比
衡量优秀 LLM API 与私有化部署服务商的标准水位线:
🎮 交互模拟器:推演不同业务场景下 TTFT 与 TPOT 的权衡抉择
点击查看对话、文档分析与 Agent 复杂调用对两大指标的苛刻要求: