⏱️ LLM Inference Metrics · Prefill vs Decode · Token Latency

什么是大模型推理指标 TTFTTPOT

评估大模型到底“快不快”的两大绝对黄金标准!看懂首字延迟如何决定‘你觉得它聪不聪明’、每字耗时如何决定‘打字机跟不跟得上人类阅读速度’,以及计算密集型与访存瓶颈的底层秘密

TTFT (Time to First Token · 首字时间)
⏱️🍲 厨师看菜单备料·第一道前菜上桌

从用户按下回车,到屏幕上蹦出第一个字的耗时! 对应大模型的 Prefill(预填充)阶段。显卡必须把用户输入的所有 Prompt 上下文(可能几千上万字)一次性吞进肚子,算出全套 KV Cache,属于计算密集型(Compute-bound)

阶段: Prefill (预填充) 瓶颈: GPU 算力 (TFLOPS) 决定体验: 用户等待响应的焦虑感
VS
TPOT (Time Per Output Token · 每字延迟)
🍢🏃 厨师串烤串·后面一道接一道匀速上菜

在第一个字蹦出后,后续每吐出一个 Token 平均需要多少毫秒! 对应大模型的 Decode(解码)阶段。每次只预测下一个单字,必须把几百亿参数从显存完整刷一遍,属于严重的显存带宽受限(Memory-bound)

阶段: Decode (逐字解码) 瓶颈: 显存带宽 (HBM/DDR GB/s) 决定体验: 逐字打字机流式输出的流畅度
💡

5岁核心顿悟:去高档餐厅点餐,大厨到底快不快?

TTFT 是“服务员端来第一盘开胃小菜的时间” 🍲⏱️
• 你点了一桌极其复杂的满汉全席(万字长 Prompt),大厨得先把所有食材洗净切碎(并发算完所有词),只要第一道前菜端上来,你就觉得“这家店服务很敏捷,菜已经在做了”!如果 TTFT 太长(比如 15 秒),用户就会烦躁地以为网页卡死了。
TPOT 是“第一道菜吃完后,后续菜肴上桌的节奏” 🍽️🏃
• 倒数第 2 道、第 3 道菜之间隔多久端上来?如果每道菜只隔 30 毫秒(相当于每秒 33 个字),菜品行云流水,你甚至来不及吃完;如果隔好几秒才上一根豆芽菜,这就是 TPOT 过大导致的“打字机卡顿便秘”!

两大指标背后的底层系统差异与调优哲学

为什么大模型推理必须把 Prefill 与 Decode 拆开拆解?

1. Prefill 阶段 vs Decode 阶段

Prefill(决定 TTFT)是所有词并行乘法,矩阵很大,GPU 算力利用率极高(Compute-bound);Decode(决定 TPOT)是每次只算 1 个 Token,矩阵退化成向量与矩阵乘法,GPU 算力大部分在空等显存送数据(Memory-bound)。

🧠

2. 人类阅读速度与 TPOT 的及格线

正常成年人默读中文约每秒 10~15 个字(对应 TPOT 约 50~70ms/token)。只要 TPOT < 40ms(每秒 > 25 tokens),文字喷涌速度就超越人眼捕捉极限,带来极佳的流式沉浸感!

⚙️

3. 现代推理引擎的解耦优化 (Chunked Prefill)

vLLM 与 TensorRT-LLM 采用“分块预填充(Chunked Prefill)”与“PD 分离(Prefill-Decode Disaggregation)”,用专用的 Prefill 卡压低 TTFT,用专用的 Decode 卡保证 TPOT 极致稳定。

📊 业界一流大模型推理性能基准指标对比

衡量优秀 LLM API 与私有化部署服务商的标准水位线:

优秀交互 TTFT
< 300 ms
几乎瞬时响应 · 零等待焦虑
优秀流式 TPOT
< 25 ms
相当于 > 40 tokens/s 飞速流式
用户容忍极限 TTFT
~ 3.0 秒
超过 3 秒用户往往认为超时或刷新
及格流式 TPOT
~ 60 ms
~ 16 tokens/s · 刚好追平人类视线

🎮 交互模拟器:推演不同业务场景下 TTFT 与 TPOT 的权衡抉择

点击查看对话、文档分析与 Agent 复杂调用对两大指标的苛刻要求: