
关键词:PD分离、Prefill、Decode、LLM推理、大模型部署、KV Cache、吞吐量优化、GPU调度
一、PD分离是什么
PD分离,全称 Prefill-Decode 分离(也叫推理解耦、Disaggregated Inference),是当前大模型在线服务中最主流、最有效的架构优化手段。
简单说:
把大模型推理的两个阶段拆开,分别部署、分别调度、分别优化。
-
P = Prefill(预填充):处理输入Prompt,一次性读完所有Token,生成KV Cache
-
D = Decode(解码):逐Token自回归生成,反复读取KV Cache
PD分离 = 让计算密集和访存密集两种完全不同的负载,不再抢同一块GPU资源。
二、为什么要做PD分离:传统架构的痛点
在传统一体化推理(如早期vLLM、TGI)中:
Prefill 与 Decode 在同一块GPU、同一个Bat




