欢迎光临
我们一直在努力

【AI黑话日日新】什么是PD分离?

在这里插入图片描述

关键词:PD分离、Prefill、Decode、LLM推理、大模型部署、KV Cache、吞吐量优化、GPU调度

一、PD分离是什么

PD分离,全称 Prefill-Decode 分离(也叫推理解耦、Disaggregated Inference),是当前大模型在线服务中最主流、最有效的架构优化手段。

简单说:

把大模型推理的两个阶段拆开,分别部署、分别调度、分别优化。

  • P = Prefill(预填充):处理输入Prompt,一次性读完所有Token,生成KV Cache

  • D = Decode(解码):逐Token自回归生成,反复读取KV Cache

PD分离 = 让计算密集和访存密集两种完全不同的负载,不再抢同一块GPU资源。

二、为什么要做PD分离:传统架构的痛点

在传统一体化推理(如早期vLLM、TGI)中:

Prefill 与 Decode 在同一块GPU、同一个Bat

赞(0)
未经允许不得转载:171主机测评 » 【AI黑话日日新】什么是PD分离?
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址