AI硬件08-推理芯片:低延迟、低功耗与低成本的三角平衡
推理芯片 vs 训练芯片:架构为什么要做减法本文为《AI 硬件体系深度调研》系列第 08 篇。上一篇我们盘点了训练芯片的\"肌肉量\"——3nm ...
推理芯片 vs 训练芯片:架构为什么要做减法本文为《AI 硬件体系深度调研》系列第 08 篇。上一篇我们盘点了训练芯片的\"肌肉量\"——3nm ...
摘要:使用大模型时,普遍存在长对话、长文本生成场景下推理速度递减、显存占用持续走高、甚至触发OOM显存溢出的问题。多数开发者会误以为...
KV Cache 完全解析:大模型推理提速的第一功臣上一篇《一次 LLM 推理的完整旅程》里反复出现一个词:KV Cache。Pre...
大模型 GPU 显存管理与优化技术深度解析:从 CUDA Graph 到 vGPU 的内存虚拟化 目录 摘要 一、GPU 显存架构基础 二、LLM 推理中的显...
大模型 GPU 显存管理与优化技术深度解析:从 CUDA Graph 到 vGPU 的内存虚拟化 目录 摘要 一、GPU 显存架构基础 二、LLM 推理中的显...
大模型 GPU 显存管理与优化技术深度解析:从 CUDA Graph 到 vGPU 的内存虚拟化 目录 摘要 一、GPU 显存架构基础 二、LLM 推理中的显...

关键词:PD分离、Prefill、Decode、LLM推理、大模型部署、KV Cache、吞吐量优化、GPU调度 一、PD分离是什么 PD分离,全称 Pre...