9月16日,英伟达在 AI 基础设施峰会上又提了一遍 DSX MaxLPS:不换芯片、不新建电厂,同一座 AI 工厂每兆瓦电力的 token 吞吐量最高再涨 40%。
同样一度电,能多出四成产出。
这不是一颗新 GPU。它动的是机房里那些一直记在账上、却用不起来的电力余量。
40% 不是芯片跑快了
MaxLPS 的全称是 Maximum Land Power Shell,指的是一座 AI 工厂的站点级物理约束:土地、电网接入、机房外壳。方案由三层组成,动态功耗分配、按负载类型调好的功耗配置档,以及 45℃ 进水的液冷站点设计。
对开发者最直接的是第一层。动态功耗软件 DPS 把数据中心从电网一路建模到机架、节点和 GPU,运维定义资源组、功率预算与策略;控制器读取实时遥测,把某张 GPU 当下用不到的功率额度,临时划给同一资源组里正憋着的另一张卡。
每次调整都要先过校验:策略、拓扑上限、共享 GPU 预算、硬件限制。它不是超频式的越界加电。
100 兆瓦里,只有 60 兆瓦在算 token
为什么有余量可捡?传统机房按\”每个机架都可能同时顶到峰值\”来预留电力,机架之间互不相借,安全,但等于把一部分电锁死在没人用的位置。
英伟达给的电力预算图很直白:
100 兆瓦电网输入,20 兆瓦给设施开销,10 兆瓦耗在机架,还有 10 兆瓦因为在故障、重启、检查点里低效运转而流失,真正能用于 AI 负载的只剩 60 兆瓦。
另一组对比更清楚:540 千瓦的站点预算里,静态配置有 170 千瓦卡在原地用不上,动态分配把这部分收回来之后,同一预算里能多塞一个机架。
落到机架级,官方验证数据是 GB200 NVL72 的机架功率从 125 千瓦压到 90 千瓦,Vera Rubin NVL72 从 136 千瓦压到 101 千瓦;吞吐基本不变的前提下,同样电力范围内机架数量分别多出 39% 和 35%,每瓦性能分别提升约


