返回快讯列表
最新动态

NVIDIA DSX MaxLPS 上线,同样电力预算下多塞最多 40% 的 Rubin GPU

NVIDIA 8 月 24 日发布 DSX MaxLPS,把电力当成机架容量的约束条件来优化,官方给出固定预算下 Rubin GPU 容量最高提升 40%,配套的动态电力软件仍是开发者预览。

NVIDIA 技术博客 8 月 24 日发了 DSX MaxLPS,作者是 Sarah McKenney 和 Harry Petty。名字全称是 Maximum Land Power Shell,官方定义为一套芯片、热、系统和软件技术的组合,用来在固定电力预算内最大化 AI 工厂吞吐。

先看电都去哪了。文中说典型站点大约 60% 的交付电力真正用于计算,一个 100 MW 的例子拆成 20 MW 设施开销、10 MW 机架损耗、10 MW 运行低效(故障、重启、检查点),剩下 60 MW 给 AI 负载。

静态分配和动态分配的差别用一个数字讲清楚了。540 kW 预算下,静态方式会把 170 kW 搁在那儿闲置,MaxLPS 实际消耗 475 kW,多上一个机架。放大到 100 MW 站点,Rubin GPU 容量最多提升 40%,能容纳约 4 万个 Rubin GPU,对应 2 zettaflops 的 NVFP4 推理、1.4 zettaflops 的 NVFP4 训练、11 PB HBM4 容量和 800 PB/s HBM4 带宽。

两个实测案例。GB200 NVL72 跑 Kimi-K2.5,机架功率从 125 kW 降到 90 kW,多上 39% 机架,约合 1.5 倍每瓦性能。Vera Rubin NVL72 跑 DeepSeek-R1,从 136 kW 降到 101 kW,多上 35% 机架,约合 1.3 到 1.4 倍。

热这块,Vera Rubin NVL72 机架的目标液冷进水温度是 45 摄氏度,温水液冷用来改善 PUE。文中顺手批评了一句传统 PID 控制是被动的,只在传感器报告偏差之后才响应,并把 Phaidra 那类 agentic 控制列为可选优化。

有两处状态要看清。动态电力软件 DPS 处于开发者预览,文档版本 v0.8,配套开源事件总线 DSX Exchange 同样是预览且属可选组件。另外官方专门说明 MaxLPS 定义的是生命周期容量目标,不是要求一开始就把每个机架填满。

更多快讯