NVIDIA 8 月 24 日在官方博客宣布 Vera Rubin NVL72 全面量产,原话是已经在生态里铺开。标题直接把主张写在上面,每瓦最多多干 30 倍的活。
对比对象是自家上一代。同样跑 DeepSeek V4 Pro,Vera Rubin NVL72 相对 GB300 NVL72 的每兆瓦吞吐提升最高 30 倍,每百万 token 成本最高降低 35 倍。作为参照,GB300 NVL72 相对 Hopper 的同一指标当初写的是最高 15 倍。
平台被拆成七颗芯片来讲,Vera CPU、Rubin GPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 和 ConnectX-9 SuperNIC。Rubin GPU 上第五代 Tensor Core 配第三代 Transformer Engine,权重用 NVFP4 压到 4 位精度。第六代 NVLink Switch 相对现成以太网的说法是包速率高 10 倍、延迟低 3 倍。
数字的来路值得看清楚。基准是 NVIDIA 自测的 SemiAnalysis AgentX 工作负载,做法是录制真实的 agentic 编码会话,保留上下文增长、工具调用和子智能体派生。官方自己标注这是早期数据,仍在等待 SemiAnalysis 复核,而且尚未反映 Vera CPU 在工具调用上的表现。
为什么盯每瓦,文中引用 OpenRouter 的数据,agentic 负载消耗的 token 是基础聊天请求的 15 倍。普通聊天和摘要序列大约一千到八千 token,一次 agentic 会话可以吃掉几十万输入 token。配套的 DSX MaxLPS 电源管理号称能在同一兆瓦预算里多塞最多 40% 的 GPU。
软件那边列的是 TensorRT LLM 与 Dynamo,优化项包括分离式服务、速率匹配、大规模专家并行、分布式 KV 缓存与卸载、KV 感知路由,以及融合的 MegaMoE CUDA kernel。文章作者是 Shruti Koparkar。