NVIDIA 9 月 16 日公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的首次结果。公司称,在 Qwen3-VL 的不同场景中,新系统吞吐最高达到 GB300 NVL72 的 3.7 倍;DeepSeek-R1 场景最高达到 2.5 倍。
NVIDIA 还表示,四架 GB300 NVL72 在 DeepSeek-R1 离线场景达到 99% 扩展效率。标准化推理基准会直接影响数据中心的系统选型,因为采购方不仅关心单卡速度,也需要比较机架扩展、能耗和单位 token 成本。
Vera Rubin 本次属于 MLPerf 预览提交,NVIDIA 在文中注明部分后续结果尚未经过 MLCommons 验证。3.7 倍只对应特定模型、精度和测试场景,不能概括成所有 AI 工作负载都获得同等提升。