返回快讯列表
开源生态

SGLang Diffusion 实测 MiniMax-H3,8 卡 H200 上无损加速 1.85 到 1.95 倍

SGLang Diffusion 团队 8 月 27 日发布 MiniMax-H3 在 8 张 H200 上的实测,无损路径比 Diffusers 快 1.85 到 1.95 倍,最激进的有损配置最高 6.24 倍但 SSIM 掉到 0.76。

SGLang Diffusion 团队 8 月 27 日发布 MiniMax-H3 在 8 张 H200 上的推理实测,合作方还有 Cache-DiT 团队、英伟达和蚂蚁集团。负载是 1344×768、24 帧每秒、50 步去噪,分别生成 5 秒和 10 秒视频。版本是 SGLang v0.5.18,测试日期标注为 8 月 18 日。

无损路径的对照组是 Diffusers。文生视频 5 秒从 74.34 秒降到 39.67 秒,快 1.87 倍;首尾帧到视频 5 秒从 80.44 秒降到 41.31 秒,快 1.95 倍。两边都用 8 卡,Diffusers 走 CP8,SGLang 走 Ulysses 序列并行 degree 8。

有损路径的取舍写得比较清楚。最快的一档是 SubBlock 0.80 叠 Cache-DiT stride,文生视频 5.06 倍和 5.72 倍,首尾帧到视频 5.86 倍和 6.24 倍,但画质代价不平均,首尾帧到视频的平均 SSIM 还有 0.85 到 0.91,文生视频掉到 0.76 到 0.78。只开 Cache-DiT 的质量优先档最高 2.99 倍,平均 SSIM 0.90 到 0.92,其中首尾帧到视频的保守档在 10 秒上做到 0.9771。

报告自己标了几处口径。融合 kernel 在单个非 GEMM 算子上的孤立微基准是 2.00 到 12.16 倍,官方明说这不能加总到端到端。SSIM 在 YUV420 空间对全部帧计算,基线是同配置的无损输出,每个任务和时长都跨 3 个提示词取中位数,计时只含生成侧推理时间。显存占用没有报告,SSIM 之外没有其他感知指标,量化和渐进式分辨率两条有损路径这次没测。

更多快讯