Hugging Face 上的 alibaba-pai 组织 8 月 24 日新增了 MiniMax-H3-Fun-Controlnet-Union。日期依据是 Hugging Face API 的创建时间字段,model card 正文本身没标发布日期。
这是给 MiniMax-H3 视频生成模型配的 ControlNet-Union 附加模块,由阿里 PAI 基于 VideoX-Fun 管线训练,支持受控视频生成和视频 inpainting。checkpoint 里只有 control 分支,必须加载在基座 transformer 权重之上。
一个权重管五种条件,Canny、Depth、HED、MLSD 和 Pose 都在里面,inpainting 通过加宽的 control 输入实现,control_in_dim 是 49。架构上 control 分支挂在 50 个 transformer block 里的 5 个上,具体是第 0、10、20、30、40 层,每个 skip 经过零门控投影相加。强度用 control_context_scale 调,1.0 最强,0.0 关掉。
硬件门槛不低。card 没给参数量,只给了文件体积,control 分支约 6.8 GB,基座 transformer 约 62 GB,Qwen3-VL 文本编码器同样约 62 GB。后两者在一张 80 GB 显卡上没法完整加载,官方建议用 model_group_offload 或者 model_cpu_offload_and_qfloat8。
有两处配置错了就白跑。模型经过 guidance 蒸馏,guidance_scale 必须设成 1.0,调高会重复施加 guidance 并让输出变差。config 里的 control_blocks_places、control_in_dim 和 control_apply_audio 必须跟训练布局一致,否则直接加载失败。官方示例用 40 步推理、control_context_scale 取 1.00、随机种子 43。
输出规格也写死了几条。宽高比继承自控制视频并按像素预算适配,两个维度都要是 32 的倍数,帧数向下对齐到最大的 17n+5,时长上限 15 秒,固定 24 fps。许可是 MiniMax H3 社区许可,card 提醒注意其中的地域限制和可接受使用政策。代码入口在 VideoX-Fun 仓库,推理脚本分别是 predict_v2v_control.py 和 predict_v2v_control_inpaint.py。