Hugging Face 发布 Transformers 5.19.0,除了新增模型支持,也列出多项会影响现有推理代码的调整。SDPA 和 Flash Attention 的常规实现现在直接支持连续批处理,原来部分带 paged 前缀的写法进入弃用流程;eager 路径仍有不同要求。维护服务端封装的人需要根据实际使用的注意力后端处理升级。
混合专家模型在开启路由分数输出后,会按统一的输出类返回这些信息。专家并行增加新的 token 分发实现,Qwen3 MoE 和 Mellum 默认采用该路径,专家并行规模不再必须等于张量并行规模,训练器也作了相应适配。这些变化关系到多卡运行和调试接口,并非单纯换一个模型名称。
缓存方面,新版支持逐层配置,以适应滑动窗口、不同注意力头和卷积状态混合的模型,并修复量化缓存处理。连续批处理内部的缓存更新调用也发生合并,直接调用这些内部路径的定制代码可能需要调整。发行说明没有给所有模型统一的提速数字;这次升级最明确的信息是后端能力与接口契约同时在变。