智谱的强化学习训练框架 slime 8 月 28 日发布 v0.3.2。这一版的核心是 GLM-5 上 Megatron 训练与 SGLang rollout 的确定性对齐,覆盖 DeepEP、DeepGEMM、DSA 稀疏注意力和 FP8 KV cache 四项。
release notes 里写明这条路径已经在大规模 GLM-5.3 训练负载上验证过,这是官方第一次确认 GLM-5.3 的训练栈。GLM-5.3 的参数量、激活量、上下文长度、训练卡数和时长都没有出现在这份说明里,与已经开源的 GLM-5.3-Flash 是什么关系也没有交代。
环境侧新增了官方的 CUDA 13 支持,面向 Blackwell 系统。另外拆出独立的 observability 模块,管日志、调试和追踪。
修复列表里有几个值得看的。block_fp8 中的 max 没有做 clamp,遇到全零块会产生 NaN 权重;dual-clip PPO 的 epsilon 没有传下去;Qwen3 的 SFT tokenization 会丢掉连续的工具返回;gpu_id 按字符串排序导致排序键出错;数据集用负索引切片时行为不对。REINFORCE++ 的折扣回报改成了向量化实现。