Hugging Face 9 月 10 日介绍基于 TRL v1.14 的异步 GRPO 训练方案。AsyncGRPOTrainer 新增 LoRA 支持后,训练端可只把适配器同步给 vLLM,而不必每次传输完整模型权重,使跨独立机器运行训练和生成变得更轻量。
示例将训练器和多个 vLLM 副本分别放在 Hugging Face Jobs 中,通过挂载同一 Storage Bucket 交付适配器文件。前置代理负责认证、根据 KV 前缀分配请求,并向各副本广播新适配器加载;权重版本管理则让旧任务使用原版本完成,新任务使用更新版本。
作者通过五次调优,将相同配方的五百步训练从三小时二十七分钟缩短到五十三分钟。这是包含批处理、并发和副本配置调整的工程案例,并非仅启用 LoRA 就能获得固定倍数加速。示例对 vLLM 版本和运行参数有明确依赖,复现时需要一起核对。