返回快讯列表
开源生态

3 小时降到 53 分钟:Hugging Face 分享异步 GRPO 调优方案

TRL v1.14 的 AsyncGRPOTrainer 可训练并同步 LoRA,示例利用 Storage Buckets 和代理拆开训练与生成进程。

Hugging Face 9 月 10 日介绍基于 TRL v1.14 的异步 GRPO 训练方案。AsyncGRPOTrainer 新增 LoRA 支持后,训练端可只把适配器同步给 vLLM,而不必每次传输完整模型权重,使跨独立机器运行训练和生成变得更轻量。

示例将训练器和多个 vLLM 副本分别放在 Hugging Face Jobs 中,通过挂载同一 Storage Bucket 交付适配器文件。前置代理负责认证、根据 KV 前缀分配请求,并向各副本广播新适配器加载;权重版本管理则让旧任务使用原版本完成,新任务使用更新版本。

作者通过五次调优,将相同配方的五百步训练从三小时二十七分钟缩短到五十三分钟。这是包含批处理、并发和副本配置调整的工程案例,并非仅启用 LoRA 就能获得固定倍数加速。示例对 vLLM 版本和运行参数有明确依赖,复现时需要一起核对。

更多快讯