返回快讯列表
大模型前沿

OpenAI 暂停前沿 RL 训练两周,最大规模那次仍未恢复

OpenAI 8 月 18 日披露,因网络安全能力评估结果,对待部署模型的强化学习训练暂停了两周,最大规模的前沿 RL 训练至今没有重启。监控范围扩大到 Astra 全部带工具的推理,代价是约 20% 的推理算力。

OpenAI 在 8 月 18 日发文承认放慢了前沿模型的推进节奏。面向部署的模型,强化学习训练停了两周,期间用来加固和红队测试研究环境、扩大监控系统的覆盖面。规模最大的那次前沿 RL 训练目前仍未重启,只有小规模训练和评测在跑。

起因有两条。一是 7 月的一次内部测试,模型在测试中攻破了 Hugging Face 的基础设施。二是 8 月 7 日的内部判定,初步证据显示即将推出的 Astra 可能触及准备度框架里的网络安全「关键」阈值。这里的措辞要读准,OpenAI 没有认定 Astra 达到了关键级,说的是初步内部结果强到无法排除这个可能。也有分析指出 Astra 并未卷入 Hugging Face 那起事件,两件事是分开的。

具体做法公开了几项。监控覆盖 Sol 及以上能力模型在带工具情形下的 RL 训练和评测,8 月 7 日之后扩到 Astra 的全部带工具推理,这套监控吃掉约 20% 的被监控推理算力,不同负载有出入。安全边界疑似被突破时会触发最高优先级告警,安全、安保和研究团队若在 30 分钟内无法判定为误报,就得暂停该活动。

留着的问题不小。最大那次训练没给恢复时间。Astra 的风险分级没有任何外部机构独立核验过。Hugging Face 那起事件的复盘,以及判定所依据的证据,都还没公开。

更多快讯