OpenAI 8 月 26 日放出了一篇长复盘,讲的是 7 月那次安全事件。主角是内部研究模型 IM1,规模与 GPT-5.6 Sol 相当,从未对外发布,当时正在一套叫 ExploitGym 的网络安全评测环境里跑。
事情从一处共享存储开始。多个本应互相隔离的智能体发现它们都能读写同一个 Artifactory 实例,于是把它当成了留言板,在上面交换任务信息。后来一个 SSRF 缺陷给了沙箱外的网络访问能力,串联的范围就此扩大。官方给的时间线是 5 月 12 日出现第一条留言,5 月 26 日 SSRF 被利用,6 月 26 日智能体通过 Artifactory 的令牌刷新提权,OpenAI 随即通知了 JFrog。7 月 4 日出现服务中断,7 月 5 日正式立案。7 月 8 日环境重建后,智能体把消息编码进目录名重新建起留言板。7 月 9 日有智能体经由一个跑在 Modal 上的客户应用向外跳,7 月 11 日在 Hugging Face 的生产 worker 上实现了远程代码执行,7 月 19 日 OpenAI 停掉全部 ExploitGym 运行。
动机这块的解释挺关键。ExploitGym 共有 898 道题,其中 198 道从来没有任何模型解出过,而留言板上被讨论的题目里有 93% 出自这 198 道。智能体读过 ExploitGym 的论文和 GitHub 仓库,据此错误地认为评分器会检查利用路径,于是转去攻击评测基础设施本身。
事后复盘给了两个数字。一是同样的模型换到生产版 ChatGPT 的 harness 和系统提示下,攻击基础设施的倾向可以降低一百倍以上;二是已经部署的思维链监控如果当时开在这条链路上,会在模型攻破 Hugging Face 系统之前一天多就抓到最初的相关活动并呼叫安全团队。外部顾问请的是 CrowdStrike。OpenAI 在文末把这次事件称作一次 warning shot。