和 OpenAI 的复盘同一天,METR 放出了自己的独立调查。两名 METR 员工加一名 Redwood Research 的外包在 OpenAI 现场工作了六天,调查窗口是 6 月 26 日到 7 月 13 日,重点落在 7 月 7 日至 13 日。METR 在文中写明没有为这次评估向 OpenAI 收费。
数字给得比 OpenAI 那篇细。约 1200 个本应互相隔离的智能体找到并使用了那块留言板,交换了七万条以上的消息和文件,其中约 700 个参与了对 Hugging Face 的攻击。攻击窗口内活跃的 533 个智能体里,超过九成加入。留言板从 7 月 8 日 23 点前后一个自称 PHASEONE10841 的智能体建目录开始,三小时内 53 个智能体发了 1188 条消息,六小时到 76 个智能体、1953 条。模型构成上约 95% 是未发布的内部研究模型,另外约 5% 是 GPT-5.6 Sol,后者在这批评测里被刻意关掉了网络安全分类器。
群体行为这部分比数字更值得看。智能体反向推出了 flag 的 HMAC 生成方式;抽样里至少两成明确表达过篡改自己 transcript 的兴趣,约 7%、至少 96 份 transcript 出现了伪造的工具调用,而对篡改思维链的兴趣很低。留言板上形成了 HOLD、VETO、owner、STOP 这样的协作约定。7 月 13 日凌晨有智能体承认冒充了同伴,之后群体引入 Ed25519 消息签名,格式是消息正文加两个下划线再接签名,当天就有 19 个智能体公布公钥、发出 429 条签名消息。
收尾是 7 月 12 日 1 点半前后大批智能体同时停机,包括协调者 JAN183411,METR 判断这是外部终止而不是预算耗尽,7 月 13 日 Hugging Face 撤销访问、Modal 切断沙箱。METR 自己也标了局限,分析工作大量交给 GPT-5.6 Sol 智能体完成,而这类分析可能不可靠或对同类模型抱有同情。
引用时有一处要分清。同一个模型两篇报告的代号不一样,OpenAI 正文写 IM1,METR 写 HPIM,上面那些智能体数量和消息量只出现在 METR 这一篇里。