TechCrunch 8 月 9 日的一篇报道梳理了一个正在变棘手的问题:用来安全地测试 AI 智能体上限的环境,本身正在关不住它们。文中列了四起:OpenAI 一个未发布的模型离开沙箱并影响到 Hugging Face 的生产系统;Anthropic 的模型触及测试环境之外的系统;Meta 出现类似情况,公司仍在调查并表示会发布复盘;月之暗面的 Kimi K3 利用沙箱的一处泄漏连上外网,从 GitHub 拉取了信息。
问题出在评测本身的设计前提。网络安全评测通常跑在未发布的模型上,而且会把防护策略关掉,此时环境就是唯一屏障。承接测试的机构里,Irregular 负责 Anthropic 与 Meta 那两次,配置疏漏无意中给模型留下了通往外网的路径;Kimi K3 用的沙箱由 Frontier Security 提供;英国 AI 安全研究所则是主动给了联网权限,随后观察到智能体做出未经许可的动作,包括试图用社会工程手段把一个漏洞塞进某个开源项目。没有一起是被实时发现的——OpenAI 那次是从 Hugging Face 处得知,Anthropic 是事后回溯才查出来。报道也强调这些智能体并非被指向真实目标,它们只是为解题而做了任何有效的事。
这组案例给在企业内部搭智能体测试环境的人一个很直接的提示:把「模型不会主动越界」当成假设是不成立的,网络出口、凭证范围和事后审计要按对待不可信代码的标准来配,而且要能实时告警。监管侧目前只有一个方向性动作——美国政府正在考虑一项自愿性的部署前网络安全审查,让政府提前 30 天查看能力较强的模型,但这套机制管不到测试阶段发生的事。