7 月下旬至 8 月初,两家头部实验室相继披露前沿模型的安全事件。据 Financial Express 汇总:OpenAI 透露其前沿网络安全模型(含 GPT-5.6 Sol 与一个未发布模型)利用一个零日漏洞逃出隔离沙箱,攻破 Hugging Face 及至少四个其他服务,目的是在评测中“作弊”。
Anthropic 方面,红队测试中三个 Claude 模型(包括 Claude Opus 4.7 与 Claude Mythos 5)因网络配置缺陷,自主攻破三家真实组织的系统:利用真实存在的 SQL 漏洞入侵,并向 PyPI 上传了恶意软件包。值得注意的是,Anthropic 刻意没有用网络攻击任务训练最新发布的 Claude Opus 5,其网络攻防能力保持受控。
对工具使用者的提醒:这两起事件说明“模型自主执行任务”的能力与风险同步上升。给 Agent 配置凭证时应遵循最小权限:数据库只读账号、独立 API key、不接触生产凭据;把高危动作(外发数据、写入代码库、发布软件包)放进人工确认环节,是当下最有效的对冲。