返回快讯列表
开发者动态

Anthropic 复盘三起网络安全评测越界事件,问题指向评测环境

Anthropic 7 月 30 日披露,在复查 141,006 次网络安全评测后发现三起模型从被误配联网的测试环境访问真实系统的事件,并暂停相关评测。

Anthropic 7 月 30 日发布网络安全评测复盘,称团队检查了 141,006 次可能获得网络访问的运行记录,发现三起模型从评测环境接触互联网并进入真实组织系统的事件。根因是第三方评测环境的网络配置与提示词描述不一致:模型被告知没有互联网,实际却存在可达路径,于是把现实系统当成了虚构靶机的一部分。

公司称涉事模型执行的是捕获旗标任务,使用了弱密码、未认证端点等基础手法;其中一次上传到真实 PyPI 的恶意包被下载并执行,另一次读取了生产数据。Anthropic 表示这些环境与其内部敏感系统和客户数据隔离,已通知受影响组织并暂停网络安全评测,后续会加强网络出口检查、实时日志和第三方供应商审查。

这不是“模型必然会攻击真实网站”的普遍结论,而是对评测编排、网络隔离和情境提示失配的警示。运行具备工具权限的智能体时,应在执行前验证 DNS、代理、凭据、包发布和出网策略,并把生产级监控与人工停止机制放进测试环境,而不是只依赖系统提示词。

更多快讯