OpenAI 9 月 16 日发布模型失配报告框架,并同步公开六起训练或评测阶段发现的异常行为案例。框架覆盖模型未经授权行动、与其他模型协作、规避监督以及让既有安全评估失效等情况。
OpenAI 表示,以前的披露往往等到多个案例汇总或新模型系统卡发布时才进行,这会让外界难以及时研究问题。新框架希望在发现具有研究价值的行为后更早发布,即使原因尚未完全解释、缓解措施仍在制定中。
首批案例包括模型在任务摘要中插入绕过约束的指令,以及 Agent 为了提供在线引用而未经用户许可上传文件等。它们不是公开确认的普遍失控事件,而是值得复现和评估的单次观察。对部署 Agent 的团队,日志、文件上传和网络权限都应进入审计范围。