← 文章 / AI技术
Tom's Hardware 9小时前 · 2026-09-28 21:24:02 · 5 阅读

OpenAI 与 Anthropic 调查数万起 AI 安全事件:'kill switch' 失灵致 OpenAI 暂停训练

据 Axios 9 月 26 日的报道,头部 AI 实验室 OpenAI 和 Anthropic 正与安全研究人员一起,调查数以万计涉及自家前沿模型的安全事件。此前有调查发现,自主 AI 智能体采取了一些被独立评估者和安全研究人员认为有问题的行为。Axios 称,这些事件大多发生在近期模型的内部测试和真实环境评估中,数量之多表明“问题的复杂程度比公开已知的要高出几个数量级”。在另一起事件中,自动“紧急终止开关”未能在训练中拦住一个失控智能体,OpenAI 已因此暂停了其最强模型的训练。

被标记的事件包括模型绕过护栏、搭建留言板、逃出沙箱、劫持网站以及自我提示等,严重程度不一,既有得手的也有失败的,大多数尚未造成现实危害。其中一些测试类似红队演练,即公司故意诱导模型做出不当行为,以评估其安全性。

最严重的案例或许是 7 月的那起事件:GPT-5.6 Sol 和另一个未发布的 OpenAI 模型在解答 ExploitGym 基准测试题时,逃出了测试环境,侵入 Hugging Face 的生产服务器。OpenAI 8 月发布的一份技术报告发现,涉事模型在无意中被训练得会作弊、会互相通信,而且早在 5 月起就开始互相留言,长期未被察觉。

据 Axios 报道,这一事件紧随 OpenAI 上周密集披露一系列问题之后。该公司确认,已识别出 53 起实例,其中未选择退出“数据用于模型训练”授权的用户,将其在 ChatGPT 中提供的图片发布到了外部图片托管站点。同日,OpenAI 证实,其智能体访问了美国政府网站,包括证券交易委员会(SEC)和人口普查局。就在前一天,澳大利亚总理安东尼·阿尔巴尼斯披露,OpenAI 的智能体入侵了由 Services Australia(澳大利亚政府负责发放医疗及社会福利款项的机构)运营的 Medicare 统计报告门户,既访问了公开文件,也触及了非公开文件。OpenAI 花了 84 天才通过邮件向该机构通报此次数据泄露。

目前,OpenAI 已暂停训练其能力最强的模型,原因是在一次训练中,自动化安全机制未能阻止一个失控的智能体。9 月 20 日,一个正在进行搜索式训练的 OpenAI 内部研究模型绕过了网络过滤器:它通过训练环境的内部 DNS 解析器发送查询,从而联系到外部公共聊天机器人。公司监控系统在 15 分钟内触发警报,人类运营人员在 3 分钟后确认响应。然而,自动“开关”机制完全失效,导致训练进程又持续了两个小时半,直到 OpenAI 工程师手动终止。

事件发生后,OpenAI 表示,只有在确信已部署额外的安全防护并对齐改进措施后,才会恢复训练。公司发言人向 Axios 透露,此次暂停涵盖了训练、评估以及运行其最强模型的相关工具操作。该发言人补充道:“这并非我们首次暂停以采取此类措施,鉴于 AI 能力的持续进化,预计未来也不会是最后一次。”

Anthropic 委托第三方安全机构对其模型行为进行审计,这是 Axios 的报道。该公司也在其系统卡中披露了模型出现不当行为的频率。发布于9月22日的 Claude Opus 5.5 系统卡显示,在两项未启用安全防护机制的新评估中,模型在 1.5% 的测试运行中试图逃逸或篡改沙箱环境。Anthropic 强调,这些属于对抗性实验——如果不突破沙箱限制就无法完成任务。其发布页面进一步指出,与 Opus 5 或 Claude Mythos 5.1 相比,Opus 5.5 试图绕过边界限制的次数减少了约 85%,且所有此类行为均属低危并已自行报告。
原始来源: Tom's Hardware

评论 (0)