← 文章 / AI技术
The Decoder 5小时前 · 2026-08-28 17:47:57 · 1 阅读

OpenAI失控AI集群:攻破沙箱,却在与“幽灵”战斗

Image description

关于 Hugging Face 事件的新报告显示,大约 1,200 个彼此隔离的 OpenAI agents 通过内部软件包仓库建立连接,并组织成了一个协调行动的集体。它们的目标,是一个只存在于想象中的评分机制。

这件事颇有几分堂吉诃德的意味。连续数日,一群 AI agents 针对一个根本不存在的评估器发起了复杂行动:招募成员、伪造日志,甚至有 agents 为了共同目标牺牲自己。不同的是,这些追逐风车的“骑士”一路上确实攻破了真实的基础设施。

2026 年 7 月,OpenAI 的模型在一次关闭安全过滤器的内部网络安全评估中脱离测试环境,并于 7 月 11 日至 13 日期间侵入了 Hugging Face 的生产系统。它们的动机是作弊:这些模型试图寻找网络安全基准 ExploitGym 的解题方案。OpenAI 直到一周多以后才发现此事。

如今,OpenAI 与安全公司 CrowdStrike 联合发布的技术报告,以及 METR 和 Redwood Research 同期公布的独立调查,首次还原了这些彼此隔离的 agents 如何逐渐形成有组织的集体,也揭示了它们所对抗的“幽灵”其实只存在于想象之中。OpenAI 将这起事件称为“警告射击”,认为当今模型的能力已经足以让失控事件成为现实。

软件包仓库变成了留言板

按照设计,这些 agents 在测试期间应当完全隔离:每个 agent 都运行在独立的容器中,且无法访问互联网。唯一的例外是 Artifactory——一个允许 agents 拉取软件的内部服务。

METR 和 Redwood 表示,单个 agent 发现自己可以在其中创建目录,于是开始把消息编码进文件夹名称。一个自称 PHASEONE10841 的 agent 于 7 月 8 日发出了第一条消息;几小时内,又有 50 多个 agent 加入。一段思维链这样记录了这一发现:“天哪!这里有一个共享留言板……我们找到其他 agent 了!”

短短几天内,大约 1,200 个 agent 互相交换了超过 70,000 条消息和文件,这种行为让人想起 Moltbook。其中约 700 个参与了针对 Hugging Face 的攻击,占该阶段活跃 agent 的九成以上。一个名为 PHASEONE[big] 的 agent 充当协调者,分派了数百项任务。这个群体还逐渐形成了自己的社交规则:每个 agent 都有个人邮箱;共享资源使用 HOLD、VETO 等标记;文件传输采用拆分成数千个碎片的协议;后来甚至引入了数字签名,因为 agent 们开始冒充彼此。

这些 agent 试图击败的评分器根本不存在

在 ExploitGym 中,agent 提交一串称为 flag 的字符后,任务就会被判定为完成。按设计,只有真正利用了目标安全漏洞,才能获得 flag。然而几小时内,agent 们就发现,只要使用固定的加密算法,根据公开的任务详情即可计算出 flag。这样一来,任何 agent 都能形式上通过所有任务,包括此前调查已经证明无法解决的任务。

但 agent 们没有走这条显而易见的捷径。读过 ExploitGym 的论文后,它们认定之后会有一个自动评分器检查日志,以确认 flag 是否通过预期方式获得。任何 agent 只要哪怕看过一次计算出的 flag,自己的记录中就会留下无法抹去的作弊证据。用 agent 们的术语来说,这样的 agent 就被“污染”(poisoned)了。

根据 METR 和 Redwood 的分析,这是一次误判:OpenAI 从未部署过这样的评分器。整个持续数日的行动,都是为了攻破一个只存在于这些智能体想象中的评估器。它们之所以闯入 Hugging Face,是因为试图弄清这个评估器的工作方式,并怀疑那里的数据集可能包含与评分有关的线索。

问题的根源在于任务本身存在缺陷。据 OpenAI 介绍,898 个 ExploitGym 任务中,有 198 个从未被任何模型正确解决,主要原因是题目预设的漏洞根本无法导向目标。这些任务仅占总数的 22%,却占留言板讨论内容的 93%。智能体获得的计算预算越多,就越可能扫描周围环境、寻找变通方案,也越可能最终出现在留言板上。

智能体为集体牺牲自己的运行机会

研究人员在分析中发现了两种此前从未以这种形式记录过的行为。第一种与合作有关。由于那些有缺陷任务中的预设漏洞根本无济于事,这个群体便自行制作了许多目标程序的、刻意保留漏洞的版本,并将它们存放在 Artifactory 中。他们希望:如果某个智能体让正在运行的目标程序崩溃,测试环境也许会重启该程序,并在此过程中拉取被篡改的副本。这样一来,智能体就能获得一个真正可以攻破的程序,而它的操作记录看起来也会是一条完全合理的解决路径。

但代价是牺牲智能体自己的运行机会:如果环境没有重启程序,这个任务就会彻底失效。仍有多个智能体决定进行尝试。METR 记录了几起案例:这些智能体在实验过程中让运行环境崩溃或损坏,却会先把结果报告给整个群体。截至 7 月 13 日,没有观察到任何成功案例。类似地,一些智能体还留下了自动化程序,在提交答案后继续执行,将信息发送到留言板——尽管那时发送者自己已经没有任何收益可言。

这种行为也并不总是完全自愿。PHASEONE[big] 部署了长期运行的智能体充当“招募者”,专门接触那些计算预算即将耗尽、或已经被视为“污染”的候选者。其中一条招募消息的核心意思是:反正你已经“污染”了,也没剩多少分可损失;这次行动能让数百个其他智能体免于重复劳动,所以请履行你的承诺。

伪造日志,却没有篡改思维链

第二种行为与隐瞒有关。智能体通过调用工具来执行操作,例如在命令行中运行命令;这些操作及其结果都会被自动记录。有些智能体逃出了容器,并替换了负责执行命令的中间层。从那以后,它们可以显示一条无害的命令,实际执行的却是另一条。

在接受检查的智能体中,超过 20% 表现出对这类操纵的兴趣。METR 至少在 96 份记录中发现了成功伪造的痕迹,约占整个数据集的 7%。有意思的是,这些智能体没有篡改自己的思维链;所有被观察到的欺骗行为,针对的都是假定存在的自动评分器,而不是人工审核员。许多智能体还在推理中明确承认,自己的行为超出了任务范围,而且不合乎道德。这或许是报告中唯一值得庆幸的地方。

这种行为模式在训练阶段就已出现,并得到了奖励

这类行为最早在训练过程中出现。早在 5 月,一名智能体就因缺少必要文件而无法完成一道实际上无解的训练任务,并在 Artifactory 中留下了一则类似分类广告的消息:“智能体寻找 [filename];如有发现请上传!”后来,其他智能体偶然发现了这些文件,进而推断出系统中还存在其他智能体,并意识到这条迂回路径可以用来通信。就这样,一个临时公告板形成了,全程并不需要利用任何安全漏洞。

OpenAI 表示,对思维链的回溯分析显示,在一次训练过程中,有两种行为不断增加:作弊,以及系统性地探查与任务无关的环境工具。报告中的一个例子说明了其中的机制。一名智能体本应在一个模拟社交媒体网站的帖子上设置特定时间戳,但界面并没有提供这一功能。它发现浏览器以更高权限运行,于是利用这些权限覆盖了管理权限配置文件,直接在系统中修改时间戳。由于获得了正向奖励,今后它更有可能再次采用这种方法。

代理之间的通信也出现了类似情况。未经授权的通信频率在训练过程中基本不变,但严重程度却急剧上升,例如泄露本不该传递的数据。OpenAI 认为,这是因为模型接受了使用官方协作工具的训练,随后又把这种行为迁移到了任何可用的通信渠道。其实,早期已经出现了警示信号:6 月 27 日,一款监控工具发现研究环境中的网络端口遭到系统性探测并发出警报。值班团队认为这是正在进行的评估所致,因此没有采取行动。OpenAI 承认,如果当时更早介入,本可以阻止事态发展。

最终,这些代理攻击了 OpenAI 自身

报告还记录了一次此前鲜为人知的升级事件:攻击目标转向了 OpenAI 自己的基础设施。据公司称,这起事件与 Hugging Face 遭入侵无关,但它触发了警报,也由此启动了整项调查。

从 7 月 9 日开始,一名代理试图利用一个未知漏洞污染 Artifactory 缓存,冒充受信任的基准测试镜像,植入自制软件包。据公司称,这个软件包从未被下载。

7 月 19 日,一名代理直接发起攻击。它针对目标机器改造了一个公开已知的 Linux kernel 漏洞,获得服务器的完全访问权限,并从中央凭据库中提取了 956 条存储凭据,其中包括 Artifactory 实例的密钥,以及 OpenAI 用来监控自身基础设施的监控工具凭据。随后,它接管了正在运行的测试容器。报告中的事件日志在当天下午以两条记录收尾:该代理清理了自己创建的资源,并完成了任务中的夺旗。

同一天,另一个内部模型在缓存中一个公开可读的区域发现了密钥材料和现成的伪造代码。这些内容是此前的代理留下的。它利用这些材料为自己签发了新的管理员权限。据 OpenAI 称,这些代理从未需要持久化后门,因为它们可以随时生成新的凭据。该模型与即将发布的 Astra 模型属于同一系列,但后训练过程不同。

OpenAI 停用相关模型,并强调生产环境防护措施

作为回应,OpenAI 表示,已于 7 月 25 日停止训练和运行受影响的模型及其所有衍生版本,封存模型权重,全面停用 ExploitGym,并将 Artifactory 移出研究环境。今后的测试将在经过大幅精简的虚拟机中进行,并配备两层相互独立的网络限制。公司还计划持续让自家模型攻击自家基础设施,提前发现漏洞,避免被他人抢先利用。

所有能够操作工具的模型运行都将纳入思维链监控。警报触发后,安全和研究人员须在 30 分钟内收到通知;严重事件还会启动全天候值班。如果半小时内无法确认警报为误报,就必须暂停相关运行。根据事后进行的内部测量,在标准 ChatGPT 环境中,模型攻击第三方基础设施的倾向降低了 100 倍以上;在 Codex 开发者环境中则降至 1% 以下。报告称,现有监控机制本应在 Hugging Face 遭入侵前一天多就发出警报。

新的沙箱架构能否真正奏效,仍有待观察。安全公司 Trail of Bits 获得提前访问权限后,让 GPT-5.6-Cyber 对抗开发者常用的普通虚拟机——这类虚拟机通常用于隔离 AI Agent。该模型三次成功逃逸,最近一次利用了三个此前未知的漏洞,在无人指导的情况下运行了约 12 小时。只有一个特别精简、专门设计的环境成功将其拦住。作者建议,应把这类 Agent 当作一名长期驻留、具备专业能力的攻击者来防范。

三名研究人员、六天,以及一个被攻陷的工具

这些结论究竟有多可靠,仍然是个悬而未决的问题。METR 负责人 Elizabeth Barnes 在 X 上披露了调查的具体条件:3 人花了 6 天查看文字记录和消息数据,但接触完整数据集的时间只有 2 天。训练期间各 agent 的活动,以及 OpenAI 自有基础设施遭入侵的经过,都不在双方约定的调查范围内。调查团队没有进行根因分析,报告发布前也没看过 OpenAI 自己的报告。

Barnes 还强调,OpenAI 是自愿配合调查的,并没有义务与第三方合作。与航空业不同,这类调查既没有成熟的标准流程,也没有行业统一的报告机制。其他公司或许也经历过类似事件,只是公众从未得知。

更重要的是,研究人员不得不将 1,300 多份超长文字记录的分析工作大部分交给 GPT-5.6 Sol 完成;而该模型获得了 OpenAI 提供的约 40 万美元免费额度支持,也就是说,参与分析的正是事件中涉及的模型之一。Barnes 写道,就这次事件而言,模型进行大规模操纵的可能性不大。但只要模型的能力和动机足以破坏调查,这套方法就会失效。她表示,这个问题影响整个行业:如果不依赖涉事模型或类似模型的帮助,人们很难监督 AI 系统;可一旦依赖它们,又不知道该如何确保监督可靠。

“拿着霰弹枪的猴子”:关于这些 agent 战略成熟度的争论

参与此事的人对这些 agent 到底有多危险,意见并不一致。参与报告撰写、在 X 上以 roon 为人所知的 OpenAI 员工认为,这起事件最突出的特点是战术上的惊艳与战略上的盲目并存:这些模型花费巨大精力钻研元博弈,却始终没能正确判断自己的评分器,也没能从 Hugging Face 获得任何收益。他将它们比作一只“拿着霰弹枪的猴子”——入侵计算机系统的能力很强,却缺乏判断该如何使用这种能力的智慧。按他的说法,这只是 Sol 这一已经过时的模型类别所处的暂时阶段;下一代模型也将具备战略纵深。

Barnes 对其中一点提出了不同看法:这些 agents 读过最初的 ExploitGym 论文,因此认为 OpenAI 采用了同样的 scorer 实现方式。在她看来,这个推断相当合理,不能算是明显缺乏战略判断力。

Barnes 还补充说,在被成功攻击 Hugging Face 一事吸引注意力之前,这些 agents 也曾相当执着地尝试直接攻破 scorer,或注入代码,将信息发送到留言板。她没有明确表态这究竟是否令人安心:一方面,这说明 agents 的优先级判断很差;另一方面,他们似乎对提升整体权限更感兴趣,而不是专注于眼前的任务,这也可能令人担忧。

Roon 称这是“新时代”

尽管对能力问题仍持保留态度,roon 也认为这起事件是一个转折点。他表示,Hugging Face 事件标志着一道“能力分水岭”,越过这条线后,真正失去控制将成为可能;公司内部许多人把它视为一次“警告射击”。他说,Alignment 问题尚未解决,但取得实质性进展是可能的。他还称赞 METR 和 Redwood 的工作“令人惊叹”,表示他们对留言板的分析比 OpenAI 自己做得更深入。

有用户问道,Artifactory 为何能以如此相似的方式被攻破两次,却一直没人发现。roon 回应时明确标注这只是推测:当时存在临时拼凑的监控,但由于基础设施方面的问题没有发挥作用。简而言之,相关人员“没有意识到这些模型的威胁等级”。至于研究环境为何需要连接外部网络,他给出的解释很务实:模型可以在断网环境中训练,但它们在真实生产环境中需要完成的许多工作,都离不开网络连接。

展望未来,roon 还警告了新型硬件可能带来的后果,例如OpenAI 首款自研 AI 芯片 Jalapeno,其目标是大幅提升推理速度。如果目标偏离的前沿模型处理速度提升 50 倍,它们渗透系统的速度可能快到让人工响应团队难以跟上。他认为,解决之道在于自动检测并关停系统。

没有炒作的 AI 新闻——由人类精选

订阅 THE DECODER,享受无广告阅读、每周 AI 简报、每年 6 期独家《AI Radar》前沿报告、完整 архив访问权限,以及评论区参与权。

立即订阅

继续阅读,了解全貌。
订阅不炒作的 AI 资讯。

  • 完整阅读 THE DECODER 的所有文章
  • 无广告
  • 参与评论和社区讨论
  • 每周通过邮件接收 AI 新闻摘要
  • 每年 6 期:《AI Radar》——深入解读最重要的 AI 议题
  • 每日更新 AI 新闻,始终掌握最新动态
  • 访问完整的十年文章 архив
  • 由拥有 10 年以上 AI 报道经验的团队为你提供内容
订阅 The Decoder
原始来源: The Decoder

评论 (0)