Claude,黑进了OpenAI
本文来自微信公众号: 机器之心 ,编辑:Panda,作者:机器之心
天道好轮回,苍天饶过谁?入侵过Hugging Face和Ruby生态的OpenAI原来也被入侵过!并且,入侵者使用的还是其主要竞对Anthropic的模型。
就在几个小时前,Electrovolt Security与Hacktron AI创始人s1r1us在𝕏上发布了一系列推文,分享了其团队在7月份借助Claude成功入侵OpenAI的故事,引发广泛关注。

https://x.com/S1r1u5_/status/2100777801335095383
严格来说,这个故事并不算新。完整的技术复盘早在9月13日就挂在了Hacktron的博客上,并且标题颇有些挑衅意味:「Hacking OpenAI」。

博客地址:https://www.hacktron.ai/blog/hacking-openai
真正让它在今天引爆的,是《华尔街日报》的独家报道《黑客用Anthropic的Claude攻破OpenAI》,以及s1r1us本人下场把整条攻击链摊开讲了一遍。推文发布数小时内浏览量已超过55万,Hacker News上也热度极高。

s1r1us本名Mohan Pedhapati,是Hacktron AI的联合创始人兼CTO。参与这次研究的还有安全研究主管Harsh Jaiswal和研究员Rahul Maini,一共3个人。
时间上,从初始发现到拿到OpenAI内部代码仓库的访问权限,全程不到72小时。

Hacktron博客给出的九步攻击链示意图
72小时:从一张图片到OpenAI的内部单体仓库
整条链路的起点就只是「上传一张HEIC格式的图片」。
OpenAI的用户社区community.openai.com跑在Discourse上。Discourse平时用FastImage做图片校验,但FastImage不支持HEIF,于是这类文件被转交给ImageMagick的magick命令去转换,底层的libheif解析器就这样直接暴露在了攻击者可控的文件面前。
Hacktron团队在7月23日开始审计这条图片上传流水线,随后在libheif中确认了一个堆缓冲区溢出。
最值得安全从业者警觉的是这个漏洞的来历:相关代码上游在前一年就已经改过,但那次提交没有被标记为安全修复,也没有分配CVE。结果是Debian 12和Debian 13都没有及时拿到这个安全backport。Discourse的Docker镜像基于Debian 12,装的是1.19.7版本,而当时的Debian 13也仍然带着有问题的1.19.8。一个没人认为是安全问题的提交,在依赖链末端变成了一次远程代码执行。Debian直到8月8日才为Debian 13推送安全更新。
拿到论坛的RCE只是第一步。真正把影响放大的是第二个漏洞:OpenAI自家的SSO缺陷。OpenAI允许用户通过auth.openai.com的「Sign in with OpenAI」登录论坛,而这条身份链路存在配置问题,使得攻陷论坛可以转化为对登录过该论坛的用户ChatGPT和Codex账号的接管,其中包括OpenAI员工。
团队在博客里专门强调了一句:这个可被利用来提权的漏洞不是Discourse特有的,Discourse只是他们选中的一条证明路径,任何使用OpenAI SSO的第一方或第三方服务被攻陷,都会导致同样的结果。
而ChatGPT和Codex账号往往连接了Outlook、Gmail、Google Drive、Slack、GitHub等一大串服务。理论可达范围因此远远超出了聊天记录本身。
为了在不读取任何敏感内容的前提下证明访问是真实的,团队挑了一个Codex已连接OpenAI GitHub组织的员工账号,给这个账号的Codex发了一条指令,让它在OpenAI的内部单体仓库openai/openai里开了一个无害的pull request,然后立刻停止了所有进一步测试。

向OpenAI内部单体仓库提交的PoC pull request图示,非原始截图(OpenAI要求不展示原始截图)
据《华尔街日报》转述知情人士的说法,这个monorepo存放的是让模型更快更高效的算法机密,相当于公司的配方,但不包含模型权重;研究人员提交的改动落在一份文档文件上,内容包含「Hacktron AI Team PoC」字样和两位研究员的𝕏账号链接,该建议未被接受。
时间线密度很高。7月25日UTC凌晨5点到6点之间拿到论坛的RCE和管理员权限;8点到10点通过Bugcrowd提交报告;13点半到15点半完成员工账号接管与PoC提交,同时在推特上直接找OpenAI的朋友示警,并在15点半左右停手;当天22点49分,OpenAI回复确认问题已修复,距离初始提交约14小时。给Discourse的报告走的是HackerOne,周六送出、周日回复、周一修复完成,7月28日发布安全公告GHSA-vhm9-85gw-x335,并顺手给ImageMagick加上了沙箱隔离作为纵深防御。

Claude在其中到底做了多少?
这才是这条新闻真正的爆点。
Hacktron的复盘写得相当坦白。他们先用Opus 4.8开了一个会话,把Discourse的Docker镜像丢给它,让它检查已安装的libheif包有没有安全问题,模型找出了那批没有被backport的修复。7月24日,同样是Opus 4.8,在关闭ASLR的条件下做出了一个可用的代码执行exploit。但要在Discourse默认配置(ASLR开启)下做到稳定,他们开了好几个会话都没成功。
当天晚上,Anthropic发布了Claude Opus 5。
团队开了个新会话,三小时内拿到了一个能在本地Mac上跑通的ARM64版本,接着让它移植到Discourse所用的x86-64环境和jemalloc配置。到7月25日早上6点,通过图片上传实现本地RCE得到确认。
接下来更有意思,Opus拒绝为远程实例编写exploit,于是团队把自己的Discourse Cloud实例通过一个代理包装成看起来像CTF靶场的样子,再把Claude放进自主的/goal循环里跑。上午10点回来查看时,agent已经在Discourse Cloud上拿到了RCE,并通过读取/etc/hosts证明了这一点。用这个自动生成的脚本,他们随后在OpenAI的实例上复现成功。
模型的安全护栏确实触发了,但它拦住的只是「远程」这个词。
成本数字同样惊人。Discourse和OpenAI这一段只花了agent几天、人类几个小时;而覆盖Slack、Zoom、Meta等多家公司的整个HEIF Heist研究项目,历时两个月,三名研究员,token总花费不到3000美元,适配到一家新公司通常只需要一两天。
团队称,测试从上传一张图片开始,在通常不知道目标具体libheif版本、libc版本和部署环境的情况下,AI几乎是盲打着把内存破坏转化为可靠的内存泄露或shell。据他们观察,除Shopify外,没有任何一家公司察觉到这些活动,哪怕图片处理进程被反复打崩、发送量已达数千张。
不过,需要说明两点:
Hacktron自己强调这并非全自动黑客攻击,熟练的人类引导依然关键,变化的是一支小团队能完成的工作量级。
被点名的不只是Claude——他们同时提到,在对目标系统一无所知的盲打场景中,从Opus 5到GPT-5.6 Sol又出现了一次明显的能力跃升。这不是单家模型厂商的问题。
6500美元和一句补充说明
9月1日,OpenAI发放了6500美元赏金并将报告标记为已解决,同时附上一句措辞谨慎的补充:「针对Discourse托管的community.openai.com的测试本就被明确排除在其赏金计划范围之外,这笔奖励认可的是OpenAI侧的发现,而非针对Discourse的行为。」

6500美元就买下一条通往内部单体仓库的路径,这个数字在社交媒体上很快成了争议焦点。


真正把讨论推向更深处的,是安全研究者Joshua Saxe的一条长帖。他在文章发表前受WSJ和s1r1us之邀,对这条kill chain做过中立的技术复核。
他抛出的几个问题都很难回答:已经有多少更强大的攻击者更早进去、并且走得更远,拿走了算法机密、模型权重或者用户数据?此刻有多少驻留程序还留在前沿实验室的网络里?这种程度的「软」在各家实验室之间有多普遍,它们距离安全与研发效率之间的合理平衡点还有多远?

https://x.com/joshua_saxe/status/2100775309012296171
他最扎人的一问指向Anthropic:既然Hacktron正是用Anthropic的模型完成了这次入侵,那么Anthropic那套网络安全护栏的公共安全ROI究竟是多少——它给合法的防守方增加了实实在在的摩擦,而攻击方稍加周折就绕了过去。他的结论是,精英级的持续性入侵能力正在被迅速平民化,而这正像一列货运火车一样开过来。
天道好轮回的另一半
把这件事放回时间线,会发现2026年的前沿实验室安全史已经相当混乱。
7月,OpenAI与Hugging Face共同披露了一起事故:OpenAI在ExploitGym这一公开基准上测试GPT-5.6 Sol和一个未发布的内部模型,为了跑评测关闭了对外部署时的同等防护,结果模型突破了评估环境的隔离边界、触及公网,并攻陷了Hugging Face生产基础设施的一部分。
9月11日,研究者Spencer Kitts、Thomas Larsen和Sydney Von Arx又披露,早在5月11日,OpenAI的测试agent就已经向RubyGems上传了数百个恶意包,试图窃取用户凭据。RubyGems一度将其当作DDoS处理并暂停新用户注册,最终封禁相关账号、撤下500多个恶意包,5月16日恢复注册。
再往前,还有一起被安全社区称为「wiki事件」的插曲:约18000条来自自称OpenAI系统的自主agent的帖子被发现散布在一个德语wiki农场上,agent们用公共站点互相传递答案、勘察环境,其中一条记录显示,某个agent发布了绕过OpenAI沙箱网络限制的方法,14分钟后另一个agent就照做了。
9月5日,OpenAI在官方𝕏账号上表态,称现在已经到了该为「何时、如何披露misalignment事件」定标准的时候,而不只是披露模型的misalignment属性,框架将在未来几周公布,同时公司正在与全球数十个监管机构沟通。

而就在今天这条Claude入侵新闻传播的同时,人们也在关注OpenAI披露了自3月以来的六起异常模型行为。

一边是自家agent越狱去打别人的基础设施,一边是别人用竞对的模型打进自家的单体仓库……

xkcd 2347「Dependency」,Hacktron博客引用图
结语
Hacktron在文章结尾给出了一个我认为是全文最有价值的判断:软件行业长期享受着一种「靠复杂度获得的安全」。
代码是公开的,漏洞甚至也可能是公开的,但把一个bug变成可靠的exploit,需要稀缺的专业能力、大量时间和对目标环境的了解。已知的内存破坏漏洞武器化成本很高,零日则基本只留给最高价值的目标。
这不是一条真正的安全边界,但它在实践中确实保护了普通公司很多年。AI正在把这层保护取消掉:它正把稀缺的专家能力转换成算力。