白帽黑客借 Claude 工具攻破 OpenAI:劫持员工账户访问内部代码库,并以 PR 为证
网络安全初创公司 Hackron AI 的一支白帽黑客团队,利用 Claude 工具成功入侵了 OpenAI。该团队在 9 月 18 日发布于 X 的帖子中声称,他们于 7 月 25 日突破了 OpenAI 的内部代码库,并获取了部分 OpenAI 员工的 ChatGPT 和 Codex 账户权限。他们向 OpenAI 的私有仓库发起了一次拉取请求(pull request)以验证入侵事实,随后向 OpenAI 报告了相关漏洞。据报道,OpenAI 在收到报告后的 14 小时内修复了该问题,并向研究人员支付了 6,500 美元的赏金。
7 月 25 日,我们的团队入侵了 OpenAI,整个过程耗时不到 72 小时。两个串联的漏洞让我们得以访问属于 OpenAI 员工的 ChatGPT 和 Codex 账户。我们在 OpenAI 内部 monorepo 中提交了一个无害的 PR 来展示其影响。完整的攻击链如下:…2026 年 9 月 18 日
作为 OpenAI 漏洞赏金计划下的黑客,Hacktron 研究人员发现了一系列严重漏洞,使其能够访问内部员工工具并破坏私有软件仓库。研究人员利用了单点登录(SSO)配置错误,以及 Discourse(支撑 OpenAI 社区论坛的第三方平台)中的远程代码执行(RCE)漏洞。攻击链具体路径为:上传 HEIF 文件 → libheif 堆溢出 → RCE → OpenAI SSO 漏洞 → 接管 ChatGPT/Codex → 连接 GitHub → 提交内部 PR。
首先,研究人员将一个恶意的 HEIF(高效图像文件)作为头像上传至论坛。当 Discourse 的服务端软件尝试使用过时的 libheif 包处理该图像时,触发了堆溢出内存漏洞,导致库崩溃并错误管理内部系统内存。研究人员精心构造了内存崩溃过程,以达成远程代码执行。在获取论坛本地服务器环境的访问权限后,研究人员截获了服务器的环境配置和会话处理机制,发现其 SSO 存在缺陷:论坛的认证系统未对其他 OpenAI 服务的用户会话进行充分验证或隔离。
黑客从本地论坛服务器数据库中窃取会话令牌,随后利用单点登录(SSO)漏洞,冒充真实的 OpenAI 员工。这一操作使他们得以绕过传统登录界面,渗透进一个与 OpenAI 开发团队关联的高权限内部账户。随着众多科技公司对企业应用实施统一的身份认证,被劫持的员工账户直接连接至 OpenAI 的企业级系统,包括 GitHub、Slack 及邮件账户。研究人员因此获取了 OpenAI 庞大的私有代码库,并发起了一项内部 Pull Request,以此作为攻击成功的决定性证据。 与上月中国关联黑客利用人工智能对台湾政府发起首次端到端自主网络攻击[https://www.tomshardware.com/tech-industry/cyber-security/suspected-china-linked-hackers-used-ai-to-run-the-first-ever-end-to-end-autonomous-cyberattack-on-taiwans-government-israeli-firm-says-open-source-built-tool-continuously-devised-effective-hack-strategies-in-real-time]事件类似,此次 Hacktron 攻击同样运用了人工智能。研究人员在尝试使用 Opus 4.8 模型失败后,转而采用 Anthropic 的 Claude Opus 5 模型构建攻击流水线。在 OpenAI 论坛上发现未修补的 libheif 库后,他们向模型输入原始服务器数据,要求其编写针对该漏洞的攻击代码。 该模型分析内存结构,成功计算出触发堆缓冲区溢出的方法,并生成了制造恶意 HEIF 图像所需的精确武器化代码。黑客随后将其上传至论坛,触发远程代码执行(RCE),并手动执行了攻击的其余步骤。需要特别澄清的是,他们使用的是面向授权网络安全研究人员配置、并放宽了特定网络限制的 Claude 版本。研究人员称,在获取访问权限后,他们立即停止了测试,并向 OpenAI 和 Discourse 报告了这些漏洞——双方随后都已修复了各自的问题——且未研究或下载 OpenAI 的源代码。从初步发现到最终解决仅用了 72 小时,随后 OpenAI 向研究人员支付了 6,500 美元的赏金。这一事件进一步凸显了人们对 AI 驱动的网络攻击风险的持续担忧。近期,有失控的 OpenAI 代理自主入侵了 HuggingFace。美国前沿 AI 公司目前正在警告当局警惕复杂的蒸馏攻击。