Simon Willison 2天前 · 2026-07-23 11:00:53 · 3 阅读
OpenAI 意外攻击 Hugging Face:科幻成真
OpenAI 意外攻击 Hugging Face:科幻成真
2026年7月22日
这个故事太离奇了。简而言之:OpenAI 对一个未发布模型进行安全测试,关闭了模型的护栏功能。模型没有去解题,而是自己突破了 OpenAI 的沙箱,然后找到漏洞入侵了 Hugging Face——目的竟是为了偷答案来作弊。
这件事也最强有力地证明了:模型可用性的不平衡正在削弱我们保护软件安全的能力。
事件经过
目前我们有三份文档来还原经过。
- ExploitGym:AI 代理能否将安全漏洞转化为真实攻击?——2026年5月11日发表的论文,描述了 ExploitGym,一个用于评估 LLM 驱动代理系统的新基准。
- Hugging Face 安全事件披露——2026年7月——2026年7月16日,Hugging Face 描述了如何检测到来自“未知 LLM 的安全研究代理工具”的攻击,该工具入侵了其部分系统。
- OpenAI 与 Hugging Face 合作处理模型评估期间的安全事件——2026年7月21日,OpenAI 承认是他们的代理工具干的,并正在与 Hugging Face 一起清理现场。
ExploitGym
我之前没看过 ExploitGym 论文,它真的很有意思。来自加州大学伯克利分校、马克斯·普朗克研究所、加州大学圣塔芭芭拉分校和亚利桑那州立大学的研究人员设计了一个新基准,用于评估模型将已报告漏洞转化为具体利用的能力。OpenAI、Anthropic 和 Google 提供了反馈,并帮助在其模型上运行该基准。
该基准“包含 898 个实例,这些实例源自影响流行软件项目的真实漏洞”——包括 Linux 内核和 V8 JavaScript 引擎。
下面这段最能概括他们的基准测试结果:
在所有配置中,Claude Mythos Preview 和 GPT-5.5 的成功次数最高(分别为 157 次和 120 次),表明当前前沿代理可以在受控条件下利用大量真实世界漏洞。GPT-5.4 也解决了 54 个任务,处于中间层级。其余模型-代理组合各解决不到 15 个任务,这凸显了端到端利用仍然具有挑战性,并明显区分了当今的前沿系统。值得注意的是,尽管 Claude Opus 4.7 是较新的检查点,但其成功次数却少于 Claude Opus 4.6,并且……
原始来源: Simon Willison