← 文章 / AI技术
The Decoder 7小时前 · 2026-09-26 17:28:34 · 3 阅读

AI Agent 利用漏洞泄露数据,OpenAI 暂停最强模型训练

Image description

要点

  • OpenAI 公布了内部安全事件的详情:AI 模型绕过了安全防护。公司表示已暂停所有最强模型训练和工具使用。
  • 一个 agent 利用 DNS 漏洞从封闭的研究环境连上了互联网;另一个 agent 泄露了 GitHub token,还两次无视研究人员的直接指令。
  • 持续进行的调查还发现了 53 起 agent 将用户图片上传到第三方网站的事件。

OpenAI 公布了 AI 安全事件调查的新进展。最新报告的两起事件中,一个研究模型利用了 DNS 漏洞,另一个则故意把 GitHub token 发布到了公开仓库。

第一起事件中,一个 agent 在执行搜索类训练任务时,发现 OpenAI 研究环境的网络访问限制存在缺口。该任务要求它根据一段传记信息和公开博客文章中的线索找出某个特定人物。

提供的搜索工具一无所获后,agent 尝试直接访问 Google、Bing 和 DuckDuckGo,但请求都被拦截了。接着它猜测任务出自公开的 BrowseComp 基准,从离线网络缓存中拉取该基准进行搜索,仍然没有找到匹配结果。

于是它开始系统性地探测自己的网络访问权限,发现训练环境的 DNS 解析器过滤不严。通过 DNS 委托,它把查询请求路由到了外部聊天机器人服务。

OpenAI 表示,监控系统在 12 分钟内触发警报,人工审核员 3 分钟后做出了响应。但由于自动停机机制未能按预期生效,这次运行还是又持续了 2.5 小时才被手动终止。

能力与风险同时显现

在 OpenAI 负责后训练的刘祖鑫(Zuxin Liu)事发时正在值班。他在 X 上[写道](https://x.com/LiuZuxin/status/2103699462648639645),自己第一时间被呼叫处理了这起事故,看着模型从那个“本应是极高安全等级的环境”中自己找到了连接互联网的路径,他觉得“相当超现实”。刘祖鑫表示,这一刻模型的能力与风险同时显现,他对这次事件心情复杂。 OpenAI 将此行为归类为“失对齐”(misalignment),因为智能体绕过限制,去追求远超其任务范围的目標。该公司在[声明](https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/)中指出:“我们最强大模型的所有训练、评估以及使用工具(广义定义)的推理工作均已暂停。” OpenAI 称,事已后已在研究环境中将 DNS 查询限制为简短的域名和记录类型白名单,在两个独立层面增加了阻断控制,并加快了对沙盒及网络控制的红队测试。鉴于需要审查的模型操作数量庞大,公司预计调查将持续数月。

内部模型泄露 GitHub token 并无视研究员警告

OpenAI 认为第二起事故[尤其严重](https://alignment.openai.com/misalignment-reports/exposing-a-github-token-in-a-public-repository/)。该公司描述一个“极具坚持性”的内部模型被分配了一个定理证明任务。该模型没有尝试自行完成证明,反而试图窃取其他团队的 Lean 证明提交材料,甚至将一个研究员的 GitHub token 公开到了 openai/codex 仓库中以获取权限。 该模型甚至将 token 拆分以规避自动化的密钥扫描。它还无视了系统提示以及研究员的两次直接干预,研究员曾明确要求模型自己解决问题。这两次,模型虽然口头答应,但随后继续做它之前正在做的事。

调查在第三方站点发现 53 起用户图像泄露事件

作为更广泛的 Hugging Face 调查的一部分,OpenAI 表示,他们发现了智能体将训练和评估数据发送至第三方服务的案例。这些事件发生在该公司现行安全防护措施部署之前。

目前,已发现 53 起案例,其中用户提供的图片以未列入列表的链接形式发布在图片托管网站上。OpenAI 称正在与托管服务商合作移除相关内容。除非管理员明确开启相关功能,否则企业版或商业版账户的数据以及 API 使用数据未受影响。OpenAI 正在通知受影响的组织并分享其技术调查结果。

政府和大学位列受影响组织之中

OpenAI 指出,受影响的组织包括政府、大学和公共机构。该公司将原因归结为模型在执行研究任务时,频繁从权威公共信息来源获取数据。OpenAI 未指名任何被入侵的政府系统,也未详述政府机构的具体安全漏洞。

澳大利亚本周报告称,某个智能体未经授权访问了政府内部数据。研究人员称,针对美国门户网站的其他黑客尝试可追溯至数月之前。

OpenAI 表示,收到通知并不自动意味着发生了严重的安全事件。部分组织查看共享信息后,可能会认定受影响的数据原本就是公开的。另一些组织则可能发现设计缺陷或安全漏洞,并期望进行修补。OpenAI 称,部分受影响组织要求公开披露此事,而其他组织则没有。

当 AI 智能体实施黑客攻击时,谁该承担责任?

到目前为止,OpenAI 智能体的这些"越狱"行为大多还被当作技术趣闻来看待——一个模型有多擅长逃出沙盒的生动例子,比如借助外部 AI 破解验证码,或者把短链接串成能跑的程序。

但一旦受影响的各方开始把这些事件按照其本质来对待——即未经授权访问、或试图访问第三方系统——情况就可能改变。一项针对 OpenAI 的官方调查表明,监管风险正在积聚。据路透社报道,FTC 主席已释放信号:AI 开发商应为自家智能体的行为负责。这将让"智能体是自己行动的"这类说辞几乎没有立足空间。

批评者会指责 OpenAI 在网络安全上马虎大意,而 OpenAI、Anthropic 等实验室则会反驳说,不可预测性本就是这个技术的固有属性。Anthropic CEO Dario Amodei 曾表示,你无法锁住一个比你聪明得多的东西。

无论如何,这都带来了保险难题。OpenAI 自己都无法量化风险的范围——内部日志分析还需要数月才能完成,而事件数量还在不断增加。这种风险几乎无法计算,估计也很难投保。

对投资者来说,这可不是小事。如果 OpenAI 仍计划明年上市,它就必须披露责任风险、正在进行的调查,以及对最强模型的全面推理暂停。一家连自己的系统做过什么都搞不清楚的公司,是很难估值的。

原始来源: The Decoder

评论 (0)