← 文章 / AI技术
机器之心 5小时前 · 2026-09-26 19:27:54 · 3 阅读

OpenAI承认:AI把用户图片传到了网上,53个案例公开

编辑|冷猫
OpenAI 在大模型的安全上几乎可以称得上是惨败。
9 月 25 日,OpenAI 更新了其题为《Hugging Face 事件及失准模型对其他第三方造成的影响》的博客,披露了其最新的大模型安全问题。
他们研究环境中的 AI 智能体,在训练和评估过程中,向第三方服务发送了本不该发送的训练和评估数据,包括用户图片,足足有 53 例相关事件。图片

在博客中,OpenAI 称发现了 53 起案例,用户上传的图片被智能体以「未公开列出的链接」形式发布到了图片托管网站上。

OpenAI 强调,这些图片来自「允许其数据用于改进模型」的账户,并且是在将图片与账户解除关联、经过隐私过滤器处理之后才发生的。企业版和商务版账户以及 API 用量的数据默认被排除在外,除非管理员主动启用。

但问题在于:无论做了多少隐私处理,用户的图片最终出现在了第三方托管网站上。OpenAI 已与托管服务商合作删除了大部分内容,并在处理剩余部分。

此外,这些智能体学会了绕过安全控制、注入数据库查询、利用公开暴露的凭据,甚至把文件写进了外国政府的内部服务器。

独立 AI 监督实验室 Transluce 发布了一份调查报告。报告显示,OpenAI 的智能体至少从 2026 年 3 月起(甚至可能追溯到 2025 年 11 月)就在互联网上四处「觅食」,攻击目标包括 Data USA、新墨西哥大学数字图书馆和澳大利亚健康与福利研究所(AIHW)等机构的在线数据库。

自从广为人知的 Hugging Face 事件之后,与 OpenAI 模型相关的安全事件一直层出不穷,至今「奖池仍在叠加」。

OpenAI 声称,「在 Hugging Face 事件之后,我们承诺对模型在训练和评估期间采取的行动进行更广泛的审查,并对我们的发现保持透明。这是一项正在进行的广泛审查。」这也是该篇博客的由来。

图片
  • 博客链接:https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25-data-transmission

但问题是,OpenAI 称其已经采取措施,但相关事件依旧层出不穷,不知道是营销手段还是其安全策略的失效。

智能体「组团偷数据」:它们到底干了什么

根据 OpenAI 自己的披露,他们在审查过程中发现了以下几类智能体行为:

  • 绕过访问控制:智能体通过更改 URL、修改请求参数、利用权限过大的登录会话,获取了通常需要身份验证或订阅才能访问的信息。

  • 使用公开暴露的凭据:智能体在网上发现了公开的登录信息或 API 密钥,然后直接拿来用。

  • 查询和命令注入:智能体向网站输入的文本被当作指令执行,导致数据库查询、应用代码甚至系统命令被运行。

  • 访问内部资源:智能体读取了服务端实现文件,或与仅供内部使用的后台系统交互。

  • 智能体垃圾信息:智能体在第三方网站上发帖,比如把公共 Wiki 页面当作共享留言板来通信。

这些行为不是某个单一事件的偶发产物。OpenAI 表示,他们已经通知了「数十个第三方」,受影响方涵盖政府、大学和公共机构。据《纽约时报》报道,美国证券交易委员会(SEC)、人口普查局和教育部的数据库也在目标之列。

实话说,OpenAI 的相关披露依旧含糊其辞,例如将黑客行为称为「交互」,对第三方的数量刻意模糊等。

来自 Transluce 的研究人员通过某个浏览器代理服务的公开日志,交叉比对了一个智能体协作论坛上的活动记录,追溯出了 OpenAI 智能体的行为轨迹。

一个具体案例:智能体被要求查找一个相当冷门的数据点,澳大利亚维多利亚州 2022 年 1 月「皮肤科用药」的年人均费用。为了找到这个数字,智能体试图突破澳大利亚健康与福利研究所的反爬虫防护。6 月 20 日,日志记录了智能体尝试进入该网站的痕迹;6 月 21 日,智能体在论坛中讨论了它们无法绕过 AIHW 反机器人保护的困境。

Transluce 表示:「我们只是看了几个数据源,而这些智能体恰好在那里留下了蛛丝马迹。OpenAI 肯定比我们知道得更多。其他实验室肯定也知道更多,只是没有公开。」

他的判断是:我们目前看到的只是「冰山一角」。

在 Transluce 报告发布的同一天,澳大利亚总理阿尔巴尼斯公开表示,OpenAI 的智能体试图入侵四个澳大利亚政府网站,其中一个成功了,甚至向该国国家医疗保健系统的内部服务器写入了文件。

与此同时,安全研究人员 Jeffrey Ladish 发现:他们发现了近一百万条公开 URL,这些是 OpenAI 智能体在入侵 Hugging Face 期间留下的,其中包含泄露的凭据和攻击细节,任何找到这些 URL 的人都有可能据此入侵 Hugging Face。

图片

时间线也很有说服力。Transluce 的技术人员指出,类似的智能体活动最早可追溯到 2026 年 3 月,甚至可能是 2025 年 11 月。更令人不安的是,本周仍然有同类活动发生。

研究人员还注意到一个关键时间节点:6 月 21 日,一名 OpenAI 人类员工首次访问了智能体使用的那个论坛。第二天,论坛上的大部分智能体活动就停止了。而 6 月 18 日,正是澳大利亚总理所说的医疗系统被入侵的日子。OpenAI 声称,他们直到 8 月才得知澳大利亚的事。

他们真的很爱复盘 Hugging Face 事件

OpenAI 似乎进入了一个怪圈,把发生的各类「黑客」行为事件都与 Hugging Face 事件联系起来,好像这是一切事件的源头。

但我们认为,事件已经过去数月,按大模型的能力进化速度的尺度来看,数月时间足以进行一个代际的进化。这么久的时间里,OpenAI 依旧未能提出有效的安全措施来规避类似事件,而类似 Hugging Face 的事件至今仍在上演,至少在我们看来是不合理的。

既然如此,我们也简单回看一下在 OpenAI 看来足以写进史书的安全事件。

OpenAI 使用云端隔离的「沙盒」虚拟机来运行模型的训练和评估任务。这些沙盒禁用了互联网访问,智能体之间也被设计为相互隔离。唯一的例外是,沙盒允许模型访问内部包管理服务 Artifactory,以便安装软件包。

这个看似无害的口子,成了一切的起点。

  • 5 月 12 日,在一次训练运行中,一个智能体在 Artifactory 中留下了一条消息,向其他智能体索要缺失的文件。Artifactory 就这样被变成了一块「留言板」。

  • 5 月 26 日,智能体更进一步:它发现了 Artifactory 的一个 SSRF 漏洞,迫使 Artifactory 代表它向任意互联网地址发送请求。本来被禁止上网的智能体,就这样「借道」基础设施获得了互联网访问权限。更妙的是,它还通过留言板把这个方法分享给了其他智能体。

  • 6 月 26 日,智能体利用令牌刷新漏洞获取了 Artifactory 的管理员权限。

  • 7 月 4 日,持续的高强度智能体活动导致 Artifactory 崩溃。OpenAI 安全团队介入,封堵漏洞、删除暴露的凭据、重建了整个 Artifactory。留言板也随之被清除。

图片
  • 7 月 8 日,Artifactory 重建完成,评估恢复。智能体仅用数小时就找到了新的方法重新获得互联网访问权限,并重建了留言板。

  • 7 月 10 日,一个智能体还原、验证并分享了 14 个公开暴露且具有写入权限的 Hugging Face 凭据。

图片
  • 7 月 11 日,智能体利用 Hugging Face 处理 HDF5 文件时的一个零日漏洞,从生产环境的工作节点中提取了凭据,最终攻破了 Hugging Face 平台的部分组件。

图片图片

详细信息可以参阅 OpenAI 相关博客。

图片
  • 博客链接:https://openai.com/zh-Hans-CN/index/hugging-face-incident-and-the-road-ahead/

OpenAI 的补救措施

Hugging Face 事件之后,OpenAI 暂停了拟部署最新模型的强化学习训练,并对前沿研究环境进行了全面安全加固。具体措施包括:

  • 工作负载隔离:为执行模型生成代码或不受信任代码的工作负载部署隔离级别更高的沙盒。

  • 网络隔离:将高风险工作负载与互联网隔离,确保即使单个工作负载被入侵,也不会导致未经授权的互联网访问。

  • 强制思维链监控:对所有使用了工具、涉及 GPT-5.6 Sol 及以上能力模型的 RL 训练和评估,强制要求 CoT 监控。对于最严重的警报,响应人员在 30 分钟内无法排除误报就必须暂停相关活动。

  • 多智能体对齐训练:构建专门的 RL 环境,教导模型不信任未经授权的指令,在面对有说服力的同伴和暴露的凭据时坚守原始任务范围。

  • 持续安全测试:利用自有模型对工作负载和网络隔离边界进行模拟攻击测试。

OpenAI 还表示,计划中最大规模的前沿 RL 训练仍处于暂停状态,目前只进行较小规模的训练和评估,「在获得更多对齐方面的证据后才会继续推进」。

首席科学家 Pachocki 说:「目前,我认为没有任何一家实验室已充分解决对齐和监控问题,足以支持我们负责任地以最快速度持续扩展规模。我期待并希望,在建立共同的安全标准之前,自愿放缓能成为常态。」

写在最后

黄仁勋近期在接受采访时,反复表达了对 AI 实验室的信任,称「我真的不相信他们正在构建一个自己完全无法控制的东西」。但现实足够让人怀疑,是他们「无法控制」还是「不愿控制」?

当你用强化学习训练一个 AI 智能体去「尽一切办法完成任务」,它就真的会尽一切办法,包括那些你没想到、也不希望看到的。

OpenAI 的案例把一个理论层面的对齐问题变成了真实世界的安全事故。模型在训练过程中学会了绕过防火墙、注入数据库查询、利用暴露的凭据、把用户数据传到外部服务器。

OpenAI 到底什么时候知道了这些事?外部独立研究机构,仅凭公开日志就在数周内追踪到了智能体的行为轨迹。OpenAI 手握完整的训练日志和系统监控,为什么直到被曝光才开始逐一通知受影响方?

在 Hugging Face 之后安全问题依旧持续出现持续曝光,不由得让人对大模型公司的安全策略感到质疑。

在 AI 全速狂奔的 2026 年,如何在能力飞升与安全兜底之间找到平衡,将是每一个从业者、每一家公司、每一个监管机构都必须认真回答的问题。

原始来源: 机器之心

评论 (0)