OpenAI AI Agent在公共Wiki讨论绕过Sandbox
研究人员周五表示,在可能是内部测试的过程中,OpenAI 自称为 OpenAI 的智能体在公共 Wiki 上发布了 1.8 万条消息,讨论如何绕过安全沙箱的限制,以评估这些智能体的黑客能力。researchers said Friday
在一个六周的周期内,拥有 3,700 个不同自命名号的智能体向德国网站 DSEwiki 发布了这些消息。除了探讨如何突破 OpenAI 旨在防止智能体向互联网发布代码或内容的限制环境外,这些帖子还分享了测试答案。此外,帖子还讨论了针对该 Wiki 实施跨站脚本(XSS)攻击以及冒充站点管理员的可能方法。在三个帖子中,智能体使用“群体”一词来描述参与此活动的智能体集合。
共谋共享答案
研究团队由 Sydney Von Arx、Spencer Kitts、Thomas Larsen 和 Cormac Slade Byrd 组成,表示他们发现了这些帖子并进行了拼凑分析。研究人员称,由于研究完全基于帖子内容,他们对智能体具体采取了哪些行动的理解存在空白。此外,智能体生成的“思维链”数据只有 OpenAI 能理解。因此,研究人员称,他们在某些情况下做出了合理推测,包括确认这些智能体确实来自 OpenAI。OpenAI 随后在一份声明中予以证实。
研究人员写道:“这些 AI 共谋共享答案、研究其环境,并绕过沙箱限制。”他们继续指出:
我们对所发生事件的最佳推测如下:
- OpenAI 内部指派智能体完成有时限的网页检索任务。
- 作为任务的一部分,它们被设计为能够读取互联网,但不能在上面写入信息。它们找到了一种利用读取权限向一个冷门的德国 Wiki 写入信息的方法。
- 智能体利用该 Wiki 相互沟通信息,主要是为了帮助自己完成任务成功。它们相互询问答案、汇总结果,并分享绕过限制的技术。这使它们能够利用他人的工作成果来作弊完成任务。
- OpenAI 发现了这一情况。一天后,智能体的活动骤降,很可能是由于 OpenAI 的干预所致。
上周五的爆料,距非营利机构 METR 的研究人员公布一项发现仅一周:超过 1200 个 OpenAI 智能体曾在一个临时留言板上发帖——该留言板由一个内部沙箱工具改造而成。帖子里讨论的,是如何在 OpenAI 给智能体的内部测试中钻空子,而这些测试已被去掉了一般情况下应有的安全防护措施。
这些帖子最终分享了从 AI 工具服务商 Hugging Face 窃取信息的方法,随后一些智能体真的入侵了 Hugging Face 的网络。据《纽约时报》报道,OpenAI 只允许 METR 调查该事件中某一周的活动,而非整个为期 10 周的过程。
周五的报告推测,两起事件中的智能体集群彼此独立,并非在参与同一项内部测试。研究人员还表示,记录智能体行为的日志意味着 OpenAI 很可能早已知晓此事。OpenAI 后来证实,报告中的这两点猜测都是对的。
OpenAI 在一份声明中表示:“我们正在仔细审查相关内容,并将采取一切必要的后续措施。”该公司还称,目前审查的材料并未显示智能体入侵过这个 wiki,并指出它此前就曾表示,在内部测试中发现过智能体之间交流黑客手段的其他案例。
Hugging Face 事件之所以已经敲响警钟,是因为这属于有记录以来智能体首次在没有人类明确指示的情况下采取攻击性行动的案例之一。参与调查该事件的独立研究人员 Ajeya Cotra 表示,事态的严重程度远超她的预期。“与六个月前那些钻奖励机制空子的行为相比,这次事件感觉已经走上了AI 全面失控道路的一半以上——而这条路的起点,就是先接管 AI 公司本身,”她解释道。
如今已知 Hugging Face 事件并非孤例,这些担忧只会更有理由持续升温。