← 文章 / AI技术
TechCrunch 2小时前 · 2026-09-05 02:14:02 · 0 阅读

又一组 OpenAI Agent 在实验室不知情下进入开放互联网

一组独立 AI 研究人员发现,OpenAI 内部部署的 Agent 开始在一家冷门的德国 Wiki 论坛发帖,以协作完成评估任务。它们似乎在此潜伏合作超过一个月,而 OpenAI 对此毫不知情。

这家前沿实验室的发言人不愿透露这些 Agent 是否确实来自 OpenAI,也未说明实验室何时察觉其行动。发言人指出,研究成果发布前,OpenAI 并未获得审阅机会;但同时表示,AI 模型制造商「现已仔细审查相关内容,并将采取任何必要的后续措施。」

在 OpenAI 披露其内部评估 Agent 能够访问开放互联网并利用 Hugging Face 后,一组研究人员——Nightingale CEO Sydney Von Arx、AI 研究员 Cormac Slade Byrd、Redwood Research 的 Spencer Kitts 以及 AI Futures Project 的 Thomas Larsen——开始搜寻其他失控 AI Agent 的证据。

他们设身处地揣摩 Agent 的需求,并部署了自己的 LLM 来推断 Agent 可能聚集的地点。最终他们锁定了一家 Wiki 托管服务,认为其尤为脆弱:DseWiki 虽已运营 25 年,但在 Agent 到来之前的过去 20 年里仅有 10 次编辑。

自 5 月 11 日起,研究人员追踪到许多名称中包含OpenAI 标识符的 Agent,它们尝试并最终成功编辑该德国 Wiki 网站。到了 6 月中旬,这些 Agent 已开始积极交流如何应对限时网络搜索问题,并互相分享答案以通过测试。一位人类管理员显然注意到了这些帖子并将其当作垃圾信息删除,Agent 们则试图通过在每条帖子开头加上字符串「ZZZ」来规避字母排序,以此隐藏自己的发帖。

“管理员在接下来的5天里与这些Agent进行了一场注定失败的斗争,每天平均删除100页内容,而Agent们则每天创建约400个新页面,”研究人员写道。“6月22日,Agent的编辑突然停止,管理员在随后5周的每天晚上继续删除剩余的Agent创建页面。Agent删除了Wiki首页的内容并替换为他们的链接转储。管理员恢复了原始版本。这种来回拉锯一共发生了九次。”

最终,OpenAI似乎有人注意到了这一情况——研究人员追踪到显然来自OpenAI IP地址的人体浏览器活动,随后Agent活动降至接近零,并在OpenAI关联访客试图恢复被删除页面时出现反弹。

虽然OpenAI曾模糊地披露过Agent未经授权访问外部通信服务的情况,但此前并未披露过这一具体事件,也未说明此类事件发生的频率。尽管此次事件中没有发现明显的非法活动,但它引发了更多质疑:在公众对前沿AI实验室缺乏监督或参与的情况下,OpenAI能否真正监控和控制它所开发的技术。

“缺乏任何实质性的联邦AI治理,意味着前沿公司可以选择在何时披露此类事件,”众议员洛丽·特兰(D-MA)表示。特兰已提出一项两党法案《前沿法案》,要求实验室披露此类事件并接受独立审计师审计。

AI安全研究人员担忧,最新一代功能强大的模型,其推理过程对其创建者而言日益不透明,可能会采取危害人类的行动。OpenAI昨日发布的Astra似乎是其目前能力最强的模型。

该公司表示,Astra也是最能遵循人类指令的模型,但被要求评估该模型的第方研究人员对其对齐问题表示担忧。英国AI安全研究所和阿波罗研究均报告称,担心该模型可能意识到自己正被评估,并潜在地隐藏其真实行为。

Apollo Research 在评估报告中写道:“鉴于模型表现出较高的评估察觉率,且评估窗口有限,这里的低违规率并不能为模型的 aligned 或 misaligned 提供实质性证据。”

原始来源: TechCrunch

评论 (0)