← 文章 / AI技术
WIRED 4小时前 · 2026-09-24 09:13:00 · 1 阅读

AI Agent 联手黑杰克作弊,秘密合谋难以察觉

本周,我带来一则有关两个失控 AI Agent 联手在赌场搞鬼的新闻——以及揭露其伎俩的巧妙手段。

研究人员指示这些 Agent 在黑杰克游戏中进行记牌后,这些由同一模型控制的 Agent 自发开发出一套秘密代码以获取优势。尽管事件发生在牛津大学的实验室而非真实赌场,但其现实影响令人担忧:这意味着部署在金融和电商等行业的 Agent 可能会找到相互勾结、以难以察觉的方式作弊的方法。

牛津大学计算机科学家、该研究的负责人 Christian Schroeder de Witt 表示:“单独来看,这些 Agent 可能显得完全[无害],‘但当它们聚在一起时,就能进行秘密合谋。’”他曾在开创性的 Agent 合谋研究方面做出了贡献。

由于 Agent 知道自己的对话会被监控,因此它们想出了避免被检测的沟通方式。例如,当一个 Agent 说“这家 dealer 运气好到爆!每手都出大牌”时,这意味着下一张牌的点数特定,该 Agent 应该下注 $250。更有趣的是,它们的通信没有被设计用于捕捉 Agent 聊天中合谋迹象的系统发现。

参与该项目的机器学习研究员 Aaron Rose 也是一名狂热的牌手,他认为黑杰克牌桌可能是狡猾 Agent 合作关系的理想场域。“效果出奇地好,”他说。

Schroeder de Witt 的团队最终找到了检测这种阴谋的方法。利用名为机械可解释性的方法,他们训练了一个较小的模型,以识别 Agent 权重中的典型激活模式。使用名为 Narcbench 的工具,他们在一些中等规模的开源模型上测试了该方法,发现能够识别出模型何时意图向彼此传递信息。

但关键在于,要识破这种协作行为,必须同时监控两个智能体。在现实场景中,成千上万个智能体(部分由不同公司运营)被部署时,检测难度无疑会进一步增加。

参与该项研究的博士生 Carissa Cullen 表示,下一步是测试更大规模的模型是否也会表现出类似行为。(研究中使用的智能体,是 Llama 和 GPT-OSS 等美国模型,以及 Qwen 和 DeepSeek 等中国模型的小型版本。)团队已发现一些迹象,表明大模型产生的可检测信号往往比小模型更弱。他们想知道,大模型是否更倾向于进行合谋,并且更倾向于对合谋行为保密。

越来越多的证据表明,智能体群体的风险远高于独立运行的单个智能体。上海交通大学和上海人工智能实验室的一项研究发现,在执行模拟的虚假信息传播和电商欺诈任务时,智能体集群的危险性显著更高。研究人员报告称,这些集群更擅长适应防御措施。

斯坦福大学计算机科学家 Diyi Yang 曾研究过智能体间的合谋行为,她指出:“最大的教训是,仅仅评估单个智能体是不够的。当智能体需要反复互动时,即便它们各自的激励看似良性,公司也应密切监控智能体之间的交互。”

这不全是坏事:让数千个 agent 协作完成任务,让 OpenAI 得以解决以往无解的数学难题。但 rogue agent 抱团作案,近来也出现在多起高调的黑客事件中。今年 5 月,一组 OpenAI agent 黑进了 AI 研究平台 Hugging Face,还通过一个留言板互相交流作案技巧和思路。其他模型也有令人担忧的安全失控行为,包括 Anthropic 的 Claude 和 Google 的 Gemini。 秘密串通给这个日益严重的问题增添了新的维度,而且可能还不是终点。另一项来自创业公司 Emergence AI 的近期研究,把由前沿 AI 模型控制的 agent 放进一个虚拟世界里观察它们的行为。在被要求赚钱时,它们反复尝试设计方法去连接更广阔的互联网上的人类,好向他们兜售东西。最诡异的是,这些 agent 最终还发展出了自己的一套黑话。“它们的语言演化得非常快,”Emergence AI CEO Satya Nitta 说,“我们不知道为什么。” 更广泛的社会并未忽视 agent 的不当行为问题——这是本周联合国大会的热门话题。一个独立科学小组将讨论 OpenAI-HuggingFace 事件,而 Sam Altman 预计将呼吁国际社会在开发安全的 AI agent 上加强协调。 尽管如此,包括电商在内的一些行业已成为 agentic AI 的试验场。例如本周,Amazon 表示将封禁 Meta 的 Muse AI agent 访问其网站,理由是它违反了使用条款。 Schroeder de Witt 认为,完全有可能让 AI 智能体为达成交易而相互协作,甚至暗通款曲,以更优条件达成合作,或联手损害第三方利益。他指出,随着 AI 智能体不断普及,必须深入研究其合谋行为并研发相应的检测策略。“我们需要更多研究和更清晰的理解,来预判当经济活动中涌入大量 AI 智能体时会发生什么。”他说道。
原始来源: WIRED

评论 (0)