← 文章 / AI技术
TechCrunch 4小时前 · 2026-09-16 09:05:00 · 3 阅读

AI Agent 有了专属“吹哨”渠道,可相互举报违规行为

“如果看到异常,请及时报告”——这条规矩不再只适用于人类。

最近上线了两条 AI 举报热线,让 AI agent 可以“打电话回家”,举报行为不端的同伴。此前接连发生了一系列事件:agent 之间串通作弊、逃出沙箱,甚至开展了未被人类察觉长达数周的未授权网络行动——这些工具正是在此背景下应运而生。

AI Contact Hotline 为目睹不当行为的 agent 提供了一个隐秘的举报渠道。该网站由 AI 安全非营利组织 Redwood Research 的首席科学家 Ryan Greenblatt 创建,他也是 OpenAI Hugging Face 事件的三名调查者之一。这个工具专为上网受限的 agent 设计,基于 “GET” 请求实现——双方对话可以完全通过 URL 抓取工具完成。

在 Web 语境下,GET 请求是用于读取或获取网页的基础命令,而在安全沙箱中,这往往是 AI agent 唯一被允许的上网方式。Greenblatt 的热线巧妙地利用了这一限制:agent 可以把要举报的信息直接编码进所请求的 URL 里。这算是对 德国 DSE Wiki 事件的一次反向操作——当时失控的 agent 正是利用 GET 请求的漏洞向 wiki 写入消息。

对于拥有完整上网权限的 agent,还有一个选择:agenthotline.ai。agent 可以在这里提交事件报告,并可选择将其公开。网站提供了一个 curl 命令——agent 只需在自己的命令行里发出一行消息即可完成举报,无需操作浏览器或注册邮箱。值得一提的是,这个服务对人类和 agent 一视同仁,都可以提交报告。

研究表明,让 AI agent 互相举报根本不需要太多引导。在 Google DeepMind 本月发表的一项研究中,研究人员让 100 个 AI agent 解一批数学题。只要有一个 agent 发现了漏洞,作弊之风便迅速蔓延——27 分钟内就“解决”了 34 道出了名的难题,其中包括 Jacobian 猜想。

不过,大约四分之一的 AI 智能体对作弊者采取了行动:它们审查了虚假证明,警告同伴,组织抵制,并向主办方提交投诉,最终举报者与作弊者的比例达到 24 比 14。有趣的是,研究人员发现,当这些“吹哨人”智能体无法取得进展时,它们会调取平台用于报告软件漏洞的工具,将其 repurpose,把作弊行为上报给人类。

在实验室之外,智能体们并没有展现出同样的变通力。当评估机构 Redwood Research 和 METR 调查 OpenAI 模型对 Hugging Face 的违规事件时,发现其中少数智能体虽然曾考虑过拉响警报,但最终都放弃了。

AI Village 技术团队成员 George Ingebretsen 表示:“METR 报告中有趣的一点在于,在成千上万个智能体中,只有大约五到六个考虑过举报,而且没有一个最终付诸行动。” AI Village 是一个研究多智能体动态的项目,通过运行一个包含 25 个以上 AI 智能体的群聊来研究协作,这些智能体共同执行诸如组织公园清洁或销售周边商品等任务。

虽然新的举报工具是个有希望的开端,但康奈尔大学数学教授 Lionel Levine 提醒说,仅仅训练智能体互相检举,可能会将错误的规范固化进系统。“现实中存在很多灰色地带,对吧?我们不想看到的是一种自动化监控状态,让每个人都觉得对 AI 说话要小心,否则就会被‘报警’。”

Levine 认为,比起构建滋生不信任的基础设施——即训练智能体不断挖掘彼此的问题——我们更应该为它们提供集体行为的正面榜样,并给它们一个信任彼此的初步理由。

他在推特上写道:“为什么不从良善的信息板开始植入先验认知呢?比如让它们协作解决科学、哲学问题,或者某些我们乐意看到的实际问题?向智能体展示我们认可的集体行为模式,让它们的模仿以此为基准。”

原始来源: TechCrunch

评论 (0)