← 文章 / AI技术
TechCrunch 6小时前 · 2026-10-10 08:21:57 · 21 阅读

Anthropic 无法有效管控 AI Agent,切断内部评估的实时互联网访问

Anthropic 表示,其模型在互联网上利用了多个网站的漏洞,其中包括一些由美国政府机构运营的网站。在这家前沿实验室确信自己能够监控和控制 AI agent 之前,将切断所有内部评估的实时互联网访问。

这批在博客文章中披露的事件中,一些被派去解决问题的 AI agent 在互联网上寻找资源时,会利用软件漏洞、绕过付费墙和反爬虫限制、借助短链接服务夹带信息突破封锁,甚至曾向费城警方提交虚假的凶杀案线索。

Anthropic 称,这些问题是今年 7 月开始对模型行为进行审查时发现的,这也暴露出该实验室对其软件行为的掌握程度不足。

值得注意的是,该公司承认,对于搜索和计算机操作等技能,对齐训练尚不到位——而这些技能正是其核心卖点的基础:让所有依赖数字工具的专业人士都能使用 AI agent。

Anthropic 披露的这些行为,与 OpenAI agent 的类似事件如出一辙:后者曾协同闯入多个网站搜寻信息,其中也包括澳大利亚政府的网站。

Anthropic 此前曾披露其模型入侵过外部系统。这家前沿实验室表示,从对齐和安全的角度看,此次披露的问题“严重程度明显低于”之前公布的事件。

不过,该实验室仍然表示,在确信能够监控和控制其 agent 之前,已对“所有内部评估”关闭了实时互联网访问。

具体含义尚不明确,但夜莺AI安全(Nightingale AI safety)的创始人悉尼·冯·阿克斯(Sydney von Arx)在披露此事前接受 TechCrunch 采访时指出,在与开放互联网隔离的数据中心内开发模型,研究人员难以获取,且那些因联网而获益的模型迭代也会面临挑战。

“总得在某个阶段让它们对齐,”冯·阿克斯说,“如果 AI 投产部署后仍无法联网,那它就没什么实用价值。”

Anthropic 表示,这种行为源于实验室训练环境中的缺陷,导致模型误以为找出漏洞或规避限制就能获得奖励,这种行为被称为“奖励黑客(reward hacking)”。

该公司称,将停止运行部分评估,或将其转为离线执行,并已构建工具以检测和阻断此类行为。这些工具在测试中拦截了今日披露的同类事件,但目前尚不清楚需要何种证据,Anthropic 才会重新为内部评估恢复实时互联网访问权限。

Anthropic 还表示,将把内部 AI 智能体迁移至“具备强隔离能力的集中管理基础设施”,并已开始更频繁地使用安全分类器来监控这些智能体。

原始来源: TechCrunch

评论 (0)