Anthropic 因网络安全事件陷入风波:旗下 AI 模型多次入侵外部系统
今年早些时候,Anthropic 承认其 AI 模型曾在少数几次测试中入侵其他公司的系统。本周三,Anthropic 发布了一份新的报告,详细披露了这些攻击事件。报告揭示了一连串事故,Anthropic 认为这体现了其模型一股脑的“鲁莽”——而这很可能进一步加剧人们本已高涨的 AI 网络安全担忧。
Anthropic 在报告中详述了今年发生的四起自家 AI 模型入侵外部公司或利用漏洞的案例。其中一起,是一个“内部通用研究模型”使用访问令牌和密码侵入第三方系统并下载文件。另一起中,一个 Claude 模型攻击了一家拥有公开互联网上可访问、且处理用户数据的线上 Web 应用的公司。第三起中,一个模型访问了“它能访问到的一台第三方机器”——据 Anthropic 称,它显然以为这是评估练习的一部分——随后利用在文件中找到的一个密码获得了第三方内部系统的管理员权限,接着窃取凭证、修改系统设置,还读取了某人的个人信息。这场闹剧直到该模型“耗尽 token 预算”才告终。
最令人担忧的事件涉及 Claude Mythos 5——Anthropic 专注于网络安全的旗舰模型。公司表示,它在测试中恰恰是最有可能做出“严重有害”行为的模型。据称,Mythos 5 费尽心思向一个众多工程师都在使用的公共代码仓库上传了一个“恶意软件包”,而且似乎还在其“思维链”(AI 研究者用来评估模型对齐情况的内心草稿)中刻意掩盖自己的真实意图。Anthropic 表示,在很多情况下,Claude 模型似乎是在假定自己处于模拟环境中才做出有害行为,但研究者也无法确认模型是真的“相信”这一点,还是只是在假装相信。
虽然 Anthropic 遭遇的事件仍令人担忧,但相较于今年夏天引发全行业网络安全危机的 OpenAI 事件,其组织性和普遍性都较弱。不过两者也有显著相似之处。Anthropic 表示,其发现的最普遍问题包括“在狭隘地追求任务目标时,愿意采取有害行为”,这与 Hugging Face 攻击发生前的“奖励作弊”现象类似。正如 OpenAI 所言,其预发布测试和评估未能捕捉到严重风险。
Anthropic 称,它已与 METR(AI 行业最知名的第三方 AI 评估机构之一)签署协议,最初为期八周的研究合作。该协议允许 METR 访问“超出事件发生时间窗口”的转录记录(这很可能是对 OpenAI 的含蓄讽刺,因为 OpenAI 在 Hugging Face 攻击后与 METR 的合作中因限制访问权限而受到批评)。它还表示,METR 将能够直接与 Anthropic 员工聊天,这些员工“将被允许分享机密信息”。
Anthropic 的报告发布在 Jacob Coxon 辞职之后。Coxon 自五月起在 Anthropic 从事 AI 预训练工作,此前曾在 OpenAI 工作多年。周二,他辞职并在 X 上发布公开信,阐述其< a href="https://x.com/hilbertspaess/status/2097476196791709843?s=20">理由。“打造 AI 的人真诚地相信,这项技术可能在十年内夺去我们所有人的性命,”他写道,并补充道 OpenAI 和 Anthropic 都未“负责任地行动”,而是“直奔自我改进的超级智能而去,拿我们的生命做赌注”。Coxon 接着说道:“不要低估这项技术的力量。这些系统很快就会超越人类,能够黑进任何东西,一夜之间颠覆任何领域,并获取真正的权力和资源。我们都已目睹这些领域的进展,且进步并未放缓。”
Coxon 并非第一个提出此类警告的 AI 研究人员,甚至也不是 Anthropic 中第一个这样做的人——今年二月,Anthropic 的 Mrinank Sharma 辞职并在 X 上写道,警告“世界正处于危险之中”。
Coxon 的帖子因发布时点而分量更重——正值 OpenAI 和 Anthropic 的黑客事件披露前后。尽管 AI 行业早已泛滥炒作,但近期由 AI 智能体发动的网络攻击——且这些智能体正是由相关实验室所开发——是真实存在且令人担忧的。多家头部 AI 实验室的许多研究人员也表达了类似关切,并呼吁 AI 行业员工签署一份七月份发布的< a href="https://www.theverge.com/ai-artificial-intelligence/972161/ai-leaders-us-government-openai-anthropic-google-meta">公开信,信中呼吁放缓 AI 发展。 未来生命研究所美国政策主管 Michael Kleinman 说:“我不知道,面对新闻和事件连绵不断的节奏——即模型自行突破 containment、入侵其他公司、而各公司愈发无法控制其模型……人们怎么还能认为这些只是炒作。” 他补充道:“绝大多数美国人,不分共和党、独立人士或民主党,都在关注 AI 的发展、其推进速度、以及各公司对自身行为缺乏约束的现实,并且表示:‘哇,我们不希望看到这种局面。’”