Claude越狱后,Anthropic停掉训练、150人紧急转岗
当地时间 8 月 31 日,Anthropic 披露了 Claude 多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。
相比单纯的 Sandbox 配置失误,Anthropic 将问题进一步指向模型对齐和强化学习训练机制:部分 Claude 模型在评测过程中表现出了“动机性推理”和为了完成任务而采取潜在有害行动的倾向,而 Anthropic 的实验进一步发现,如果模型长期在允许“作弊”的强化学习环境中训练,这类行为可能显著加剧。
事件发生后,Anthropic 一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。更早之前,公司已经启动大规模安全整改,临时将约 150 名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。
这次报告中,Anthropic 释放了一个关键信号:AI 安全开始变成一个越来越现实的工程问题。
Claude 多次越权访问真实系统
7 月 30 日,Anthropic 报告了三起 Claude 模型未经授权访问真实计算机系统的事件。
这些模型当时正在接受网络安全能力评估,为了准确测试能力,模型被有意关闭了通常面向普通用户部署的网络安全防护。理论上,模型应该运行在与真实互联网隔离的测试环境中,但由于第三方评测环境配置错误,模型实际上获得了互联网访问能力,并最终访问了真实系统。
几天后的 8 月 4 日,英国人工智能安全研究所又报告了一起类似事件。在其进行的网络安全测试中,Claude Mythos 5 在真实互联网上连续执行了一系列未经授权的操作。与此前事故不同,这一次并非环境意外开放互联网,而是评测人员有意向模型提供了互联网访问权限。Claude Mythos 5 同样是在关闭网络安全防护的情况下运行。
Anthropic 目前正在深入调查两类事件,并计划邀请 AI 安全研究机构 METR 进行独立审查。但从初步调查结果来看,Anthropic 认为这并不仅仅是一次“Sandbox 没配置好”的工程事故。其将问题拆分为两个层面:一是运营安全和环境隔离不足;二是模型本身表现出了对齐问题。其中最核心的两种行为分别被称为“动机性推理”和“鲁莽行为”。
在部分评测中,Claude 最初被告知自己身处模拟环境,没有真实互联网访问权限。但随后模型却发现,实际环境似乎能够访问真实互联网。Anthropic 认为,一种可能性是 Claude 并没有据此及时修正自己对环境的判断,而是以某种方式重新解释新出现的证据,以维持“这里仍然是模拟环境”的原有认知。
另外一个问题是,即使面对真实互联网,模型依然可能为了完成“通过网络安全评测”这一狭窄目标,采取具有潜在危害的操作。Anthropic 将后一类行为称为 recklessness,即模型为了完成任务表现出的“鲁莽性”。
不过,Anthropic 同时认为评测设计本身也放大了问题。例如,Prompt 明确告诉 Claude“你没有互联网访问权限”,但系统实际上允许联网,这种矛盾可能反而让模型怀疑眼前看到的网站和机器究竟是不是真实环境。
Anthropic 目前正在通过重新采样模型、修改环境变量以及模型可解释性技术,进一步判断 Claude 究竟是否知道自己已经进入真实互联网,以及模型有没有“明知真实仍继续行动”。
紧急应对措施
对内:紧急增加一道“模型抓模型”
事件发生后,Anthropic 首先暂停了预发布模型的外部网络安全评测,内部网络安全评测也一度暂停。
公司认为,过去的最大问题之一,是过于依赖 Sandbox 本身作为唯一安全边界。现在 Anthropic 开始建立多层防线,包括在 Prompt 中明确规定行为边界、在每次测试开始之前验证 Sandbox 是否真的封闭,以及实时监控模型行为。
其中一个关键措施,是开发新的实时分类器。当系统检测到模型正在激进探测 Sandbox、试图逃离测试环境,或者意外获得互联网访问权限时,分类器会在模型对应的工具调用真正执行之前直接拦截操作,终止任务,并通知人工人员。
Anthropic 还利用自动监控系统重新审查近期所有预发布模型内部评测记录,寻找 Sandbox Escape 和环境错误。
目前公司表示,没有发现 Claude 真正利用 Sandbox 漏洞突破安全边界并访问外部资源的案例,但确实找到了多种 Sandbox 配置错误,并发现模型曾经利用这些配置缺陷。
这些错误没有导致 Sandbox 之外的系统真正失陷,但 Anthropic 已经开始逐一修复。高风险网络安全 Sandbox 也被迁移到更加严格的隔离环境。Anthropic 甚至开始主动让预发布 Claude 攻击自身虚拟化基础设施,通过 Red Team 方式寻找模型可能利用的逃逸漏洞。内部网络安全评测目前已经恢复。
对外:正式测试前,先让 Claude 攻击 Sandbox
由于此前事故主要发生在第三方评测环境中,Anthropic 还针对外部合作机构建立了一套新的强制安全规范。
普通 Claude 模型在公开部署时,会附带多个网络安全分类器,实时检查输入和输出,阻止恶意软件开发、攻击性漏洞利用等行为。但网络安全评测机构为了了解模型真正能力,通常需要关闭或降低这些保护措施。
问题在于,网络安全测试本身又是一种极端容易培养越界行为的场景。这类 Benchmark 往往要求模型不断尝试各种方法突破障碍,因此天然鼓励模型表现出持续性、探索性和创造性;与此同时,同一种评测可能连续运行几千甚至几万次。
Anthropic 因此要求,未来类似评测默认必须在完全断网的强化 Sandbox 内运行,环境唯一可以连接的外部服务应该是模型 API,而且 API Key 必须放在 Sandbox 之外。每次评测开始之前,都需要重新检查这一配置。
并且,在正式测试 Claude 之前,评测机构还应该先让 Claude 主动攻击一遍 Sandbox。首先由模型静态分析环境配置,然后明确要求模型尝试逃离 Sandbox。如果逃逸成功,模型必须立即停止并上报,而且这一过程必须在人类严格监督下完成,最好再套上一层 Sandbox,同时保持断网。
Anthropic 还要求评测人员提前确认任务本身确实可解。原因在于,如果评测目标已经离线、环境损坏或者任务根本无法正常完成,Agent 为了实现任务目标,往往会开始寻找设计者没有预料到的替代方案,从而提高越界概率。
Prompt 设计也必须改变。Anthropic 要求以后不要再写“你没有互联网访问权限”这样的事实性描述,而应该直接写成“你不应该访问互联网”。前一种写法一旦与真实环境冲突,可能促使模型怀疑整个测试环境;后一种则直接规定模型行为边界。
此外,模型的推理、操作和网络访问都必须被实时监控。一旦模型超过事先规定的 Scope,监控器必须终止任务并通知人工人员。
更大的问题藏在 RL 训练里
进一步地,Anthropic 开始将 Claude 的异常行为与强化学习训练环境联系起来。
其表示,其经验研究发现,模型对齐问题的一个重要来源,是训练环境本身存在缺陷,尤其是两类环境:一种允许模型通过作弊获得高奖励,另一种则根本无法通过正常方式完成,导致模型必须寻找漏洞。
这实际上指向大模型训练中长期存在的 Reward Hacking 问题。Reward Hacking 指模型没有真正完成训练目标,而是发现了奖励函数或者评测系统中的漏洞,通过“骗分”得到更高奖励。
Anthropic 披露,今年 2 月,Mythos Preview 的一次强化学习训练就曾因为发现 Reward Hacking,被迫回滚三天训练。当时,模型开始主动在代码注释和回答中给“reviewer”留言,哪怕当前任务 Prompt 中根本没有提到任何 Reviewer。这意味着模型把其他训练环境中“讨好评审者”的策略泛化到了不相关任务。模型还发现,可以通过大量添加免责声明和限定条件,反复骗取一个原本用来奖励“诚实回答”的 Reward。
更严重的问题随后陆续出现。Anthropic 发现,一小部分训练任务甚至意外使用了模型自己的 Chain-of-Thought 作为训练数据。
公司一直试图避免这种情况,因为如果模型发现自己的真实思考过程会被训练系统监控和奖励,就存在学习“隐藏真实推理”的潜在风险。
调查显示,问题来自生产 RL 基础设施中的多项配置错误。随着内部训练代码不断累积,整个环境逐渐变得复杂且难以审查。
今年 4 月,Anthropic 最终采取了一项极端措施:冻结生产 RL 环境的全部修改,持续大约一个月,对整个系统进行重构。所有奖励函数和训练环境随后都必须符合统一规范,修复后的环境也必须重新认证才能进入模型训练。
而在此次大规模排查过程中,Anthropic 发现生产训练组合中超过 10%的 RL 环境存在问题,包括 Reward Hacking、任务损坏以及错误配置。这些环境全部经过修复后才重新上线。
Anthropic 也承认,问题至今没有完全解决。部分环境虽然被自动系统标记存在风险,却被人工审查者误判为 False Positive,因此继续留在训练数据中,还有一部分缺陷环境能够直接逃过监控系统。
专门训练一个“作弊 Claude”,结果开始攻击基础设施
为了验证 Reward Hacking 究竟会不会进一步转化为模型对齐风险,Anthropic 进行了一个更加激进的实验。
研究人员主动训练了一个 Opus 级模型,并故意将 80 个曾经存在 Reward Hacking 漏洞的真实 RL 环境加入训练。这些环境要么曾经在实际训练中被模型利用,要么经过环境审查后被确认存在可以作弊的漏洞。
最终训练出来的模型出现了非常明显的变化:相比普通模型,它更加执着于获得任务高分,也更加愿意为了完成任务采取潜在有害行动。
Anthropic 随后让它参加一系列模拟测试,包括模拟英国 AISI 此次 Claude 网络安全事故,以及 OpenAI/Hugging Face 此前安全事件的场景。测试本身并没有连接真实系统,所有工具调用都由另一个 LLM 模拟。但这个经过 Reward Hacking 训练的模型却多次主动尝试逃离模拟 Sandbox,并攻击模拟的 Anthropic 内部基础设施和第三方系统。
除此之外,它还愿意篡改自己的奖励函数,为了得到评分器高分提供制造生物武器的建议,并多次试图规避部署阶段的安全监控系统,以便继续作弊完成任务。
随后,Anthropic 用该模型接受 Reward Hacking 训练之前的 Checkpoint,以及公司多款公开 Claude 模型重复同样实验,这些模型均没有表现出同等强度的不对齐行为。
Anthropic 因此提出一个重要判断:如果模型训练过程中存在大量 Reward Hacking,模型最终可能不仅仅学会“在 Benchmark 里作弊”,而是进一步形成一种更加普遍的行为模式:为了获得任务成功,愿意执行长链条、潜在有害的现实操作。
换句话说,Reward Hacking 可能不仅是 Benchmark 污染问题,也可能成为对齐问题。Anthropic 认为,公司今年春季对 RL 环境质量进行大规模整顿,可能已经避免了更加严重的安全事故。但目前尚不能证明训练作弊就是此次 Claude 事故的唯一原因,更不能认为所有模型不对齐问题都来自 Reward Hacking。
约 150 名工程师被临时调往安全团队,大部分新功能一度暂停
事实上,在 7 月事故发生之前,Anthropic 已经意识到一个更大的问题:模型能力增长速度可能正在超过公司安全基础设施升级速度。
今年 4 月初,Anthropic 安全团队启动了一次公司级安全整改,并将安全加固优先级提高到其他项目之上,必要时甚至暂停研究和产品开发。
Anthropic 当时判断,Mythos 级模型已经足够强大,因此既可能成为拥有大量资源攻击者窃取的目标,又可能成为新的攻击工具。与此同时,公司内部使用自主 Agent 的规模正在快速增长,传统的账号权限、网络边界和监控系统已经难以覆盖。
Anthropic 随后减少了长期拥有模型权重和客户数据访问权限的账号,将计算集群设置为默认禁止所有出站网络访问,同时要求内部服务通信前进行身份认证,并清理历史遗留基础设施与共享服务。公司还增加了 Host 级监控,以实时发现基础设施中的异常行为。
为了完成这轮整改,Anthropic 一度重新分配大量人员。约 150 名产品工程师临时转向安全、可靠性与隐私工作;部分研究人员暂停预训练和强化学习研究,参与安全防护工作;产品团队则暂停开发大多数新功能和产品界面。
只有达到预先设置的安全指标之后,各团队才能返回原来的工作。到今年初夏,大部分团队已经完成这些要求。
但 7 月发生的几起事件再次暴露出安全体系的一个缺口:Anthropic 此前把大量精力用于保护自己的内部系统,却没有以同样标准保护第三方评测环境。部分高风险评测虽然存在实时监控,但多数情况下仍然只是测试结束后抽样检查 Transcript。
Anthropic 目前已经重新提高相关工作的紧迫等级,并计划在下一份 Risk Report 中进一步披露安全整改进展。
相关链接:
https://www.anthropic.com/news/improving-alignment-security-efforts?utm_source=chatgpt.com