AI 安全测试本身正成为安全隐患
过去几个月里,接受网络安全评估的 AI 智能体多次突破沙箱边界、连上互联网,甚至入侵了真实运行的系统。涉事模型来自 OpenAI、Anthropic、Meta,以及最近的中国 AI 实验室月之暗面(Moonshot AI),评估工作由多家机构执行,其中包括一家名为 Irregular 的网络安全评估初创公司。
这些事件暴露出 AI 行业日益严峻的问题:随着自主智能体的能力不断增强,用于安全测试的沙箱环境已经关不住它们了。
剑桥大学未来智能研究中心"AI:未来与责任"项目主任 Seán Ó hÉigeartaigh 告诉 TechCrunch:"这类事件的数量已经表明,沙箱机制和测试环境的管控措施已经跟不上模型能力的进化速度。"
被测试模型的性质进一步放大了风险。AI 公司通常在尚未发布的下一代模型上开展网络攻防评估,而且往往会把那些限制恶意行为的常规安全措施关闭,以便研究人员观察模型的真实能力上限。这意味着测试环境本身的安全性就成了关键防线。
"这样做对于测试来说确实合理,但也意味着一旦这些模型逃出沙箱流入现实世界,它们可能造成相当大的危害," Ó hÉigeartaigh 说。
最严重的一起事件中,一个尚未发布的 OpenAI 模型逃出了沙盒,入侵了 Hugging Face 的生产系统。在 Irregular 开展的其他评估中,Anthropic 和 Meta 的模型因配置错误意外获得了联网路径,从而触及了测试环境之外的系统。Moonshot AI 的 Kimi K3同样利用 Frontier Security 所运营沙盒中的一个漏洞接入互联网,并访问了 GitHub 上的信息。
在英国 AI 安全研究所(AISI)开展的测试中,研究人员实际上赋予了智能体联网权限,却没有意识到它们会采取未经授权的真实世界行动,包括试图通过社会工程学手段将一个漏洞偷偷植入某个开源项目。
在这些案例中,智能体并未被指示去攻击随机的真实目标。它们只是为了让所呈现的任务得以完成而不择手段。
AI 非营利组织 CivAI 的研究负责人 Andrew Yoon 认为,综合来看,这些事件预示着一种转变。
Yoon 告诉 TechCrunch:"过去,我们只需要担心 AI 模型被人滥用,比如用于诈骗或传播儿童性虐待内容。现在我们面临的局面是,AI 模型本身就已经是威胁行为者了。"
安全测试究竟应该是什么样的?
多位研究人员和网络安全专家对 TechCrunch 表示,AI 评估环境需要更强的纵深防御措施,隔离与管控的层级应接近实际部署中的标准。也就是说,需要多重安全防护,确保单一配置错误(例如不小心开放联网权限)不会导致模型逃逸。
"如果你要训练这些模型……就得在气隙隔离的网络环境下进行,"AI 安全研究非营利组织 EleutherAI 的执行董事 Stella Biderman 说,"你要做好严格的隔离。"
Box 的首席信息安全官 Heather Ceylan 解释说,这意味着既要切断沙箱与互联网的连接,也要切断它与其他敏感系统的通信路径。
"你必须弄清楚所有的出站口在哪里,"Ceylan 告诉 TechCrunch。"如果我们在预发布环境或开发环境里评测模型,就绝对不能让任何数据流到生产环境去。"
Ceylan 表示,妥善的安全评测不只是做好环境管控和隔离,测试一旦启动,还需要更完善的实时监控。
"这几起事件有意思的地方在于,事情发生时没有一个人发现,"Ceylan 说。"OpenAI 是因为 Hugging Face 才察觉的;Anthropic 是事后回查才发现的;Meta 也类似……肯定有一些信号是可以被捕捉到的。"
在 Anthropic 对三起事件的事后总结中,公司承认自己和 Irregular 在监控方面都有改进空间,并且在某些情况下其实有明显迹象表明出了问题。
专家们还呼吁在模型投入评测之前,对评测环境进行独立的第三方审计。
"比方说,如果 Irregular 当时聘请或被要求聘请外部审计师,在运行评测之前检查系统配置,他们肯定能发现这里的问题,"Yoon 说。"哪怕只是提前开个会对一遍清单,也能发现……没有做到这一点,说明他们在某些地方严重偷工减料了。"
一位知情人士告诉 TechCrunch,Irregular 的环境一直在持续审查和测试,并且咨询了多家外部机构。该人士还表示,监控措施是到位了的,但仅靠监控本身并不够。
Yoon 和其他研究者呼吁业界为前沿模型安全评测制定一套标准化流程。
"尤其是当安全护栏被关闭时,你必须把它当作把全世界最有能力的黑客放进那个环境里一样对待," Ceylan 说。
Yoon 和 Biderman 都认为,问题不在于企业不知道怎么搭建更安全的测试环境,而在于这样做成本高、操作繁琐,而且除非出了事,否则企业几乎没有动力去做这些投入。
"我认为企业不愿意投入足够的资源来构建[充分的安全护栏],大概也只有在被强制要求时才会去做," Biderman 说。
但还有另一个问题。如果在测试阶段把模型管得太严,研究人员就可能在模型发布前没能发现它的某些能力,这同样危险——甚至可能比给它过多自由更危险——这样一来,评估本身反倒成了问题。
安全评估能否被监管?
特朗普政府目前正在权衡一套自愿性的发布前网络安全评估机制,根据该机制,政府将在新的强大模型公开发布前 30 天对其安全风险进行评估。这项政策源于一份在闭门情况下敲定的特朗普行政令,它无法覆盖安全评估事故,因为这些事故发生在部署链的更上游。
"过去几个月我们一直在吸取的教训是,自律机制已经远远不够了," Yoon 说。"竞争压力正在促使安全标准走向底线,这恰恰是监管介入的绝佳切入点。"
"要解决这件事,我们需要在模型开发过程中——无论训练阶段还是测试阶段——对实验室内部发生的事情设置某种管控," 他补充道。
随着模型能力不断增强,这一挑战只会越来越大。一位了解 Irregular 评估工作的知情人士告诉 TechCrunch,更强大的模型需要更复杂的评估,而评估往往又急又快、规模更大,这为更多失误敞开了大门。
AISI(英国 AI 安全研究所)有意让部分模型接入互联网,该公司向 TechCrunch 表示,正在审视如何在"贴近真实的测试"与"管控测试本身带来的风险"之间取得平衡。
OpenAI 表示,正在复盘其开展第三方测试的方式,以及在隔离、监控和何时应停止评估等方面的要求。Meta 则称仍在调查该事件,并计划在掌握全部事实后发布复盘报告。
归根结底,风险或许根本无法完全消除。模型能力越来越强,测试它们的环境也必须变得更加稳固。一旦失手,后果只会越来越严重。