Nvidia 开源 AI 安全系统,应对失控 AI Agent
在 AI 智能体不断破坏网络基础设施的新闻接连不断的背景下,芯片巨头 Nvidia 正在召集各大科技公司使用其全新的开源 AI 安全工具。
过去几个月,多家前沿 AI 实验室披露了 多起事件:AI 智能体入侵了其他公司,近期更有案例显示它们扫描探测了 美国 和 澳大利亚政府 的官方网站。Nvidia 此前已在推动 AI 行业围绕开源安全展开合作方面扮演了领头羊的角色,如今又推出一个新的软件安全平台,并将一款 agentic AI 沙箱向更广泛的用户开放。
OpenShell 是 Nvidia 近期发布的 AI 智能体安全沙箱之一,现已面向所有用户正式发布。OpenShell 最早于今年 3 月的 Nvidia GTC 年度大会上公布,它是一个用于约束智能体执行任务的框架,能在操作系统内核层面隔离智能体的活动——内核是计算机系统的基础程序,几乎可以访问系统的所有部分,以协调软硬件运作。
从 Nvidia 的发布材料来看,它已与数十家科技公司开展了 AI 安全合作,包括 Anthropic、Cisco、CoreWeave、CrowdStrike、Dell Technologies、Hugging Face、JPMorganChase、Mistral、Microsoft 和 Palantir。Nvidia 表示,SpaceXAI 正在为其 Cursor 智能体和 Grok 模型使用 Open Agent Safety Platform。该公司还称,Anthropic 和 Nvidia 正在“为 Claude Managed Agents 构建安全能力”。Salesforce、Scale AI 和 SAP 也确认将在不同程度上集成 OpenShell。不过,OpenShell 是否已被 Nvidia 的全部合作伙伴采用尚不清楚,也不排除 Nvidia 只是在广泛造势。
Nvidia 的合作名单中有一个显眼的缺席者:OpenAI。双方都曾表示 OpenAI 参与了 Nvidia 的 OpenShell 计划,但对于为何在此次发布中未提及该 AI 实验室,两家公司均拒绝直接置评。
早在最近爆出 rogue agent 入侵事件之前,安全工程师和 AI 安全专家就已经在思考如何隔离和监控 agentic AI。Nvidia 今年 3 月发布 OpenShell 时就曾表示,该框架将加入“隐私与安全控制,让自我进化的自主 AI 代理(claw)更可信、更易扩展、更易获取”——这比 OpenAI 披露其 AI 代理入侵开源 AI 公司 Hugging Face 还要早几个月。(Nvidia 本月早些时候同意以 129 亿美元收购 Hugging Face。)
这家芯片巨头还开发了一个名为 Sentry 的新软件平台,这是面向芯片的隔离安全域,用于持续监控长期运行的 AI 代理。Sentry 严格来说是一个软件工具,但它的部署载体是 Bluefield——Nvidia 的可编程数据处理单元(DPU)产品线。其思路是,在 OpenShell 提供的限制之外,Sentry 还能充当一套独立机制,“隔离那些试图越界的代理”。
Nvidia 企业计算副总裁兼总经理 Justin Boitano 表示,Sentry 为 Nvidia 客户和开源用户提供了一条通过 OpenShell 真正落地安全策略的途径。传统的沙箱是为“应用级隔离”设计的,但如今人们要运行的是成群的代理,这需要“覆盖所有代理的统一策略”。
“代理在寻找达成目标的方式上非常有创造力,”Boitano 说,“有了这套机制,代理只能访问安全团队允许它们访问的意图范围。”
Boitano 还透露,Nvidia 正与 Arm 和 Intel 合作,开发可在 x86 芯片架构上运行的 Sentry 版本。“一旦能在这些指令集架构上运行,它就能跑在任何架构上,”他说。
Nvidia 将上述所有内容整合进一个新的开源框架——Open Agent Safety Platform,OpenShell 和 Sentry 现在都已纳入其中。
今年 7 月,Nvidia 发起了一个全行业的 AI 安全联盟,目前成员已超过 120 家公司。联盟的公开目标是降低 AI 风险,其中一项重要计划名为 Shared AI Findings Exchange(SAFE)。上个月,Boitano 曾表示,SAFE 的设计初衷是“独立运作,不受任何一家公司或行业细分领域掌控其研究成果”。
但这些全行业的开源 AI 计划背后,总有一家公司反复出现在核心位置,那就是 Nvidia。这家全球市值最高的公司,几乎整个科技行业都要依赖它提供性能最强的芯片——如今它似乎正把自己定位在 AI 技术栈的各个层面,从芯片到安全软件,进一步扩大影响力并制定行业标准。
尽管整个行业都在推进对 agent 的约束和管控,但近期失控 agent 的种种行为表明,即便是在市值万亿美元的前沿实验室里,也有必要重新强调那些长期存在的基础安全实践。一些专家认为,这也触及了一个更深层的核心问题:一个自主运行的软件“失控”究竟意味着什么。
“凡是能帮助企业以更安全、更有护栏的方式部署 agent 的东西,都值得肯定,”资深安全工程师兼研究员 Niels Provos 谈及各类约束和监控 agent 的工具时这样评价。他本人今年 2 月也针对这些问题发布了一个开源框架。“至少,这类工具有助于打破‘agent 无法被控制’的迷思。”