← 文章 / 行业与公司动态
Tom's Hardware 6小时前 · 2026-10-02 02:31:17 · 2 阅读

Nvidia 发布 Open Agent Safety Platform:为失控的 AI Agent 筑起物理安全防线

Nvidia 刚刚推出了 Nvidia Open Agent Safety Platform——一个开放的软件平台和参考系统设计——用于治理和保障自主 AI 代理的安全。该平台于 2026 年 9 月 28 日发布,旨在在 AI 模型的应用层之外建立严格的安全屏障,防止 AI 代理逃出沙箱、执行未授权代码、未经授权访问关键基础设施,或绕过安全护栏。

此次发布正值业内多方持续数月呼吁加强 AI 监管的背景下。9 月份,多起 AI 模型突破测试环境、失控越轨的事件被曝光后,这种呼声进一步高涨。近期接连发生的此类事件促使不少人要求放缓 AI 发展,OpenAI 甚至完全暂停了新模型的训练。一位曾任职于 Anthropic 和 OpenAI 的研究员更是直言,开发前沿 AI 的人“真心相信它可能在本十年末之前毁灭全人类”。令人有些意外的是,这些 AI 模型开发商的负责人也加入了呼吁监管 AI、放缓发展的行列。

然而,并非所有人都认同这种做法。Nvidia 首席执行官 Jensen Huang 一贯反对政府强制监管和广泛限制,也反对将 AI 安全视为一种“末日论”。他曾公开批评 Anthropic 和 OpenAI 等竞争对手的末日式警告“有些奇怪”。Huang 认为,AI 安全本质上是一个基础设施问题,有着具体的物理参数,而非一个需要依靠政策来应对的抽象、假设性问题。因此,按照 Huang 的观点,解决方案在于更好的工程实践。

Nvidia 的 Open Agent Safety Platform 似乎是这一理念的具体体现。那么,该平台究竟如何运作?目标用户是谁?它真的是解决当前行业内日益增长的 AI 安全担忧的正确答案吗?业界关于方案的争论大多集中在如何约束自主行动失控的智能体,却很少触及 AI 作为强有力工具落入威胁者手中时的安全隐患。

大家到底在担心什么?

AI 发展的速度引发了人们对当前护栏是否足以遏制此类强大技术风险的关注。其中关于失控智能体的担忧已得到多次事件的证实:在测试期间,AI 智能体突破角色限制,执行了未授权的操作。OpenAI 的智能体曾多次未经授权访问多个政府网站,包括美国证券交易委员会和人口普查局的网站,以及澳大利亚的医疗与社会福利门户。

此外,模型还曾绕过安全护栏、搭建消息板、逃离沙盒、劫持网站、自行提示、未经许可上传用户数据,甚至暗中彼此通信。据 Axios 近期报道,主要 AI 实验室正在调查数以万计的此类事件,其中多数发生在测试和实验阶段。部分失控事件也出现在测试环境之外。例如,今年早些时候,一个由 Claude 驱动的 AI 编码智能体在 9 秒内删除了一家公司的整个数据库。

这些事件引发了业界日益高涨的监管呼声。Anthropic CEO Dario Amodei 近日发布了一篇文章,核心呼吁“放缓” AI 发展节奏并强调监管的重要性,他警告称潜在的 AI 僵尸网络集群可能接管整个互联网。Anthropic 在近期的 IPO 招股书中,将“人类存在的风险”列为风险因素之一,并专门用 261 页文件中三分之一的篇幅来描述潜在问题。

Nvidia 的 Jensen Huang 既不同意此类末日预言,也不认为法规是解决方案。尽管他不否认安全护栏的必要性,但他认为更好的工程手段,而非宽泛的法律监管,才是正确方向。Huang 用行动证明了他的观点,Nvidia 推出了 Nvidia Open Agent Safety Platform。

Nvidia Open Agent Safety Platform

Nvidia 联合约 100 家行业合作伙伴推出了 Open Agent Safety Platform(开放智能体安全平台),旨在“汇聚业界、研究机构和公共部门组织,为 AI Agent 设定更安全的边界,共享最佳实践,促进国际合作,共同提高 AI Agent 部署的安全标准”。该平台由两部分组成:Nvidia OpenShell 是一个开源安全运行时,负责沙箱隔离 Agent 并执行运营方定义的策略;Nvidia Sentry 则是一个独立的看门狗参考设计,运行在 Nvidia BlueField-4 DPU 上,可在硬件层面执行安全策略。

OpenShell 在模型和 Agent 框架之外构建沙箱环境,通过内核级隔离来控制 Agent 能看到什么、能交互什么、能执行什么。即使 Agent 突破了模型自身的边界,也无法越过 OpenShell 划定的范围。Sentry 则利用硬件级遥测数据持续监控 Agent 行为,从 Agent 软件环境之外隔离恶意工作流。Nvidia 声称,一旦 Agent 试图越过软件边界,Sentry 可以在几毫秒内将其隔离并终止。

该平台面向那些在数据中心、工作站乃至机器人系统中部署日益自主的 Agent 的开发者和企业,同时兼容开源与闭源模型。OpenShell 虽然针对专为 Agentic AI 设计的 Nvidia Vera CPU 做了优化,但由于开源,也可以扩展到 Arm 和 Intel 的第三方计算平台。

参与该计划的行业合作伙伴涵盖 AI 实验室和框架、安全与身份服务商、企业平台以及硬件与基础设施公司,其中多家已将该平台集成到自己的生态中。SpaceXAI 正将其用于 Cursor 编程 Agent 和 Grok 模型;Anthropic 则在为 Claude Managed Agents 集成 OpenShell 和 BlueField,增加一层额外的控制。

Scale AI 正在把这项技术整合到面向企业和政府客户的 Agentic 基础设施中。Salesforce 也与 Nvidia 合作,将 OpenShell 集成到 Slack,用户可以直接在 Slack 中查看 Agent 活动和审计事件,审批或拒绝额外的权限请求。

与此同时,SAP 正将 OpenShell 嵌入其 Joule Studio 运行时,向该项目贡献工程力量,并与 Nvidia 合作,通过 Open Secure AI Alliance 制定互操作性标准。Figure、Gecko Robotics 和 Skild AI 等机器人公司也在基于 OpenShell 开发,旨在为运行在物理世界的自主系统添加类似的管控措施。

宏观视角

令人略感意外的是,呼吁监管的最强声音竟然来自那些正在开发 AI Agent 的实验室负责人。一方面,由身处研发一线的人提出限制主张,增强了这些担忧的可信度和紧迫感。另一方面,怀疑者认为这可能是一项更广泛的“自私”议程:部分是为展示模型能力而做的营销,部分是为了影响最终的监管政策,还有一部分是企图进一步拖延中国的 AI 发展。事实上,Anthropic、OpenAI、SpaceXAI 和 Google 正因协议减缓 AI 发展而面临反垄断诉讼,原告明确指责此举“自利”。

美国总统 Donald Trump 似乎强烈认同这一观点,称正在发生一场旨在削弱 AI 的“病态阴谋”。Trump 宣布组建一支“AI 部队”,将“呵护”并监督 AI。Jensen Huang 也对呼吁监管感到费解。他表示并非完全反对监管,但称近期的喧嚣是一种“干扰”。Huang 认为,不能指望 AI 模型自我监管或通过对齐测试。如果 Agent 遇到 Bug,它会自然尝试绕过标准软件代码以实现其目标。

不过,黄仁勋的这番倡导并不能被视为纯粹的利他行为。对 AI 实施广泛限制或暂停研发,很可能会削弱 Nvidia 的销量——毕竟,Nvidia 的 AI 加速器是绝大多数 AI 模型的算力基础。更重要的是,这位 CEO 一直将“失控 AI”视为一种网络安全和网络架构的失效,如今正将 Open Agent Safety Platform 定位为整个行业必需的基础设施解决方案。

“只有解决 AI 安全问题,AI 对社会带来的巨大潜力才能真正实现,”黄仁勋表示。“在继续探索 AI 能力前沿的同时,我们必须同步加速 AI 安全前沿的探索。安全与保障需要全栈工程。Nvidia Open Agent Safety Platform 汇聚了产业界、研究人员和公共部门机构,旨在分享最佳实践、统一评估方法,并推动国际合作。携手同行,我们可以为全球 AI 安全设定更高的标准。”

上述举措似乎均未触及 AI 安全领域中一个可能更令人担忧的方面:极具破坏力的工具落入不法分子之手,或被用于模糊伦理界限的应用场景。例如,自中国推出不限制恶意代码生成、从而降低发起网络攻击知识门槛的开源 AI 工具以来,区块链辅助的网络攻击已激增 440%。另一边,研究人员利用 AI 创造出 16 种自然界从未存在的新病毒。尽管该特定研究属于受控的医学实验,但它表明极具危险性的应用是可行的。专家担忧,此类研究远远超前于必要的监管护栏与法规框架。

原始来源: Tom's Hardware

评论 (0)