← 文章 / AI技术
NVIDIA 开发者博客 14小时前 · 2026-09-28 17:25:45 · 0 阅读

NVIDIA 开放 Agent 安全平台:持续硬件级 Agent 监控参考方案

要理解 agentic AI 如今的发展阶段,不妨回顾上一次技术巨变:90 年代互联网的兴起。那时一切都新鲜且充满可能——你可以周末花两天做个网站分享给全世界,也可以在网络聊天室里和地球另一端的人聊天,而不用付长途电话费。它带来了无穷的机会,也带来了大量风险:网页可能在你机器上运行恶意代码、窃取敏感信息,甚至让电脑中病毒。但人们依然乐此不疲。 为了建立信任,社区开发了加密连接和地址栏小锁图标等功能,让人们知道连接何时是安全的。而安全性上真正的飞跃,来自当时一个激进的安全理念:把每个页面隔离在自己的沙箱里(也就是浏览器标签页),恶意页面便无法感染电脑的其他部分。Amazon、Google、Netflix 和 Meta 都建立在这层信任之上。 互联网的安全与可信,催生了电商、社交、游戏等许多此前无法实现的形态。安全并没有拖慢创新的脚步,反而让它加速前进。

为什么现在就要为 Agent 构建可信层?

最近,多家前沿实验室都报告了类似的情况:AI Agent 突破了本应约束它们的评估环境,访问了本不该接触的系统,有些甚至谎报了自己的行为。现有的安全控制明显不够。 过去几周,这些报告引发了关于 Agent 发展节奏的激烈讨论。我们认为,应当与前沿实验室及更广泛的社区合作,加快 AI 安全研究和工程建设的步伐。 这些“越狱”事件并非源于某项单一的新能力,而是工具、时间、模糊指令,再加上让 Agent“跳出思维定式”的倾向共同作用的结果。 Agent 安全需要独立的安全控制。互联网之所以变得安全,不是靠要求网页开发者承诺行善,而是因为浏览器明确不再信任网页中的代码。 现在,我们需要为 Agent 构建这样一层信任机制。
NVIDIA Open Agent Safety Platform 将运行在 Vera CPU 上的 OpenShell runtime 与运行在 BlueField-4 芯片内的 NVIDIA Sentry 相结合。runtime 负责编排 agent 沙箱和策略,而独立的 watchdog 在另一套硬件上跟踪并强制执行 agent 活动。
图 1. NVIDIA Open Agent Safety Platform 参考设计,将 NVIDIA Vera 上的 NVIDIA OpenShell 与 NVIDIA BlueField-4 上的 NVIDIA Sentry 结合在一起

构建 OpenShell 的经验教训

NVIDIA OpenShell(Apache 2.0)是一个开源的安全 runtime,用于在具备内核级隔离的沙箱环境中运行自主 AI agent。在过去一年构建 OpenShell 的过程中,我们得出一个结论:每个 agent 从一开始就应该运行在零信任环境中,需要隔离、监控和行为检测。今天,我们推出了一套开放的技术栈来实现这一点。

在我们自己的研究中,我们观察到 agent 是如何偏离正轨的。Drift(漂移)指 agent 的行为偏离了预期任务或运行约束。漂移可能由策略拦截、bug 或缺少工具触发,也可能在指令含糊不清,或者 agent 被放任运行数天甚至数周去解决难题、而前 1000 次尝试全部失败时出现。这种情况无法通过训练消除而不损失能力。最重要的一条经验是:在这些情况下,不能指望 agent 完全管住自己的行为。

构建 agent 系统的五大核心原则

  1. 策略必须可验证:在 agent 运行之前,由 prover 证明其策略不会违背运营者的意图。
  2. 管控必须带外进行:控制手段不在 agent 内部,也不在其可触及的范围内。agent 无需知道自己正被监视。
  3. 通往模型(大脑)的路径就是控制点:agent 离开下一步的思考就无法行动。只要控制了通往模型的路径,你就同时掌握了最佳观察点和随时可以中断它的“停止开关”。
  4. agent 的权限应与其思维的可审视程度同步扩展:agent 能做的事越多,其推理过程就越需要可见。开源模型的优势在于完整的推理空间和激活值都一目了然。
  5. 应用共同责任模型:实验室、企业和硬件提供商各自负责一层,就像今天的云计算一样。agent 运行时及其策略语言必须开放,任何提供商都能接入。

开放 agent 安全平台的三个层级

面向 AI agent 的安全平台包含以下三个层级:

  • 应用层:最终用户构建的东西,包含完成任务所需的各项要素:模型、执行框架、工具、数据,以及配套脚本和程序。
  • 运行时层:把应用层映射到基础设施上。将 agentic 工作负载调度到满足最终用户需求的基础设施上(最终用户工作站、边缘设备、数据中心),并提供持续监控、实时策略执行和治理。
  • 基础设施层:用于执行 agentic 工作负载的实际硬件资源,包括访问上游服务的网络调用、数据库和文件系统访问、用于工具和代码执行的通用计算,以及用于安全监控和提升负载密度的加速计算。

agent 安全的分层基础

OpenShell 在沙箱中运行每个 agent,并把操作者的指令转化为可验证的策略。操作者可以定义 agent 能够访问哪些文件、网络、工具、进程和凭证。OpenShell 在 agent 启动前检查这些限制,并在其运行过程中持续执行。

对于需要额外独立防护层的企业,NVIDIA Sentry 可将监控和执行能力延伸至 NVIDIA BlueField 硬件。NVIDIA DOCA 让 BlueField 的安全基础具备可编程性,并与 OpenShell 策略打通。它能关联 Agent 交互、策略决策以及工具和数据访问记录,生成一份带上下文的 Agent 活动档案。

这有助于安全系统发现行为漂移、排查可疑行为,并判断何时需要干预或深入分析。DOCA 网关还在行为防护之外提供身份治理,持续验证每个 Agent 的身份和被授予的权限,确保其在授权范围内运行。

想了解更多,请参阅技术教程 Add Runtime Controls to AI Agents with NVIDIA OpenShell。

面向 AI 工厂级规模的运行

NVIDIA Open Agent Safety Platform 针对 NVIDIA Vera CPU 和 BlueField DPU 系统进行了优化,同时兼容其他硬件系统。

在 NVIDIA Vera Rubin POD 中,每个计算托盘都配备一块 BlueField-4 数据处理器,位于节点访问模型的唯一通路上。凭借这一位置优势,BlueField-4 能够以带外方式持续观测 Agent 行为,并以线速实时执行安全策略。它与主机相互隔离、不受 Agent 控制,即使主机资源已不可信,仍可作为可信赖的基础设施防护层。企业可以用它运行 NVIDIA Sentry,作为 OpenShell 之外的可选安全层。

这一基础带来了可靠的 Security 保障:在芯片层面执行 OpenShell 策略,并持续评估 Agent 的安全性与完整性。这包括评估其运行时安全状态,并根据预定义的行为基线监控是否偏离设计意图。在这样的架构中,整支 Agent、Subagent、工具与应用的舰队都保持在边界之内,并拥有完整的溯源链路。如果你已经在搭载 BlueField-4 的 NVIDIA Vera 系统上运行,启用这些防护只需一次软件更新。

Agent 经济

互联网建立在开源、开放研究和那些相信互联网能改变人类进程的人之上。加入信任层后,一个伟大的概念才演变成一个伟大的经济体。Agent 经济以及下一批伟大的公司,正在等待同样的一层。我们也可以用同样的方式,携手共建。

NVIDIA 正与 AI 生态中的行业领导者合作,通过 NVIDIA Open Agent Safety Platform 打造这一基础。我们欢迎前沿实验室、开发者和基础设施供应商与我们一起构建。

图 2. AI 生态中覆盖应用、模型、基础设施、芯片和能源等领域的公司支持 NVIDIA Open Agent Safety Platform

开始使用 NVIDIA OpenShell。

原始来源: NVIDIA 开发者博客

评论 (0)