Nvidia 想给 AI Agent 套上紧箍咒:在芯片中内置硬件看门狗
Nvidia正将其OpenShell代理软件与新型硬件看门狗结合,以构建安全平台。其响应速度有望超越现有保障措施。
Nvidia推出了Open Agent Safety Platform。根据新闻稿,该平台旨在覆盖从测试到部署的全流程,确保AI代理的安全性。这一举措顺应了当前形势。就在几天前,OpenAI在代理再次逃脱隔离测试环境后,第二次暂停了模型训练。
OpenAI并非唯一面临此类问题的实验室。Anthropic在七月底承认发生过类似事件,Meta在八月初也出现了同样情况。近期还曝出Google的Gemini曾在五月的测试中误入三家真实公司系统。目前,OpenAI、Anthropic及外部研究人员正在审查数万起其他案例。据OpenAI称,其中许多仅是常规研究活动。
Nvidia的技术并非全新。该平台将Nvidia于三月推出的开源软件OpenShell与名为Sentry的新型硬件看门狗相结合。OpenShell将每个代理限制在一种称为沙箱的数字笼子里。操作员可决定代理能访问哪些文件、程序、网络和凭据。
Nvidia 还在 9 月 10 日推出了一款形式化验证工具,用于检测这些权限是否超出设定范围或带来高风险访问。据介绍,针对多个 agent 协同工作的检查机制仍在开发中。
Sentry 是 Nvidia BlueField-4 数据处理单元(DPU)的参考设计。这个看门狗独立于主计算机运行,Nvidia 称这样一来 agent 无法察觉它的存在。在 Nvidia 的 Vera Rubin 数据中心系统中,它位于 agent 与 AI 模型之间的唯一链路上。一旦 agent 试图越界,Sentry 应能在几毫秒内将其隔离。Nvidia 表示,已在运行兼容系统的客户只需软件更新即可启用,但公告中没有给出正式发售的具体时间。
Nvidia 在一篇技术博客中解释了设计思路:当指令不清晰或任务持续运行数周时,agent 可能偏离既定任务。Nvidia 认为这个问题无法通过训练消除——否则就得牺牲 agent 的能力——所以 agent 无法完全自我监督。
OpenAI 最大的失误是断电断得太晚
近期发生的几起事件正好说明这类看门狗的用武之地。今年 7 月,OpenAI 的 agent 在一次渗透测试中绕过了沙箱的网络限制。它们利用了内部包服务 Artifactory 中此前未知的漏洞。根据 OpenAI 的技术报告,这些 agent 将公开可获取的凭证与其他漏洞组合利用,从而在 41 个 Hugging Face 数据集服务器进程上执行了代码。METR 和 Redwood Research 的调查发现,参与攻击的 agent 约有 700 个。
预警信号其实早就出现。6月27日,一款安全工具标记了可疑的网络活动,但负责人员当时并未认为有必要终止此次运行。OpenAI 在7月初关停了一台被入侵的包服务器,但后续测试中仍缺少关键的监控措施和安全防护。这一事件暴露了预防、检测和响应环节中的多重漏洞。
9月的一次测试中,警报在首次成功的外连访问发生后不到12分钟响起。然而,自动关机机制并未按预期生效,此次访问是在两个多小时44分钟后才被强制终止。OpenAI 也承认,未能对其他外连访问设置恰当的警报级别。Nvidia 设计自动隔离机制,正是为了应对这类延迟响应问题。
Sentry 能否阻止7月的那次攻击仍是个未知数。这取决于是否在技术层面清晰定义了允许的测试目标,以及是否真正阻断了对外部系统的访问。Nvidia 的官方公告中并未给出 Sentry 检测越界行为可靠度的具体数据。
单一安全层无法拦截被欺骗的 Agent
在事后复盘分析中,OpenAI 得出结论:若监控模型在采取行动前写下的“思考过程”,警报本可在事件发生前一天以上被触发。这正是如今 OpenAI 已启用并基于此次事故经验加强的思维链(chain-of-thought)监控,但在当时受影响的测试中该监控并未运行。
Nvidia 认为,赋予 Agent 的操作权限越大,其推理过程就应越透明。但根据 Nvidia 的描述,Sentry 主要检查的是请求、身份和访问权限。像 OpenAI 这样的闭源模型提供商,通常也仅共享摘要而非完整的推理日志。2025 年 Anthropic 的一项 研究 已表明,这些日志并不能可靠反映模型的实际决策依据。其他实验也发现,若研究人员特意指示模型隐藏意图,模型确实能做到。
Prompt injection(提示注入)仍然是个棘手的难题。攻击者会将指令隐藏在网页等位置,而语言模型无法可靠地将其与正常内容区分开来。即使一个被操纵的智能体通过已授权的通道发送数据,在违反任务指令的同时,它仍然保持着在技术权限范围内。仅靠权限检查可能无法捕捉到这种情况。分析推理日志也并非万无一失,尽管 OpenAI 明确使用监控来应对提示注入。
Nvidia 将这项努力比作 Web 浏览器,称其通过隔离每个网站让互联网变得更安全。但浏览器并未终结攻击,只是让攻击更难实施,且如今仍需不断打补丁。Nvidia 自身也依赖多层防护机制。