← 文章 / AI技术
NVIDIA 博客 7小时前 · 2026-09-22 14:05:39 · 4 阅读

AI 安全是一项工程问题:如何在 Agent 技术栈的每一层解决它

AI 安全是一个工程问题。这意味着需要明确的安全需求、可执行的管控措施、责任到人,以及证明防护有效的证据。

随着 AI 能力的增强,行业必须加速安全工程实践,扩大防御工具的获取范围,并更快地分享行之有效的经验。

技术迭代,安全本质不变

互联网和云计算改变了软件的运行方式,但核心安全责任依然存续:建立身份、控制访问、限制暴露面,并验证防护是否有效。

AI Agent 引入了新能力——推理、使用工具,以及根据遇到的数据调整行为。这些能力要求将既有原则应用于新的运行环境。

这种快速演进带来了压力。组织既想享受 AI 带来的生产力红利,而用于治理和保护这些系统的最佳实践尚在发展中。

安全依赖于完整的 Agent 技术栈

应用依赖于代码、数据、身份、服务和基础设施。安全则取决于这些组件如何协同工作——而 AI Agent 扩展了这一系统。

模型提供能力;harness 负责编排上下文、工具和工作流;运行时环境提供执行操作的基础设施。技术栈的每一层都承载安全责任,有效的防护需要在数据、指令和操作流经系统的每一层设置控制措施。

以一个更新客户记录的 Agent 为例。假设它在附件文档中遇到恶意指令,并试图将客户数据导出到未授权的目的地。

网络策略应当阻止该传输,而受保护的日志则应捕获尝试的工具调用、授权决策及结果,以便安全团队识别所用工具及其试图到达的目的地。

更新客户记录的权限不应自动延伸为导出该数据的权限。Agent 可以请求额外访问权限,但不能自行授权。

将安全融入 Agent 的运作机制

即使 agent 做出了错误决策,安全边界也必须依然有效。agent 的运行环境决定了它能做什么,因此必须在文件、网络目的地和进程上设置限制,而不能依赖 agent 自身的判断。

指令和防护措施可以引导行为,但安全还需要可强制执行的具体边界。

每个 agent 都需要可追溯的身份,以及仅限于其任务范围的凭证。组织需要明确的策略,规定 agent 可以访问哪些信息、可以改动哪些系统、哪些操作需要审批。在这些边界之内,关键操作和权限变更仍需人工批准。

团队还需要验证 agent 所用工具、技能和依赖项的来源与完整性。一旦出问题,受保护的工具调用、授权决策和执行结果记录可以帮助调查人员还原事件经过。再加上清晰的权限回收和事故遏制流程,这些证据才能真正派上用场。

NVIDIA OpenShell 是一个开源的安全运行时,它在 agent 无法触及的层面强制执行策略,提供沙箱化执行环境,并管控 agent 对数据、网络和系统资源的访问。Open Secure AI Alliance 的合作伙伴也在基于 OpenShell 构建产品:Cisco 的 DefenseClaw 在其上增加了治理层,JFrog 则与 OpenShell 集成,对 agent 技能进行扫描和验证,并强制执行技能访问策略。

工程团队需要安全性的实证

部署之前,团队需要证据证明相应的控制措施确实能阻止 agent 越权获取凭证、或向未授权目的地发送敏感数据的尝试。

测试还应覆盖篡改权限、干扰监控等行为,并且在模型、工具或工作流发生重大变更后重新执行。

必须有明确的负责人,利用测试结果判断系统是否具备部署条件,并确保失败的测试能触发纠正措施。在测试或运行中发现的问题,都应被复现、调查并解决。每个发现都可以转化为可重复执行的测试,方便团队在未来版本中验证修复效果是否持续有效。

例如,CrowdStrike 的 SafeMind 通过反复模拟攻击来测试和强化防御;Palo Alto Networks 的 Prisma AIRS 则随着模型和应用的演变更新,持续进行红队演练。

防御者需要在关键时刻拥有合适的工具

调查失败需要适合特定任务、数据环境的有力工具。开放模型与闭源模型满足着互补的需求。

闭源模型提供托管能力与服务,而开放模型让防御者能够检查相关组件、调整策略,并在自有基础设施上开展工作。

在处理安全事件时,这种掌控力有助于团队复现故障,并在自有系统上测试修复方案,同时确保敏感证据不出本地环境。

强大的 AI 可以辅助这一工作,帮助发现漏洞、验证修复、调查攻击。其价值应通过可复现的发现、可验证的修复以及更快的响应时间来评估。

例如,Capital One 的 VulnHunter 实现 AI 驱动的代码安全;ReversingLabs 的 Spectra Assure 利用 AI 分析软件包,检测恶意软件与篡改行为。

通过公开协作将优势转向防御方

共享故障证据、有效控制措施及修复验证方式,能帮助其他团队强化自身系统。

NVIDIA 的安全研究 与开放安全 AI 联盟(Open Secure AI Alliance)通过向更广泛的安全社区输出研究成果、实用工具及专业经验,支持这种交流。

AI 安全本质上是个工程问题。每个 Agent 部署都需要可执行的边界、明确的责任主体,以及证明防护机制确实有效的证据。开放研究和共享工具能帮助更多防守方达到这一标准,并随能力演进持续改进。

了解更多 NVIDIA 的安全研究,并加入 Open Secure AI Alliance

原始来源: NVIDIA 博客

评论 (0)