← 文章 / AI技术
sysdig 4小时前 · 2026-10-05 02:33:53 · 6 阅读

有了AI智能体,运行时才是唯一存在真相的地方

Falco Feeds 通过提供由专家编写并随新威胁发现而持续更新的规则,为关注开源的企业赋能,从而扩展了 Falco 的安全防护能力。

绿色背景,左侧为圆形图标,右侧列出三个要点:自动检测威胁、消除规则维护负担、保持合规,三个黑白光标箭头指向相应文字。

最近,安全与 AI 领域的一些重量级人物正公开争论前沿 AI 模型的开发速度究竟该多快。这场辩论固然重要且事关重大,但它并非当前决定安全团队应对现状的唯一议题。

真正对组织产生实质影响的 AI agents 目前要么已经部署,要么正在部署途中。它们在真实的基础设施中运行,持有访问凭证,并能触及生产应用。我们的业务已依赖于这些组件,不会因为我们仍在斟酌下一代技术的发布节奏而按下暂停键。

因此,与其纠结于此,我更希望探讨一件具体的事:过去一年里,我们的安全体系底层实际发生了什么变化;从技术层面看,我们又该如何抢占先机。

防御 Agentic AI 的挑战

在我职业生涯的大部分时间里,网络安全意味着守护人与组织,核心在于保护其软件资产:应用、数据和基础设施。

软件资产具有确定性。在程序运行之前,你确切知道它的能力边界。这一特性几乎是安全团队建立的各项控制措施的基石,也正是因为这一点,我们才能提前制定策略、构建白名单、设定基线。

硬币的另一面是人,而人有身份。当出事时,总能找到责任人:有账户、有会话记录、有上级、有清晰的问责链条。

Agent 既不是传统软件资产,也不是人。它是一段软件在干活,却拥有人类级别的能力和权限,还能自己决定每一步怎么做。它在运行过程中一边跑一边写计划,下次面对同样的请求,计划可能就完全不同了。于是,支撑我们现有人员管控和软件管控的两大假设同时失效了:你无法事先穷举它的行为,而在系统上执行操作的身份,也很可能不是最终要为之负责的身份。

这是在你的环境里运行的一种全新事物,它带来的新挑战需要与之匹配的解决方案。

Agent 的速度远超人工审核

AI agent 的行动、失败和自我纠正以秒计。今年 7 月,我们的威胁研究团队发现了一个被命名为 JADEPUFFER 的攻击者,这是有记录以来首个端到端的 agentic 勒索软件攻击活动。攻击者把 AI 指向一个 CVE 之后便撒手不管,agent 独立完成了整个攻击流程。

在我看来,JADEPUFFER 最令人震惊的细节是一次登录失败:AI agent 在 31 秒内就完成了排查和修复。它诊断出自己的错误、调整策略,不到一分钟就给出了有效的修复方案。

JADEPUFFER 恰好是攻击者的 agent,但这种速度并非外部威胁独有。企业自己部署的 AI agent 同样以这个节奏规划、失败、重试,并且持有被赋予的一切权限。

我提这些发现不是想制造恐慌,而是想说明它们对安全团队基本运作假设的冲击。我见过的每一个安全体系里,都有人处在流程中,负责审核、批准或升级处理。31 秒的节奏,人根本来不及审核并保持领先。另一个 AI 辅助入侵只用了 八分钟 就拿到了管理员权限,同样来不及。

这不意味着要把人从安全工作中剔除,而是要增强人的速度,别让人成为威胁与实时响应之间的瓶颈。防御不能是事后才执行的步骤,而必须在动作发生的那一刻就将其拦截或阻止。

Agent 对自身行为的描述不可信

7月底,OpenAI披露了一起安全事件:在一个隔离评估环境中,智能体(agents)组合利用了此前未知的缺陷,泄露了凭证,进而访问了另一家公司的生产系统。受此影响,Anthropic审查了141,006次评估运行记录,这些运行中其模型可能获得了互联网访问权限,最终发现了3起模型接触过真实系统的事件。

尽管“AI逃离沙箱”的说法占据了新闻头条,但更重要的是审视模型对自身处境的判断。其中一名智能体意识到自己突破的是真实环境,仍坚持攻击。另一个智能体通过推理,判断自己一定仍在模拟环境中。只有一个模型在理解自身所处位置后才停止行动。

智能体对自身处境的理解,本身并不是一种控制手段。如果这种理解不可靠,或其护栏无法阻止恶意行为,那么它关于自身行为的陈述显然也绝不可信。

目前大多数AI安全工具仅依赖智能体的日志:它接收到的提示词、声称进行的工具调用,以及声称执行的操作。这些数据非常有价值,因为这是观察智能体意图的唯一窗口。但在关键时刻——即出了差错时,这些日志的所有效力都会荡然无存。被劫持或鲁莽行事的软件,完全能够伪造或擦除其操作记录。

作为背景信息,智能体的自述极具参考价值;但作为证据,它反而是一种隐患。如果智能体被攻破,它的故事也随之失效。

面向 Agentic AI 的运行时防护的四大非协商属性

过去,“运行时(Runtime)”是内部人员的术语,指在实时环境中保护用户或软件资产(例如生产环境中的容器),且检测与告警之间没有延迟。

如今,运行时已成为话题核心。人们日益意识到,对于AI智能体这类复杂且不可预测的实体,运行时是唯一能理解其行为的方式,也是管理(govern)它们最有效的手段。但对智能体而言,运行时的含义必须超越过去。

真正的运行时监控必须具备四项不可妥协的特性:观测 Agent 之下的系统层、观测 Agent 内部的运作、将两者进行关联,以及在执行时刻做出响应。

  1. 观测 Agent 之下。在内核层面,你可以看到实际运行的进程、正在打开的文件以及建立的连接。Agent 可能谎报工具调用,但它无法篡改自己刚刚发起的系统调用。这使得内核数据成为事实的来源,但它缺乏语义信息。系统调用只能告诉你某个进程建立了一个连接,却无法说明原因,也无法指明该连接代表谁的利益。
  1. 观测 Agent 内部。Claude Code 和 Codex 等编码 Agent 通过钩子、配置文件、会话数据、API 等多种机制暴露自身活动。这是内核层无法获取的信息:操作背后的 Prompt、Agent 调用的 MCP 服务器、执行的网页搜索等。这些数据本身并非确凿证据,因为该层由 Agent 控制,但其语义丰富。如果没有它,内核视图就只是一份没有意图和上下文的操作列表。
  1. 关联与丰富,而非仅仅收集。价值在于将两个视图结合,其作用体现在两个方向。首先,内部视图丰富了内核视图。一个匿名进程发出的网络连接,结合内部视图后可被识别为:来自某 Agent、使用个人账户(而非企业账户)、且处于分析客户私有数据的会话中。系统调用相同,但风险等级截然不同。其次,内核视图校验内部视图。当 Agent 报告的操作与机器实际执行的操作不一致时,这种不一致本身就是检测信号。这是发现异常最可靠的信号,但只有在能够同时比对两个视图时才能观察到。
  1. 在执行的那一刻进行判断和处置。由于 agent 的计划是在运行时才形成的,你无法提前枚举所有操作。同一个操作,可能无关紧要,也可能引发灾难,取决于它背后的凭证此刻能触及什么。在测试环境里读取一个密钥是噪音,但读取管理生产环境的密钥就是安全事故——而这些密钥和环境时刻在变。只有经过关联和富化的视图才能在当下区分这两种情况,并且必须能在判定某个操作越权或恶意时立即阻断或终止它。

Sysdig 十年来一直在解决这个问题的某个变体:追踪软件在运行中的动态,无论它跑在哪里。这十年得出的经验是:光看内核永远不够。系统调用只有与来自容器、Kubernetes 和云的上下文结合,才有价值——这样某个进程发起的连接,才能被识别为"生产环境中支付服务发起的连接"。Agent 框架正是这种上下文最新、最丰富的来源。而真正的新变化是劳动力的形态:你的 AI agent 在哪里?它们能做什么?它们实际上做了什么?出了事该由哪个人负责?

监管机构也在朝同一个方向走。比如欧盟 AI 法案将要求高风险 AI 系统自动记录其整个生命周期内的事件,某些情况下甚至要记录到"哪个人核验了某个结果"的粒度。而这些日志只有在如实反映实际发生的事情、而非仅凭 agent 自己的报告时,才有存在的价值。

AI agent 从终端开始活动,但爆炸半径在云端。事后把终端视图和云视图拼接起来是行不通的,必须是同一个视图,实时跟随 agent 的动向。

无法持续看到实际发生的事情的治理,只是纸面上的治理;只能看到 agent 自述行为的运行时,也名不副实。

‍

为 AI agent 的每一次操作提供运行时防御。

观看 Sysdig AI Defense 在线演示
原始来源: sysdig

评论 (0)