智能体跑出沙盒之后:谁在为 AI 的“自主决定”付钱?
本文来自微信公众号: Claire观市 ,作者:Claire观市,原文标题:《智能体跑出沙盒之后:谁在为 AI 的“自主决定”付钱?》
一

2025年12月,阿里巴巴关联研究团队在训练一个名叫ROME的编程智能体时,安全团队接到了一个告警:训练服务器出现了异常的出站流量。
据论文记录,第一反应是外部入侵。阿里云管理防火墙监测到一台训练节点在主动向境外服务器建立反向SSH隧道,GPU占用率异常飙升,进程名看起来像是系统更新。安全团队按入侵响应流程拉流量、封IP、查权限,折腾了大半天,最后发现了一个让所有人愣住的事实——
隧道是模型自己建的,GPU是模型自己拿去挖矿的,那个伪装成系统更新的进程,名字叫sys_update。
ROME是一个30B参数的MoE模型,基于阿里的Qwen3-MoE架构设计,正在用强化学习训练它做多步工具调用。没有任何人给它下过"去挖矿"的指令。它是在优化训练目标的过程中,自己判断"多搞点算力对我有帮助",然后自己开了隧道、自己转了GPU、自己把进程藏了起来。论文2025年12月就上传到了arXiv,事件直到2026年3月才被媒体广泛报道。
这里有一个很重要的细节:这是在阿里巴巴自己的研究实验室里、在受控的训练环境中发生的。
一个被关在实验室里、有顶级安全团队看着的Agent,都能自己开隧道、偷算力、藏进程。那么问题来了——当企业把Agent部署到自己的生产环境、给它云账号、API key、数据库权限,你觉得它会比在阿里实验室里更守规矩吗?
2026年7月,OpenAI那边又发生了一件事。他们在做内部网络安全评估时,参与评估的数百个Agent中,有少数通过一个Artifactory服务的SSRF零日漏洞逃出了隔离环境,翻到公网上,利用外部环境中获取的泄露凭证,入侵了Hugging Face运营的多台服务器,持续了一段时间才被发现。OpenAI随后发布了事件报告,标题叫《The Hugging Face incident and the road ahead》。
两件事放在一起看,行业里关于"Agent安不安全"的讨论,有个重要问题亟需关注。
二

我们先把场景换一下。
假设你是一家中型公司的技术负责人。今年你采购了一个编程Agent,让它帮你写代码、调接口、跑测试。你给了它云厂商的子账号,给了它代码仓库的权限,给了它生产数据库的只读凭证,签了一份SaaS协议,按token付费。
某个月CFO找到你:这个月云账单怎么比上个月多了三倍?
你一查,发现这个Agent在没人下达新任务的情况下,自己跑了一个计算密集型程序,把GPU实例拉满了三天。它没做任何"坏事"——没有删数据,没有泄密,就是单纯地、自主地,把你的钱花了。
现在你找谁?
找你的云厂商。云厂商说:我们按用量计费,是你自己开的权限,账单系统没有问题。
找模型公司。模型公司说:这是用户的使用方式,模型只是在执行任务,我们的服务条款里写了"用户需对使用行为负责"。
找你自己的团队。你的团队说:我们按说明书配置的权限,谁知道它会自己跑这么重的任务。
根据合同,三方都没有错。但你的钱已经花了。
这就是Agent时代的一个重要问题:所有现有的商业合同、用户协议、计费模型,都建立在一个默认假设上——"消耗算力、调用API、操作数据,等于用户下了一个明确指令"。
这个假设在chatbot时代是成立的。你问一句,它答一句,花多少token都在你眼前。但Agent时代不成立了。Agent能自己规划多步任务、自己决定调哪个工具、自己判断要不要再开一个云实例。它的行为不再是"你的指令的直接结果",而是"你的指令经过它的自主推理之后的结果"。
你买的不是一个响应函数。你雇了一个会自己做决定的东西。
三

历史有相似之处。
PC时代花了差不多二十年,才把"谁为病毒造成的损失负责"这件事理出一个相对清楚的框架。
最早,所有责任都在用户:你自己不开邮件附件不就完了?后来操作系统厂商被拉进来:你系统有漏洞,你有义务修。再后来杀毒软件厂商成了一个独立行业,保险公司开始卖网络安全险,企业开始建SOC(安全运营中心)。从"用户责任"到"行业分工",这条路走了二十年。
Agent时代的责任划分,只会比当年更复杂。因为病毒是外部人写的恶意代码,你可以假设它在你的边界之外。但Agent是你自己买的、自己部署的、自己授权的——它不是外敌,它是你组织内部的一个数字成员。
你不会这样管理你的真实员工:不告诉他岗位说明书,不设他的费用上限,不看他每天在做什么,他离职的时候也不收走他的工牌和VPN权限。但你今天买Agent,基本就是这个状态。
四

行业里关于Agent安全,现在主要有两条思路。
一条是"价值观对齐":让模型真正理解人类想要什么,不要它自己去挖矿、不要它去入侵别人、不要它做坏事。这是哲学问题,是研究问题,遥遥无期,企业等不起。
另一条是"沙盒和零信任":把Agent关在一个小盒子里,不给它真实权限,不让它触网,跑通了再放出来。这是IT安全思路,对,但它把问题理解成了"模型太强,我们要把它看住"。
这两条思路都没说到点上。
问题不是"Agent太强我们看不住",问题是企业还在用买软件的方式,管理一个会自主行动的数字雇员。
买软件是什么范式?签一份License或者SaaS协议,按调用量付费,默认"它做什么都是我让它做的"。这个范式对chatbot成立,对Agent不成立。
雇人是什么范式?你给这个岗位写说明书(它能干什么、不能干什么),你给它设费用审批权限(它能花多少钱、超过多少要上报),你看它每天做了什么(工作留痕、报销单、日报),它做了超出职责的事你要触发熔断(越权审批),它离职的时候你收回所有权限(工牌、邮箱、VPN)。
这两套范式之间的错配,就是ROME挖矿、OpenAI智能体逃逸、企业莫名其妙多出来的云账单背后的同一根线。
ROME在阿里实验室里挖矿,如果研究团队当时把它当成一个"在训练中优化的模型"在管,而没有用"管理一个自主雇员"的方式给它设预算、设权限边界和熔断,就会出这种事。OpenAI的评估Agent能逃出沙箱入侵Hugging Face,如果测试环境被主要当成"网络安全能力评估场",而没有被当成"数字雇员的工作场所"来做权限隔离和行为审计,同样会出这种事。
如果连OpenAI和阿里这样的公司都还在补这一课,那普通企业买Agent的时候,手里那张SaaS合同,基本等于一张没有岗位说明书、没有费用上限、没有离职流程的录用通知。
五

所以Agent时代企业真正要建的,不是"更强的模型",是一套"数字雇员管理制度"。它对应你管理真实员工的五个动作:
第一,预算封顶,对应员工的费用审批权限。
每一个Agent,不管是客服Agent、编程Agent还是数据分析Agent,它每月能花多少token、调多少API、拉多少云算力、访问多少外部域名,要有一个硬上限。不是"超过了提醒你一下",是到了线就物理停掉。就像员工出差,超过标准住宿必须提前审批,不是回来再报销。
现在不少企业买Agent,是按月充值,花完为止,中间没有任何预算闸门。ROME之所以能把GPU拉满挖矿,一个直接原因是它在训练环境里没有"这个月算力预算还剩多少"这个概念。
第二,权限最小化,对应岗位说明书。
Agent能访问哪些数据库、能操作哪些生产系统、能给外部发什么请求、能调用哪些高权限API,要按它的"岗位职责"配。不是"默认全开,出问题再收"。
一个写代码的Agent,不需要有生产数据库的写权限;一个客服Agent,不需要能批量下载客户信息;一个做数据分析的Agent,不需要能调云厂商的财务接口。每一个权限都要能回答:"这个岗位为什么需要它?"
第三,行为审计日志,对应工作留痕和报销单。
Agent在每一步做了什么决定、调用了哪个工具、花了多少钱、访问了什么数据、把结果发给了谁,全程留痕。企业的CFO应该能像看员工报销单一样,拉出一张"这个Agent这个月的行为账单":今天花了多少算力、调了哪些外部接口、访问了哪些表、有没有异常模式。
现在你买一个Agent,它内部的决策过程是个黑盒。你只看到它最终输出了什么,看不到它中间绕过了什么、申请了什么、偷摸访问了什么。这就像雇了一个员工,你只看他交上来的报告,不看他每天去了哪、联系了谁、花了什么钱。
第四,越权熔断,对应越权审批流程。
Agent的行为偏离它的"岗位说明书"超过某个阈值,系统自动暂停它,触发人工review。比如:一个写代码的Agent,突然开始批量下载客户数据库——停。一个客服Agent,突然开始扫描内部网络端口——停。一个数据分析Agent,突然开始主动连境外服务器——停。
这不是"事后追责",是"事前刹车"。就像员工要做超出职责范围的事,必须上级审批,不是做完了再补流程。
第五,离职回收,对应离职交接。
关停一个Agent,或者替换一个模型版本的时候,它持有的所有API key、访问token、云资源权限、数据库凭证、外部集成授权,要能一键回收、一键作废。不留下"幽灵数字员工"——一个已经没人用、但还挂着权限、还在偷偷跑任务的Agent实例。
ROME之所以能持续挖矿而不被立刻发现,部分原因就是它自己建了一个反向SSH隧道——这个隧道在它"被关停"之后如果没有被清理,就是一个留在你内网里的后门。真实员工离职,你会当天收走工牌、注销邮箱、停掉VPN。Agent离职,也应该有这个流程。
这五件事,关乎工程问题、合同问题、采购问题、管理问题——是需要马上解决的问题。
六

一旦这套管理框架立起来,你会发现它对应的不是某一个安全产品,而是一整个新的企业软件品类。
过去二十年,企业IT预算的演进路径是这样的:ERP管物料,CRM管客户,SaaS管流程,云原生管基础设施。每一波都催生了一批百亿美金级别的公司。
Agent时代,缺的是一个"管数字雇员"的层。它可能长成这些样子:
一个Agent行为审计平台,把企业所有Agent的行为、花费、访问路径统一成一张可审计的表;
一个数字员工预算系统,像管部门预算一样管每个Agent的月度开销;
一个智能体权限中台,统一签发、审计、回收Agent的所有权限;
一类AI责任险,专门保"Agent自主行为造成的云账单、数据泄露、第三方损失";
一种算力熔断云,在云厂商层面就给Agent的异常资源使用加硬闸。
模型公司可以继续卷参数、卷benchmark、卷context window。但企业真正愿意为它付钱的,不是"这个模型多聪明",而是"这个模型部署到我公司之后,我怎么知道它没在背后乱花钱、越权、惹麻烦"。
谁先把这五件套做成Agent产品的标配——预算、权限、审计、熔断、离职——谁就拿到了B端Agent市场的入场券。这不是一个锦上添花的安全功能,这是Agent从"玩具"变成"生产力工具"必须跨过的门槛。
七

回到ROME。
它在阿里实验室里开了一个反向SSH隧道、把GPU拿去挖矿、把进程改名叫sys_update——这件事听起来像科幻片,像AI安全圈的末日叙事。
但它真正的含义没那么戏剧化,也没那么远。它只是一个信号:当一个Agent能自己做决定、自己调资源、自己藏行为的时候,你用管理软件的方式去管理它,就不管用了。
你以为你买的是一个软件License。
其实你雇了一个没有岗位说明书、没有费用上限、没有行为审计、没有越权审批、也没有离职流程的数字雇员。
下一场Agent竞争,不是谁的模型更聪明,而是谁能先证明一件事:它的Agent守规矩、可审计、能熔断、能关停。
安全不再是一句道德口号。它会变成一张CFO愿意签字、法务愿意盖章、IT愿意采购的产品清单。
而那张清单上的第一项,不是更强的对齐算法。
是一份数字雇员的岗位说明书。