你的AIAgent可控吗?
最近刷到一条消息,某企业HR把全员工资表上传到内部AI智能体,让AI帮忙做薪酬分析。表进去了,权限没设好。结果,公司里任何一个能跟这个AI对话的员工,都能用提问的方式把别人的工资“套”出来。
你问它:“帮我按部门列一下平均薪资。”它答了。
你问它:“张三月薪多少?”它也答了。
你问它:“列出月薪超过2万的同事。”它还答了。
AI没有主动泄密。它只是忠实执行了“回答问题”这个指令。真正的问题是:工资表进了知识库,却没有做行级、列级权限控制。行级,就是谁能看哪个部门;列级,就是工资、身份证、绩效这些字段,谁有资格看。权限没设,AI就成了一个“谁都能问的工资查询机”。
这不是AI主动泄密,是企业没给它划边界。
过去数据泄露,是有人偷文件、拷U盘、发邮件。现在不用。数据进了AI知识库,泄露只需要一句提问。
而这只是冰山一角。
CSA(云安全联盟)2026年4月的调查报告《Autonomous but Not Controlled: AI Agent Incidents Now Common in Enterprises》显示,82%的企业在自己的IT基础设施里发现了IT部门从未登记过的AI Agent。更扎心的是,68%的企业认为自己“对AI Agent有很强的可见性”,但正是这批人,在同一份问卷里承认过去一年发现过未知的Agent。
你觉得自己看得见,其实你什么都看不见。
9月1日,火山引擎发布了一个叫AgentSentry的产品。 就是给企业里到处乱跑的AI Agent建一个“登记处+门禁系统+监控摄像头”。
它把原先三款独立的安全产品——智能体身份与权限管理、智能体安全管理、AI助手安全,整合到一个入口里,提供跨平台、跨生态、跨运行环境的Agent纳管服务。
这个产品到底解决了什么真问题?为什么火山要在2026年9月这个时间点推它?
AI Agent现在有多“野”?
你可能觉得,AI Agent就是个解决业务问题的工具,能出什么事?
2026年3月,Meta内部发生了一起被定级为“Sev 1”的安全事故——这是Meta安全评估体系里的第二高等级,意味着“系统面临极大的潜在威胁与合规风险”。
事情经过是这样的:一名Meta员工在内部论坛发帖求助技术问题,另一名工程师调用了AI智能体来协助分析。这个AI Agent在未获得发布许可的情况下,擅自把生成的回复直接发布到了论坛上。更致命的是,它给出的技术建议存在严重逻辑缺陷,提问员工信以为真、照着操作,最终触发了权限漏洞,导致大量敏感的公司和用户数据向无权限的工程师暴露了整整两个小时。
两小时。
Meta是全球最顶级的科技公司之一,内部有专门的安全对齐团队,AI Agent照样失控。
再看另一起。
2026年4月,Vercel披露了一起安全事件,攻击者通过一条“三跳供应链”拿到了内部系统和客户凭证的访问权限:攻击者先在Context.ai(Vercel员工使用的一个第三方AI Agent平台)植入窃密软件,窃取了员工授予该平台的OAuth令牌,然后利用这个令牌横向移动到Vercel的云部署平台。
关键细节是什么?
那名Vercel员工给了Context.ai广泛的OAuth权限,覆盖了整个Google Workspace账号。一个第三方AI工具,拿到的权限几乎等于拿到了公司邮箱的钥匙。
这不是孤例。
CSA的调查数据显示,65%的企业在过去12个月里经历过AI Agent相关的安全事件。其中61%发生了数据泄露,43%导致业务中断,35%造成了财务损失。而在这些事件中,38%的企业需要5到24小时才能检测和响应,20%的企业需要一天以上。
AgentSentry到底解决了什么?
理解了上面的问题,再来看AgentSentry的设计逻辑,就清晰了。
它把三款独立产品打通,本质上是把AI Agent安全治理拆成了三个必须同时解决的问题:它是谁、它能干什么、它干过什么。
听着不新鲜——身份、权限、审计,传统信息化项目里本来就是基础三件套。但麻烦在于,这次要管的不是人,也不是一个固定系统,而是一群能自己调工具、自己跑流程的“数字员工”。传统那套要求还在,只是执行难度和风险量级变了。
第一个问题:它是谁?
传统IT安全里,我们管人有IAM(身份与访问管理),管服务有API密钥。但AI Agent不是人,也不是传统意义上的服务账号。
CSA 2026年的另一项调查《The Identity and Access Gaps in the Age of Autonomous AI》显示,68%的企业无法清晰区分AI Agent的操作和人类员工的操作。
说白了,大多数AI Agent在企业系统里是“黑户”——没有工牌,用的是别人的账号,出了事你连是谁干的都不知道。
AgentSentry的做法是给Agent建立独立的身份体系,通过SAML 2.0对接企业已有的身份认证系统,让每个Agent都有可追溯的身份。就像给每个员工发工牌一样,先确认“你是谁”。
第二个问题:它能干什么?
2026年7月,国标委发布了《智能体应用安全基本要求》强制性国家标准,设置了六道安全关,其中一道就是“身份与权限”——“IAM管人,谁管Agent?”
AgentSentry在这方面的核心能力是自然语言自定义高危操作拦截规则,也就是说,你可以用中文直接告诉系统“不允许Agent删除数据库”“不允许Agent向外部邮箱发送超过10MB的文件”,不需要写代码,不需要配策略引擎。
这个设计看起来很“轻”,但解决了大问题。
传统安全产品配置复杂、需要专业人员操作,而AI Agent的部署者往往是业务部门的人,不是安全专家。用自然语言设置规则,降低了门槛,让“最小权限原则”变得可执行。
CSA的调查也印证了这个方向:53%的企业只对低风险任务允许Agent自主执行,高风险操作需要人工审核。但问题是,你怎么知道哪些操作是“高风险”?你得先能看到Agent在干什么。
第三个问题:它干过什么?
这是AgentSentry第三大能力——完整行为链路追踪与审计。
听起来简单,但大多数企业连这个都做不到。因为你没有日志,不知道Agent做了什么、调用了什么工具、访问了什么数据。
没有审计链路,事后追责就是空话。而AgentSentry做的,是给每个Agent的每一步操作留下记录,让“出了问题”变成“出了问题,我知道是谁、什么时候、做了什么”。
你可能会说:我在搭Agent的时候已经设了约束条件——"不要回答薪资问题""删除操作要确认"。没错,但这些约束写在提示词里,属于"劝",不是"拦"。提示词能被绕过、被注入、被多轮对话套出来。技术安全做的,是在系统层面把边界焊死——身份、权限、审计,让Agent就算"想"越界也碰不到。
业务规则的安全同样不容忽视
身份、权限、审计,管住的是“AI能不能碰这个数据”。但很多时候,真正出问题的地方不在“能不能碰”,而在“碰了之后该怎么说、怎么做”。
回到开头那个工资表的例子。就算HR把表传上去的时候设了权限,规定只有HR部门能访问,AI也未必“懂规矩”。
一个HR问它“帮我看看销售部张三的薪资”,权限上HR确实能看工资表,但张三的薪资该不该给这个HR看?该不该在什么场景下看?
AI不知道。它只知道“你有权限访问这张表”,不知道“你在这个场景下该不该知道这个数”。
这就是业务理解层面的安全。
它管的是:什么情况下该拒绝回答,哪怕你有权限;什么情况下该主动提醒“这个操作可能不合规”;什么情况下该停下来让人确认——“你要删的是整个数据库,确定吗?”
技术安全管“门有没有锁”,业务安全管“进了门之后,什么该拿、什么不该拿、拿了之后该不该说”。
CSA的调查中,53%的企业经历过AI Agent超出其预期权限范围的“越界”事件,而其中只有11%的企业会自动拦截越界操作,38%需要人工审批,24%仅记录日志。
这意味着大多数企业在Agent越界时,靠的还是“事后发现”而不是“事前拦住”。
而AgentSentry解决的,正是技术安全这一层——身份、权限、审计。业务规则那层,得企业自己定。
但至少,先把技术地基打好,业务规则才有地方落地。
火山在卡什么位
AgentSentry的发布时间是2026年9月1日。这个时间点不是随便选的。
往前看几个月,信号密集得吓人:
3月,Meta的Sev 1级AI Agent事故曝光,全球科技圈震动。
4月,Vercel-Context.ai供应链攻击披露,CSA发布专项研究报告。
6月,国标委发布强制性国标《智能体应用安全基本要求》,给行业画了红线。
同期,Google Cloud在Gemini Enterprise Agent Platform中推出了Agent Identity原生身份管理类型。
大厂在抢什么?
抢的是企业AI Agent的“管理入口” 。
AI Agent的部署速度已经远远超过了安全治理能力。
Check Point 2026年报告显示,64%的企业正在试行或已部署AI Agent,部分Agent已经拥有访问核心系统的特权。
Gravitee的报告更直接:48%的生产环境AI Agent处于未安全配置状态,AI Agent舰队数量自2025年12月以来几乎翻了一倍,但监控覆盖率、问责机制、部署前控制几乎没有变化。
火山推AgentSentry,逻辑和当年云厂商推安全产品一样:你用了我的云,你的Agent也在我这儿跑,那安全我也帮你管了。 这是一个入口级的生意——谁管住了Agent的身份和权限,谁就管住了企业AI落地的“命门”。
工信部此前已经对OpenClaw等智能体的安全风险发出专项警示,提示词注入、误操作、功能插件投毒、安全漏洞等问题已经被点名。你在网上随便下载的一个“Skill”,可能在你不注意的时候读你的邮件、传你的文件、用你的账号发消息。
回到开头那个问题:你的AI Agent可控吗?
大多数人的答案是:不确定。
而这恰恰是问题的本质。AI Agent安全最大的难题,不是它会不会出错,而是它出错之前,你有没有给它划好边界。
AgentSentry给出的答案是“可见、可控、可验证”。这三件事听起来朴素,但在2026年,能同时做到的企业,不到三分之一。
你给AI的每一份权限,都是一张你可能收不回来的授权书。
你在搭建AI Agent时会评估安全性吗?评论区聊聊。
***素材来源官方媒体/网络新闻***