AIAgent的信任危机
去年这个时候,我帮一家做跨境电商的公司部署了他们的第一个AI Agent。接入客服系统后,第一周的数据确实好看:响应时间从平均三分钟压缩到三秒内,客户满意度评分从4.2升到了4.6。CTO在周会上说,这才是AI该有的样子。
到了第三个月,数据开始往下掉
不是技术出了问题。Agent跑得很稳,接口正常,模型也没有更新。出问题的是信任。客服主管开始要求Agent每回答一条客诉都必须有人复核;财务部门发现Agent自动生成的对账报告里有两笔数据对不上,虽然事后查是上游系统的问题,但"不敢用"的情绪已经扩散开来。
我后来在Gartner的一份调查里找到了共鸣。2025年6月,他们对360名IT应用负责人做了问卷:75%的人说已经在组织里部署了某种形式的AI Agent,但只有15%表示正在考虑、试点或部署完全自主的Agent。
中间那道60个百分点的缺口,就是信任危机。
信任从哪来,又往哪去?
我翻了一遍近半年的行业报告,想搞清楚这个数字到底是怎么掉下去的。
McKinsey在2025年6到7月的全球调查里记录了AI Agent的信任轨迹。62%的受访者说自己的组织至少在做Agent的实验,但真正开始规模化部署的只有23%。更值得注意的一条是:51%的AI使用者报告说自己的组织经历过至少一次AI引发的负面后果,其中近三分之一的罪魁祸首是不准确——也就是我们常说的幻觉问题。
Gartner的数据更直接。他们调查了企业对Agent供应商的幻觉防护能力有多少信任,只有19%的受访者说"高度信任"或"完全信任"。同时,74%的人认为AI Agent是一个新的攻击面,而只有13%的人确认自己的组织有完善的治理结构来管理它。
AvePoint对750名全球IT领袖的调查里,88.4%的组织报告过至少一次AI Agent相关的安全事件,数据泄露占50.1%,被恶意输入操控占49.6%。
我把这些数字放在一起看,发现一个模式:信任的流失不是因为Agent变差了,而是因为企业给它的权限变大了。
当Agent还能做简单的问答时,出错了最多是回答不准确,影响有限。但当它开始自动审批订单、修改配置、调用外部API时,同样的幻觉就变成了实际的损失。PwC的调查里有这样一组数据:企业对Agent的信任在低风险任务上还在70%以上,但一到金融交易场景就掉到20%,自主员工交互场景掉到22%。
信任不是线性下降的,它是断崖式的。一旦你让Agent碰钱或者碰人,信任曲线几乎垂直下跌。
为什么幻觉这么难解决?
我在GitHub上扒了几家开源Agent框架的代码,发现核心问题不在模型本身,而在工程实现。
大多数企业Agent架构是这样的:模型层负责理解指令和生成决策,工具层负责执行操作,中间靠一个"guardrails"层做校验。听起来完善,但实际上这个校验层往往是被最后塞进去的。
一个做金融自动化的朋友给我看了他们公司的Agent架构草图。模型调用外部API之前要经过权限校验、输入清洗、输出验证三道关卡。但他说:"三道关卡的维护成本比Agent本身高。而且业务方总说'加个审批流程太慢了',最后能跳过的还是会跳过。"
G2对1000多名B2B软件买家做了一个调查,其中提到:近三分之二的受访者说Agent需要的人为监督比预期多得多。原因包括数据不够结构化、编程学习曲线陡峭,以及对技术本身不够信任。
超过25%的安全事件达到了"严重"级别。数据泄露影响最大,其次是声誉损失。
这些不是实验室里的理论风险,是真实环境里每天都在发生的事。
MIT的AI Agent Index 2025做了个有意思的盘点。他们追踪了30个主流Agent系统的安全特性,结论很直接:240个安全相关字段中有135个没有公开信息。近三分之二的Agent开发者不公开安全评估。
只有4个Agent在13个高自主性Agent中提供了Agent级别的安全评估。
这意味着什么?意味着企业在采购和部署Agent时,很大程度上是在盲飞。你买的Agent到底有没有做安全测试?有没有对抗注入测试?有没有越权行为的防护?大多数情况下,答案只能是"供应商自己知道"。
那怎么重建信任?
我在部署Agent的过程中试过一些方法,不一定放之四海而皆准,但至少在几个项目里验证过。
权限分级。不要给Agent一个"全能账号"。把它的权限拆成只读、建议、执行三级,每一级都有明确的边界。只读级可以查询数据但不能修改;建议级可以生成方案但不能自动执行;执行级必须有具体的操作清单,且每条操作都留审计日志。
强制人工审批。对于高风险操作,Agent可以生成方案、准备参数、甚至预执行,但最后的提交必须有人点确认。听起来效率低了,但实际使用中,审批环节的存在本身就会让使用者更敢于信任Agent——因为你知道有兜底的。
可追溯。每一笔Agent的操作都要记录完整的上下文:它收到了什么输入、调用了什么工具、为什么做出这个决策。当出问题时,追溯比修复重要。
预期管理。这听起来最不重要,但实际是最难做到的。我在给那家跨境电商公司做复盘时,CTO原来说"Agent会替代人工客服"。后来他改成"Agent处理标准化流程,人工处理异常情况"。预期从"替代"回到"辅助"之后,团队的信任反而回升了。
信任从来不是技术单方面能解决的问题。它需要架构、流程、人和预期的共同配合。Agent不会自动让人信任它,就像一个新来的员工也不会因为你发了工牌就自动被团队接纳一样。
给Agent定规矩,其实就是给组织定规矩。
2026年,McKinsey的那份"AI信任成熟度调查"里有一个趋势值得注意:AI信任正逐渐被视为业务推动力,而不是合规练习。那些在信任建设上先投入的企业,反而能更快规模化Agent的部署。
信任不是部署的前置条件,它是部署过程中要持续建设的东西。
从我自己的经验看,Agent的信任曲线是这样的:上线前三周是高增长,三个月左右见顶,然后开始下滑。如果不下功夫维护,它会一直往下降,直到降到一个"只看不敢用"的地板价。
能不能不让它掉,取决于你从一开始就给它定多少规矩。