为什么AIAgent进了企业,就停在演示阶段?
2024 年 2 月,Klarna 宣布它的 AI 客服助手相当于 700 名人类客服:首月处理 230 万次对话,覆盖 35 种语言,预计每年省下 4000 万美元。公司顺势冻结招聘,员工规模从 4500 人降到 3500 人,目标进一步缩到 2000 人。
一年多以后,同一家公司的 CEO 向彭博社承认,他们走得太远了,正在重新招人。他的原话是:当成本成为组织这件事时最主要的考量,"你得到的结果就是质量下降"。
从"相当于 700 人"到"重新招人",中间只隔了 15 个月。
如果这只是 Klarna 一家的失手,可以归结为执行问题。但 Gartner 在 2025 年 6 月给出另一个数字:到 2027 年底,超过 40% 的 AI 智能体项目会被取消,原因是成本上升、商业价值不清、风险控制不足。IBM 对 2000 名 CEO 的调研更直接:只有四分之一的 AI 项目实现了它承诺的回报,只有 16% 被推广到全公司。
如果你在企业里负责过 AI 落地,这些数字应该不陌生。评测跑通了,演示很漂亮,预算也批了,然后项目就停在那里。
主流解释通常有两个:模型能力不够,或者数据质量太差。两种说法都低估了问题。真正卡住 AI Agent 的,不是它够不够聪明,而是三件模型之外的事:它看不看得见现实、做错了能不能收回、出了事由谁签字。
不是模型看不见,是系统没把状态交给它
AI Agent 的第一步不是推理,是看见。它需要知道当前的完整状态:订单走到哪一步了、这笔款审批到哪个节点、客户的合同里有没有附加条款。这些信息要么由结构化接口一次性给出,要么靠它自己在一堆页面里拼凑。
问题几乎总是出在后者。
试点环境的"聪明",大多来自状态被简化了。 早期验证范围窄、数据干净、边上还坐着大量人工兜底——在这种条件下,模型看起来无所不能。BlackLine 的 CTO Jeremy Ung 说得很直白:试点往往非常亮眼,"你在一个隔离的环境里拿到了令人兴奋的结果"。问题出在放大之后:文档格式不统一、例外情况成倍增加、真实用户的行为毫无规律。
Klarna 的 AI 客服也是这个模式。第三方工程师测试后的结论是:它并不差,只是能力有限——准确复述文档,然后快速把人转给人工。它能处理高并发、低复杂度的问答,一旦遇到需要判断的复杂案件,就没有地方可去。这不是模型不会判断,而是复杂案件需要的上下文——历史工单、账户状态、例外条款——从来没有被打包进它能看见的范围。
状态能不能被一次性、确定性地读取,决定了一个 Agent 是"聪明"还是"无能"。 同样的模型,接在财务系统上像个专家,接在一堆要人工点击的网页后面就像个新手。把这件事归为"模型能力不足",等于让模型替环境背锅。
不是它不会做,是它做错了收不回来
这是最容易被忽略的一条。演示阶段只需要证明"能做",生产阶段却必须回答"做错了怎么办"。
写代码之所以最先被 Agent 突破,是因为编译器提供了即时、确定、可重复的反馈,而版本控制让任何错误都能一键回滚。订机票、改合同、动资金就不一样:外部世界响应延迟、库存实时变化、每一步都可能不可逆。
CIO.com 的一篇分析点出了这个机制:一旦 Agent 进入真实工作流,可逆性就变得困难。如果一次自主流程产出了不一致的结果,企业需要搞清楚的不只是"哪里错了",还有"它是怎么一步步走到这里的"。没有这种可追溯性,回滚既慢又危险。
所以企业实际在做的事,是把不可逆的动作一个个摘出来:可以自动生成草稿,但不能自动发送;可以自动给出建议,但不能自动执行付款。Agent 的行动边界,经常不是由"它能做什么"划定的,而是由"哪些动作可以撤回"划定的。
这也解释了为什么企业里的 Agent 常常显得缩手缩脚。它不是在能力上不够,而是在一个不允许犯错的流程里被刻意限制。这未必是坏事,但它说明一件事:行动的边界由可逆性决定,而不由智能水平决定。
不是技术不成熟,是没有人愿意签字
即使模型看得见、动作也能收回,还有最后一道坎:组织愿不愿意为它的判断负责。
Gartner 在 2026 年 5 月的一份报告里给了一个更精确的描述:到 2027 年,40% 的企业会降级或停用自主 AI Agent,原因不是技术失败,而是治理失败。报告里有一句话几乎就是这个问题的答案——失败最可能发生在组织分不清"Agent 能做什么"和"它被授予了多少权限"的时候。
Gartner 把这种错误称为"二元治理":要么全锁死,要么全信任。前者的结果是简单任务被过度限制、交付变慢,员工绕开系统自行其是;后者的结果是高自主 Agent 失去约束,运营、安全和合规风险一起放大。两种做法都错,因为它们都没有回答那个真正的问题——这一次,责任落在谁头上。
更早的一个例子是加拿大航空:它的客服机器人给乘客编造了一条不存在的退款政策,公司最终被要求赔付,而且无法主张"那是机器人说的,与我们无关"。责任不会因为执行者变成 AI 就消失,它只会转移,并且往往转移到组织身上。
Klarna 的教训也在这里。CEO 事后的反思是"我们可能过度倾斜了"。当成本成为唯一考量,AI 客服被推到了它还没有准备好承担的边界之外——不是因为它做不了那些对话,而是因为没有人愿意为"它做错了"这个结果负责。
值得参考的是 Gartner 给出的分级思路,它把自主性拆成四档:只读观察、给建议、经批准后执行、自主执行。判断一个 Agent 该停在哪一档,不该问"模型能不能做到",而该问"这个动作出错后,谁签字、谁来承担"。 责任能不能落地,决定了自主性可以开到第几档。
边界由三件事共同决定
回到 Klarna。它的问题不是模型不行——它的 AI 客服准确、不胡编、响应快。它的问题是:复杂案件的状态没有完整交到模型手里,出错的动作没有清晰的回退路径,也没有人愿意为一次判断失误承担责任。三件事同时收紧,Agent 就只能停在一个很窄的安全区里。
AI Agent 的能力边界,由感知、可逆性和责任三件事共同决定,而不是由模型大小决定。 环境愿不愿意把状态结构化地交出来,划定了感知的边界;动作能不能收回,划定了行动的边界;后果由谁承担,划定了自主性的上限。
这三个问题,没有一个能靠换一个更强的模型解决。它们需要重新设计接口、重新划分权限、重新安排责任——本质上是组织工程,不是模型工程。
这也解释了一个正在发生的现象:真正把 Agent 用起来的公司,往往不是模型最强的,而是那些先把流程、权限和责任理清楚的公司。Agent 不是买来就能用的能力,它是一次需要被安装进组织的改造。
那么,你所在的组织里,AI 项目目前卡在哪一档——是看不见状态,收不回动作,还是没人愿意签字?
信息来源
- Gartner,《Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027》,2025 年 6 月 25 日
- Gartner,《Gartner Says Applying Uniform Governance Across AI Agents Will Lead to Enterprise AI Agent Failure》,2026 年 5 月 26 日
- 彭博社对 Klarna CEO Sebastian Siemiatkowski 的访谈,2025 年 5 月
- CIO.com,《Why most agentic AI projects stall before they scale》
- IBM 对 2000 名 CEO 的调研(Fortune 报道),2025 年 5 月
识别关键变量,打磨稀缺判断。欢迎订阅《远见卓识》