前沿模型成本与开放权重热潮推动模型路由需求增长

随着前沿模型公司之间的竞争日趋激烈,Kimi K3、Qwen3.8-Max 等开放权重模型的能力也不断提升,模型路由已成为 AI 部署中的关键环节。Stripe 刚刚以超过 70 亿美元收购 OpenRouter,而企业领域的相关趋势同样火热。
Glean由前 Google 杰出工程师 Arvind Jain 联合创办并担任 CEO,专注于帮助大型组织应用 AI。去年 6 月完成1.5 亿美元的 F 轮融资后,公司估值达到 72 亿美元。今年,Glean 的年度经常性收入(ARR)达到 3 亿美元,15 个月内增长了两倍。
Glean 的使命之一,是为每项任务选择合适的模型——甚至判断是否真的需要 LLM。
Jain 告诉 Latent Space:“Glean 的一个重要目标,是避免在不需要 LLM 的任务上使用它。有时你会看到,Glean 中有人只是要把两个数字相加或相乘,其实用计算器就够了。”
不过,Glean 真正想做的,是为企业员工提供 Jain 所说的‘一个真正强大的个人协作者’。这意味着,它需要充当主流 LLM 的元级编排层。

“如今的 Glean 可以看作 ChatGPT、Claude、Gemini 和 Grok 的超集,”Jain 说,“我们日常使用的这些 AI 产品,Glean 将它们的能力融合到了一种统一的体验中。”
对企业来说,把 AI 技术引入组织只是挑战的一半。另一半,是把组织内部的知识纳入 AI 系统。
“归根结底,我们的业务是深入理解你的数据、知识和信息,同时了解公司内部的工作运转方式,”Jain 说。
Glean 如何实现模型路由
那么,模型路由在实际中是如何运作的?基本上,Glean 提供三种模型选择方式:
员工可以手动选择模型。
管理员可以限制可用模型,或设置使用上限。
Glean 的自动模式会针对每项任务动态选择模型。

事实证明,Glean 的客户大多出于经济因素选择自动模式。
“为什么大家都在讨论模型路由?为什么对此感到兴奋?主要还是因为成本。”Jain 告诉我们。
Glean 的另一位联合创始人、工程负责人 Tony Gentilcore 最近声称,Glean 的成本效益“比 Claude Code 高出 4 倍”:平均每项任务成本为 0.45 美元,而 Claude Cowork 为 1.84 美元。他将此归因于 Glean 的“harness 和路由能力”。
对个人用户来说,每月花 20 美元、100 美元或 200 美元订阅 LLM 服务,往往能获得很高的性价比。但对企业而言,按用户计算的成本很容易失控。
“AI 模型的成本越来越高。”Jain 说,“比如 Opus,或者 GPT 的最新模型——也就是最先进的那些模型。它们不仅能力更强,还能处理比上一代复杂得多的任务。但按 token 计算,它们的价格也更高,有时是上一代模型的两倍甚至四倍。而且,用户还会用它们执行更长的任务。这样一来,平均到每个用户身上的支出,可能是去年的 10 倍、20 倍。成本确实上涨了很多。”
来自人的反馈闭环
Glean 崛起的另一个关键因素是,它能看到普通企业用户究竟如何使用 AI。这款产品可能会作为“同事”部署给每一名员工,也可以用于在各个部门和职能领域构建、部署智能体。
在 Glean 的客户中,Zillow 表示,其 7,000 名员工中的采用率达到 80%;而在Booking.com,“Glean 成为了公司首个实现全员采用的 AI 平台”。如此广泛的渗透率,让 Glean 得以全面了解企业如何使用 AI。
“因此,我们能够大范围观察人们实际如何使用 AI。”Jain 说,“我们可以看到,他们在处理不同类型的任务时,最先选择哪些模型;当对结果不满意时,又会在什么情况下切换到其他模型——也就是能真正给出正确结果的模型。”
这种大规模的人类反馈闭环,有助于持续改进模型路由系统。
Waldo 登场:收集原始素材
Glean 架构中的另一部分是一个名为 Waldo 的模型。Jain 介绍说,它位于各个大语言模型之上。Waldo 于今年 4 月推出,被称为“Glean 的首个智能体搜索模型”。

在一篇技术博客文章中,Waldo 被描述为用户查询的过滤流程:它会“决定如何拆解问题、使用哪些工具、接下来读取什么内容,以及何时已经收集到足够证据,可以将任务交给 frontier model,以生成高质量答案”。
这意味着,模型路由发生在 Glean 确定完成任务所需的、Jain 所说的“原材料”之后。
他补充说:“我们可以在不消耗 LLM token 的情况下,收集完成任务所需的原材料。”
由此可见,拥有更丰富上下文的低成本模型,可能胜过一个塞满无关数据的 frontier model。
开放权重模型迅速崛起
Jain 证实,企业目前对开放权重模型的兴趣显著增加,主要原因是成本问题。不过,这种变化只是近几个月才出现的。
他说:“去年,(开源 LLM 的)使用量还微乎其微,几乎没有人真正认真考虑开源方案。”部分原因在于,许多此类开源模型是在美国之外开发的,因此被蒙上了一层“污名”。
但如今,企业客户的兴趣突然大幅上升。

“过去三个月,随着 AI 成本飙升,企业开始发现,继续维持这些 AI 投资已经难以为继。”Jain 说,“由于开源方案执行任务的成本低了一个数量级,因此引发了极大关注。 如今可以说,大多数企业都在考虑把开源模型作为 AI 战略的重要组成部分。”
不仅如此,如今各类组织也不再倾向于只依赖一两家供应商,而开放权重模型的兴起正在推动这一趋势。
“现在没人愿意只依赖一家或两家模型供应商,也没人认为自己能在没有开源方案的情况下生存下去。”Jain 说。
评测
2026 年,严肃讨论 AI 就绕不开评测——也就是评估 LLM 的输出质量。我询问了 Glean 如何开展评测,以及评测结果如何反馈到模型路由系统中。
Jain 表示,他们有“内部测试系统”,会针对不同的查询类别,在真实工作负载上比较各种替代方案。具体来说,他们会让模型选择一条路由,同时并行使用“成本可能略低或略高的其他模型”来完成同一项任务。

随后,Glean 会利用“基于 AI 的评审器”来判断“模型路由器的选择是否精准”。
Jain 解释道:“这其实是一个持续学习的过程,会根据新的真实流量不断更新。简单来说,你让模型路由器替用户完成任务,但在后台同时用同样的任务进行测试。”
他补充说,这一过程只会覆盖真实使用中的“一小部分”流量。但对于 Glean 的规模而言,这已经足够用于训练和改进模型路由器。
从企业搜索到端到端 AI 平台
接下来,Latent Space 将持续关注的一个趋势是:企业如何部署 AI 系统,以及其中一些组织如何彻底转向 AI 原生模式。
Glean 是观察这一趋势的一个特别有代表性的公司,因为它是最早面向企业提供 AI 服务的公司之一。Glean 成立于 2019 年初,最初专注于解决企业搜索问题。正如 Jain 所说,Glean 是“第一家将 transformers 和语言模型应用于企业的公司”。

2023 年 4 月,swyx 采访了 Glean 的Deedy Das。如今,Das 已成为 Menlo Ventures 的风险投资合伙人,而他曾是 Glean 的创始工程师之一。但即便在当时——Glean 成立约四年后的 2023 年——公司的重点仍主要是企业搜索。
到了 2026 年,企业使用 AI 的场景已经不只是搜索。AI 正在成为每位员工工作流中不可或缺的一部分。
正如 Das 在去年 11 月重返 Latent Space 播客时所说,这让 Glean 成为一家更“性感”的 AI 公司。他说:“总的来说,我喜欢 Glean 的一点是:它原本是一家无聊、毫不起眼的公司,后来却变得很有吸引力。”
话题也因此回到了模型路由。Arvind Jain 在谈话最后称,Glean 是一个“端到端 AI 平台”,并且被企业客户“高频使用”。他补充说,这让 Glean 得以“掌握实现有效模型路由所需的数据”。
594 分享 上一篇 下一篇