开放权重模型占 token 用量的 56%,Astra 在 Fable 5.1 上的支出翻倍
每月,AI Gateway 负责在生产级应用和 AI 实验室之间调度数十万亿个 token。这些流量让我们得以洞察当下企业的真实 AI 使用状况,并每月发布相关数据。查阅 6月、7月 及 8月 的 Production Index 报告。
复制链接2026年9月摘要
本期 9 月指数报告基于 AI Gateway 截至 2026 年 8 月收集的数据。
开放权重模型首次占据网关 token 总量的主导地位,占比从 12 月的 7% 跃升至 8 月的 56%。
单 token 平均成本不足五个月前的一半。8 月单 token 价格下跌 23.2%,连续第三个月环比下降,团队支付的中位数成本降低了 7.6%。
Fable 5 是 Anthropic 能力最强的模型,但其占网关支出的份额在一个月内缩水三分之二。Opus 5 价格仅为前者一半,份额却翻了三倍。Anthropic 仍占据全部支出的 64%。
自 5 月起,Gemini 3 Flash 在网关 token 中的份额已流失 95%,其中超过四分之三的流量转投其他实验室的模型。
特别报道:OpenAI 发布 Astra,发布于 9 月 3 日
GPT-6 Astra 在发布两天内便拿下 OpenAI 支出的三分之一,其占网关支出的份额是 Fable 5.1 的两倍。两款模型间隔两天发布且定价相同,但 Astra 在上市前 12 天占据了网关总支出的 7.7%,而 Fable 5.1 仅为 3.7%。
复制链接开放权重模型首次拿下 token 流量多数份额
8 月,开放权重模型处理了 AI Gateway 上 56% 的 token,这是它们首次占据流量多数。
回溯至 2025 年 12 月,它们处理的 token 不足十分之一;仅八个月后,其流量已超过所有闭源模型总和。



虽然前沿模型仍占据大部分支出,但 open-weight 模型的消费份额正在加速增长。随着 open-weight 模型能力越来越强,客户正把更多生产级工作负载迁移过去。



开放权重模型采用的增长,推动八月份网关的平均 token 价格下降了 23.2%。这是连续第三个月下跌,也是自四月份以来幅度最大的一次。在两个月内 token 用量均超过一千万的团队中,中位数团队的单 token 成本降低了 7.6%,这一降幅是七月份 2.9% 的两倍多。
团队现在可以用同样的预算获得更大的推理量,并将前沿模型专门用于那些值得支付溢价的场景。
复制标题链接前沿模型进入平台期,Fable 支出转向 Opus 5
需要前沿模型的生产型工作负载,并不总是需要最贵的那个。它们只需要足够好的模型。
Fable 是 Anthropic 提供的能力最强的模型。Opus 位于其下一级,单 token 价格约为 Fable 的一半。随着美国对 Fable 5 出口管制解除并在 7 月 1 日恢复访问,其网关消费份额飙升至 13.2%。就在同月底,Opus 5 上线。
8 月,Fable 5 在网关支出中的占比降至 4.9%,而 Opus 5 的占比升至 22.5%。使用 Fable 的十支团队中,有九支减少了用量,且相比迁移到其他任何模型,它们更倾向于将工作负载转移至 Opus 5。Fable 的额外性能提升并不值双倍的价钱。


团队们弃用了 Fable——Anthropic 最昂贵、能力最强的模型,但该公司仍占网关支出的最大份额,因为流失的工作负载降级至 Opus 5,而非转向其他实验室。
自 12 月以来,Anthropic 每月至少占据 AI Gateway 支出总额的 61%,8 月这一比例更是达到 64%。自 12 月起,其模型每个月均占据支出榜前两名,即便具体上榜的型号有所更迭。


Copy link to heading用户忠诚度看的是模型特性,而不是厂商
用户对厂商的忠诚度并非源于品牌,而是源于模型特性,保持一致性才是关键。
当新模型保留了用户在前代模型中看重的东西,厂商就能留住客户;反之,这些客户就会转向其他提供商来满足需求。
Claude Opus 5 发布后,其新增用量几乎是 Fable 流失量的两倍,因为它能以一半的价格处理同样的工作负载。而 Z.ai 推出 GLM-5.3-Flash 后仅五天,日用量就达到了 GLM-5.2 的三倍。


Google 在留住客户方面遭遇困难,因为它的新模型在能力或价格上缺乏相对优势,导致 Gemini 3 Flash 的大部分工作负载转移到了 OpenAI、Anthropic 和 DeepSeek。



大约一半的 v
