← 文章 / 未分类
vercel 10小时前 · 2026-09-18 08:46:25 · 1 阅读

开放权重模型占 token 用量的 56%,Astra 在 Fable 5.1 上的支出翻倍

每月,AI Gateway 负责在生产级应用和 AI 实验室之间调度数十万亿个 token。这些流量让我们得以洞察当下企业的真实 AI 使用状况,并每月发布相关数据。查阅 6月7月8月 的 Production Index 报告。

复制链接2026年9月摘要

本期 9 月指数报告基于 AI Gateway 截至 2026 年 8 月收集的数据。

  • 开放权重模型首次占据网关 token 总量的主导地位,占比从 12 月的 7% 跃升至 8 月的 56%。

  • 单 token 平均成本不足五个月前的一半。8 月单 token 价格下跌 23.2%,连续第三个月环比下降,团队支付的中位数成本降低了 7.6%。

  • Fable 5 是 Anthropic 能力最强的模型,但其占网关支出的份额在一个月内缩水三分之二。Opus 5 价格仅为前者一半,份额却翻了三倍。Anthropic 仍占据全部支出的 64%。

  • 自 5 月起,Gemini 3 Flash 在网关 token 中的份额已流失 95%,其中超过四分之三的流量转投其他实验室的模型。

特别报道:OpenAI 发布 Astra,发布于 9 月 3 日

  • GPT-6 Astra 在发布两天内便拿下 OpenAI 支出的三分之一,其占网关支出的份额是 Fable 5.1 的两倍。两款模型间隔两天发布且定价相同,但 Astra 在上市前 12 天占据了网关总支出的 7.7%,而 Fable 5.1 仅为 3.7%。

复制链接开放权重模型首次拿下 token 流量多数份额

8 月,开放权重模型处理了 AI Gateway 上 56% 的 token,这是它们首次占据流量多数。

回溯至 2025 年 12 月,它们处理的 token 不足十分之一;仅八个月后,其流量已超过所有闭源模型总和。

Open-weight model token share rose every month from April through August, rising from 13% to 56% of total volume. Open-weight model token share rose every month from April through August, rising from 13% to 56% of total volume. Open-weight model token share rose every month from April through August, rising from 13% to 56% of total volume.
4 月到 8 月,open-weight 模型的 token 占比逐月上升,从 13% 涨到总量的 56%。

虽然前沿模型仍占据大部分支出,但 open-weight 模型的消费份额正在加速增长。随着 open-weight 模型能力越来越强,客户正把更多生产级工作负载迁移过去。

开放权重模型处理了八月份网关 56% 的 token,占比消费总量的 14%。开放权重模型处理了八月份网关 56% 的 token,占比消费总量的 14%。开放权重模型处理了八月份网关 56% 的 token,占比消费总量的 14%。
开放权重模型处理了八月份网关 56% 的 token,占比消费总量的 14%。

开放权重模型采用的增长,推动八月份网关的平均 token 价格下降了 23.2%。这是连续第三个月下跌,也是自四月份以来幅度最大的一次。在两个月内 token 用量均超过一千万的团队中,中位数团队的单 token 成本降低了 7.6%,这一降幅是七月份 2.9% 的两倍多。

团队现在可以用同样的预算获得更大的推理量,并将前沿模型专门用于那些值得支付溢价的场景。

复制标题链接前沿模型进入平台期,Fable 支出转向 Opus 5

需要前沿模型的生产型工作负载,并不总是需要最贵的那个。它们只需要足够好的模型。

Fable 是 Anthropic 提供的能力最强的模型。Opus 位于其下一级,单 token 价格约为 Fable 的一半。随着美国对 Fable 5 出口管制解除并在 7 月 1 日恢复访问,其网关消费份额飙升至 13.2%。就在同月底,Opus 5 上线。

8 月,Fable 5 在网关支出中的占比降至 4.9%,而 Opus 5 的占比升至 22.5%。使用 Fable 的十支团队中,有九支减少了用量,且相比迁移到其他任何模型,它们更倾向于将工作负载转移至 Opus 5。Fable 的额外性能提升并不值双倍的价钱。

Fable 5 fell from 13.2% of gateway spend in July to 4.9% in August as Opus 5's spend share rose to 22.5%. Fable 5 fell from 13.2% of gateway spend in July to 4.9% in August as Opus 5's spend share rose to 22.5%.
随着 Opus 5 的支出占比升至 22.5%,Fable 5 在网关支出中的占比从 7 月的 13.2% 跌至 8 月的 4.9%。

团队们弃用了 Fable——Anthropic 最昂贵、能力最强的模型,但该公司仍占网关支出的最大份额,因为流失的工作负载降级至 Opus 5,而非转向其他实验室。

自 12 月以来,Anthropic 每月至少占据 AI Gateway 支出总额的 61%,8 月这一比例更是达到 64%。自 12 月起,其模型每个月均占据支出榜前两名,即便具体上榜的型号有所更迭。

Anthropic has held the top two spots by spend every month since December. Google and OpenAI have each cracked third twice.Anthropic has held the top two spots by spend every month since December. Google and OpenAI have each cracked third twice.
自 12 月以来,Anthropic 每月都稳占支出榜前两名。Google 和 OpenAI 则各有两次挤进第三。

Copy link to heading用户忠诚度看的是模型特性,而不是厂商

用户对厂商的忠诚度并非源于品牌,而是源于模型特性,保持一致性才是关键。

当新模型保留了用户在前代模型中看重的东西,厂商就能留住客户;反之,这些客户就会转向其他提供商来满足需求。

Claude Opus 5 发布后,其新增用量几乎是 Fable 流失量的两倍,因为它能以一半的价格处理同样的工作负载。而 Z.ai 推出 GLM-5.3-Flash 后仅五天,日用量就达到了 GLM-5.2 的三倍。

GLM-5.3-Flash 在 AI Gateway 上线一天后便超越 GLM-5.2,到 8 月 31 日已处理 Z.ai 三分之二的 token。GLM-5.3-Flash 在 AI Gateway 上线一天后便超越 GLM-5.2,到 8 月 31 日已处理 Z.ai 三分之二的 token。
GLM-5.3-Flash 在 AI Gateway 上线一天后便超越 GLM-5.2,到 8 月 31 日已处理 Z.ai 三分之二的 token。

Google 在留住客户方面遭遇困难,因为它的新模型在能力或价格上缺乏相对优势,导致 Gemini 3 Flash 的大部分工作负载转移到了 OpenAI、Anthropic 和 DeepSeek。

Gemini 3 Flash 流失的流量中,超过四分之三流向了其他实验室,而谷歌自家全尺寸 Flash 继任者接到的不足十分之一。Gemini 3 Flash 流失的流量中,超过四分之三流向了其他实验室,而谷歌自家全尺寸 Flash 继任者接到的不足十分之一。Gemini 3 Flash 流失的流量中,超过四分之三流向了其他实验室,而谷歌自家全尺寸 Flash 继任者接到的不足十分之一。
Gemini 3 Flash 流失的流量中,超过四分之三流向了其他实验室,而谷歌自家全尺寸 Flash 继任者接到的不足十分之一。

大约一半的 v

原始来源: vercel

评论 (0)