相差183倍!AI大模型价格撕裂:有人卖奢侈品,有人卖日用品

2026年,大模型市场最魔幻的一幕不是谁又刷榜,而是价格表先精神分裂了:同一个Token,贵的和便宜的能差出183倍。
Claude Fable5输出价50美元/百万Token,DeepSeekV4-Flash缓存命中价0.025元/百万Token。一个像在五星酒店点矿泉水,一个像在批发市场买自来水。
别急着问哪个模型更强,这个问题已经过时了。2026年的开发者只问一个问题:这活值几个钱,就配几个钱的模型。
同一个市场,一边涨价一边降价,中间几乎没人站得住。这不是价格战,这是市场的自我分裂。
01
价格K型撕裂
先说结论:市场现在不是普涨,也不是普降,而是K型撕裂。高端涨价,低端降价,中间价位最尴尬。K字上面那根线是“贵有贵的道理”,下面那根线是“便宜到你不试都对不起电费”。
高端这边,Claude Fable5输入10美元、输出50美元,是上一代两倍;Open AI GPT-6Astra也站上10/50美元;Kimi K3输出100元/百万Token,较上代涨2-3倍。
为什么敢这么标?因为这些模型默认开“自适应思考”,每回答一次,内部先疯狂开会,消耗大量思考Token,烧的是高端显存。看着只是输出一段文字,背地里模型在脑子里已经反复盘算好多轮,烧的全是真金白银的算力。
低端这边,画风完全反过来。Open AI把自家Luna砍价80%;DeepSeek Flash版本一降再降,空闲缓存场景直接再砍六成;Qwen(通义千问)Flash、小米MiMoV2.5全都开启大甩卖,小米最高直接降价99%。
行业统计指数已经跌到不到1美元每百万Token,便宜的推理模型干一次活成本几乎可以忽略不计。
IntuitionLabs说,定价已经裂成一条宽带,不往中间值收敛。
翻译一下就是,便宜模型正在变成水电煤,贵模型正在变成专家门诊。

(图片来源:《生活大爆炸》)
有意思的来了,国内市场走出了反向剧本:平价模型在海外杀价抢地盘,国内高峰时段反而涨价。
拿DeepSeek举例,工作日业务高峰期,输出价格相比之前暴涨350%。摩根士丹利的数据更直白,国内大模型输出平均价格,对比去年直接涨了80%。
因算力不够扛不住高峰期的流量,智谱涨价,豆包也推出了收费百元级别的专业版本。
反观海外厂商,还在不断下调部分API价格、取消原定涨价计划,疯狂稳住客户。
为什么会出现这种离谱分化?本质是两类模型吃的算力完全不是一回事。高端思考型模型,算力消耗是近乎指数级增长。
搞Agent智能体任务,内部循环跑几十轮,每跑一轮就要烧一波算力,定价不再看输出多少个字,而是看模型到底“想了多久”。而低端模型靠MoE混合专家、量化压缩、投机解码一堆技术,拼命往下压成本,越卖越便宜。
举个大白话例子,就是拿大模型审核百万字法律合同,每一条都要反复比对校验,错一个条款可能赔几百万,这种活,用最贵的旗舰模型,钱花得值。但如果只是做客服工单分类、简单文档摘要,允许小部分出错,这种活还用高价旗舰,纯纯属于人傻钱多。
同样是调用大模型,任务不同,成本天花板天差地别。一个市场,一头疯狂涨价、一头疯狂甩卖,价格根本不会往中间靠拢,K型撕裂就这么实实在在发生了。
02
中国模型的非对称战争
这轮价格大分裂,谁是最大赢家?爆妹儿觉得,是中国模型。
中国模型玩的是“非对称战争”,不在你最强的赛道上跟你硬碰硬,而是直接换条赛道,也就是“我打不过你的智商,但我打得过你的钱包”。
Qwen和DeepSeek定位为具成本效益的替代方案,承认不一样,但够用且便宜得多,直接开辟新战场。
翻译一下,成本效益方案,也就是“我承认咱俩不一样,但我便宜到你能忍”。这就像不去米其林跟人拼厨艺,直接在楼下开24小时快餐,把全城打工人全接走,拿价格差换市场。
这一招效果非常明显,OpenRouter数据显示,2026年2月中国大模型单周Token调用量首超美国,月度中国17.5万亿、美国11.2万亿,全球前五模型中国占四席。
HuggingFace8月14日也报告,Qwen过去六个月下载超30亿次,谷歌4.18亿,Meta2.27亿。中国开源月下载占比41%,美国36%。
国外企业的选择也能窥探一二。微软用DeepSeekV4做CopilotCowork低成本选项,西门子、Airbnb用中国模型。
凭啥这么能打?凭的是“架构换成本”这套骚操作。
Qwen3.5-Plus总参数3970亿,每次推理只激活大约170亿,MoE把激活参数压到最低,单次推理成本被摁得死死的。
DeepSeekV4-Pro输入3块钱、输出6块钱,不到ClaudeFable5同档位的十分之一。
腾讯云在报告里把这套全球定价结构形容成一座金字塔:旗舰、通用、轻量化三层,各层各的定价逻辑,井水不犯河水

(图片来源:《生活大爆炸》)
更骚的是,同一个厂商在两个市场玩两面派:国内高峰时段涨价薅羊毛,海外降价抢地盘,用国内赚的利润去补贴海外扩张。里外里,横竖不吃亏。
开发者这头的采购逻辑也彻底变了。一年前技术选型,大家纠结的是“全站到底接哪个模型”;到了2026年,问题变成了“任务分几层、每层接哪个”。多模型路由,按任务类型、难度、容错率,把请求分发给不同价位的模型,已经从极客玩具进化成了工程标配。
NVIDIA 8月开源了NeMoSwitchyard,LangChain的基准测试显示,光靠路由就能带来74%的成本优化。OpenRouter一个接口接了500多个活跃模型,累计路由量高达136万亿Token。
中型SaaS架构师技术博客写道:前端需求理解、架构评审、复杂代码生成走ClaudeFable5或GPT-5.6Sol,容错率低,错一次人工修复成本超模型差价。后端批量代码补全、单测生成、文档摘要、工单分类走DeepSeekV4-Flash或QwenFlash档,量大容错率高。
数据也印证了这套玩法。AICC报告显示,2026年Q1企业流量里,旗舰模型占比已经掉到31%,剩下69%全让中端和成本效率模型吃了。企业Token总成本同比降了67%,其中34个百分点纯粹是路由优化省下来的。旗舰和Flash档价差5到20倍,只要把20%的请求路由到便宜档,总账单直接砍掉60%以上。
但别高兴太早,这里有个陷阱。Token单价下降,企业AI账单却在上升。
数据显示,中国日均Token调用量从2024年初约1000亿涨到2026年3月约140万亿。一次Agent任务消耗约为线性workflow的30倍。知乎Agent联调63次烧1083万Token,产出不到2000字。
翻译一下,这就像手机的流量费降了,但你开始24小时刷4K视频,月底账单照样教你做人。
说到底,分层定价能成立,底层逻辑就两条:一是用量爆炸式增长,二是不同任务的质量要求天差地别。全都用旗舰,账单直接破产;全都用便宜货,核心环节错一次,损失比省下的钱还多。所以,市场只能分层,也只能分裂。
03
价格战尽头不是统一低价
可能有人觉得,这价格战打着打着,最后肯定是大家一起降价,市场收敛到个合理价位,然后拼服务、拼生态,跟云计算和芯片的历史一模一样。
这逻辑,乍一听很顺,像手机从大哥大到千元机。但这个认知有待商榷。大模型不一定走这条路,因为它不是“性能涨20%,价格涨20%”的线性商品。
传统IT产品性能与成本近似线性,快20%贵20%,用户按需挑选。大模型能力越强,开发者越敢交复杂任务;任务越复杂,模型思考越深,算力消耗越接近指数级。能力溢价随智能体任务普及被放大,自我强化循环,不会收敛。
用大白话来说就是,模型越聪明,人类越不当人,直接把烂摊子全扔给它,然后算力账单爆炸。
NVIDIA 5月的技术博客算过一笔账:Agentic系统消耗的Token,比标准聊天多15倍。ClaudeCode实测,33分钟处理了283个请求、烧掉数百万输入Token。就算有缓存压缩,Agent的消耗依然是传统聊天的十几倍。
腾讯云发布TokenHub时引用的预测更吓人:2026年3月,中国日均Token消耗超过140万亿,而2024年全年全球的消耗,才只有这个数字的十分之一。两年翻十倍以上,推手就是Agent。
《麻省理工科技评论》8月的文章点破了本质:DeepSeek涨价、OpenAI降价,是Agent改写了这场大模型价格战。到了Agent时代,成本不再取决于你问几个问题,而是取决于任务步骤数、上下文长度、思考Token量、失败次数,还有人工返工。每一步都在烧钱。
钱都烧到哪去了?烧到了HBM上,这玩意儿已经取代GPU,成了AI算力的第一刚需。Epoch AI的数据显示,HBM占AI芯片组件总成本的63%。
SemiAnalysis的报告更扎心:HBM供应缺口2025年是5%、2026年是6%、2027年要到9%,
厂商已经开始提前锁产能了。华为昇腾950DT报价25万以上,两个月直接涨了20%到50%。全球HBM缺口1.6亿颗,想全面替代,还得再等三到五年。
所以,需求侧就是永久分层的。合同法律审查,错一个条款赔几百万,用50美元的高端模型,一点都不贵;一万条客服工单,错几条无伤大雅,用0.5美元的模型都是浪费。奢侈品和日用品,永远不会互相替代,中间价位市场根本挤不出来。

(图片来源:《生活大爆炸》)
致同咨询的梁伟说得透彻:高附加值场景,用户买的是更低的失败率;低附加值场景,就用轻量模型加谷时折扣对付一下。
最能证明“贵有贵的道理”的,是Anthropic,它成了全球第一家单季盈利的主流大模型厂商。
2026年Q2营收预计109亿美元,环比暴涨127%,营业利润约5.59亿美元,比行业预测的2028年扭亏,整整提前了两年。到7月底,年度经常性收入突破650亿美元,相比2025年底的90亿,涨了七倍。
Anthropic凭啥赚钱?靠的是企业API这条大腿:大客户占比高,付费质量高。推理缓存技术把单位算力成本压下来,高端定价撑着高毛利,根本不靠走量。只要企业愿意为更低的失败率掏钱,50美元这个价就站得住。
爆妹儿觉得,未来能活下来的模型,只有两种,要么足够便宜,要么足够出色。便宜的吞掉底层,出色的霸占顶层,中间地带被挤得喘不过气。
摩根士丹利说,中国大模型正在从价格竞争转向智能竞争,DeepSeek上调API价格、Kimi K3和Qwen3.8-Max冲进大参数时代、开源授权条款收紧,都是信号。新浪财经也说了,中国模型市场已经离开统一低价获客的阶段,进入按任务价值、使用规模、算力约束分别定价的阶段。
04
结语
说到底,大模型之间的183倍价差,不是市场出了毛病,恰恰是市场走出婴儿期的标志。行业告别了“所有模型对标同一个标杆”的时代,进入按任务定价、按层竞争的新阶段。
高端守住价值最高的任务,便宜的吃掉流量最大的场景,中间地带被两头夹击。
定价逻辑也彻底转向了。以前大家比谁最强,排行榜分数决定溢价;现在比的是每美元能完成多少有效任务,任务结构决定价格。贵的模型,锁定那些错不起的核心环节;便宜的,接管规模最大的调用量。
选模型,已经变成一门资产配置的手艺:你得先摸清每类任务的容错边界,再在质量曲线和成本曲线的交叉点上下注。定价表就是战略地图,高端锚定智能上限,低端划定生态范围。
大模型正在变成电一样的基础设施,电价会按用途、时段、可靠性分级,DeepSeek搞峰谷定价,就是在向电力行业学习。
所以结论很扎心也很清晰,大模型不是一块铁板,而是一整层基础设施。它的定价,从过去到未来,几乎都不会统一。想等大模型白菜价?省省吧。
「风险提示:本文纯属个人观点,不构成任何投资、购买建议!」
题图来源:《生活大爆炸》
#deepseek #Claude #kimi #GPT #Qwen

END
公众号推送规则调整后
文章可能会乱序出现
不想错过「科技爆研所」的更新
记得设置为“星标”
常留言、点关注、不迷路