AI大模型越训越大,为什么几家巨头反而踩了刹车
9 月 16 日,央广网发了一篇报道,标题里有个词很扎眼:踩刹车。
说的是大模型训练进入十万卡时代,头部厂商反而在节奏上收着走了。
一边是 9 月里 28 个新模型扎堆发布,一边是"踩刹车",这两件事放一起,得掰扯清楚。
先看这个 9 月有多猛
9 月 1 日 Anthropic 发 Claude Fable 5.1,9 月 3 日 OpenAI 发 GPT-6 Astra,9 月 10 日 DeepSeek 发 V4.1-Flash,9 月 21 日 xAI 发 Grok 4.7。11 天里 28 个模型,最多的一天一口气发了 7 个。
这个节奏不是巧合,是谁家先动、对手几个小时内就得跟的军备赛。
GPT-6 Astra 烧掉了什么
GPT-6 Astra 是 OpenAI 史上最大规模的训练项目,用了超过 10 万块 GPU。十万卡是什么概念,一座超算中心的规模,电费、卡钱、机房,全是天文数字,这个不用展开,常识就能算明白。
支撑这一切的,是一个叫 Scaling Law 的东西,翻译过来是缩放定律。
2020 年 OpenAI 发过一篇论文,结论是:只要同步往上堆参数、堆数据、堆算力,模型能力就会沿着一条可预测的曲线往上涨。
过去几年,全行业就是照着这张图烧钱的。
刹车踩在哪
国金证券的分析师在采访里给了两句话,放在一起看就有意思了。第一句:Scaling Law 还没有被打破,堆料依然有效。第二句:超过某个临界点后,效果的边际改善在放缓。
翻译成人话:钱还能换能力,但兑换率在跌。以前一块钱能买两分进步,现在一块钱可能只买半分。
刹车不是不踩油门了,是不愿意再为那半分进步翻倍烧钱了。
实际的动作说明了一切
看各家 9 月实际发了什么,比听发布会实在。
28 个模型里,带 Flash、Lite 这种后缀的占了一大片,全是效率款。DeepSeek 干脆换架构,把推理效率拉上去,价格压到每百万输出 token 1.2 美元。OpenAI 出的 Sol 和 Luna,主打快和便宜,API 价格降一半。
旗舰照冲,那是撑门面的;真正打市场的是便宜、快、够用这一档。一边往上够天花板,一边把地板铺厚,两手都在做,钱更多流向了后者。
这事对普通人是好事
巨头踩刹车,用户是受益的一方。竞争从"谁训练得最贵"转向"谁的单位成本最低",最后传导下来就是你用 AI 越来越便宜、越来越快。
下次再看到"参数又翻倍了"的新闻,可以平淡一点。真正影响你钱包的消息长这样:哪家把同样任务的成本又砍了一半。
盯价格表,比盯参数表有用。
(本文由 AI 辅助整理,内容为作者本人实操核对)