AI风向标0909丨14.8GW背后,大模型到底需要多少算力?(下篇)
01DAILY SIGNALS
今日科技新闻
01百度把小度升级成家庭超级智能体
9月8日,百度宣布“超能小度”完成智能体化升级,同时推出闺蜜机、智能屏、摄像头和智能音箱四款新品。和过去“说一句、做一件事”的语音助手不同,新版小度开始尝试理解一个目标,再自主拆解任务、调用不同设备完成。比如家长把课表发给小度,它可以识别日程冲突、重新安排并同步到家里的智能屏;对音箱说“看看猫在不在书房”,它也可以调用摄像头判断后再给出答案。
02字节被曝推进实时空间视频“世界模型”
媒体报道称,字节正在基于Seedance开发一款实时空间视频生成模型,张一鸣亲自协调跨部门团队和算力资源,最快可能在10月亮相,不过目前字节尚未正式确认。和普通视频模型“输入提示词、生成一段视频”不同,它想生成的是一个能跟着用户动作和声音实时变化的虚拟环境:你移动、转身或者说话,眼前的世界也会随之改变。未来可能与 Pico 打通,并应用于直播、短剧和游戏。视频生成正在从“生成一段内容”,进一步走向“生成一个可以进入和互动的世界”。
03国内部分AI算力价格涨幅超过30%
腾讯云、阿里云、百度智能云等厂商陆续上调部分算力产品价格,部分服务最高涨幅超过30%。背后不仅是高端AI芯片、HBM、电力和网络等供给承压,更重要的是需求正在从“训练一次模型”转向“持续调用模型”:截至今年3月,中国日均Token调用量已经超过140万亿;2025年推理数据量也首次超过训练,未来推理算力需求甚至可能达到训练的3倍以上。
02THE TOPIC
14.8GW背后,大模型到底需要多少算力?(下)
昨天我们从Anthropic签下14.8GW算力讲起,聊了什么是算力、为什么需要万卡集群,以及训练一个大模型为什么需要这么多GPU。
但昨天其实只讲了AI算力的一半。
如果把一款大模型从“被造出来”到“真正被我们使用”的过程稍微展开,它大致会经历三个阶段:
预训练(Pre-training) → 后训练(Post-training) → 推理(Inference)
先把这三个概念讲清楚。
从训练到推理,模型到底经历了什么?
第一步是预训练。
我们可以把它理解成:先让模型学会大量基础知识和能力。
模型公司准备海量文本、图片、代码等数据,把这些数据不断输入模型。模型进行计算,根据预测结果不断调整内部参数。
这个阶段通常数据量巨大、训练时间长,也是我们昨天讲到万卡集群、大规模GPU并行计算时,最典型的场景。
经过预训练以后,我们得到的是一个已经拥有大量知识和基础能力的模型。
但这个时候,它还不一定是我们最终拿到手的ChatGPT或者Claude。

接下来通常还要经过第二个阶段:后训练(Post-training)。
如果说预训练是在让模型“学会更多东西”,那么后训练更像是在教模型:怎么把已经学会的能力更好地用出来。
比如让模型更好地理解和遵循人的指令、改善回答质量、提升推理能力,以及在特定任务上表现得更好。这里会涉及监督微调、偏好优化、强化学习等不同技术路线,不同模型公司的具体方法也不完全一样。
但对于我们今天理解算力来说,不需要把这些技术全部展开。只需要知道:预训练结束,并不意味着模型训练彻底结束了。
后训练同样需要大量计算,而且随着模型公司越来越重视推理、Agent和专业任务能力,后训练本身也正在变得越来越重要。所以如果把昨天讲的“训练算力”再拆细一点,其实包括:预训练算力 + 后训练算力。
完成这些以后,我们才得到一个真正准备拿出来服务用户的模型。

然后才进入第三个阶段:推理(Inference)。
推理可以理解成:让已经训练好的模型开始工作。
比如你今天打开Claude,问它:“帮我总结一下这份报告。”这时候Anthropic不会重新训练一次Claude。它做的是把你的问题交给已经训练完成的Claude模型,然后运行这个模型,计算应该给你什么结果。
路径就变成了:用户提出问题、问题被转换成Token、模型读取已有参数进行计算、一个Token一个Token生成结果、返回给用户
这就是推理。

所以训练和推理最简单的区别其实就是:
训练,是改变模型。
推理,是使用模型。
训练过程中,模型的参数会不断被更新;而推理过程中,模型通常不会因为你问了一个问题,就重新修改自己的基础模型参数。
它只是利用已经学到的东西,计算这一次应该输出什么结果。
所以对于一家大模型公司来说,其实一直存在两笔完全不同的账单:训练算力:花算力把模型造出来。推理算力:花算力让模型真正服务用户。

而这两笔账还有一个非常重要的区别。训练再贵,它依然是一项相对集中的任务。一代模型训练完成以后,这一次大规模训练最终会结束。
但是推理不一样。只要有人使用AI,推理就一直在发生。
你问Claude一个问题,需要推理。100万人同时使用Claude,需要同时处理大量推理请求。
如果未来有几亿人每天使用AI,甚至每个人背后还有多个Agent不停工作,那么推理就会从一次集中的计算任务,变成一条24小时不停运转的算力流水线。
这也是为什么今天的大模型公司开始越来越重视推理算力。
训练和推理,用的是同一种算力卡吗?
既然训练和推理干的事情不一样,那它们使用的芯片是不是也不一样?
答案是:可以用同一种芯片,但关注的重点不太一样。
比如英伟达的H100、H200、B200,既可以用来训练大模型,也可以拿来做推理。但训练和推理对硬件的需求并不完全相同。
先看训练。训练一个大模型,需要处理海量数据,还要不断计算、更新模型参数。而且前沿模型往往需要几千甚至几万张GPU同时工作。所以训练特别看重几件事情:单张芯片的计算能力、显存容量和带宽,以及大量芯片之间的高速通信能力。
简单来说,训练更关心:能不能把一个巨大的计算任务,尽可能快地跑完。
这也是为什么昨天讲训练算力时,我们一直在讲万卡集群、HBM、高速网络和GPU之间的互联。因为对于训练来说,不只是每张卡要快:几万张卡还得一起快。
但到了推理,问题发生了变化。模型已经训练好了,不需要再不断更新模型参数。现在面对的问题变成:怎么用尽可能低的成本,快速处理源源不断的用户请求。
比如晚上8点,同时有100万人打开Claude。这个时候模型公司关心:一个用户要等多久才能看到第一个字?一张卡一秒钟能生成多少Token?同样100万次请求,需要多少张GPU?
一张GPU每天能够服务多少用户?所以推理阶段特别关注的是:延迟、吞吐、显存、能效和单位Token成本。
这也解释了为什么AI芯片市场并不是简单的:“最强的芯片 = 最适合所有AI任务的芯片”。
有些场景需要追求最强性能,有些场景更看重成本和能耗;有些模型需要巨大的显存,有些小模型则可以运行在更便宜的芯片上。
所以今天我们看到的AI算力市场,其实正在慢慢分化。
训练算力追求的是:怎么更快地把模型训练出来。
推理算力追求的是:怎么更便宜、更快地让模型服务更多人。
推理算力起来以后,芯片市场也开始变了
训练和推理对芯片的要求不同,这件事情最后也会直接反映到AI芯片市场上。
过去几年,我们讨论AI芯片的时候,谁能够训练大模型?
所以大家最关注的是英伟达H100、H200、B200,以及国内能够支撑大规模模型训练的高性能AI芯片。但随着大模型真正进入应用阶段,另一个市场正在迅速变大:推理。
IDC数据显示,2025年中国推理算力支出已经首次接近训练算力支出。它意味着AI芯片的需求正在从过去相对集中的“大模型训练”,向每天持续发生的“大模型使用”扩散。
而中国AI芯片市场本身也在快速变化。IDC数据显示,2025年中国云端AI加速卡出货量大约400万张。其中英伟达约220万张,占55%;国产AI芯片厂商合计约165万张,占到了41%。
国产厂商里面,华为昇腾约81万张,占整个市场约20%;阿里平头哥约26万张,百度昆仑芯和寒武纪分别约12万张。

再看中国:过去两个月,模型为什么突然加速迭代
理解了训练和推理的区别以后,再回头看最近两个月的中国大模型,会发现一个挺有意思的现象。
从7月到9月,中国模型进入了一轮非常密集的迭代期。
DeepSeek、Kimi、Qwen、GLM、混元等模型不断更新,从过去单纯比“谁的基础模型更强”,扩展到了代码、推理、Agent、多模态等方向。
如果把这些更新拉成一条时间轴:
7月|DeepSeek: 路透7月7日报道,DeepSeek正在开发自己的推理芯片;更关键的是,报道还提到,DeepSeek此前已经越来越多使用华为昇腾,4月发布的V4进行了昇腾适配,而V4-Flash的部分训练也使用了昇腾处理器。
7月16日|Kimi K3: Kimi K3发布后迅速获得大量用户,甚至因为需求超过计算容量,一度暂停新订阅。
7月31日|DeepSeek V4-Flash:开始明显强调“更少的计算换更强的Agent能力”。
8月12日|阿里Qwen 3.8:2.4T MoE模型正式开放。Qwen3.8-2.4T-A95B在8月12日正式上线,随后8月14日又推出27B版本。
8月31日—9月2日|模型继续向“Agent + 更低成本”推进。 8月31日GLM-5.3-Flash上线,公开信息直接强调通过稀疏注意力和线性注意力等方式,以更低成本提供更高智能水平;9月2日Qwen3.8-Max又更新,重点已经明显转向复杂工程项目、长程自主开发、多工具调度和协作Agent。

把这两个月放在一起看,会发现中国模型竞争背后其实同时发生了两件事情。
一边是:模型越来越强。
另一边是:大家也在想办法让越来越强的模型跑得更便宜。
这两件事情必须同时发生。
因为模型越来越大,如果每一次调用都需要更多、更贵的GPU,那么模型能力再强,也很难真正提供给几千万甚至几亿用户。
MoE让一个拥有巨大参数规模的模型,不必在每一次推理时都激活全部参数;量化可以降低模型运行所需要的显存和计算资源;推理框架、算子、编译器和软件系统不断优化,则是在想办法让同样一张芯片每天处理更多Token。
而在中国,这件事情还有另外一层意义:国产算力。
过去我们讨论国产AI芯片,经常问:“它能不能训练出世界最强的大模型?”
但到了推理时代,这个问题正在发生变化。因为真实的AI应用并不是每一次都需要世界上最强的GPU。有些场景追求极致性能,有些更看重显存,有些更在乎延迟。能不能稳定供货?跑这个模型需要多少钱?100万个Token还能不能再便宜一点?
这恰恰给国产AI芯片留下了一个很大的空间。
国产芯片不一定需要在每一个指标上都超过最先进的英伟达GPU。如果它能够针对国产模型做好适配,在真实业务里稳定运行,同时拥有更好的成本和供应优势,它就可能成为一个有竞争力的选择。
这可能也是中美AI竞争正在出现的一个有意思的差异。
美国头部模型公司正在提前锁定越来越多的GPU、数据中心和电力。Anthropic签下14.8GW,OpenAI也在规划更庞大的AI基础设施。
它们真正争夺的,其实不只是“更多算力”,而是:未来几年稳定、可用,而且能够快速扩张的算力供给。
而中国在高端AI芯片供应受到限制的情况下,除了继续增加国产算力供给,还更早面对了另一个问题:怎么把手里算力,用得更具性价比。
这并不意味着中国不需要更多算力,也不意味着单靠“效率”就能够弥补高端芯片上的差距。但它确实让模型、芯片和软件之间的协同优化变得更加重要。
所以写完上下两篇,再回头看Anthropic的14.8GW,AI时代可能同时存在两场算力竞赛:一场是谁能够获得更多算力。另一场比谁能够把同样的算力用得更好。
END NOTE
我是 Ninili,坚持|热爱|努力搬砖|初心依旧