← 文章 / AI技术
旎旎的学习笔记 6小时前 · 2026-09-09 17:44:41 · 3 阅读

AI风向标0909丨14.8GW背后,大模型到底需要多少算力?(下篇)

01

DAILY SIGNALS

今日科技新闻

01

百度把小度升级成家庭超级智能体

9月8日,百度宣布“超能小度”完成智能体化升级,同时推出闺蜜机、智能屏、摄像头和智能音箱四款新品。和过去“说一句、做一件事”的语音助手不同,新版小度开始尝试理解一个目标,再自主拆解任务、调用不同设备完成。比如家长把课表发给小度,它可以识别日程冲突、重新安排并同步到家里的智能屏;对音箱说“看看猫在不在书房”,它也可以调用摄像头判断后再给出答案。

02

字节被曝推进实时空间视频“世界模型”

媒体报道称,字节正在基于Seedance开发一款实时空间视频生成模型,张一鸣亲自协调跨部门团队和算力资源,最快可能在10月亮相,不过目前字节尚未正式确认。和普通视频模型“输入提示词、生成一段视频”不同,它想生成的是一个能跟着用户动作和声音实时变化的虚拟环境:你移动、转身或者说话,眼前的世界也会随之改变。未来可能与 Pico 打通,并应用于直播、短剧和游戏。视频生成正在从“生成一段内容”,进一步走向“生成一个可以进入和互动的世界”。

03

国内部分AI算力价格涨幅超过30%

腾讯云、阿里云、百度智能云等厂商陆续上调部分算力产品价格,部分服务最高涨幅超过30%。背后不仅是高端AI芯片、HBM、电力和网络等供给承压,更重要的是需求正在从“训练一次模型”转向“持续调用模型”:截至今年3月,中国日均Token调用量已经超过140万亿;2025年推理数据量也首次超过训练,未来推理算力需求甚至可能达到训练的3倍以上。

02

THE TOPIC

14.8GW背后,大模型到底需要多少算力?(下)

昨天我们从Anthropic签下14.8GW算力讲起,聊了什么是算力、为什么需要万卡集群,以及训练一个大模型为什么需要这么多GPU。

但昨天其实只讲了AI算力的一半。

如果把一款大模型从“被造出来”到“真正被我们使用”的过程稍微展开,它大致会经历三个阶段:

预训练(Pre-training) → 后训练(Post-training) → 推理(Inference)

先把这三个概念讲清楚。

从训练到推理,模型到底经历了什么?

第一步是预训练

我们可以把它理解成:先让模型学会大量基础知识和能力。

模型公司准备海量文本、图片、代码等数据,把这些数据不断输入模型。模型进行计算,根据预测结果不断调整内部参数。

这个阶段通常数据量巨大、训练时间长,也是我们昨天讲到万卡集群、大规模GPU并行计算时,最典型的场景。

经过预训练以后,我们得到的是一个已经拥有大量知识和基础能力的模型。

但这个时候,它还不一定是我们最终拿到手的ChatGPT或者Claude。

接下来通常还要经过第二个阶段:后训练(Post-training)。

如果说预训练是在让模型“学会更多东西”,那么后训练更像是在教模型:怎么把已经学会的能力更好地用出来。

比如让模型更好地理解和遵循人的指令、改善回答质量、提升推理能力,以及在特定任务上表现得更好。这里会涉及监督微调、偏好优化、强化学习等不同技术路线,不同模型公司的具体方法也不完全一样。

但对于我们今天理解算力来说,不需要把这些技术全部展开。只需要知道:预训练结束,并不意味着模型训练彻底结束了。

后训练同样需要大量计算,而且随着模型公司越来越重视推理、Agent和专业任务能力,后训练本身也正在变得越来越重要。所以如果把昨天讲的“训练算力”再拆细一点,其实包括:预训练算力 + 后训练算力。

完成这些以后,我们才得到一个真正准备拿出来服务用户的模型。

然后才进入第三个阶段:推理(Inference)。

推理可以理解成:让已经训练好的模型开始工作。

比如你今天打开Claude,问它:“帮我总结一下这份报告。”这时候Anthropic不会重新训练一次Claude。它做的是把你的问题交给已经训练完成的Claude模型,然后运行这个模型,计算应该给你什么结果。

路径就变成了:用户提出问题、问题被转换成Token、模型读取已有参数进行计算、一个Token一个Token生成结果、返回给用户

这就是推理。

所以训练和推理最简单的区别其实就是:

训练,是改变模型。

推理,是使用模型。

训练过程中,模型的参数会不断被更新;而推理过程中,模型通常不会因为你问了一个问题,就重新修改自己的基础模型参数。

它只是利用已经学到的东西,计算这一次应该输出什么结果。

所以对于一家大模型公司来说,其实一直存在两笔完全不同的账单:训练算力:花算力把模型造出来。推理算力:花算力让模型真正服务用户。

而这两笔账还有一个非常重要的区别。训练再贵,它依然是一项相对集中的任务。一代模型训练完成以后,这一次大规模训练最终会结束。

但是推理不一样。只要有人使用AI,推理就一直在发生。

你问Claude一个问题,需要推理。100万人同时使用Claude,需要同时处理大量推理请求。

如果未来有几亿人每天使用AI,甚至每个人背后还有多个Agent不停工作,那么推理就会从一次集中的计算任务,变成一条24小时不停运转的算力流水线

这也是为什么今天的大模型公司开始越来越重视推理算力。

训练和推理,用的是同一种算力卡吗?

既然训练和推理干的事情不一样,那它们使用的芯片是不是也不一样?

答案是:可以用同一种芯片,但关注的重点不太一样。

比如英伟达的H100、H200、B200,既可以用来训练大模型,也可以拿来做推理。但训练和推理对硬件的需求并不完全相同。

先看训练。训练一个大模型,需要处理海量数据,还要不断计算、更新模型参数。而且前沿模型往往需要几千甚至几万张GPU同时工作。所以训练特别看重几件事情:单张芯片的计算能力、显存容量和带宽,以及大量芯片之间的高速通信能力。

简单来说,训练更关心:能不能把一个巨大的计算任务,尽可能快地跑完。

这也是为什么昨天讲训练算力时,我们一直在讲万卡集群、HBM、高速网络和GPU之间的互联。因为对于训练来说,不只是每张卡要快:几万张卡还得一起快。

但到了推理,问题发生了变化。模型已经训练好了,不需要再不断更新模型参数。现在面对的问题变成:怎么用尽可能低的成本,快速处理源源不断的用户请求。

比如晚上8点,同时有100万人打开Claude。这个时候模型公司关心:一个用户要等多久才能看到第一个字?一张卡一秒钟能生成多少Token?同样100万次请求,需要多少张GPU?

一张GPU每天能够服务多少用户?所以推理阶段特别关注的是:延迟、吞吐、显存、能效和单位Token成本。

这也解释了为什么AI芯片市场并不是简单的:“最强的芯片 = 最适合所有AI任务的芯片”。

有些场景需要追求最强性能,有些场景更看重成本和能耗;有些模型需要巨大的显存,有些小模型则可以运行在更便宜的芯片上。

所以今天我们看到的AI算力市场,其实正在慢慢分化。

训练算力追求的是:怎么更快地把模型训练出来。

推理算力追求的是:怎么更便宜、更快地让模型服务更多人。

推理算力起来以后,芯片市场也开始变了

训练和推理对芯片的要求不同,这件事情最后也会直接反映到AI芯片市场上。

过去几年,我们讨论AI芯片的时候,谁能够训练大模型?

所以大家最关注的是英伟达H100、H200、B200,以及国内能够支撑大规模模型训练的高性能AI芯片。但随着大模型真正进入应用阶段,另一个市场正在迅速变大:推理。

IDC数据显示,2025年中国推理算力支出已经首次接近训练算力支出。它意味着AI芯片的需求正在从过去相对集中的“大模型训练”,向每天持续发生的“大模型使用”扩散。

而中国AI芯片市场本身也在快速变化。IDC数据显示,2025年中国云端AI加速卡出货量大约400万张。其中英伟达约220万张,占55%;国产AI芯片厂商合计约165万张,占到了41%。

国产厂商里面,华为昇腾约81万张,占整个市场约20%;阿里平头哥约26万张,百度昆仑芯和寒武纪分别约12万张。

再看中国:过去两个月,模型为什么突然加速迭代

理解了训练和推理的区别以后,再回头看最近两个月的中国大模型,会发现一个挺有意思的现象。

从7月到9月,中国模型进入了一轮非常密集的迭代期。

DeepSeek、Kimi、Qwen、GLM、混元等模型不断更新,从过去单纯比“谁的基础模型更强”,扩展到了代码、推理、Agent、多模态等方向。

如果把这些更新拉成一条时间轴:

7月|DeepSeek: 路透7月7日报道,DeepSeek正在开发自己的推理芯片;更关键的是,报道还提到,DeepSeek此前已经越来越多使用华为昇腾,4月发布的V4进行了昇腾适配,而V4-Flash的部分训练也使用了昇腾处理器。

7月16日|Kimi K3: Kimi K3发布后迅速获得大量用户,甚至因为需求超过计算容量,一度暂停新订阅。

7月31日|DeepSeek V4-Flash:开始明显强调“更少的计算换更强的Agent能力”。

8月12日|阿里Qwen 3.8:2.4T MoE模型正式开放。Qwen3.8-2.4T-A95B在8月12日正式上线,随后8月14日又推出27B版本。

8月31日—9月2日|模型继续向“Agent + 更低成本”推进。 8月31日GLM-5.3-Flash上线,公开信息直接强调通过稀疏注意力和线性注意力等方式,以更低成本提供更高智能水平;9月2日Qwen3.8-Max又更新,重点已经明显转向复杂工程项目、长程自主开发、多工具调度和协作Agent。

把这两个月放在一起看,会发现中国模型竞争背后其实同时发生了两件事情。

一边是:模型越来越强。

另一边是:大家也在想办法让越来越强的模型跑得更便宜。

这两件事情必须同时发生。

因为模型越来越大,如果每一次调用都需要更多、更贵的GPU,那么模型能力再强,也很难真正提供给几千万甚至几亿用户。

MoE让一个拥有巨大参数规模的模型,不必在每一次推理时都激活全部参数;量化可以降低模型运行所需要的显存和计算资源;推理框架、算子、编译器和软件系统不断优化,则是在想办法让同样一张芯片每天处理更多Token。

而在中国,这件事情还有另外一层意义:国产算力。

过去我们讨论国产AI芯片,经常问:“它能不能训练出世界最强的大模型?”

但到了推理时代,这个问题正在发生变化。因为真实的AI应用并不是每一次都需要世界上最强的GPU。有些场景追求极致性能,有些更看重显存,有些更在乎延迟。能不能稳定供货?跑这个模型需要多少钱?100万个Token还能不能再便宜一点?

这恰恰给国产AI芯片留下了一个很大的空间。

国产芯片不一定需要在每一个指标上都超过最先进的英伟达GPU。如果它能够针对国产模型做好适配,在真实业务里稳定运行,同时拥有更好的成本和供应优势,它就可能成为一个有竞争力的选择。

这可能也是中美AI竞争正在出现的一个有意思的差异。

美国头部模型公司正在提前锁定越来越多的GPU、数据中心和电力。Anthropic签下14.8GW,OpenAI也在规划更庞大的AI基础设施。

它们真正争夺的,其实不只是“更多算力”,而是:未来几年稳定、可用,而且能够快速扩张的算力供给。

而中国在高端AI芯片供应受到限制的情况下,除了继续增加国产算力供给,还更早面对了另一个问题:怎么把手里算力,用得更具性价比。

这并不意味着中国不需要更多算力,也不意味着单靠“效率”就能够弥补高端芯片上的差距。但它确实让模型、芯片和软件之间的协同优化变得更加重要。

所以写完上下两篇,再回头看Anthropic的14.8GW,AI时代可能同时存在两场算力竞赛:一场是谁能够获得更多算力。另一场比谁能够把同样的算力用得更好。

END NOTE

我是 Ninili,坚持|热爱|努力搬砖|初心依旧

原始来源: 旎旎的学习笔记

评论 (0)