← 文章 / 科技资讯
旎旎的学习笔记 1小时前 · 2026-09-08 16:02:14 · 1 阅读

AI风向标0908丨14.8GW背后,大模型到底需要多少算力?(上篇)

01

DAILY SIGNALS

今日科技新闻

01

字节跳动借了296亿美元,继续砸钱做AI

字节跳动近期获得约296亿美元银团贷款,最初计划融资200亿美元,但由于银行认购需求旺盛,最终扩容至296亿美元,近30家银行参与。这也是2026年以来亚洲第二大美元计价贷款,仅次于软银的400亿美元融资。贷款期限为3年,并可延长至最长5年。

02

华为用量产数据回应“韬定律”散热问题

华为何庭波最新研究进一步回应“韬定律”的一个关键问题:芯片通过3D逻辑折叠提高晶体管密度后,会不会带来更严重的功耗和散热压力?公开的麒麟2026数据显示,在相同制程节点下,相比麒麟9030 Pro,其晶体管密度提升55%,功耗下降41%,CPU主频提升13%。这意味着,在先进制程继续突破越来越困难的情况下,除了继续拼“几纳米”,通过芯片架构创新提升性能,也正在成为另一条技术路线。

03

国产AI芯片收入增长,现金流压力也在上升

2026年上半年,国产AI芯片“四小龙”收入集体增长:摩尔线程营收17.36亿元,同比增长147%;沐曦13.2亿元,增长45%;壁仞12.4亿元,增长近20倍;天数智芯9.46亿元,增长192%。但卖得越多,对现金的需求也越大。为了提前锁定晶圆、HBM等紧缺产能,沐曦上半年预付款达到约22亿元,较去年底增长163%;与此同时,多家公司存货和应收账款也明显增加。

02

THE TOPIC

14.8GW背后,大模型到底需要多少算力?

9月7日,据The Information报道,从去年10月以来,Anthropic已经签下了至少14.8GW的新增算力容量协议。按照目前已经披露的云计算、芯片和数据中心协议估算,未来十年的潜在成本最高可能达到5170亿美元

与此同时,Anthropic还在为接下来的IPO做准备。路透此前报道称,公司正在接近敲定一笔约150亿美元的循环信贷额度

看到这里,先说一个概念:GW,GW是一个功率单位。1GW等于10亿瓦。

14.8GW换成我们更熟悉的电费,中国居民第一档电价因地区不同,大致在每度电0.4—0.6元左右,例如广东约0.64元/度、江西约0.60元/度、四川约0.53元/度。

我们简单按0.6元/度来算。

如果14.8GW的设备真的全天24小时满负荷运行,那么一天消耗的电量大约是14.8GW × 24小时 = 3.552亿度电。

对应的电费大约是:2.13亿元一天。

当然,这只是一个为了帮助理解规模的极简换算。

实际AI数据中心不会按照居民电价结算,也不一定全年满负荷运行;不同地区、峰谷时段、长期购电协议都会影响真实电价。

而且14.8GW本身也不是Anthropic今天实际消耗的电力,而是未来几年已经签约和规划涉及的计算容量。

但即便只是一个粗略换算,也足以说明它的量级。与此同时,我们上面说的也是按照中国的用电来计价,如果换成美国,整体的用电金额可能会更夸张,但是对于他们说最头疼的不光光是费用,而是“电不够用了”。

这里的“缺电”,并不是说美国全国已经没有足够的发电量,而是AI数据中心的用电需求增长得太快,原有的电网和电力基础设施跟不上了。

过去很长一段时间,美国用电需求增长相对缓慢,电网也是按照这种节奏建设的。但AI出现以后,一个新的数据中心可能一上来就需要几百MW,甚至向GW级发展。

美国能源信息署预计,受大型计算设施特别是数据中心推动,美国正在经历2000年以来最强的一轮持续用电增长。更直观的是,美国劳伦斯伯克利国家实验室预计,到2030年,数据中心可能消耗美国11.8%左右的电力,在不同情景下甚至可能达到9.5%—15.3%。

问题在于:数据中心可以两三年建起来,电网却没有这么快。

建设新的发电设施、变电站和高压输电线路,再到最终并网,往往需要更长时间。而且美国不同地区的电网相对分散,即使别的地方有电,也不意味着能够马上把这些电送到数据中心集中的地方。

这个矛盾现在已经开始真正出现。

以美国最大电网PJM为例,2026年上半年输电拥堵成本已经升至约60亿美元,同比增长43%;而全球数据中心最密集的北弗吉尼亚,正是拥堵比较严重的地区之一。

德州的情况更加夸张。

2023年以来,申请接入德州电网的大型数据中心等项目需求已经从约48GW增加到超过474GW。虽然其中包含大量重复申请和可能最终不会建设的“幽灵需求”,但增长速度已经快到德州开始暂停部分新的数据中心并网,并重新审核哪些项目真的会落地。

而中国面对的情况又不太一样。

中国拥有庞大的电力系统和数据中心建设能力,但在AI算力扩张上,还有一个更加现实的约束:高端AI芯片。

所以如果把两边的情况稍微简化一下,会出现一个很有意思的差异:美国有先进芯片,但正在想办法给越来越多的芯片找电;中国有庞大的电力和基础设施能力,但还在想办法让更多国产芯片撑起AI计算。

但是不管缺什么,在AI时代下,有一种东西是大家都缺的,那就是:可用的算力。

什么是算力?

算力,就是计算机处理数据、完成计算的能力。

比如我们问AI:“这张图片里有没有一只猫?”AI并不是像人一样真正“看见”了一只猫。图片首先会被转换成大量数字,然后这些数字进入神经网络,经过一层又一层计算,最后模型得出一个结果:这里大概率有一只猫。

模型越来越大,需要处理的数据越来越多,背后的计算也越来越复杂。能够以多快的速度、多大的规模完成这些计算,就是我们所说的算力。

那算力从哪里来?

最直接的答案就是:芯片。

我们平时电脑里的CPU当然也有算力,但到了大模型时代,真正被大量使用的是更擅长并行计算的GPU和各种AI加速芯片。

这也是为什么过去几年,只要聊AI算力,就绕不开英伟达。

从A100、H100、H200,到后来的Blackwell,再到新一代Rubin,英伟达一直在提供越来越强的AI计算能力。

除了英伟达以外,各个大厂都在构建属于自己的芯片。

Google有自己的TPU,Amazon有Trainium,AMD有Instinct;中国也有华为昇腾,以及寒武纪、摩尔线程、沐曦等AI计算芯片。

所以我们平时听到的:英伟达算力、国产算力、昇腾算力、云上算力……

有1万张GPU,就有1万张GPU的算力吗?

答案其实是:不一定。

这也是为什么现在的大模型公司里,还有一项非常重要的能力:AI Infra,也就是AI基础设施。

如果说芯片解决的是“有没有算力”,那么AI Infra解决的是:怎么把这些算力真正用起来。一家公司买了1万张GPU,并不意味着它立刻就拥有了1万张GPU的有效算力。这些GPU要被装进服务器,通过高速网络连接;训练数据要快速送到每一张卡上;不同GPU之间还需要不断交换计算结果。

模型太大,一张卡装不下,还要把模型拆到几十、几百甚至几千张GPU上共同计算。其中任何一个环节跟不上,都可能出现一种非常昂贵的情况:GPU买回来了,但GPU在“等”。

所以AI Infra真正要解决的是:怎么把芯片、服务器、网络、存储、软件、电力和散热组织成一套高效运行的计算系统。

同样是1万张GPU,两家公司因为集群调度、通信效率和软件优化不同,最终真正能够用于模型训练的有效算力可能差很多。

而这些效率最终都会变成成本。

同一个模型,如果训练时间能够缩短;同样一张GPU,如果每天能够完成更多计算;同样1万张卡,如果能够让更多芯片保持高效工作——这些看起来只是工程上的优化,最后节省的都是真金白银。

所以今天的大模型竞争,其实至少有两层:上面是模型能力的竞争,下面是AI Infra效率的竞争。

模型规模越大,下面这一层就越重要。

从一张GPU,到万卡集群

一张GPU当然可以运行AI。但训练今天最前沿的大模型,一张卡远远不够。于是工程师会先把多张GPU装进一台服务器,再把大量服务器通过高速网络连接起来。

最后就形成了我们经常在新闻里看到的:万卡集群。

所以“万卡集群”并不是一张超级大的显卡,而是想办法让上万张AI芯片像一台巨型计算机一样共同工作。

模型训练的时候,这些GPU需要不断交换数据。

其中一张卡计算得很快,但如果它算完以后要等其他卡,整个系统的效率还是会下降。

所以当算力规模越来越大,竞争的重点也开始从:谁能让更多芯片一起高效工作。

这也是为什么AI算力发展到今天,高速网络、交换机、光模块、HBM甚至软件系统的重要性都在上升。

算力已经从一张芯片,变成了一套系统。

那训练一个大模型,到底需要多少算力?

这里还有一个特别容易产生误解的地方。

我们经常看到新闻说:“某个模型用了1万张GPU训练。”

于是很容易理解成:1万张GPU = 这个模型需要的算力。

其实不是。

举一个极端简化的例子:1000张GPU训练100天;和1万张GPU训练10天;两者消耗的总计算资源可能处于接近的数量级。

所以真正衡量训练一个大模型需要多少计算资源,至少要同时看:什么芯片 × 多少张 × 跑多长时间。

还要再加上模型规模、训练Token数量、芯片利用率和算法效率。

这也解释了为什么AI公司如此执着于建设更大的集群。

对于前沿模型公司来说,更大的集群意味着:同样一次实验,可以更快跑完。

以前需要三个月训练的模型,如果能够缩短到一个月,团队就可能多做几轮实验、更快发现问题,也更早开始下一代模型。

所以算力在模型竞争里买到的,其实还有一样非常重要的东西:时间。

再回到Anthropic的14.8GW

到这里,再看开头的14.8GW,它背后是一座座数据中心、一排排服务器、大量AI芯片,以及把这些芯片连接起来的网络、存储、软件、电力和散热系统。

这也是为什么AI公司发展到今天,越来越不像我们过去理解的一家纯软件公司。为了训练下一代模型,它们开始提前锁芯片、锁数据中心,甚至开始锁电。

Anthropic签下14.8GW,本质上也是在提前锁定未来几年继续训练和迭代Claude所需要的基础设施。

而且,这还只是训练算力

模型训练完成之后,每一次用户和Claude对话、每一次AI写代码、每一个Agent执行任务,其实还会继续消耗另一种算力:

推理算力。这个我们明天再聊。

END NOTE

我是 Ninili,坚持|热爱|努力搬砖|初心依旧

原始来源: 旎旎的学习笔记

评论 (0)