AI的数字炼金术:为何大模型如此耗电?

内容来源|本文摘编自机械工业出版社出版书籍《电力超级周期:AI 驱动的能源变革》王高峰 著责编 | 贾宁
第 9838 篇深度好文:6800 字 | 20 分钟阅读
当我们随手调用 AI 生成文案、依靠大模型辅助医学诊断、体验智能驾驶带来的便捷时,大多数人只会惊叹人工智能展现出的类人智慧,却很少留意这份智能背后隐藏的巨大能源代价。
AI 如同一位神奇的“数字炼金术士”,能够把海量原始数据淬炼为智能能力,但支撑这套炼金术运转的“炼金熔炉”,需要源源不断消耗巨量电力作为燃料。
高盛发布的行业报告给出了一组极具冲击力的预测:受 AI 产业高速扩张驱动,预计到 2030 年,全球数据中心电力需求相比 2023 年将激增 160%175%。按照 IEA 统计,2023 年全球数据中心总耗电量为 415 太瓦时,以此基数测算,2030 年 AI 带来的新增用电需求将达到 664726 太瓦时。
作为参照,世界最大水电站三峡电站的年发电量约 100 太瓦时。这就意味着,仅仅为了承接 AI 催生的新增电力缺口,全球需要额外投入相当于 7 座三峡水电站满负荷全年运行的发电产能。
看似简单的一次 AI 对话、一张 AI 生成图片,背后是数据中心成千上万芯片的高速运算。AI 的电力消耗主要来源于两大核心环节:训练与推理。
训练是耗时数周乃至数月的超大规模并行计算,是大模型完成知识积累的启蒙过程;推理则面向亿万终端用户,承担每一次实时交互请求,单次请求耗电微乎其微,但海量请求叠加之后,会形成规模恐怖的持续能源消耗。
本文结合行业公开数据、硬件运行逻辑、多行业真实应用场景,完整拆解 AI 能耗的来源、规模与分布,厘清智能技术爆发伴随的能源现实挑战。
一、训练:烧电的AI“启蒙仪式”,
一次学习耗掉小城年电量
1. 千亿参数模型的算力狂欢,每小时抵 300 家庭月用电
2025 年一个冬日深夜,北半球寒流席卷北美大陆,美国俄勒冈州哥伦比亚河畔的一座大型数据中心内部却维持着恒定的恒温环境。这里正在开展千亿参数大模型的最终训练冲刺。
控制室的监控屏幕上,电力消耗曲线长期维持在高位,这一集群每小时的耗电量,大致等同于 300 户普通家庭一整个月的用电总量。这样的场景,如今正在全球不计其数的数据中心反复上演。
国内某头部科技企业自研千亿参数大模型,仅完整训练阶段就消耗 1.2 亿千瓦时电能。这份庞大能耗并非统计数字的虚高,是上万块高端 AI 芯片密闭在机房中,数十天不间断满负载运算产生的真实代价。
单块英伟达 H100 显卡满负荷运行功率可达 700 瓦,一万张该型号显卡仅核心计算每小时就会消耗 7000 千瓦时电力,再叠加冷却、供电、存储配套设备的能耗,整套集群单日耗电量,足以覆盖一座小型城镇全部居民的日常用电。
大模型的训练,是 AI 的求学阶段。它不会在安静的软件环境里完成学习,而是依托上万块专业 GPU 搭建的超级算力集群,以吞噬海量文本、图像数据的方式完成知识积累。

想要让模型读懂人类语言、掌握常识逻辑,就必须投入难以想象的计算资源,而资源的具象体现就是源源不断的电力。
2. 训练的本质,用暴力算力换取机器认知
大模型训练的底层逻辑,是机器依靠海量重复计算,从海量原始数据当中归纳总结事物内在规律,逻辑上近似人类依靠大量阅读、刷题建立认知。但和人类学习截然不同,AI 没有主观理解能力,全部学习过程依靠暴力矩阵运算与参数迭代完成。
以经典的 GPT3 模型为例,它拥有 1750 亿个模型参数,相当于 AI 大脑内部的亿万神经连接。训练阶段,数万亿规模的文本素材被输入系统。
原始文本首先被拆解为 Token 词元,词元可以是一个词语、一个字或者一个音节,这是大模型能够识别的最小信息单元。随后词元被转化为高维数字矢量,送入拥有 96 层网络的 Transformer 架构当中。
在多层网络内部,每一组参数都在反复记录事物之间的关联,例如学习“狗属于动物”的基础常识,建立“下雨”和雨伞之间的因果联系。
正式训练流程分为预测与纠错两个循环。模型根据现有参数对下文内容做出预测,再将预测结果和真实标准答案进行比对。一旦预测出现偏差,系统就会启动反向传播机制,沿着网络链路回溯,批量调整内部数以亿计的参数权重,修正模型的判断偏差。
仅仅一次纠错迭代,就要完成数万亿次数学运算。想要让 AI 从逻辑混乱的胡言乱语进化到具备完备知识输出能力,这套预测纠错的循环,需要重复数百万次。
这就好比一名学生永无止境的刷题,每做错一道题目就要全面复盘修正。只不过 AI 的作业量是人类的亿万倍,为支撑这种超高强度循环运算,必须调动成千上万块高端算力芯片协同并行工作,电力消耗随之水涨船高。
3. 三大核心推手,推高训练阶段爆炸式能耗
①参数军备竞赛:盲目堆砌参数,催生大量无效耗电
AI 训练能耗指数级上涨,首要驱动因素就是行业持续多年的模型参数军备竞赛。2018 年主流大模型参数规模还停留在数十亿级别,到 2025 年,全球头部大模型参数规模相比 2023 年已经翻了十倍,对应的训练电耗同步增长 12 倍。
从 GPT2 的 15 亿参数,到 GPT3 的 1750 亿参数,再到 GPT4 突破万亿参数,每一次参数规模跃升,计算量都会迎来剧烈扩张。
参数增长带来的计算负担并非线性上升。参数数量翻倍,训练计算量往往迎来平方甚至立方级别的增长,模型内部参数之间的组合关联会呈指数膨胀。如同搭建巨型多米诺骨牌,仅仅增加一倍骨牌数量,规划倒塌路径需要付出的精力远不止翻倍。
能耗数据直观印证这一趋势:GPT2 完整训练能耗约 30 兆瓦时;GPT3 飙升至 1287 兆瓦时,能耗增幅达到 42 倍;GPT4 单次完整训练电耗进一步攀升至 5 万兆瓦时。换算成碳排放,这一训练过程相当于排放超 1.5 万吨二氧化碳,等同于 3000 台燃油汽车一整年尾气排放的总和。
更值得警惕的是,庞大模型当中,绝大多数参数实际处于无效工作状态。OpenAI 针对电路稀疏性的相关研究表明,针对特定业务任务,即便把模型 99.9% 权重清零,仅仅保留 0.1% 核心权重,依旧可以维持模型主要性能。
这说明当下大模型训练,大量电力被消耗在无效参数运算上,如同用高压水枪浇灌小花,资源投入远远超出实际业务需求。但在“参数越大能力越强”的行业惯性认知之下,企业依旧不断扩充模型规模,陷入性能提升与能耗暴涨的恶性循环。
②硬件集群:芯片功耗、散热系统双重电力黑洞
万亿参数大模型的训练,离不开大规模 GPU 硬件集群,而整套硬件本身就是巨大的电力消耗源。当前大模型训练高度依赖 GPU,GPU 擅长大规模并行计算,但硬件能效存在先天短板。
英伟达 A100 单卡功耗约 400 瓦,20252026 年主流 H100、H200 芯片单块功耗已经达到 700 瓦。一枚指甲盖大小的芯片,满负载发热功率等同于一台全力工作的家用电暖器,而训练集群当中,这类芯片动辄数千上万块同时运行。
一套千亿参数模型训练集群,通常配置 20005000 块高端 GPU,同时配套大量 CPU、高速内存、存储阵列与高速网络交换机。以 5000 块 H100 组成的集群举例,仅计算芯片总功率就达到 3500 千瓦,每小时直接耗电 3500 千瓦时。
这还只是算力芯片本身的直接能耗。GPU 高负载运行会产生巨量热量,如果温度过高会出现降速甚至硬件烧毁,数据中心必须部署庞大风冷或者液冷系统保障设备安全。行业用 PUE(电源使用效率)衡量机房整体能效,目前 AI 数据中心 PUE 普遍在 1.41.8。
该指标意味着,每向计算芯片输送 1 千瓦时电力,就要额外消耗 0.40.8 千瓦时电力用于散热降温。
有公开资料显示,OpenAI 训练 GPT3 过程中,冷却系统消耗清洁淡水多达 70 万升,除此之外,UPS 不间断电源、机房照明、安防监控等配套设施,还会产生大量隐性能耗。
除此之外,算力冗余进一步放大能源浪费。为应对训练突发故障、算力峰值波动,数据中心一般预留 20%-30% 的闲置算力资源。
谷歌内部生产环境统计显示,很多场景芯片实际利用率不足 50%。大量电力被用来维持并未参与运算的硬件待机运转,造成可观的能源浪费。
③规模闭环:集群扩张,能耗层层叠加
大模型训练是一套完整的系统工程,绝非单纯堆叠 GPU。GPU 之外,高速存储需要持续供电读取海量训练数据集;高速交换机需要不间断工作,保障上万块芯片之间高速数据互通;供电系统要持续转换高压市电适配芯片电压。
集群规模越大,配套硬件数量同步上涨,各类辅助设备能耗同步叠加,形成“算力扩张功耗上涨散热投入加大总能耗进一步抬升”的闭环。这也是为什么越是超大规模模型,单位有效算力对应的额外能耗占比越高。
4. 训练能耗总结
第一,大模型训练属于一次性、高强度的能源投入,是 AI 诞生的启蒙成本,普通企业无力承担,基本集中于头部科技企业;
第二,参数军备竞赛是能耗暴涨的核心推手,大量电力消耗在无效参数运算,单纯堆砌参数并不是最优技术路线;
第三,硬件本身高功耗,叠加散热、冗余算力、配套设施,会进一步放大整体能源消耗。
训练能耗只是 AI 能源故事的上篇,真正长期持续的压力,来自面向亿万用户的推理环节。
二、推理:细水长流的用电日常,
全民交互成能耗无底洞
1. 单次交互微耗电,累计总消耗反超训练
如果说训练是少数企业投入巨资完成的一次性算力狂欢,推理就是 AI 面向大众日复一日的日常用电。我们在对话框输入提问等待回答、自动驾驶实时解析道路环境、AI 工具生成短视频,每一次用户操作,都会触发模型推理流程。

单次推理请求的耗电量十分微小,可当全球数十亿用户高频调用,微小的单位能耗不断累积,推理整体耗电量已经超越训练环节。IDC 行业统计数据显示,2025 年全球 AI 推理电耗的增长速度,已经达到训练阶段的 2.3 倍,推理成为 AI 电力消耗真正的无底洞。
2024 下半年至 2025 年,AI 大模型正式进入大规模商业化落地周期,公有云平台大模型 API 调用量出现数倍级爆发。统计数据显示,2025 年上半年公有云大模型调用规模,对比 2024 全年提升接近 5 倍。
每一次接口调用都会触发推理计算,海量高频的用户交互,持续拉高全球整体电力需求。
2.推理的本质,调用已有知识解决现实问题
推理是大模型把训练阶段习得的知识转化为实际业务价值的核心环节。推理阶段不会修改、更新模型内部参数,只依靠前向传播完成计算,调用已经训练完成的固定模型,针对全新输入输出结果,逻辑近似人类运用过往学到的知识解答全新问题。但不更新参数,不等于计算量低,复杂任务的推理依旧要完成海量矩阵运算。
完整推理流程可以拆解为四个核心步骤。
第一步原料预处理:将用户输入的文字、图像拆解为 Token 基础单元,转化为机器可以识别的高维数字矢量;
第二步核心网络加工:信息送入 Transformer 网络,经过多层自注意力层与神经网络节点反复运算,挖掘输入信息内部逻辑关联;
第三步结果预测:基于计算结果,在海量备选词汇、特征当中计算输出内容的概率分布;
第四步循环产出,也就是自回归生成,机器逐词输出片段,再把输出内容回输进模型,反复迭代,直到生成完整回复。
以向 ChatGPT 输入 “请解释什么是人工智能” 举例。
点击发送之后,输入文本被切分成一组 Token,转化为矢量代码送入网络。自注意力层会计算所有词语之间的权重关联,识别出 “人工智能” 是句子核心主题。
经过数十层网络运算,模型输出词汇概率,优先输出概率最高的词语。输出第一个词之后,再把该词放回输入序列,重新完整运算,循环往复。
屏幕上看似瞬间弹出的回答,背后已经完成数十亿次矩阵运算。
谷歌 Gemini 的能效监测数据显示,单次智能化查询耗电约 0.24 瓦时,物理层面大致等同于家用微波炉启动瞬间运行 1 秒钟。单个请求能耗微乎其微,但是规模效应带来的总消耗不容小觑。
截至 2025 年末,每月超过 4.5 亿用户在谷歌各类产品当中使用 Gemini 能力。结合谷歌 2024 年全球数据中心总耗电 30.8 太瓦时,行业普遍估算 AI 负载占头部科技企业数据中心总耗电 20%25%,可以推算,2025 全年 Gemini 系列推理总耗电量大约 68 太瓦时,也就是 60 亿80 亿千瓦时。
仅仅一家企业的推理业务,就消耗了规模惊人的电力。
3. 推理能耗的扩散效应,全行业场景能耗分化
早期 AI 推理主要集中在大型云端数据中心,如今 AI 能力持续向各类终端渗透,推理场景高度碎片化,能耗扩散到各行各业,管控难度随之提升。
①云端高负载业务场景
自动驾驶是典型高能耗终端应用。
一台 L4 级别自动驾驶车辆,本质就是一台移动微型智算中心。车载 AI 系统需要实时解析激光雷达、摄像头、毫米波雷达海量传感器传回的数据,每一秒都要完成巨量推理计算。车载 AI 芯片持续运行功率可达数百瓦,相当于车内同时点亮数盏白炽灯。
倘若一座城市有十万台自动驾驶汽车上路,全部车辆推理的单日总能耗,会超过一座大型工业园区的用电规模。
医疗 AI 推理的能耗常常被大众低估。
AI 辅助诊断系统处理 CT、核磁共振影像时,需要对千万像素级医学图像逐点提取病理特征,单张影像的推理计算量,等同于大模型生成数万汉字文本。国内某三甲医院 AI 影像诊断中心,仅仅维持 5 台高性能诊断服务器不间断运行,日均耗电量就达到 800 千瓦时。
金融行业 AI 推理压力同样巨大。
高频交易 AI 需要在毫秒乃至微秒级完成海量市场数据分析,输出交易指令。为消除物理延迟,算力集群必须 24 小时满负载待命。同时风控系统对每一笔交易做并发推理校验,零延迟、低误报的硬性业务要求,推高持续电力消耗。
②海量边缘终端场景
推理能耗不只是大型机房的问题,海量边缘设备累积能耗同样不可忽视。智能手表健康 AI 监测、家居语音助手、商场客流分析设备,单台设备功耗很低,但设备基数庞大,多数保持全天候待机。
依据 2026 年行业测算,全球仅智能音箱一类交互终端,年度总耗电量突破 20 太瓦时,这一规模已经抵得上一座中型火电站全年发电量。
③不同行业推理能耗的不均衡分布
不同垂直领域 AI 推理能耗差异巨大。金融、医疗、法律这类高精密行业,单位业务对应的算力消耗,远高于教育、普通娱乐场景。
金融行业稳居推理能耗榜首。高频交易、实时风控,对响应时延有着极致要求,算力集群常年满负荷运转,电力消耗居高不下。
医疗行业能耗增长斜率最快,三维医学影像的高维度数据处理,加上手术机器人硬件热备待命机制,持续拉高功耗。
法律领域需要检索海量法条判例,多链路交叉校验保障严谨性,重复计算多,能效比偏低。
能源行业自身的 AI 应用也在快速消耗电力。
电网调度(包含风、光等绿色能源)的AI预测分布式节点,年耗电量增速超过 16%。高端制造业产线 AI 视觉检测系统,24 小时高频触发推理,单体功耗有限,但工厂大规模部署之后,会直接影响城市工业电力规划。
4. 案例总结
第一,推理单次请求能耗极低,但用户基数庞大、调用频次高,累计总能耗已经超过训练,成为长期能源压力来源;
第二,推理场景从云端向边缘终端扩散,能耗分布碎片化,增加统计与管控难度;
第三,行业之间能耗差距明显,对时延、精度有严苛要求的垂直行业,会产生更高的电力消耗;
第四,推理能耗会随着 AI 应用普及持续扩张,是未来 AI 能源挑战的核心战场。
三、AI 能耗的通用方法论:
看清智能背后的能源平衡
1.AI 两大环节能耗对比
训练环节属于一次性高投入能耗,发生在模型研发阶段,依靠大型 GPU 集群,主要浪费来自无意义参数堆砌、硬件冗余配置。只有少数头部企业具备承担成本的能力。
推理环节属于持续性海量消耗,发生在产品落地之后,单次请求能耗微小,依靠亿万次用户调用累积巨大能耗,压力伴随 AI 应用渗透持续增长。
AI 高耗电并不是技术发展的必然宿命,很大一部分能耗来自行业内卷式参数竞赛、硬件能效短板、应用场景无序扩张。技术本身可以创造智能,但不合理的技术路线会放大能源代价。

2. 降低 AI 能耗的可行路径
第一,模型算法层面:推动模型精简,通过稀疏化、蒸馏等技术裁剪无效参数,在保障业务能力前提下降低计算量,摒弃一味比拼参数规模的内卷思路。
第二,硬件与机房层面:迭代更高能效比的 AI 芯片,普及液冷等先进散热方案,优化算力调度,降低 PUE,减少不必要的算力冗余,提升芯片实际利用率。
第三,应用场景层面:做好算力统筹,区分云端大模型与端侧轻量化模型,不盲目在边缘设备部署重型大模型,根据业务需求匹配算力规模。
3. 核心认知
AI 数字炼金术,本质就是以能源换取智能价值。很多人把 AI 高耗电归结为技术原罪,但能耗高低取决于模型设计思路、硬件水平、落地场景三者共同作用。
训练环节告诉我们:AI 的诞生启蒙需要高昂能源成本,盲目内卷参数只会造成资源浪费;
推理环节告诉我们:AI 普及落地之后,亿万普通用户的每一次点击,都会汇聚成不容小觑的电力负担。
AI 革命不只是算法与软件的革命,同时也是一场能源效率革命。未来人工智能产业想要长久健康发展,必须在智能价值与能源代价之间找到平衡点。


*文章为作者独立观点,不代表笔记侠立场。
好文阅读推荐:分享、点赞、在看,3连3连!