软件或成破解超大规模AI能耗困境的最简方案
数据中心的能源需求持续飙升。据国际能源署预测,到2030年,仅满足AI需求就需消耗945TWh电力,这一规模相当于日本目前的用电量。能源紧缺不可避免,而业界的应对之策主要集中在物理层面:研发更高能效的GPU,并从本已紧张的电网中获取更多电力供应。但将目光局限于硬件真的明智吗?或许,通过缩减这些机器上运行的软件负载,才更有潜力实现节电。
Uptime Institute 2025年的调查显示,过去六年来,平均电能使用效率(PUE)几乎停滞不前。PUE指标能反映冷却和供电系统是否浪费,却无法衡量服务器上运行的软件是否在做有价值的工作。考虑到现代数据中心中服务器约占电力需求的60%,而冷却能耗在高效超大规模数据中心中仅为7%左右,在企业级低效设施中则可能超过30%,从软件端挖掘能效提升空间显然是合理的。
密歇根大学计算机与工程专业博士生、ML.Energy 计划研究人员 Jae-Won Chung 在接受 Tom’s Hardware Premium 采访时指出:“对于看似核心问题的答案——‘软件或算法能否实质性帮助电力和能源问题?’——答案是肯定的,百分之百有效。”
Chung 认为,计算机系统应视为一个堆栈,底层是硬件,上层依次是系统软件、算法和应用。硬件端最难处理:芯片更换缓慢且成本高昂。但其余三层变更起来更容易,且在这些层面取得的任何效率提升都可以复利效应般累积放大。
ML.Energy 对阿里 Qwen 3 235B A22B Thinking 模型的测试显示,在解题任务上,用 FP8 这种精度稍低的格式做推理,能耗比 bfloat16 版本低了三分之一。Chung 自己开发的 Perseus 训练优化器则找出大模型训练任务中负载较轻的部分,让它们放慢节奏,与繁忙部分同步完成。这套系统在不降低吞吐量、不改动硬件的情况下,最多省下了 30% 的训练能耗。
这不是技术爱好者在边缘上的小打小闹:一些最大的 GPU 厂商也在做类似的事。Nvidia 的 Blackwell 功耗配置会根据工作负载,精细调整 GPU 算力与显存频率、功耗上限、NVLink 状态和缓存设置。Nvidia 认为这样做最多可省 15% 的能耗,同时保留 97% 以上的整体性能,让受电力限制的设施能运行更多 GPU,吞吐量最多提升 13%。
"机房里最吵的那排机架"
SHI 数据中心基础设施业务开发经理 Chetan Visrolia 在接受 Tom's Hardware Premium 采访时表示,他见到的最明显的浪费,往往来自运行旧代码的老旧设备。"这是最容易摘的果子,能快速省钱,"他说,"任何数据中心都能找到,因为它就是机房里最吵的那排机架。"
云实例也可以做更合理的规格匹配,反复使用的 AI 提示词可以缓存起来,而不是每次都重新计算。让小模型处理常规请求、把大模型留给难题,也能提高效率。与此同时,更好的批处理和编译器可以提升加速器利用率,压缩提示词并限制输出长度,也能减少处理的 token 数量。
软件还能改变用电的时间和地点。苏黎世联邦理工学院(ETH Zurich)自动控制实验室博士生 Sophie Hall 研究过 Google 全球数据中心集群的负载转移,她在接受 Tom's Hardware Premium 采访时认为,耗电量本身未必是主要问题。
“更像是在问:他们什么时候用、在哪里用、以及它与电网如何互动?”她说道。如果批量任务对时间不敏感,就可以将其延迟到本地需求低谷期执行,或者调度到拥有闲置容量且电力碳足迹更低的区域。Hall 的研究通过提前一天的规划和实时调度来响应电网信号,同时确保性能保证。 Hall 表示,当超大规模云厂商建设的产能远超实际需求且电网并非瓶颈时,采取此类行动的需求并不大。但 对 AI 的巨大需求 改变了这一局面。 不过,这里也存在限制:各国的数据主权规定可能禁止工作负载跨境传输,而推理提供商也可能担心将大型数据集在网络中移动可能带来的风险。“数据需要在物理和地理上移动到另一个位置,”Hall 说,“这并不容易。” AI 驱动的超大规模数据中心需求意味着,软件并非万能药,也不能替代更先进的芯片和新的电力基础设施。但它可以作为一层控制机制,从那些 成本日益高昂 的资产中榨取每一滴潜力,同时帮助将需求转移至产能充裕的地方。 杰文斯悖论(Jevons’ paradox)也在起作用,在考虑让系统运行得更高效时必须将其纳入考量。如果节省的每一瓦电力都被用于生成更多的 token,效率提升并不能降低设施的电耗。“电力是 AI 数据核心的瓶颈,”Chung 说。“我们确实希望最有效地利用消耗的每一瓦电力。”