报告:AI 价格崩跌速度超越摩尔定律
比 DNA 测序和 20 世纪算力降得更快
Epoch 的报告用它所说的"人工思维"(artificial thought)的相对成本勾勒出一幅惊人的图景:AI 的成本在短短五年内下降了数十万倍。相比之下,报告显示锂电池在 1991 到 2024 年间,近 25 年里"只"下降了 100 倍。算力则是降幅最大的,自 1940 年起 60 年间下降了数千亿倍。 这一点尤其值得关注,因为过去 60 年的大部分时间里,Moore's Law 一直是不变的规律。算力的性能和效率每年都在显著提升,其累积效应是:现代计算机不仅比前代快得多,按算力能力衡量,运行成本也便宜得多。 而 AI 的性能提升和成本下降,比这还要快。
图表中降幅与AI最相似的成本指标是DNA测序,它常被作为技术成本下降的经典案例。其相对成本的跌幅甚至超过了AI,不过这一过程耗时二十余年。
而Epoch AI的数据显示,AI用区区五年半便实现了同样的降幅。这意味着成本每季度下降近50%,每年则降至原来的十三分之一。AI成本的下降速度比DNA测序快四倍,比锂电池快十八倍。
这些数据仍有若干局限。算力成本仅统计至2001年,之后缺乏相对成本数据;电力成本则只追踪到1973年,因此完全遗漏了近年来太阳能的爆发式增长。此外,AI成本下降趋势也仅从2023年起有直接追踪数据,此前的数据是根据既有短期趋势及外部研究外推得出的。
Epoch AI的结论并非基于特定模型,而是基于在研究生级谷歌防作弊问答(GPQA Diamond)基准测试中得分达到81.25%或更高的模型,并追踪模型回答该测试中一道选择题的成本。
这一指标确实能衡量AI在多个知识领域的通用能力,但未必涵盖AI能力的全部范畴。不过,它确实展示了新一代模型在此类任务上的优势:它们不仅更容易在测试中取得高分,而且成本也大幅降低。
便宜了多少?
Epoch AI引用了OpenAI于2025年1月发布的GPT o3模型:该模型在GPQA Diamond测试中得分75%,单题价格为0.30美元。而仅仅一年半后,OpenAI发布的GPT-5.6 Luna在同一测试中表现相当,单题价格却仅为0.0004美元。
但并非所有领域都能如此迅速且均匀地降低成本,其进展也并非线性。Epoch AI 将研究范围扩展至国际象棋谜题和数学基准测试后,发现不同领域的成本效率提升速度差异巨大。GPQA Diamond 基准测试呈现出成本快速下降后长期停滞的平台期特征;而 AIME OTIS Mock 测试在每一个数据点上则表现出更加规律的进展。国际象棋谜题虽然未追踪至相同的成功率指标,但也展现出更为稳定一致的性能提升。
然而,前沿数学(Frontier Math)相关领域的进展在 2025 年至 2026 年间几乎停滞,随后在年中突然大幅降价。
Epoch AI 还指出,成本下降的速度正在放缓,这一趋势在衡量特定性能水平的大多数指标上均有所体现。在其追踪的五项基准测试中,初期季度成本降幅为 66%,而两年后这一数字已降至 32%。
这可能意味着 AI 的进步正在放缓,或者降低 AI 使用成本的难度正在增加,尤其在 2026 年,随着能源价格和计算硬件成本飙升。如果 AI 智力的“原材料”比过去昂贵得多,提供更低价格的优质服务自然更加困难。
“基准刷分”问题依然严峻
正如 Epoch AI 所指出的,这份数据潜在的最大问题在于“基准刷分”(Benchmaxxing)的可能性。这指的是 AI 开发者专门针对某些旨在测试通用能力的基准测试进行模型训练,以在这类测试中获得高分。
用数据“美化”跑分是软件公司的老把戏——Nvidia 和 ATI 就曾在 2003 年因篡改 3DMark 成绩被抓,2024 年 Intel 也有数千条测试成绩被作废,原因同样是在另一个基准测试中用了不公平的优化手段。
Epoch AI 在基准测试中加入了随机化元素,尽量避免模型“认出”自己正在被测试,也避免开发者专门针对第三方测试做优化训练。但并非所有测试都有这层防护,而那些没有随机化的测试成绩下滑更快,说明数据里多少存在针对跑分的优化。
这并不推翻整个结论,但对这些数字保留几分怀疑还是有必要的。
并非所有人都在享受降价红利
对 AI 开发者来说,尤其是那些一边砸几千亿美元建基础设施、一边研发前沿模型的公司,这组结果传递的信息相当扎心:花大价钱买“特权”意义不大。尽管 Fable、Mythos 和 OpenAI 的最新模型这些旗舰相比同类产品运行成本依然高昂,但随着各家旗舰开发商在帕累托前沿——即低成本与高智能的交汇点——上展开竞争,token 价格一直在持续下跌。
但如果其他模型能以极低的成本实现同等 90% 的智能水平,且这一成本在未来数周数月内只会进一步下降,那么用户是否还需要为最新的功能和能力付费?尤其是当这些替代模型采用开放权重形式,允许第三方竞争并提供效率最高、成本最低的版本时。
但与其他订阅服务一样,决策因素不仅仅是价格,也不仅关乎智能或能力。熟悉度至关重要:用户习惯于当前的 UI、工作流以及组织正在运行的其他系统。对于任何长期承诺,尤其是财务承诺,信任感都极为关键。你能否信任一家提供比你过去一年使用的模型更便宜的新第三方服务?也许可以,但值得承担这份风险吗?
切换到新模型意味着需要验证新基准测试的真实性,并相信未来价格不会剧烈波动(虽然很可能波动),从而导致节省的成本落空。你还得相信,原本使用的系统不会在几周后就追上进度,且新系统没有漏洞或隐私隐患。
更换 AI 工具并非简单地追逐成本或智能。尽管价格可能在急剧下跌,但这并不意味着 AI 的订阅模式行不通,只是更难说服用户。