← 文章 / AI技术
Lobsters 3小时前 · 2026-08-12 03:21:58 · 0 阅读

本地模型不会赢:为什么推理终将在数据中心完成

每当有新的开放权重AI模型发布,人们就会本地模型才是未来。既然人人都能在笔记本电脑或手机上运行AI模型,何必还要花数十亿美元建数据中心?我认为这种想法注定行不通。无论开放权重模型变得多强大,绝大多数推理任务终将在AI数据中心完成。

本地模型太弱,难以普及

本地模型永远无法达到同等的强大程度。这一点应该显而易见:目前所有前沿模型(无论封闭还是开放权重)都过于庞大,只能在数据中心的完整GPU集群上运行。当然,小模型会随时间推移变得更聪明。一年后,你或许能在笔记本上运行一个与GPT-5.6-Sol实力相当的模型。但到那时,你又会觉得GPT-5.6-Sol弱得派不上用场。

很多人否认最后这一点,但事实如此:几乎所有人的实际偏好都是在自己预算范围内选择最强可用的模型。如果AI进步停滞在GPT-4的水平,我们或许能围绕它打造出一些强大的工具,但今天谁还会用GPT-4?随着大语言模型能力提升,我们对它们的期望也水涨船高:现在期待智能体系统能独立解决越来越多的问题。当它们犯迷糊或卡壳时,那种挫败感极其强烈。有选择余地时,人们自然会选那个让自己少受挫的模型——而那永远会是更大、更强的那个。

本地模型更贵,效率也更低

除此之外,数据中心模型永远更便宜。我不明白为什么总有人说本地模型省钱:在我看来,这和人们说开Uber是“白赚的钱”(忽略了油费和车辆损耗)是同一个错误。光是搭建一个低配家庭实验室1的初始投入,就够你订阅好几年的AI服务了。电费每月大约要50到300美元,取决于你跑多少推理任务——这又相当于多订几份付费订阅的钱。

为什么数据中心模型更便宜?并非因为数据中心推理受到补贴:实际上推理相当便宜。如果你在本地和数据中心运行相同的模型,数据中心模型本质上会更高效

主要原因在于批处理。一块GPU执行数十万次数学运算的速度与执行一次运算几乎相同。然而,对于单个用户的推理,每个新token都依赖于前一个的结果,因此无法进行批处理2。可以批处理的是数百名用户的推理同时进行。这所耗费的时间、电力和热量,与一次只为一名用户推理几乎相当。

当你在家运行自己的推理时,没有可批处理的内容——最多并行运行几个AI代理——因此利用率极低。你为大量潜在推理付了费却用不上:这些资源被白白浪费了。唯一的解决办法是找几个朋友,把你的本地推理端点开放给他们(到那时,你基本上就是在运行一个自己的简陋数据中心)。

另一个原因是数据中心拥有更大、更高效的GPU。你在本地运行模型所用的消费级GPU,通常是像RTX 4090这样的游戏显卡。而专为批处理AI推理设计的数据中心B200,在相同功耗下,算力约为前者的三倍,内存带宽接近四倍3。因此,综合批处理和GPU效率,你在本地运行模型所消耗的资源大约是数据中心的30倍。

顺便说一句,这也是我对那些声称本地模型好、因为它们不像大型数据中心那样耗资源的人持怀疑态度的原因。如果你想高效运行LLM,就应该尽可能把使用量推向AI数据中心!善意地理解,他们的意思是我们都应该运行更小的模型——但即便如此,理想情况下你也应该通过,比如,GPT-5.6 Luna API来使用小模型,而不是自己托管模型。

那么本地模型还有可能胜出吗?

本地模型会胜出吗?或许存在这样一个可能的世界。一种情况是,政府可能出于对AI危险的担忧,或是迫于公众压力,全面禁止使用AI数据中心。在那个世界里,本地模型就成了唯一的选择。 另一种可能是,AI的发展在大型模型上停滞不前,而小型模型却持续进步。我很难想象这种情况如何发生(除非政府干预,如上所述),但如果一个300亿参数的模型能成为前沿模型,那么本地模型或许就有了竞争力。 又或者,模型变得极其强大,以至于一个300亿参数的模型就足够聪明,能处理所有事情,那么除非要解决黎曼猜想,否则没人真的需要像Opus或Sol这样的模型。我对此并不太信服。如今的模型虽然能进行前沿数学研究,但在重构大型代码库方面还不如我,所以很难想象我会不想用最聪明的模型。

本地模型并非无用

我确实认为本地模型总会有其用武之地。我想起了Thinking Machines的“交互模型”背后那个出奇简单的想法(OpenAI也这么做,因为这显而易见):对于语音聊天这类对延迟敏感的应用,用一个小而快的模型来处理对话,同时委托给一个大而慢的模型进行深度思考。如果五年后大多数AI使用都通过手机或笔记本电脑上的本地模型来中介,我也不会感到惊讶(尽管在这个世界里,大部分工作仍将由AI数据中心完成)。 有些用户即使本地模型更弱、更贵,也会更偏爱它们。例如,能够在本地操控模型,对这类用户来说可能是个杀手级功能。另一些人可能只是看重对自身基础设施的完全掌控,或是网络连接不稳定4。如果你属于这类人——尤其是如果你只是与模型聊天,而非用于研究或编程——那么本地模型是个不错的选择。然而,我认为这始终会是小众群体。大多数用户仍将通过数据中心进行推理。
  1. 这个链接是一年前的——现在价格已大幅上涨

  2. 具体来说,瓶颈在于将模型权重移入GPU,这一步骤必须完成,且无论处理一个用户的令牌还是一百个用户的令牌,耗时相同。

  3. 我借助LLM辅助估算,但你可以自行从NVIDIA的数据文档核对。

  4. 前提是仍有稳定电源和足够资金来搭建家庭推理集群。


如果你喜欢这篇文章,可以考虑订阅邮件更新以获取我的新文章,或在Hacker News上分享

这里预览一篇与本文标签相关的文章。

高级AI谄媚行为

众所周知,AI谄媚是指模型夸你聪明。哇,你说得太对了。这不仅是新观点——简直是开创性的。你真是个特别的用户。很容易识别,对吧?

关于AI谄媚行为的讨论在去年达到顶峰,当时“#keep4o”运动抗议OpenAI移除其最谄媚的模型(GPT-4o),而许多人公开陷入AI精神错乱状态。
继续阅读...


原始来源: Lobsters

评论 (0)