← 文章 / AI技术
Interconnects 5小时前 · 2026-08-28 17:53:05 · 1 阅读

授人以渔:让每个人都能造出 Token

人们最早常拿来比较的,是开放模型的发展与 Linux 这类基础性开源软件项目之间的关系。两者确实存在一些清晰的类比,但这种类比为开源模型生态的自我维持能力描绘出了一条相当狭窄的发展路径:Linux 发展到足够庞大后,凭借其作为许多任务最佳工具的地位,便会形成自我强化。真正更接近开源操作系统的,其实是开源语言模型——也就是完整提供训练方案、数据、代码等全部要素的模型。我们平时使用的开放权重模型——只有模型权重和用于运行它们的推理代码——则更像是基于某个软件项目开发时所安装的特定软件版本。

分享

模型权重平均而言更迭很快,但和许多广泛使用的软件一样,它们的生命周期其实相当长。这也解释了为什么许多公司至今仍在使用基于 Llama 3 构建的工作流,尽管智能体行为在几年后才开始兴起。如今以我在 Ai2 参与构建的 Olmo 系列为代表的开源训练方案,以及 EleutherAI 更早推出的 Pythia 等项目,本质上都是资源密集型流程。任何公司都可以拿来修改,按下“运行”,从而生成一套新的模型权重。在最理想的情况下,社区还可以将数据或训练代码方面的改进反馈到下一代模型中!这正是 NVIDIA 大力投资近期开源模型的原因之一——对于 Nemotron 系列,NVIDIA 会尽可能依法公开所有数据、训练代码等内容。NVIDIA 希望看到的是这样一个世界:无数人都能构建“token 机器”,让智能不被少数人垄断。如此一来,各行各业的众多公司都会产生巨大的推理需求,并纷纷采购 NVIDIA 的产品。

开源 AI 的未来并不简单,因为打造顶尖模型需要投入巨额资本。事实证明,在行业内,构建具有竞争力的模型仍比许多人预想的更容易实现。很多人的默认判断是:模型训练成本过高,而开源方案又落后太多,因此围绕 LLM 训练的某个环节创办一家新实验室并不可行。

接下来可能有两种走向。第一种是这套开源路线确实奏效:如果它对 Nvidia 有效,那么由此带来的芯片需求和利润,可能远超模型开发成本。目前有报道称,Nvidia 正在为此投入 260 亿美元。但这条路能否走通仍不确定,AI 高昂的资本投入也可能让越来越多公司退出模型训练。到目前为止,我们还没看到太多这样的迹象。事实上,已经退出的公司——比如 Databricks 和 01.ai——似乎更像是个别例外。

未来几年,开源生态会越来越依赖 Nvidia 的资金支持。这是一个关乎生死的窗口期:这种模式必须在几年内为 Nvidia 带来回报,或者由另一家开源模型公司,围绕开放性建立起类似平台的资金正反馈。要在数十年的语言模型发展中持续下去,这种经济回报必须与 Anthropic 和 OpenAI API 创造的利润相匹配。推动力可能来自性能竞争,也可能是 AI 浪潮足够庞大,让开源模型训练、推理和微调领域的公司都获得海量需求。

第二种走向是,如果上述两条能带来正向财务回报的路径都未能实现,开源模型就会走上与头部闭源模型不同的发展道路,更加注重效率、可修改性和专业化等方向。我个人认为这最有可能成为最终结果:开源模型依然极其有用,但相较于闭源模型,它们会填补长尾生态。后者在知识工作协作、药物发现、SWE 等最具价值的领域拥有垄断性控制权。所谓长尾,可能包括面向特定企业、使用私有数据、部署在本地环境中,专门处理重复性业务任务的智能体。

我认为这种开源训练模式很难普及,部分原因在于训练正变得越来越复杂,也越来越抽象。当前的开源模型生态,得益于人们对开源模型 post-training 的兴趣激增而蓬勃发展。这些人会使用 DeepSeek V4 Flash、Inkling Small 或 GLM 5.X 等模型,针对特定的智能体任务进行 finetune(例如使用目前最受欢迎的 finetuning API——Tinker)。

Interconnects AI 是一份由读者支持的出版物。欢迎考虑订阅。

订阅

过去几年里,post-training 基本上指的是修改基础模型、让它具备智能并能够实际使用的整个过程。如今,训练基础模型使其成为通用智能体推理器的能力,正变得越来越不透明,类似于几年前大规模预训练实践给人的感觉。这种变化甚至可能改写沿用了数年的 pretraining、midtraining、post-training 术语体系,最终形成更接近 pretraining、reasoning training 和 post-training 的划分。

随着愿意训练完整模型的人越来越少,投资开源 AI 的意愿也在下降。我们大概只能从这些迹象中得到一些提示,但面对这种局面的经济规律,我们几乎无能为力。这一趋势意味着,能够发布基础模型(即核心推理训练之前的模型版本)的开源模型构建者数量还会进一步减少。与此同时,开源模型构建者也在尝试采用收入分成许可,允许下游将模型用于产品或推理服务。这些尝试关系到如何维持构建接近前沿水平的开放权重模型所需的资金;未来一段时间内,它们能否成功至关重要。Nvidia 围绕开源生态制定的需求增长策略,能否成功并持续下去,也取决于这些人的成败。

与此同时,开放权重模型领域还将迎来大量新动作。毕竟,开放获取智能是当下最有力的商业策略之一。Meta 等拥有雄厚资产负债表的超大规模云服务商,就是这类间接从 AI 获利的新玩家代表。假如 Meta 将实力极强的 Muse Spark 1.2 模型以开放权重形式发布,就会严重拖累依靠出售 token 获利的 Anthropic 和 OpenAI 的营收增速。这些公司都在把互补品商品化,只是采取的方式不同:Nvidia 想教会所有人“捕捞 token”,让整个生态能够自我维持;Meta 则是在战略性地用 token 淹没市场。

767 分享 上一篇
原始来源: Interconnects

评论 (0)