最新开放模型速递(第 23 期):Laguna S2.1、Inkling 与 Kimi K3
整合是许多敏锐观察者为训练模型的实验室在不远的将来预言的路径之一。由于训练成本每年都以数量级攀升,它曾被贴上「必然」的标签。然而,作为一个早在 2024 年就预测整合潮会在 2026 或 2027 年真正到来的人,如今我们身在何处?现实是:正在训练强大模型的公司反而更多了——总体投入依然轻松达到数亿乃至数十亿美元——而且公开发布这些模型的机构也越来越多。
对 token 的需求高得惊人,而且随着模型效率提升、解锁更多可能的使用场景,这一需求很可能继续增长。那些我们原以为终将走向整合的实验室正意识到,打造「token 机器」很可能是一条通往价值之路,假以时日,会有更多公司认识到这一价值来源。
最典型的例子是 Thinking Machines——2025 年 2 月该公司宣布成立时,几乎没人(包括我自己在内)会把它归入开放模型公司的行列。如今,他们的开放模型微调服务每年进账数亿美元,而且他们正在发布美国打造的最强开放权重模型——领先于早期的领跑者 NVIDIA(Nemotron)和 Arcee(Trilogy)。
生态的另一端,则是中国实验室的持续发力,小米等新入局者仍在更广阔的 AI 经济中不断积累声量。在长期预言整合之后,如今更稳妥的判断似乎是预言持续普及,并去想象开放模型在其中扮演的角色。像 Kimi K3 这样的收益分成许可究竟能否立得住?开放模型能抢占多少市场份额?我们正在进入决定性的时代。
这是我们有史以来内容最密集的开放模型盘点之一,我们非常兴奋!
本周精选
Inkling(来自 thinkingmachines):Thinking Machines 的首个模型,是一个 975B-A41B 的多模态 MoE,支持文本、图像和音频输入,输出文本。虽然在其尺寸级别中,它并非(中国)同侪中最强的模型,但它的定位是极佳的微调基底,例如通过其商业产品 Tinker。他们还发布了一个更小的版本(276B-A12B),以其体量而言竞争力相当强。
Hy3(来自 tencent):腾讯的 295B-A21B MoE,各项指标全面超越前代。不过最值得一提的是许可证变更:上一版本(Artifacts 21 曾介绍过)采用自定义且相当严苛的许可证,而腾讯此番改用 Apache 2。该模型还证明了一道有 50 年历史的数学题(借助专用 harness,并以 Sol 作为评判,尽管后者究竟有多关键尚不清楚)。

Laguna-S-2.1(来自 poolside):Poolside 横空出世,迅速成为 Artifacts 的常客,这是它连续第三个月上榜。S2.1 是 118B-A8B MoE 经过全新预训练与后训练的版本,能塞进一台 DGX Spark,这为它赢得了大量关注。Poolside 还采用了 OpenMDW 许可证——一种类似 Apache 2.0 的自由许可证,但专为 AI 模型提供了更扎实的法律保障。公司还在其博客中披露了更多细节,包括全部评估轨迹。对一个开放模型的发布来说,这样的透明度实属罕见!
DeepSeek-V4-Flash-0731(来自 deepseek-ai):就在 OpenAI 把自家最小模型的价格砍掉 80% 的仅一天之后,「鲸鱼」放出了 V4 Flash 模型的更新,在帕累托前沿上压过了 Luna。更大的模型尚未更新,因此它的性能落点仍有待观察。在 V4 首发批次中,Flash 版本就凭借单位参数性能成为全场明星,而 Pro 则表现平平。

Kimi-K3(来自 moonshotai):这是近段时间最重磅的开放模型发布,我们已在单独一篇文章和一期播客中做过介绍。它以非商业许可证发布,要求推理与微调服务商签署商业协议。Kevin Xu 和 Graham Webster 在一篇文章中认为,这类许可证为政府未来针对与中国 AI 公司做生意的美国实体采取行动提供了潜在抓手:
但如果一家美国公司需要与 Moonshot 签约,才能提供 Kimi K3 生成的推理 token,情况就大不相同了。美国官员等曾讨论为限制中国开放模型使用而准备的一些政策工具,将更明确地找到用武之地。
模型
通用模型
LongCat-2.0(来自 meituan-longcat):「中国版 DoorDash」又来了。这一次,美团发布了又一个 1.6T 参数的大 MoE。虽然抛开榜单成绩,这个模型在其尺寸级别并非最强,但它完全在昇腾 910 上训练,成为首个完全用中国加速器训练的非华为「非玩具级」模型。其他中国芯片大多只用于推理(如果真有在用的话)。
Laguna-XS-2.1(来自 poolside):Poolside 小尺寸(33B-A3B)MoE 的更新版本。
Motif-3-Beta(来自 Motif-Technologies):韩国 Motif 的 314B-A13B MoE 预览版。这是该公司迄今最具雄心的模型:体量大得多,还引入了 GDLA、mHC 等架构创新。
Apertus-v1.5-70B(来自 swiss-ai):完全开源的 Apertus 1.0 的继续预训练版本,额外使用了 2T token。
Instella-MoE-16B-A3B-Think(来自 amd):AMD 用 Instinct 卡训练的 16B-A3B MoE。AMD 还公开了从base 到 SFT 检查点、以及 MidTrain 和 DPO 的全部训练阶段。
