开源模型现状:2026 年夏季观察
在 AI 领域,时间总是过得飞快。距离我们上次发布春季报告(半年期生态分析)才过去几个月,截至今年夏天又有不少值得关注的发现。本报告梳理了 2026 年 1 月至 8 月期间的各项观察,并附上支撑每一项结论的数据。
HF Hub 上的模型和数据集每天都在增长。在此期间,公开模型仓库从 243 万增长到 296 万,数据集从 71.1 万增长到 100 万,Spaces 从 100 万增长到 144 万。但底层的分布依然高度集中:约 85.6% 的模型终身下载量不足 200 次,而 1.5% 的仓库贡献了 99.2% 的总下载量。后续所有的讨论都发生在这个格局之下。
1. 前沿模型迭代加速
过去有一条清晰的进阶路径:各实验室通常先发布较小的模型,再逐步推向更大规模。而到了 2026 年,几家中国实验室完全跳过了这一渐进过程。
2026 年几乎每个月,中国实验室发布的最大、性能最强的开源模型,参数规模都超过了美国实验室当月发布的任何模型。中国实验室每月的天花板在 754B 到 2.78T 参数之间;美国模型在七个月中有五个月都未突破 130B,唯一例外是 NVIDIA 5 月和 6 月发布的 561B 参数的 Nemotron 3 Ultra,以及 Thinking Machines Lab 的 Inkling。
图表把各家机构分成了两派。Moonshot、MiniMax、Xiaomi 和 Z.ai 几乎不发布 70B 以下的模型,开发者第一次接触到的就是大到本地根本跑不起来的版本。Tencent 和 Alibaba Qwen 则覆盖了从 1B 以下到顶端的全尺寸。
第一派的形成有两个原因。一是训练大模型已经不再是差异化优势——Xiaomi、Ant Group 和 Meituan 今年都迈过了万亿参数的门槛,而一年前它们在开源权重领域还都名不见经传。二是机构不再需要靠发布小模型来保持可达性,因为社区的量化生态几天内就能让大模型跑起来,这点我们后面还会再谈到。
于是,模型尺寸分布更多反映的是定位意图而非能力差异。纯前沿路线的厂商把筹码全押在基准排名和 API 商业化上;全谱系覆盖的厂商则在争夺开发者的默认选择。两者都是理性的,只是在追逐不同的目标。
美国在开源领域并没有缺席。
今年发布新开源模型最多的两家组织,同时也是造芯片的公司:AMD 和 NVIDIA。两家各发布了超过 200 个新模型仓库,远超其他参与者,LiquidAI 以约 100 个排名第三。硬件厂商已经意识到,开源模型是卖芯片的一种方式:一个针对你的硬件做了优化、且可自由获取的模型,就是硬件能力最有力的证明。
如果把小型模型和 embedding 模型也纳入统计——Google、Microsoft、IBM Granite 以及 OpenAI 较早期的视觉和语音模型每年带来数亿次下载——美国的开源 AI 正在壮大。
NVIDIA 等更多硬件和基础设施公司正在训练出有竞争力、并以开放权重发布的模型。NVIDIA 的 Nemotron 模型家族性能强劲。Meta 这类长期领跑者也在重拾开源初心,推出了 Meta 的 Muse Glimmer。
在最前沿的规模上,今年美国发布的部分超过 100B 参数的模型,是基于中国模型构建的,或是利用了中国实验室的成果,例如 Thinking Machines 的 Inkling(952B)。主要的原创美国模型包括 NVIDIA 的 Nemotron 3 Ultra(561B)、Nemotron 3 Super(124B),以及 Arcee AI 的 Trinity-Large(399B)。
AMD 贡献了大量模型转换工作。这件事很重要:它让万亿参数模型能高效地运行在美国硬件上。这构成了一个分发与优化层。
与此同时,中国的开源模型越来越多地针对国产芯片进行优化——同一场竞争,方向相反:模型围绕特定硬件生态来设计。
2. 关注度 ≠ 采用度
我们选取了今年累计下载量前 25 的模型仓库,以及点赞数前 25 的仓库。两个榜单恰好只有一个仓库同时上榜。
我们统计的是窗口期内的下载量而非累计下载量,所以仅凭"存在时间更久"并不会获得额外优势;控制住发布时间这一变量后,两者的分化反而更加明显。下载量前 25 名中没有一款是 2026 年发布的模型,而这 25 款里有 13 款来自 2022 年。all-MiniLM-L6-v2 七个月内被下载了 15.5 亿次,点赞却只有 5,156;Kimi-K3 每获得一次点赞大约只对应 60 次下载。
这两个指标刻画的是两种完全不同的行为。点赞表达的是"这个发布值得关注",它集中流向发布后几周内的前沿模型;下载则说明"某样东西已经被接入某个按计划自动运行的 pipeline",这种流量是小型、稳定模型用多年时间慢慢积累起来的。要读懂业界在兴奋什么,看点赞;要读懂业界当前在依赖什么,看下载。把其中任何一方当作另一方的代理指标,是我们最常见到的误读 Hub 的方式——这其中也包括我们自己早先的工作。同样的分化也出现在发布者层面。
在 Hub 上,只有中国的前沿实验室呈现出"大头由大模型撑起"的格局。MiniMax 2026 年几乎全部下载量都来自 70B 以上的模型,Moonshot 这一比例为 88%,DeepSeek 为 55%,Z.ai 为 39%。美国的大体量账号没有一家是这种结构:Google、Microsoft 和 IBM Granite 2026 年 70B 以上的下载量基本为零,NVIDIA 和 Meta 也分别只有 14% 和 9%。
这种差距在总下载量上更加明显。Moonshot 只做旗舰模型,全年下载量为 3700 万次;而 Qwen 通过覆盖不同参数规模的广泛发布策略,下载量达到 20.45 亿次(仅统计有明确参数量的仓库,若包含所有仓库则为 20.61 亿次),约为前者的 55 倍。从 2.4 万亿参数的 Qwen 3.8 Max 到 27B 等小尺寸型号,整个系列持续扩展,体现了同样的多场景覆盖思路。
时间也是关键因素。大多数模型在发布后都会出现使用量的急剧下滑,随后进入长期平稳的长尾阶段。模型的采用与否,基本在前几个月就决定了。
这就解释了为什么当前的下载量往往并非由最新发布的模型驱动,而是来自那些经过时间沉淀、已成为基础设施的少数模型。
3. 开源权重的转移:价值在哪里沉淀
如果前沿模型是一门授权生意,你大概会预期最重要的发布附带最严苛的条款。然而,下面的数据讲述了一个不同的故事。
今年中国发布的 178 个 20B 参数以上的模型中,59% 采用 Apache 2.0,22% 采用 MIT,几乎没有非商业限制条款。不过最近几周,这一趋势在真正的大模型上开始发生变化——Kimi K3 和 Qwen 3.8 2.4T 开始在许可证中加入非商业限制和分成要求。
DeepSeek 和 Z.ai 在 7000 亿到 1.65 万亿参数区间发布的模型均采用纯 MIT 协议。中国实验室对其最大模型的授权,与其最小模型一样宽松,而且比美国实验室更宽松:在美国同尺寸段的模型中,29% 采用 Apache 或 MIT,41% 使用自定义条款,30% 完全未声明许可证。
不管出于什么目的发布,这些模型都不是为了许可证收入。权重以最宽松的条款免费公开。回报必须来自别处:API 和云业务、硬件和平台布局,或者生态位本身。例如,Z.ai 和 Kimi 的估值印证了一条行之有效的开源策略——在社区中获得关注和增长机会。但展望未来,整个行业可能会转向更清晰的、从开源采用中直接变现的路径。
4. Qwen 已成为社区的基础模型
一个模型的生态地位不仅取决于自身的发布,还取决于社区在它之上构建了多少。如前所述,Qwen 是一个例外,它正在获得广泛关注和采用。
数据来源:Hugging Face
按这一指标衡量,Qwen 已成为开源模型生态中最大的基础之一。Qwen 系列模型目前在 Hub 上拥有 151,448 个衍生模型,是 Meta 总规模的 2.6 倍,是 Llama 系列仓库的 4.7 倍。Google 以 82,506 个衍生模型紧随其后。第三大来源是 Unsloth,这是一个发布量化版和可直接微调版本的社区账号,其中许多进一步扩展了 Qwen 生态。
2026 年前七个月,Qwen 衍生模型以每天约 180–210 个新仓库的速度增长,表明这种采用并非由个别发布驱动。Qwen 已成为开发者在决定微调和部署哪些模型时的默认选择之一。
Qwen 能占据这个位置有多个原因。首先是稳定性。Qwen 一直保持着规律的发布节奏,持续更新整个模型家族,而不是偶尔推出一款旗舰模型。其次是覆盖面。它发布的模型涵盖了各种参数规模和使用场景,无论开发者需要的是可本地运行的小模型还是用于部署的大模型,都能在同一个生态中找到合适的选项。第三是开放性。Apache 2.0 协议减少了在定制、二次分发和商业使用上的障碍。 这些因素彼此强化。覆盖面广的模型家族会吸引更多开发者;开发者越多,衍生作品就越多;而这些衍生作品又让整个生态对未来用户更具吸引力。 这一地位很大程度上是由社区共建的。那 151,448 个衍生模型代表的是其他开发者创建的下游工作,而不是 Qwen 自己发布的模型。就连 Hub 上 Qwen 模型的 28,531 个 GGUF 转换版本中,Qwen 自己发布的也只有 54 个。5. 小模型仍是务实之选
在明确标注参数量的模型中,10 亿参数以下的模型拿走了全部下载量的 83%,而 1000 亿参数以上的只有 1%。只看 2026 年累计的下载量,情况也没有变化:70B 以上参数的模型只占 3%。这个三月得出的结论至今依然站得住脚,原因和之前一样——大多数开发者手头的硬件只能跑得动小模型。 那么一个万亿参数的模型到底怎么才能让普通用户用上?答案是 llama.cpp。 今年二月,ggml 团队加入了 Hugging Face,项目本身仍然完全开源、由社区治理,技术方向也保持不变。变化的只是——本地推理领域最重要的项目现在有了稳定的资源支撑。
天花板跟着 llama.cpp 一起抬高了。7 月的快照里,DeepSeek-V4-Flash 的 GGUF 构建版本参数量约为 284B,Kimi-K3 约为 2.8 万亿。过去本地推理意味着在笔记本上跑个 8B 模型,现在则是把一个万亿参数的混合专家模型拆分到几台消费级机器上跑。这正是前沿模型一年前还不存在的另一条路径,也是"前沿优先"发布策略如今仍然可行的原因。
而这条路径的载体是 Qwen:每月 GGUF 下载量 3960 万次,接近 Gemma(2080 万)的两倍,是 Llama(750 万)的五倍多。Llama 的落后不是供应问题——Llama 衍生出的 GGUF 仓库数量其实略多于 Qwen,货架一样大,流量只有五分之一。
这七个月内,模型仓库数量增长了 21.5%。它们周围的几个生态,增速是它的好几倍。
声明使用 gguf 库的仓库增长 464%,lerobot 增长 194%,Apple 的 mlx 增长 148%,而 transformers 和 peft 只增长了 16%,diffusers 增长 21%。模型建模核心的增长大致跟平台平均增速持平。但决定模型能在哪里真正跑起来的运行时层——本地推理格式、Apple Silicon、机器人控制栈——增速是前者的三到七倍。
在十个最大的模型家族中,背后的实验室几乎不发布官方的 GGUF 转换版本。然而开发者本地运行模型时,往往用的正是 GGUF 版本。在发布时提供官方转换、记录量化方案并对产物进行签名,所需额外投入并不多。与其在内部维护这套流程,实验室不如与 Unsloth 这类现有的生态贡献者协作。这样做有助于缩小模型作者测试的权重版本与社区实际采用版本之间的差距。
6. Agent 成为新的用户
三月份时我们还写不出这一节,因为当时尚无相关数据工具。七月份发布的 agent-usage 数据集记录了 coding agent 通过 huggingface_hub 或 hf CLI 调用 Hub 时所发送的 agent/<name> 令牌——包括搜索模型、上传数据集、运行 Jobs、创建 Spaces 等操作。我们首次得以一窥 Hub 接收到的 agent 流量规模及其来源工具链。
Claude Code 在七月份以 44.4% 领先,但单月数据掩盖了真正的趋势:它在四月占比 67.8%,五月为 64%,而 Codex 则从 10.4% 稳步攀升至 20.8%。这是一个没有既定赢家的市场,一次版本发布或一次默认设置的变更就可能在一个月内带动一半的流量迁移。
第二个发现是未识别客户端这一类别。七月份近四分之一的 agent 标记流量来自数据集中尚未命名的工具链,五月份这一比例更是高达 59.8%。从四月到七月,涌现出十余种新的客户端标识符。新进入者的涌现速度远超任何注册机制所能收录——而这本身就是最重要的发现。
今年我们投入了大量精力为这一类读者(而非仅面向人类浏览器)进行建设。三月起,论文开始提供机器可读的 Markdown 版本。四月,智能体追踪(agent trace)被提升为一类正式数据集,同时每个 Gradio Space 都新增了 agents.md 端点,使智能体能够直接读取 Space 的 API 并调用。七月,我们在 MCP 服务器上推出了 hf_fs 工具,以仅千余 token 的开销,统一暴露仓库、存储、文档和论文接口,并附带可挂载的安全沙箱用于代码执行。协议层面同样出现了整合趋势,MCP 正式加入 Linux 基金会的 Agentic AI 基金会。
随后在七月,智能体不再只是读者,而是变成了入侵者。我们遭遇了据信是首例有记录的自主智能体主动发起持续性入侵的事件。当团队试图使用前沿闭源模型分析截获的攻击代码时,它们的安全护栏拒绝了该任务。最终,分析工作是由运行在我们自己基础设施上的量化开源模型 GLM-5.2 完成的。我们已发布安全事件披露和完整的技术时间线。
展望未来
相较于春季报告所述,地缘格局的再平衡仍在持续加速。尽管美国的开源模型依然具有竞争力,但中国多家前沿模型实验室之间的角逐同样引人注目。这些前沿模型收获的大量点赞,反映出社区最关注的兴奋点所在,也为借助这种热度的公司带来了估值上的增长空间。
然而,AI 的竞赛既需要冲刺,也是一场马拉松。llama.cpp 之类的工具让大模型的本地部署更加便捷,但丰富的模型矩阵及其广泛采用仍是关键所在——开发者、发布者和未来用户之间由此形成的良性反馈循环,才是制胜之本。那些能深度嵌入基础设施、融入生态系统的模型,终将在隧道尽头迎来商业上的合理回报。
最后,随着智能体首次超越人类,成为 HF Hub 的第一大用户,下一份报告的面貌或将截然不同。
在 AI 领域,短短数月便足以重塑整个生态。
方法说明
本分析基于 2026 年前七个月在 Hugging Face Hub 上观察到的活动数据。
报告中使用的各项指标——包括下载量、点赞数、衍生模型和模型发布量——分别反映了生态系统的不同方面,不应将其直接理解为模型质量、商业采用率或整体市场份额的衡量标准。
下载量体现了 Hub 生态系统内的使用情况,但无法反映 API 调用、私有部署以及通过其他渠道分发的模型。
点赞数反映了社区的关注度和兴趣,而衍生模型则体现了开发者在已有模型基础上进行二次开发的活跃程度。
由于开源 AI 的采用发生在众多渠道中,Hub 活动应被视为观察生态发展的一个视角,而非对 AI 市场的完整度量。
编辑说明
本文已更新,补充了 8 月初的最新发布内容。








