从 900 个最受欢迎的开源 AI 工具中我学到了什么
[]
更新(2026 年 2 月):开源 AI 仓库的完整列表已托管在 Good AI List,每日更新。仓库数量已膨胀到 1.5 万个,你可以提交遗漏的仓库。你也可以在我的 GitHub cool-llm-repos 列表里找到其中一部分。
四年前,我对开源 ML 生态做过一次分析。此后形势发生了很大变化,所以我想重新审视这个话题。这一次,我聚焦于基础模型相关的技术栈。
数据来源
我在 GitHub 上用关键词 gpt、llm 和 generative ai 进行了搜索。如果觉得 AI 现在让人应接不暇,那是因为它确实如此。光是 gpt 就有 11.8 万条结果。
为了减轻工作量,我把搜索范围限制在至少 500 star 的仓库。其中 llm 有 590 条,gpt 有 531 条,generative ai 有 38 条。我也会时不时浏览 GitHub trending 和社交媒体来发现新仓库。
花了大量时间之后,我整理出 896 个仓库。其中 51 个是教程(如 dair-ai/Prompt-Engineering-Guide)和聚合列表(如 f/awesome-chatgpt-prompts)。虽然这些教程和列表很有用,但我更关注软件本身。终稿列表里我仍然保留了它们,但分析只针对那 845 个软件仓库进行。
这个过程痛苦却很有收获。它让我更清楚地了解了大家都在做什么、开源社区的协作程度有多惊人,以及中国的开源生态与西方有多么不同。
新的 AI 技术栈
我认为 AI 技术栈包含三层:基础设施、模型开发和应用开发。
-
基础设施
技术栈的最底层是基础设施,包括模型服务相关工具(vllm、NVIDIA Triton)、算力管理(skypilot)、向量搜索与数据库(faiss、milvus、qdrant、lancedb)等等。
-
模型开发
这一层提供模型开发所需的工具,包括建模与训练框架(transformers、pytorch、DeepSpeed)、推理优化(ggml、openai/triton)、数据集工程、评估等等。任何涉及修改模型权重的操作(包括微调)都发生在这一层。
-
应用开发
有了现成的模型,任何人都可以在其之上开发应用。这是过去两年里最活跃、且仍在快速演进的一层,也被称为 AI 工程(AI engineering)。
应用开发涉及提示工程(prompt engineering)、RAG、AI 界面等等。
在这三个层级之外,我还另外划分了两类:
- 模型仓库:由公司和研究人员创建,用于分享与其模型相关的代码。此类仓库的例子包括
CompVis/stable-diffusion、openai/whisper和facebookresearch/llama。 - 应用:基于现有模型构建的应用。最受欢迎的应用类型包括编程辅助、工作流自动化、信息聚合等等。
注:在这篇文章的早期版本中,应用 被作为技术栈中的另一个层级。
AI 技术栈随时间的演变
我按月份绘制了各类别仓库的累计数量。在 Stable Diffusion 和 ChatGPT 问世后的 2023 年,新工具呈现爆发式增长。曲线在 2023 年 9 月之后趋于平缓,可能有以下三个原因。
- 我的分析只纳入 star 数达到 500 的仓库,而仓库积累到这么多 star 需要时间。
- 容易摘的果子基本已被摘完。剩下的需要更大投入才能做出来,因此能上手的人也就更少了。
- 大家已经意识到在生成式 AI 领域很难脱颖而出,热度也随之回落。说个我亲身感受:2023 年初,我跟企业聊 AI,话题几乎都绕着生成式 AI 转;但最近的对话明显更务实,有几家甚至提到了 scikit-learn。打算过几个月再回来看这个趋势是否成立。
2023 年增长最快的两层是应用层和应用开发层。基础设施层虽然也有增长,但远不及另外两层。
应用层
不出所料,最受欢迎的应用类型是编程类、机器人(角色扮演、WhatsApp bot、Slack bot 等)以及信息聚合类(例如“把它接到 Slack,让它每天帮我汇总消息”)。
AI 工程
2023 年可以说是 AI 工程之年。由于相关工具形态相近,分类并不容易。我暂时把它们归为以下几类:prompt 工程、AI 界面、Agent,以及 AI 工程(AIE)框架。
Prompt 工程远远不止调一调提示词,它还包括受限采样(结构化输出)、长期记忆管理、prompt 测试与评估等。
AI 界面面向终端用户提供与 AI 应用交互的入口,这也是我个人最看好的方向。目前比较受欢迎的形式包括:
- 网页和桌面应用。
- 浏览器插件,让用户浏览网页时可以随时调用 AI 模型。
- 通过 Slack、Discord、微信、WhatsApp 等聊天应用接入的机器人。
- 能让开发者把 AI 应用嵌入到 VSCode、Shopify、Microsoft Office 等应用中的插件。插件方案在那些需要借助工具来完成复杂任务的 AI 应用(agent)中非常常见。
AI 工程框架是对所有帮你开发 AI 应用的平台的一个统称。其中很多围绕 RAG 构建,但也有不少提供其他工具,比如监控、评估等。
Agent 这个分类有点奇怪,因为很多 agent 工具本质上就是精心设计的 prompt 工程,再配上受限生成(例如模型只能输出预设好的动作)以及插件集成(比如让 agent 能调用工具)。
模型开发
ChatGPT 出现之前,AI 技术栈以模型开发为主。2023 年模型开发最大的增长来自大家对推理优化、评估以及参数高效微调的日益关注(这些被归类在建模与训练下)。
推理优化一直都很重要,但如今基础模型的规模让它对延迟和成本变得尤为关键。优化的核心方法没变(量化、低秩分解、剪裁、蒸馏),但针对 Transformer 架构和新一代硬件又涌现出了许多新技术。比如在 2020 年,16 位量化还算是业界前沿,现在我们已经看到了 2 位量化,甚至低于 2 位的方案。
同样地,评估一直都很重要,但如今很多人把模型当作黑盒来用,评估就变得更加关键了。新的评估基准和方法层出不穷,比如对比评估(参见 Chatbot Arena)以及 AI 作为裁判。
基础设施
基础设施层负责管理数据、算力以及用于服务部署、监控等平台工作的工具链。尽管生成式 AI 带来了诸多变革,开源 AI 基础设施层却基本保持不变。这可能也是因为基础设施类产品通常不太会开源。
这一层中最新的类别是向量数据库,代表公司有 Qdrant、Pinecone 和 LanceDB。不过许多人认为这根本不该单独算作一个类别。向量搜索早已存在多年,与其为向量搜索专门打造新数据库,不如像 DataStax、Redis 这样的现有数据库厂商,直接把向量搜索能力集成到数据原本所在的地方。
开源 AI 开发者
开源软件和很多事物一样,遵循长尾分布:少数账号掌控着大量仓库。
一人撑起十亿美元估值的公司?
845 个仓库分布在 594 个不同的 GitHub 账号下。其中有 20 个账号各拥有至少 4 个仓库,这 20 个账号合计托管了 195 个仓库,占列表总数的 23%。这 195 个仓库总共收获了 1,650,000 颗 star。
在 GitHub 上,账号既可以是组织,也可以是个人。前 20 个账号中有 19 个是组织,其中 3 个属于 Google:google-research、google 和 tensorflow。
这 20 个账号中唯一的个人账号是 lucidrains。如果按 star 数排序(仅统计生成式 AI 仓库),前 20 名里有 4 个是个人账号:
- lucidrains(Phil Wang):能以惊人的速度实现各类 state-of-the-art 模型。
- ggerganov(Georgi Gergov):物理学出身的优化之神。
- Illyasviel(Lyumin Zhang):Foocus 和 ControlNet 的作者,目前是斯坦福博士生。
- xtekky:一位全栈开发者,gpt4free 的作者。
毫不意外,越靠近技术栈底层,个人开发者就越难以独立构建。基础设施层的软件最不可能由个人账号发起和维护,而超过一半的应用是由个人托管的。
个人发起的应用平均获得的 star 数比组织发起的要多。此前已有人预测我们将看到许多极具价值的"一人公司"(参见 Sam Altman 的访谈 和 Reddit 讨论),我觉得他们也许是对的。
100 万次提交
超过 20,000 名开发者为这 845 个仓库做出过贡献,提交总数接近 100 万次!
其中最活跃的 50 位开发者提交了超过 100,000 次 commit,人均超过 2,000 次。最活跃的开源开发者前 50 名完整名单见 此处。
蓬勃发展的中国开源生态
中国的 AI 生态与美国分道扬镳早已是众所周知的事(我在 2020 年的一篇博客中也提到过)。当时我的印象是 GitHub 在中国并不普及,这个看法可能受到了中国 2013 年封禁 GitHub 事件的影响。
但这个印象已经过时了。GitHub 上有大量面向中文用户的热门 AI 仓库,它们的说明文档都是中文写的。还有不少仓库专门服务于中文或中英双语模型,比如 Qwen、ChatGLM3、Chinese-LLaMA。
美国许多研究实验室早已不再用 RNN 架构做语言模型,但基于 RNN 的 RWKV 模型家族依然很受欢迎。
还有一些 AI 工程工具,专门提供了把 AI 模型集成到微信、QQ、钉钉等中国主流产品中的方式。不少热门提示词工程工具也都有中文镜像版本。
GitHub 关注者排名前 20 的账号中,有 6 个来自中国:
- THUDM:清华大学知识工程与数据挖掘小组(KEG)。
- OpenGVLab:上海人工智能实验室通用视觉团队。
- OpenBMB:大模型基础开放实验室,由面壁智能与清华大学 NLP 团队联合创建。
- InternLM:来自上海人工智能实验室。
- OpenMMLab:来自香港中文大学。
- QwenLM:阿里巴巴 AI 实验室,Qwen 模型系列的发布方。
昙花一现
我去年观察到一个现象:很多仓库的关注度飙升之后又迅速冷却,我的一些朋友把这叫做"炒作曲线"。在这 845 个 GitHub 星标超过 500 的仓库中,有 158 个(18.8%)过去 24 小时里一颗星都没涨,37 个(4.5%)过去一周毫无增长。
下面是两个这样的仓库与两个长生命周期项目的增长曲线对比。尽管这两个例子里的项目后来都不再被使用了,但我认为它们的价值在于让社区看到了可能性,而且作者能这么快把东西做出来,本身就很酷。
我个人最喜欢的创意
社区里涌现出了大量精彩的想法,下面是我最喜欢的几个。
- 批量推理优化:FlexGen、llama.cpp
- 更快的解码器,技术包括 Medusa、LookaheadDecoding
- 模型融合:mergekit
- 约束采样:outlines、guidance、SGLang
- 看似小众却把一个问题解决得非常出色的工具,比如 einops 和 safetensors。
总结
虽然分析中只收录了 845 个仓库,但实际上我浏览过几千个。这让我对看似庞杂的 AI 生态有了一个全局性的认识,希望这份 清单对你也有所帮助。如果发现遗漏的仓库,欢迎告诉我,我会把它加进来!