英伟达 130 亿美元收购 Hugging Face
TheInformation 率先爆出消息,如今又得到了确认——英伟达正以 130 亿美元收购 HuggingFace,约为其 1.5 亿美元 ARR 的 80 倍,该公司 2026 年客户数量翻了一番。这几乎是英伟达 2026 年 1 月最初 70 亿美元报价的两倍。

还能说什么呢?我们就是乐见好人赢。而在此背景下——GLM-5.3-Flash(即 Ox Alpha)让所有人眼前一亮(除了 GDM 的含糊发帖者),Qwen 也在国产芯片上推出了令人印象深刻的 Flash 模型——Hot Chips 会后这场关于西方开源 AI 的讨论,恰好为这桩收购提供了绝佳注脚。
AI News,2026 年 8 月 25 日至 26 日。我们查看了 12 个 subreddit、544 个 Twitter 账号,未再查阅其他 Discord。AINews 网站支持检索全部往期内容。提醒一下:AINews 现已成为 Latent Space 的一个栏目,你可以自行选择订阅或退订邮件频率!
AI Twitter Recap
头条:GLM 5.3 Flash 发布及各方反应
What happened
Z.ai 正式发布 GLM-5.3-Flash,证实此前预览的「Ox Alpha」模型就是它的公开身份。
Z.ai 将 GLM-5.3-Flash 定位为原生多模态模型,拥有 100 万 token 上下文窗口、320B 总参数 / 18B 激活参数,以 MIT 许可证发布,可通过权重、API、聊天、编码套餐和 AutoClaw 获取。
Z.ai 同时将其定位为 GLM-5.2 的高性价比继任者,并依据其内部基准宣称它在各努力档位上都优于 GLM-5.2,编码能力与 Claude Opus 4.8 相当。
这次发布还解开了困扰许久的 Ox Alpha 之谜:多位博主明确将 Ox Alpha 与 GLM-5.3-Flash 联系起来,包括 SemiAnalysis、rasbt、theo 和 Cline。
第三方模型基础设施支持几乎随即到位:CoreWeave、Baseten,以及 Cline 在 VS Code / JetBrains / CLI 中的免费集成。
发布后不久,Z.ai 工程师 Zixuan Li 表示聊天模板已更新,早期下载者应重新下载模型,暗示这是一次 day-0 的打包或提示词格式修正。
Artificial Analysis 最初发布概览时列出了错误的 400k 上下文窗口,随后更正为 100 万上下文,与 Z.ai 最初的公告保持一致。
对于一次开源权重模型发布而言,社区的反响异常热烈:从「HOLY」这类简短的惊叹,到更实质性的判断——该模型可能已是单位智能成本最优的选择,例如 Artificial Analysis 和 zainhas 的观点。
这次发布还被纳入了关于中国前沿开源模型的更大叙事中,有帖子指出,中国的开源实验室正在线性注意力、稀疏注意力、残差路径设计和 Muon 等相似的架构选择上趋于收敛。
至少有一项模态声明遭到了独立质疑:skalskip92 认为该模型虽号称「原生视觉」,但在多项视觉/目标检测任务上表现疲软。
Official claims and launch details
Z.ai 的官方首发推文是事实基准:GLM-5.3-Flash 被描述为:
320B 总参数 / 18B 激活参数
100 万 token 上下文
原生多模态
MIT 许可证
此前以 Ox Alpha 之名预览
「完全运行在国产 AI 芯片上」
发布时的分发/可用渠道:
Hugging Face 权重
Z.ai API
聊天
ZCode
编码套餐
AutoClaw
最强的厂商自报性能声明来自 Z.ai 的编码主题帖:在 Z.ai Code Bench 上,GLM-5.3-Flash 「在各努力档位上都明显优于 GLM-5.2,且与 Claude Opus 4.8 表现相当」。不过这是一方基准测试,有参考价值,但应比独立评测更谨慎地看待。
AutoClaw 随后发布的助阵帖将模型定位为适合视觉语言理解、代码生成和长程智能体任务,并把可用性与积分/返现捆绑,但这主要是上线信息而非新的技术证据:AutoClaw 发布帖。
Independent benchmarks and cost/performance positioning
这批推文中最有分量的独立评测来自 Artificial Analysis。其结论是:GLM-5.3-Flash 在 Artificial Analysis 智能指数上得 57 分。
Artificial Analysis metrics cited
AA 智能指数得分:57
与 GLM-5.3 的差距:落后得 60 分的 GLM-5.3 3 分
单任务成本:0.09 美元
API 价格:输入 0.15 美元 / 100 万 token,输出 0.50 美元 / 100 万 token
缓存输入:约 0.026–0.03 美元 / 100 万 token,相当于 80% 折扣
模型规模:320B 总参数 / 18B 激活参数
许可证:MIT
上下文:最初列为 400k,后更正为 100 万
Comparisons cited by Artificial Analysis
与 GPT-5.6 Terra 和 Muse Spark 1.2 同以 57 分持平,但单任务成本要低得多。
0.09 美元/任务,对比 GLM-5.3 max 的 0.68 美元/任务。
宣称单任务成本比 GLM-5.3 max 低约 7.5 倍。
宣称单任务成本比 GPT-5.6 Terra 便宜约 5.7 倍,比 Muse Spark 1.2 便宜约 4.4 倍。
Token-efficiency and reasoning mix
Artificial Analysis 指出了一个有趣的权衡:
GLM-5.3-Flash 跑完智能指数用了 1.49 亿输出 token
对比 GLM-5.3 的 1.68 亿
但在相近智能指数得分下,多于 Kimi K3(1.33 亿)和 Qwen3.8 2.4T A95B(1.36 亿)
1.49 亿 token 中的 1.34 亿(约 90%)是推理 token
这是一个重要的细节:该模型的经济学之所以亮眼,主要因为 token 定价极低,而非它特别省 token。
Agentic/work evals from Artificial Analysis
Artificial Analysis 还报告称,GLM-5.3-Flash 在智能体任务上的表现强于其原始知识指标所暗示的水平:
GDPval-AA v2 Elo:1770
在误差范围内与 GLM-5.3 和 Grok 4.6 持平
仅落后于 Claude Opus 5 xhigh/max
Terminal-Bench v2.1:84.3%,对比 GLM-5.3 的 83.9%
τ³-Banking:47.2%,落后 GLM-5.3 3.1 个百分点
Knowledge/hallucination stats
AA-Omniscience 得分:+7
准确率:28%
幻觉率:28%
与 GLM-5.3 对比:
GLM-5.3 准确率 34%
GLM-5.3 幻觉率 30%
与 GPT-5.6 Terra 对比:
Terra 准确率 47%
这印证了各方反应中反复出现的主题:GLM-5.3-Flash 在实战代码/智能体工作流上可能远比在宽泛的现实世界事实知识上更强。
Architecture and systems details
多位懂技术的网友试图逆向剖析或总结从 GLM-5.2 / GLM-5.x 起究竟变了什么。
这批推文中最详尽的公开架构拆解来自 rasbt:GLM-5.3-Flash 的骨干从 GLM-5.2 的 744B-A40B 转向 320B-A18B,并采用:
Kimi Linear 风格的 3:1 混合注意力
34 层 KDA(Kimi Delta Attention)
11 层 MLA/DSA
MLA = Multi-head Latent Attention(多头潜在注意力)
DSA = DeepSeek Sparse Attention(DeepSeek 稀疏注意力)
DeepSeek V4 风格的 mHC 残差路径
四路并行流
外加一个原生视觉编码器
同一条推文称其为「超级混合」架构,因为它的两大注意力组件本身就已是「高效」变体,而不是简单的「高效注意力 + 全注意力」混合。
thealexker 的另一份系统视角的有用总结,把这次发布解读为一个效率工程故事,要点如下:
对比 GLM-5.2:
成本约为其 1/10
激活参数 32B → 18B
层数 92 → 45
线性 + 稀疏混合注意力
每层平均 KV Cache 更小
长上下文下注意力计算的复合开销更低
声称视觉智能受益于编码/RL 风格的改进
称 GLM-5.3 基础设施智能体参与合著了部分工作,协助优化内核、定位瓶颈并改进推理服务栈
eliebakouch 的宏观背景帖带有观点色彩,但在技术上值得关注,因为它把 GLM 放进了中国开源模型的整体趋势中:
几乎所有中国前沿模型现在都在用线性注意力
几乎都在用稀疏注意力 / 索引器压缩设计
许多采用 mHC、注意力残差、门控残差等花式残差
许多在用 Muon
那条帖子并非对 GLM 论文的直接解读,但它解释了为何这些架构细节能立刻引起模型工程师的共鸣:GLM-5.3-Flash 看起来只是这个快速收敛的效率优先的中国前沿开源设计空间中的又一个数据点。
Chinese chip angle and serving implications
硬件/推理服务是这次发布中被讨论得最多的部分之一。
Z.ai 自己称模型「完全运行在国产 AI 芯片上」。最有力的放大来自 SemiAnalysis,它聚焦于「国产芯片每天承载 100 万亿 token 推理」这一说法。该推文没有给出完整推导,但把这桩基础设施壮举框定为整场发布中最令人震撼的部分。
各方反应突出了这件事的分量:
teortaxesTex 还给出了直观的产能粗算:
如果推理经济性与 V4-Flash 相当,
每 NPU 每秒 1 万 token 是「现实的」
单芯片每天 8.64 亿 token
每天 100 万亿 token 意味着约 11.6 万片芯片
即 10 万片以上芯片的规模——「可行」,但要吃掉总算力的极大一部分
这一估算属于推测而非证实,但它展示了工程师们如何解读这条服务声明:不只是营销辞令,而是一份基础设施宣言——意味着庞大的国产加速器集群和成熟的推理优化。
Adoption and distribution reactions
这轮反应周期中一个值得注意的现象,是实际使用帖出现得有多快。
Cline 称 GLM-5.3 Flash 已是 Cline 史上增长最快的模型,不到一周便驱动了 全部流量的 11%,同时还以Cline 内免费进行宣传。这固然有推广成分,但也是实实在在的需求信号。
基础设施提供商动作迅速:
CoreWeave:「即将登陆 CoreWeave Serverless Inference」
Baseten:day-0 上线,强调通用智能 + 智能体编码、原生视觉和 100 万上下文
Dell(经 Jeff Boudier):将 GLM 5.3 Flash 和 Qwen 3.8 Flash 定位为可本地部署的开源模型
这一点很重要,因为它印证了 GLM-5.3-Flash 并未被当作猎奇对象;它被立即接入了真实的推理/开发者技术栈。
Facts vs opinions
Facts / externally attributable claims
Z.ai 以 320B 总参数 / 18B 激活参数、100 万上下文、MIT 许可、多模态、此前以 Ox Alpha 之名预览的姿态发布了 GLM-5.3-Flash。
Z.ai 声称该模型运行在国产 AI 芯片上。
Artificial Analysis 报告了 AA 智能指数 57 分和 0.09 美元/任务的成本,以及各种基准细节和定价。
Artificial Analysis 后来把上下文条目从 400k 更正为 100 万。
Zixuan Li 表示聊天模板已更新,模型用户应重新下载。
Cline 称该模型不到一周驱动了全部流量的 11%。
Baseten、CoreWeave、AutoClaw 等纷纷宣布支持/分发。
Opinions / interpretations
thealexker 将这次发布主要解读为一个效率工程的故事。
eliebakouch 将其视为中国前沿开源架构令人振奋地趋于收敛的证据。
zainhas 认为它现在是单位成本智能的最优选择。
skalskip92 则认为该模型视觉能力很差,对发布的多模态宣传提出异议。
scaling01 声称「一眼便知」Ox Alpha 是 GLM 系模型,并进一步声称 ZAI 使用了炒作账号;该说法在这批推文中未经证实。