← 文章 / AI技术
Interconnects 5小时前 · 2026-08-28 17:53:48 · 1 阅读

GLM-5.3:中国实验室如何紧跟AI前沿

说明:我正在出差,没法为这篇文章录制旁白。补充:发出邮件后,我又加上了关于中国数据产业的第 5 点。

今天,Z.ai 发布了 GLM-5.3。目前该模型仅在 coding plan 中提供,API 版本即将上线,两周后还会登陆 Hugging Face(开放权重)。这个模型的表现非常亮眼,得分提升幅度甚至有些惊人。在许多基准测试中,它已经超过了 Moonshot AI 的 Kimi K3;在部分测试中,还超过了 Claude Fable 5 或 GPT-5.6-Sol。

下面是更完整的对比:

这意味着,GLM-5.3 基本已经处在 agentic coding 基准测试的前沿,而它只有约 7500 亿参数——仅为 Kimi K3 的三分之一!Z.ai 的博文写得相当直白,开篇就是一句颇为大胆的话:

我们为 GLM-5.3 做的,只有扩展 post-training。

GLM-5.3 与 GLM-5.2 使用相同的基础模型,但 post-training 得到了大幅扩展。为了避免过度概括,可以说,相比 Kimi,Z.ai 似乎更擅长 post-training;而 Kimi 更像是一件预训练领域的杰作。发布之后,很多人都在讨论:中国为什么能保持如此强劲的追赶势头?这样一个小得多的模型,怎么能达到美国领先开源模型的水平?这些结果是真的吗?

订阅

最简单的解释是:Z.ai 非常擅长这件事。别忘了,他们投入这一系列模型的时间,可能比业内绝大多数团队都更早。下面简要回顾 GLM 模型的发展历程。

  • Zhipu AI 成立 – 2019 年

GLM 5.2 于今年 6 月 22 日发布,影响很大。发布几周后,我仍经常听熟悉的 AI 研究人员提起,他们继续使用这个模型,主要是因为它速度快(有些人会将模型部署在内部集群上,以获得比公共服务更快的速度),而且足够简单(在开发前沿 AI 系统时,不会有回滚等额外机制)。总的来说,GLM-5.2 经受住了热度与期待的考验。

我自己也经历过类似的怀疑,心想:“他们怎么能一次又一次做到?按理说,这些模型不该有看起来那么强。”美国公司的资源优势如此悬殊,却始终没能在能力上拉开差距,这确实让人有些难以理解。最常见的解释是蒸馏(distillation)。我之前写过,也详细讨论过这个问题,但我认为它并不是主要因素。顺带一提,最近有一篇论文展示了如何用简单方法提取 frontier model 的推理轨迹——这类方法显然很适合中国实验室大规模采用。我不明白美国的实验室为什么没能更快修补这一行为,反而跑去向政府寻求政策援助。这在我看来完全说不通。

Z.ai 的博客说得很直接,也符合以 RL 为主导的训练方式。他们表示,训练过程中使用了“更多环境、更多样的任务,以及投入更多算力”。RL 环境本身、支撑大规模运行这些环境的基础设施,以及将它们高效组合起来的算法,都不是简单靠“蒸馏”就能获得的。

Interconnects AI 是一份由读者支持的刊物。欢迎考虑订阅。

订阅

那么,如果不是靠蒸馏,中国实验室究竟是怎么做到的?他们是在 benchmaxxing 吗?benchmaxxing 的一种公认定义,是让模型围绕测试集进行优化,导致其真实世界表现与纸面分数出现明显偏差。决定性因素更多在宏观层面,而非技术细节(当然,技术细节确实重要,只是不同实验室之间更难从这些方面看出差异):

  1. 对 Z.ai 来说,发布新模型可能只需几天,而 OpenAI 或 Anthropic 往往要等上几个月。OpenAI 和 Anthropic 的内部模型很可能远胜 Z.ai 和 Moonshot AI。但这些美国公司通常要过几个月才会向公众发布模型,这反而让中国实验室在前沿模型的采用竞争中占据了明显优势。简单来说,美国实验室把大量时间花在发布前测试上,而中国实验室则利用这段时间持续优化模型、刷高基准测试成绩(SpaceXAI 在这方面可能更接近中国实验室)。在进展如此迅速的情况下,这很可能是中国实验室能够持续站在前沿的最大原因。到目前为止,这种做法对美国实验室在经济上仍然可以接受,毕竟它们的模型依然拥有巨大的需求。


    随着构建 LLM 的实验室不断加强模型自我改进闭环,如果其中任何反馈环节需要用户数据,那么更快的发布周期可能会让中国实验室获得巨大优势:在下一代明显更强的模型问世、导致市场需求转移之前,它们的模型可以保持更长的生命周期。


    这显然正是业内许多人担心的竞争态势。如今有这么多实验室都在领先能力范围内开发前沿模型,很难想象这种趋势会在近期缓解。

  2. 没错,Z.ai 可能确实比 OpenAI 或 Anthropic 更看重公开基准测试。这些基准测试——例如在 Artificial Analysis Intelligence Index 或类似聚合榜单上取得高分——会直接影响它们的股价。为了持续融资并维持团队士气,它们在很多时候都必须这样做;毕竟,作为资源有限的挑战者与美国巨头比肩,本身就是一个极具吸引力的故事。

    适度刷榜并不一定源于绝境或类似压力。在数量惊人的实验室中,这几乎已经成为行业惯例。许多公司的数据获取策略,就是购买自己在基准测试中落后的那些领域的数据。

  3. Z.ai 并没有为了刷榜把 GLM-5.3 练到“烤糊”(至少不是故意的,而且他们也会对此进行检查)。如今每家实验室都在应对强化学习扩展带来的各种问题。Anthropic 的 Opus 5 和 Sonnet 5 虽然基准测试成绩惊人,但口碑却相当两极化。整个行业都面临同样的处境:有些模型权重比其他模型更好用,但各家发布博客里的基准成绩基本都是真实的。

  4. GLM-5.3 可能是一个比 Claude Fable 或 GPT Sol 更窄的模型。GPT-5.2 发布时,除了 agentic coding 之外,它在其他领域的评价并不一致。与此同时,OpenAI 和 Anthropic 的模型服务着规模庞大的企业客户,覆盖数不清的使用场景。处于采用曲线早期阶段的公司有一个优势:可以优先瞄准价值最高的场景。在 post-training 阶段,少关注一些边缘需求,会让最终模型的整合容易得多

    当然,这个说法有些夸张,因为据报道,Z.ai 凭借强劲的本地部署业务,ARR 已达到 10 亿美元。


    同样,GLM 旗舰模型一直不具备视觉能力。纯文本模型确实让 Z.ai 更容易拿到有竞争力的分数,但这也是一个竞争更激烈的领域。另一方面,Inkling-Small 这类模型则是为全模态能力而设计的。

  5. (新增)中国的 RL 数据产业正在迅速崛起。我们关注的许多消息来源和传闻渠道都提到,中国的数据产业正在快速发展,而背后的重要推动力,正是向中国模型实验室销售服务的美国数据公司。具体来说,中国实验室可能会购买许多美国前沿实验室使用的同类 RL 环境,并更快发布经过下游 RL 训练的模型。我们目前对这个市场的规模和影响仍存在较大的不确定性,但它显然正变得越来越重要。

  6. Z.ai 是一家能力极强的 LLM 机构,其计算效率很可能远高于 OpenAI 和 Anthropic。这一点值得反复强调:他们非常擅长自己的工作。Z.ai 与清华大学有着密切联系,而清华汇聚了许多中国最优秀的计算机科学家。这支规模庞大、积极进取的人才队伍,和对任何西方同行一样,都是他们取得成功的关键。

    我访问清华大学时拍摄。

总体来看,他们围绕 GLM 系列模型采取的策略相当稳妥。恭喜发布!我很期待模型权重公开,这样就能进行更长时间、更深入的测试了(我通常使用 Fireworks 或 Baseten 这类美国开放权重模型推理服务)。

发表评论

这又推动了一个不可避免的趋势:极强的网络能力将逐渐渗透到整个经济体系。Z.ai 也已经意识到这一点,并表示

GLM-5.3 是我们迄今为止在网络安全任务上能力最强的模型。在漏洞发现、漏洞利用分析以及复杂的多步骤安全任务方面,它都有显著提升。这些能力可以帮助防御者更早发现弱点、验证风险并加快修复速度。

但这些能力也带来了明确的双重用途风险。因此,我们将采取分阶段发布策略。首先,我们会让经过筛选的安全合作伙伴在受控环境中评估 GLM-5.3,随后再逐步开放更广泛的访问权限和 API。待必要的安全评估与发布准备工作完成后,我们将公开 GLM-5.3 的完整模型权重。

他们还提到,除了进行模型对齐外,也会通过请求分类器和思维链监控来监督平台上的推理过程。但关键在于具体执行细节,目前还不清楚每家 AI 实验室能做到什么程度。能力扩散的上限,取决于最薄弱的环节。

归根结底,随着真正的开放权重模型即将出现,这类安全措施几乎无关紧要。即使不是 GLM-5.3,也会有其他模型跟进。具备这些能力的模型规模正逐渐缩小,修改和部署也越来越容易,甚至可能在没有安全防护的情况下运行。Z.ai 做对了一些事情,包括推动发现更多漏洞并进行主动管理,但任何一家公司的能力都远不足以独自应对这一局面。

我们需要由政府或行业联盟牵头,制定工业级的指导方案,立即为整个软件行业的这场转型做好准备。

133214分享上一页下一页
原始来源: Interconnects

评论 (0)