GLM-5.3-Flash 低成本匹敌顶级模型,且无需依赖 Nvidia
- Z.ai 发布了 GLM-5.3-Flash:这款模型拥有 3200 亿参数,上下文窗口长达 100 万 token。
- 在 Intelligence Index 上,它的表现几乎追平更大的 GLM-5.3,但每项任务只需 0.09 美元,成本约低至后者的七分之一。
- 该模型完全运行在中国 AI 芯片上,而 Z.ai 自研的软件也实现了与 Nvidia GPU 相当的效率。
Z.ai 新推出的 GLM-5.3-Flash 性价比突出,但也存在明显短板,同时还展现出一个值得关注的基础设施亮点。
据 Z.ai 介绍,GLM-5.3-Flash 是 GLM-5 系列首款原生多模态模型。它总参数量为 3200 亿,其中仅 180 亿处于激活状态;模型采用 MIT 许可证,并支持 100 万 token 的上下文窗口。模型权重已在 Hugging Face 开放。
Artificial Analysis 的测评显示,在最高推理强度下,该模型在 Intelligence Index 上获得 57 分。它只比规模更大的 GLM-5.3 少 3 分,后者得分为 60;同时与 GPT-5.6 Terra 和 Muse Spark 1.2 持平。广告
真正引人注目的是价格。该模型在 Intelligence Index 上的单任务成本为 0.09 美元,而 GLM-5.3 为 0.68 美元,前者便宜约 7.5 倍。据 Artificial Analysis 称,这让 GLM-5.3-Flash 进入了智能与成本的帕累托前沿,也使其成为近期对西方供应商持续施加价格压力的又一款中国模型。广告

在 Z.ai 的 API 上,GLM-5.3-Flash 的价格为每百万输入 token 0.15 美元、每百万输出 token 0.50 美元,略高于 GLM-5.3 价格的十分之一。在智能体任务中,它的表现也能跟上更大的 GLM-5.3。在 GDPval-AA v2 测试中,该模型的 Elo 得分约为 1770,与 GLM-5.3 和 Grok 4.6 持平,仅落后于 Claude Opus 5。不过,它的 token 使用效率仍然较低。Artificial Analysis 发现,它消耗的输出 token 中约有 90% 用于推理。
用中国芯片替代 Nvidia
在正式发布前,Z.ai 曾以“ox-alpha”的匿名身份在 OpenCode 和 OpenRouter 上测试该模型,并一度成为当周最受欢迎的模型。有趣的是,据 Z.ai 称,这些流量全部由中国 AI 芯片处理。广告
SemiAnalysis 报道称,该模型每天处理 100 万亿 tokens。此前,人们普遍认为只有前沿 AI 实验室才具备这样的算力规模。Z.ai 表示,其硬件效率和单 token 成本已经达到常见 Nvidia GPU 的水平。SemiAnalysis 认为,这是对“CUDA 护城河”的又一次考验,此前 OpenAI 的新芯片也取得了类似结果。
CUDA 是连接 AI 软件与显卡的 Nvidia 编程层。经过近 20 年的发展,几乎所有 AI 框架都针对 CUDA 做了优化。换用其他芯片,就意味着要重做这些工作:重新编写计算操作、调整内存访问方式,还要找出新的性能瓶颈。广告
因此,Z.ai 基于 SGLang 开发了自有推理服务软件,并将处理流程拆分为可以独立扩展的多个阶段。团队表示,在相同硬件上,这套方案的吞吐量相比首次尝试提升了 3 倍。整个优化过程还借助了一个基于 GLM-5.3 的 agent。广告
拒绝炒作的 AI 新闻——由人工精选
订阅 THE DECODER,即可享受无广告阅读、每周 AI 简报、每年 6 期独家“AI Radar”前沿报告、完整文章存档,以及评论区访问权限。
立即订阅 来源:Z.ai / GLM-5.3-Flash | Artificial Analysis / 基准测试 | SemiAnalysis / 中国 AI 芯片