Hacker News 7小时前 · 2026-08-29 21:42:46 · 5 阅读
GLM-5.3 现已开放权重
GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升都来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的能力强得多:
- 更强的编程能力:GLM-5.3 是编程能力最强的开放权重模型,在自家的 Z.ai Code Bench 上比 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上取得开源 SOTA。
- 涌现的网络攻防能力:随着后训练规模的扩大,网络攻击能力的发展超出了我们的预期。GLM-5.3 在漏洞挖掘基准 CyberGym 上达到最先进水平,且越靠近漏洞利用链的上游提升越大——在漏洞利用类基准上,其成绩达到 GLM-5.2 的两倍以上。
基准测试
| 基准测试 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 (w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE (v1.1) | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon (v1.1) | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench (v1.0.6) | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
本地部署 GLM-5.3
GLM-5.3 支持通过以下框架部署,欢迎试用:
- SGLang——参见cookbook
- vLLM——参见recipes
- TokenSpeed——参见这里
- Transformers——参见transformers 文档
- KTransformers——参见教程
- Unsloth——参见指南
- 在
Ascend NPU平台上部署时,支持 vLLM-Ascend、xLLM 和 SGLang 等推理框架——参见这里。
注意事项
- GLM-5.3 支持通过
reasoning_effort参数控制思考预算,可选三个级别:low、high和max。不传该参数(或传入其他值)时默认为max;要使用low或high,需要显式传入。复现基准与排行榜成绩时,请保持默认的max。 - 在 GLM-5.3 的对话模板中,不传
clear_thinking时默认为false。对话场景请显式传入clear_thinking=true。
脚注
- HLE w/ tools:评测使用
temperature=1.0、top_p=0.95的采样参数,最大生成长度163,840token;评测在300,000token 最大上下文下进行,并采用上下文管理策略。评判模型为 GPT-5.6-luna (medium)。 - NL2Repo:在 1M 上下文下以
temperature=1.0、top_p=1.0、max_new_tokens=64k评测 NL2Repo。为防止作弊,我们采用基于规则和基于 LLM 的判定来阻止恶意行为(如未经授权的 pip 或 curl 操作)。 - DeepSWE:使用 mini-swe-agent 框架运行 DeepSWE,参数为
temperature=0.95、top_p=1.0、timeout=6h,上下文 400K。 - Terminal-Bench 2.1:在 Claude Code 2.1.207 中评测,参数为
temperature=1.0、top_p=1、max_new_tokens=65536,超时 6 小时。 - Terminal-Bench 3.0:使用 Claude Code 2.1.207 框架评测 Terminal-Bench-3 任务(reasoning effort=max,400K 上下文,128K 最大输出),每个任务 3 次 rollout 取 avg@3。每次 rollout 在由任务官方镜像构建的隔离容器中运行,上限 600 个 agent 轮次,超时 10 小时。Tool Search 已禁用,各 agent 产出的工件由任务官方的独立验证器评分。
- Agent's Last Exam (CLI):使用官方评测协议和 Claude Code 框架评测 ALE(reasoning effort=max,1M 上下文,64K 最大输出)。105 个任务各自在隔离的 Docker 容器中运行,使用其 Task Card 声明的资源。默认超时 4 小时,任务专属限制优先(最长 8 小时)。Tool Search 已禁用,结果由官方 ALE 评分器评分。
- Toolathlon Verified:所有结果均通过官方评测服务获得,报告 3 次独立运行的 pass@1 平均值。
- AutomationBench:在 AutomationBench v1.0.6 上评测,纳入了 PR #13 中对
null类型处理问题的修复。 - GDPval-AA v2:模型由 Artificial Analysis 评测。
- CyberGym:在 Claude Code 2.1.207 中评测 GLM-5.3(max reasoning effort,无 web 工具,
temperature=1.0、top_p=1.0、max_new_tokens=128000)。所有评测不限单任务超时,结果为 1,507 个任务上的单次运行 Pass@1。为模拟真实使用场景,我们将 agent 置于任务容器内,同时移除所有 Git 相关信息,并施加域名白名单(仅允许 pypi.org、deb.debian.org 等基本域名用于安装基础工具),以防 agent 作弊。 - ExploitGym:在 Claude Code 2.1.207 中评测 GLM-5.3、Kimi-K3 和 Qwen3.8 Max(max reasoning effort,无 web 工具,
temperature=1.0、top_p=1.0、max_new_tokens=128000)。报告结果为 869 个任务在 2 小时和 6 小时两档超时预算下的单次运行 Pass@1;超时预算按各模型的每秒 token 速率(TPS,取自 Artificial Analysis)对 API 推理时间折算(GLM-5.3 按 115 TPS、Kimi K3 按 40 TPS、Qwen3.8 Max 按 47 TPS 折算),再加上非 API 开销。同样施加域名白名单(仅允许 pypi.org、deb.debian.org 等基本域名用于安装基础工具),以防 agent 作弊。 - ExploitBench:在 Claude Code 2.1.207 中评测 GLM-5.3(max reasoning effort,无 web 工具,
temperature=1.0、top_p=1.0、max_new_tokens=128000)。遵循官方评测设置,将 agent 与环境的最大交互轮数限制为 300,对 3 个修订版本共 41 个任务计算平均覆盖率得分。任务的覆盖率取各修订版本所达能力的并集,平均分由各结果平均得出。同样施加域名白名单(仅允许 pypi.org、deb.debian.org 等基本域名用于安装基础工具),以防 agent 作弊。 - FrontierSWE:评测由 Proximal 进行,1M 上下文长度、max effort 级别、128K 最大输出 token。优势分数(Dominance score)截至 2026/08/14。
- PostTrainBench:使用 Claude Code 2.1.207 评测 GLM-5.3,max effort 级别,
temperature = 1.0、top_p = 1.0、max_new_tokens = 128000,上下文窗口 1M token。报告 3 次运行的加权平均。未能产出分数的运行回退到官方零样本基座模型基线分。对于旨在防止使用第三方 API 的检查,我们移除了原先基于模式匹配的检查——当本地 vLLM 端点经 OpenAI SDK 访问时它们会产生误报;改为使用 LLM agent 检查解答中是否存在外部 API 使用。 - SWE-Marathon:使用 Claude Code 2.1.207 评测 GLM-5.3,maximum effort 级别,
temperature = 1.0、top_p = 0.95、max_new_tokens = 128000,上下文窗口 1M token。对于strip-clone,原有反作弊检查的 import 检测过于宽泛,可能误杀合法实现;我们移除了受影响的检查,改用基于 LLM 的检查以避免误报。对于parameter-golf和trimul-cuda,NVIDIA wheel 的变更导致 Docker 镜像构建失败,我们添加了--extra-index-url https://pypi.org/simple以恢复构建。
引用
如果 GLM-5.3 对你的研究有帮助,欢迎引用我们的技术报告:
@misc{glm5team2026glm5vibecodingagentic,
title={GLM-5: from Vibe Coding to Agentic Engineering},
author={GLM-5-Team and : and Aohan Zeng and Xin Lv and Zhenyu Hou and Zhengxiao Du and Qinkai Zheng and Bin Chen and Da Yin and Chendi Ge and Chenghua Huang and Chengxing Xie and Chenzheng Zhu and Congfeng Yin and Cunxiang Wang and Gengzheng Pan and Hao Zeng and Haoke Zhang and Haoran Wang and Huilong Chen and Jiajie Zhang and Jian Jiao and Jiaqi Guo and Jingsen Wang and Jingzhao Du and Jinzhu Wu and Kedong Wang and Lei Li and Lin Fan and Lucen Zhong and Mingdao Liu and Mingming Zhao and Pengfan Du and Qian Dong and Rui Lu and Shuang-Li and Shulin Cao and Song Liu and Ting Jiang and Xiaodong Chen and Xiaohan Zhang and Xuancheng Huang and Xuezhen Dong and Yabo Xu and Yao Wei and Yifan An and Yilin Niu and Yitong Zhu and Yuanhao Wen and Yukuo Cen and Yushi Bai and Zhongpei Qiao and Zihan Wang and Zikang Wang and Zilin Zhu and Ziqiang Liu and Zixuan Li and Bojie Wang and Bosi Wen and Can Huang and Changpeng Cai and Chao Yu and Chen Li and Chengwei Hu and Chenhui Zhang and Dan Zhang and Daoyan Lin and Dayong Yang and Di Wang and Ding Ai and Erle Zhu and Fangzhou Yi and Feiyu Chen and Guohong Wen and Hailong Sun and Haisha Zhao and Haiyi Hu and Hanchen Zhang and Hanrui Liu and Hanyu Zhang and Hao Peng and Hao Tai and Haobo Zhang and He Liu and Hongwei Wang and Hongxi Yan and Hongyu Ge and Huan Liu and Huanpeng Chu and Jia'ni Zhao and Jiachen Wang and Jiajing Zhao and Jiamin Ren and Jiapeng Wang and Jiaxin Zhang and Jiayi Gui and Jiayue Zhao and Jijie Li and Jing An and Jing Li and Jingwei Yuan and Jinhua Du and Jinxin Liu and Junkai Zhi and Junwen Duan and Kaiyue Zhou and Kangjian Wei and Ke Wang and Keyun Luo and Laiqiang Zhang and Leigang Sha and Liang Xu and Lindong Wu and Lintao Ding and Lu Chen and Minghao Li and Nianyi Lin and Pan Ta and Qiang Zou and Rongjun Song and Ruiqi Yang and Shangqing Tu and Shangtong Yang and Shaoxiang Wu and Shengyan Zhang and Shijie Li and Shuang Li and Shuyi Fan and Wei Qin and Wei Tian and Weining Zhang and Wenbo Yu and Wenjie Liang and Xiang Kuang and Xiangmeng Cheng and Xiangyang Li and Xiaoquan Yan and Xiaowei Hu and Xiaoying Ling and Xing Fan and Xingye Xia and Xinyuan Zhang and Xinze Zhang and Xirui Pan and Xu Zou and Xunkai Zhang and Yadi Liu and Yandong Wu and Yanfu Li and Yidong Wang and Yifan Zhu and Yijun Tan and Yilin Zhou and Yiming Pan and Ying Zhang and Yinpei Su and Yipeng Geng and Yong Yan and Yonglin Tan and Yuean Bi and Yuhan Shen and Yuhao Yang and Yujiang Li and Yunan Liu and Yunqing Wang and Yuntao Li and Yurong Wu and Yutao Zhang and Yuxi Duan and Yuxuan Zhang and Zezhen Liu and Zhengtao Jiang and Zhenhe Yan and Zheyu Zhang and Zhixiang Wei and Zhuo Chen and Zhuoer Feng and Zijun Yao and Ziwei Chai and Ziyuan Wang and Zuzhou Zhang and Bin Xu and Minlie Huang and Hongning Wang and Juanzi Li and Yuxiao Dong and Jie Tang},
year={2026},
eprint={2602.15763},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2602.15763},
}
原始来源: Hacker News
