9月全球最新AI大模型能力排行榜!

9月初,Artificial Analysis 发布智能指数(Intelligence Index)v4.2。
该指数将主流大模型置于十类真实任务中统一评测,涵盖智能体工作流、代码、科研推理、长文档理解等领域,最终合成一个综合得分,衡量的是模型"执行实际任务"的能力,而非单纯的记忆或答题水平。
榜单收录 643 个模型配置。以下为前27名完整排名。


榜单分析
Top 10 结构:中美各占多少

按模型口径(同源模型取最高分)统计前十名:美国 8 席,中国 2 席。
美国:Claude Fable 5.1、GPT-6 Astra、Claude Opus 5、Claude Fable 5、Muse Spark 1.3(Meta)、GPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flash
中国:Kimi K3(第 8,指数 50)、GLM-5.3(第 9,指数 49)
前十名整体被美国厂商占据,Anthropic 一家占四席。中国模型的代表是 Kimi K3 与 GLM-5.3,两者的指数与第 7 名差距在 2 分以内,已触及第一梯队下沿。

TOP27地区分布
按 27 个配置统计:美国 19 席,中国 7 席,阿联酋 1 席。
美国:Anthropic、OpenAI、Meta、Google、xAI、Thinking Machines 六家厂商全线在场,前 12 名中占 11 席
中国:月之暗面、智谱、阿里、DeepSeek、MiniMax 五家厂商上榜,集中在第 13–23 名区间
其他:阿联酋 MBZUAI 的 K2 Horizon 排第 22 名,是榜单中唯一非中美模型
按实验室整体实力,Artificial Analysis 官方排序为:Anthropic > OpenAI > Meta > xAI > 月之暗面 > 智谱 > Google

选型建议:对应日常使用场景
对普通用户而言,榜单分数并不直接等于"该用哪个"。
榜单上的 27 个配置大多通过官方应用提供服务:
GPT-6 Astra 与 GPT-5.6 在 ChatGPT 应用内,
Claude Fable 5.1 在 Claude 应用内,
Kimi K3 在 Kimi 应用内,
GLM-5.3 在智谱清言内,
DeepSeek V4-Flash 在 DeepSeek 应用内。
选择的出发点不是型号名称,而是"自己平时让 AI 做什么、是否愿意为此付费"。
可简化为四句:
追求各场景下的上限效果:GPT-6 Astra
日常办公写作、打开即用:Claude Fable 5.1 / GPT-5.6
中文内容创作、偏好国产模型:Kimi K3 / GLM-5.3
零成本高频使用:DeepSeek V4-Flash

重点关注
1. 榜首之争:两份权威榜单给出不同答案
在智能指数 v4.2 上,Claude Fable 5.1 以 57 分居首,GPT-6 Astra 以 55 分紧随其后。
另一权威评测体系 Epoch AI 的综合榜(ECI)则将 GPT-6 Astra 列为全球第一(169 分)。
分歧源于评测侧重:AA 指数更看重智能体与知识工作,Epoch 更看重数学与推理。GPT-6 Astra 是目前唯一能独立解决两道未解数学难题(Erdős 猜想)的模型,但在本榜的智能体维度仅比 GPT-5.6 Sol 高 4 分。
2. 分项评测中 OpenAI 反超
综合排名 Anthropic 居首,但在 GDP.pdf(长文档推理)单项上,GPT-6 Astra 以 33.2% 超过 Claude Fable 5.1 的 26.2%;token 使用效率方面 GPT-6 Astra 同样领先。综合榜与单项榜的差异提示:模型选择应匹配具体任务场景。
3. 中国厂商的两种路径
Kimi K3(50 分)与 GLM-5.3(49 分)是目前最接近第一梯队的中国模型,与前一位差距在 2 分以内。智谱同时登上"单任务成本最优"的 Pareto 前沿,与 Anthropic、OpenAI、Meta 并列。整体而言,中国模型在综合智能上仍有差距,但在开源与性价比两条路径上已进入第一梯队。
榜单每月更新,模型格局随之变动。v5 大版本预计 10 月发布,届时评测规则与排名都可能再次调整。
