2026年8月AI大模型能力TOP30排行榜(附清单),藏着一些不太好看但很真实的信号
每次大模型排行榜更新,我都会认真看一遍。不是为了追热点,是因为这个榜单的变化速度,有时候比新闻本身更能说明问题。
八月份这份TOP30,我看完之后坐了一会儿,有些东西跟我想的不太一样。

先说最上面。
Claude Opus 5,63分,第一。紧接着是Claude Fable 5,62分。Anthropic一家公司占了前两名。
这个结果说实话让我有点意外,但仔细想想又不意外。过去一年多,Anthropic在长文本理解、复杂推理、代码生成这几个维度上的进步是有目共睹的。他们不怎么做营销,不怎么开发布会,但模型能力一直在往上走。
OpenAI这次排第三的是GPT-5.6 Sol,61分。后面还有Terra、Luna、Codex,加上一个5.3版本的Codex,OpenAI一家公司占了五个席位。这说明什么?说明他们的策略是多线并进,不同场景用不同版本去打。
Grok 4.6,61分,跟GPT-5.6 Sol并列。xAI这家公司,从马斯克一开始被大家当笑话看,到现在真刀真枪杀进前四,中间其实也就两三年。有时候我会想,行业里那些"不可能",保质期真的越来越短了。
然后是让我最关注的部分——中国厂商。
Kimi K3,60分,第五名。
月之暗面这家公司,从Kimi K1开始我就在关注。他们的产品思路一直很清晰,就是做"能真正帮人干活的AI"。K3这次能进前五,我觉得不是偶然,是他们一直在做的那件事终于到了一个临界点。
Qwen3.8-Max,58分,第六。阿里的通义千问系列,说实话之前有一段时间我觉得他们节奏有点慢,但这次3.8版本直接跳到第六,说明底层能力还是有的,只是之前可能没完全释放出来。
DeepSeek V4,56分,第九。深度求索这家公司,从V1到V4,每一步都走得很扎实。他们的开源策略在开发者社区里口碑很好,这次商业模型也能排进前十,算是两条腿都站住了。
再往后看,GLM-5.2,53分。豆包Seed,52分。这两个也在第一梯队边缘了。
但让我觉得需要说一说的,是后半段。
从第二十名开始往下,你会看到一个很集中的现象:华为盘古、百度文心、腾讯混元、科大讯飞、360智脑、商汤、百川、零一万物、中国移动九天……
这些名字,每一个背后都是大厂或者明星创业公司。但分数基本在33到43之间。
我不是说这些公司不行。但客观讲,跟前面那些比,差距确实存在。而且这个差距不是"再努力一下就能追上"的那种,更像是路线选择、资源投入、技术积累这些更深层的东西造成的。
尤其是华为盘古和百度文心,这两家其实很早就开始做大模型了,起步比很多公司都早。但现在排在这个位置,多少有点让人感慨。先发优势这个东西,在AI领域好像没那么管用。
最后说几个我个人的小感受。
第一个感受是,这个榜单的分数区间其实很窄。最高63,最低33,中间只差30分。但体感上,第一名和第三十名的差距远不止30分能形容的。越往上走,每一分的提升都越难。就像跑步,从10秒跑到9秒,和从5秒跑到4秒,完全是两回事。
第二个感受是,中国厂商在中间位置(第五到第十五名)的表现其实相当不错。Kimi、Qwen、DeepSeek、GLM、豆包,这几个已经能跟全球一线掰手腕了。但如果把视野拉到整个榜单,你会发现"头部集中"的趋势在加剧。
第三个感受,也是我最想说的:排行榜这个东西,看看就好。
分数能说明一些问题,但不能说明所有问题。一个模型排第几名,跟它在你的实际工作场景中好不好用,是两回事。我见过有人用排第十五的模型写出了非常好的方案,也见过有人用排第一的模型做了个一塌糊涂的PPT。
工具终究是工具。关键还是用工具的那个人,想清楚自己要解决什么问题。
这份榜单我大概率下个月还会再看一遍。到时候再聊聊,又有什么变了。
附:清单| 排名 | 模型名称 | 厂商 | 能力分数 |
|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 63 |
| 2 | Claude Fable 5 | Anthropic | 62 |
| 3 | GPT-5.6 Sol | OpenAI | 61 |
| 4 | Grok 4.6 | xAI | 61 |
| 5 | Kimi K3 | 月之暗面 | 60 |
| 6 | Qwen3.8-Max | 阿里巴巴 | 58 |
| 7 | Muse Spark 1.2 | Meta | 57 |
| 8 | GPT-5.6 Terra | OpenAI | 57 |
| 9 | DeepSeek V4 | 深度求索 | 56 |
| 10 | Claude Sonnet 5 | Anthropic | 55 |
| 11 | GLM-5.2 | 智谱AI | 53 |
| 12 | GPT-5.6 Luna | OpenAI | 52 |
| 13 | DeepSeek V4-Flas | 深度求索 | 52 |
| 14 | Gemini 3.6 Flash | 52 | |
| 15 | 豆包 Seed | 字节跳动 | 52 |
| 16 | Gemini 3.1 Pro | 48 | |
| 17 | GPT-5.3 Codex | OpenAI | 46 |
| 19 | 小米 MiMo V2.5 | 小米 | 43 |
| 20 | Kimi K2.7 Code | 月之暗面 | 43 |
| 21 | 腾讯混元 Hy3 | 腾讯 | 42 |
| 22 | 文心一言 5.1 | 百度 | 42 |
| 23 | 华为 盘古 | 华为 | 41 |
| 24 | 讯飞星火 | 科大讯飞 | 40 |
| 25 | 阶跃星辰 Step 3.7 | 阶跃星辰 | 40 |
| 26 | 360智脑 | 360 | 38 |
| 27 | 商汤 商量 | 商汤科技 | 36 |
| 28 | 百川 | 百川智能 | 35 |
| 29 | 零一万物 Yi | 零一万物 | 34 |
| 30 | 中国移动 九天 | 中国移动 | 33 |