← 文章 / AI技术
币圆梦 6小时前 · 2026-09-27 21:24:10 · 3 阅读

AI大模型排行榜

最近半年,大模型圈的变化速度让我有点跟不上。

2026年2月,国产模型的Token调用量首次单月占比过半,超过美国模型。Hugging Face全球开源榜TOP10里,中国模型占了8席。Kimi K3杀进了LMSys综合榜前十,Qwen3.8-Max发布当天就登顶前端开发榜。

但别急着喊"国产赢了"。综合榜头部,依然是Anthropic的地盘。Claude系列一口气占了LMArena中文榜前七名里的六席。

没有一个模型在所有维度上领先。2026年大模型竞争的核心事实,就这一句。

这篇文章把全球主流大模型的最新排名、关键基准数据和背后的趋势一次性讲透。

01

竞技场:全球前十长什么样

LMSys Chatbot Arena是目前公认最靠谱的大模型排行榜。它的逻辑很简单,人类盲测,两个模型同时回答同一个问题,人选更好的那个,Elo分数累积排名。跟国际象棋的积分系统一个原理。

2026年8月的全球总榜长这样:

排名模型厂商Elo强项
1Claude Opus 4.8Anthropic1580编程/Agent
2Claude Opus 4.7Anthropic1567推理/Agent
3GPT-5.5 ProOpenAI1551推理/工具
4Gemini 3.1 ProGoogle1538科学推理
5GPT-5.5OpenAI1523通用主力
6Claude Sonnet 4Anthropic1518生产级
7Kimi K3月之暗面1516前端代码
8Gemini 3.0Google1505性价比

数据来源:LMSys Chatbot Arena 2026年8月第三方快照。Elo分数越高表示人类盲测偏好越强。各榜单口径和快照时间不同会存在小幅波动。

几个事实直接跳出来。

前三名里,Anthropic占了两个。Claude Opus 4.8以1580分稳坐第一,领先第三名GPT-5.5 Pro近30分。在Elo体系里,30分的差距意味着人类偏好上明显的可感知差距。

Kimi K3排第七。这是国产模型首次在LMSys全球总榜上稳定守住前十。1516分,和第六名Claude Sonnet 4只差2分。更狠的是,Kimi K3在前端代码竞技场拿了1679 Elo,编程能力全球第一档。

Google的Gemini 3.1 Pro排第四,但它在科学推理上独步天下,GPQA Diamond拿到94.3%,全场最高。每个玩家都有自己的护城河。

02

三巨头:各有各的牌

Anthropic——编程和Agent的双料王。

Claude Opus 4.8的综合排名第一,SWE-bench Pro达到69.2%。这个指标衡量的是AI自主修复真实GitHub issue的能力,接近七成的通过率,已经超过了不少初级工程师的水平。Anthropic的策略很清晰,押注Agentic AI,让Claude不只是聊天,而是能自主完成多步骤任务。

Claude Opus 4.8 关键数据LMSys综合Elo:1580(全球第一)SWE-bench Pro:69.2%MMLU:92.8%MATH:92.3%上下文窗口:100万token

OpenAI——拆分层级,通吃高中低。

2026年7月,OpenAI把GPT-5.6拆成了三个层,Sol是旗舰,Terra是平衡型,Luna是经济型。名字起得像咖啡杯大小,但策略是对的不可能一个模型打天下。GPT-5.6 Sol在MMLU-Pro拿91.2%,HumanEval 96.4%,SWE-bench Verified 88.1%,基准覆盖面全场最广。

更有意思的是GPT-5.4 Thinking。它在OSWorld基准上达到75%,首次超过人类基线72.4%。意思是,在操作系统级别的复杂任务执行上,AI比普通人更强了。

Google——科学推理和长上下文的王者。

Gemini 3.1 Pro的GPQA Diamond 94.3%是全场最高,这个基准测的是研究生级科学问答。200万token的上下文窗口也是最大的,能一口气吞下一整本书加几百篇论文。多模态方面,Gemini 2.5 Ultra原生支持60fps连续视频流理解,看视频这个能力目前没有对手。

03

中国军团的突围

2026年最值得说的不是谁排第一,而是中国模型怎么追上来的。

Kimi K3,月之暗面出品,2.8万亿参数,1M上下文,7月17日发布。它在LMSys全球总榜排第七,前端代码竞技场1679 Elo全球第一档。Terminal Bench 2.1拿到88.3%,MMMU-Pro 81.6%,OmniDocBench 91.1%。7月27日开放权重,2.8万亿参数的开源模型,这在一年前不可想象。

Qwen3.8-Max,阿里8月3日发布,2.4万亿参数,激活95B。发布当天登顶前端开发竞技场,SuperCLUE中文综合第一,Arena综合榜国产最高排第八。工具幻觉率只有0.11%,意思是用它调工具几乎不会瞎编。这个指标对Agent应用至关重要。

DeepSeek V4,4月24日发布,距V3整整484天。MMLU-Pro 82.4%,HumanEval+ 85.7%,Terminal Bench 2.1 87.9%,支持百万上下文。开源,价格3元/6元每百万token。DeepSeek的路线很清楚,开源生态打底,合理定价走量。

其他值得关注的中国选手:豆包Seed 2.1-Pro(字节)OpenCompass均分80.5,代码90.8;GLM-5.3-Flash(智谱)首次进入代码榜Top10排第七;MiMO-V2-Pro-Thinking(小米)SuperCLUE写作榜第四,总分78.9。

国产模型在代码、前端、中文写作、多模态等细分领域已经能和头部闭源模型正面打。但综合榜的绝对头部,还差一步。

差在哪?Agent能力和推理深度。Claude Opus系列在SWE-bench Pro上的表现,国产模型暂时还没追上。Kimi K3在终端任务上很强,但复杂多步推理的稳定性还有差距。这是下一个攻坚战。

04

没有全能选手

把几个关键基准摆在一起看,你会发现一个有意思的事实。

模型MMLU-ProHumanEvalSWE-benchGPQA DiamondMATH
Claude Opus 4.8—93.6%69.2%①77.1%92.3%
GPT-5.6 Sol91.2%①96.4%①88.1%②—92.3%①
Gemini 3.1 Pro92.6%①——94.3%①—
DeepSeek V4-Pro82.4%85.7%+———
Kimi K3—————

①表示该项基准的已知最高分。SWE-bench列中,Claude为Pro口径69.2%,GPT-5.6为Verified口径88.1%(不同口径不可直接比较)。"—"表示该数据未在公开来源中查到。数据来源:各模型官方技术报告及第三方评测。

看明白了吗?

MMLU-Pro最高的是Gemini 3.1 Pro。HumanEval最高的是GPT-5.6 Sol。SWE-bench Pro最高的是Claude Opus 4.8。GPQA最高的是Gemini。数学最高的是Claude和GPT并列。

每个维度排第一的模型都不一样。这意味着选模型这件事,从「谁最强」变成了「谁最适合你的场景」。

写代码找Claude或GPT,做科学研究找Gemini,要性价比找DeepSeek,要中文写作找豆包或Qwen。全能选手不存在了。

05

五条趋势线

趋势一:推理模型成为主战场。OpenAI的o系列开了头,现在所有头部玩家都在做thinking版本。GPT-5.4 Thinking在OSWorld首次超过人类基线,Claude Opus 4.6 Thinking的AAII达到61.4,DeepSeek V4的Toolathlon-Verified 74.1%。模型不再只回答问题,而是学会先想再答。这是质变。

趋势二:开源正在追上闭源。Kimi K3开源2.8万亿参数,DeepSeek V4开源百万上下文,Qwen 3.5在HuggingFace霸榜,Llama 4 Maverick MMLU-Pro 81%。HuggingFace全球开源TOP10中国占8席。一年前开源模型和闭源旗舰的差距还是代差,现在缩小到了同代竞争。

趋势三:价格战在收尾,涨价潮开始了。Kimi K3的API价格较前代涨了3倍,输入20元输出100元每百万token。MiniMax M3发布时价格翻倍。智谱GLM-5海外版涨价67%到100%。但同时,DeepSeek V4-Pro还是3元/6元,Qwen-Flash最低0.2元。市场在分化,有人靠涨价覆盖推理成本,有人靠低价走量。低价窗口正在关闭。

趋势四:多模态进入旗舰标配。Gemini 2.5 Ultra原生60fps视频流理解,Claude Fable 5的视觉能力排Arena第一,GPT-5.6 Sol多模态工具使用,Kimi K3原生视觉理解OmniDocBench 91.1%。只处理文本的模型已经不好意思叫旗舰了。SuperCLUE多模态视觉榜上,Gemini 2.5-Pro以74.99分排第一,GPT-5紧随其后。

趋势五:中国模型从追赶到局部超越。2月Token调用量首次过半,Kimi K3进全球前十,Qwen3.8-Max登顶前端开发榜,DeepSeek V4开源标杆,豆包Seed 2.1-Pro OpenCompass均分80.5。在代码、前端、中文写作这些细分领域,国产模型已经能和Claude、GPT正面竞争。但在Agent能力和深度推理上,差距依然存在。

06

怎么选:一张地图

排行榜看完了,实际怎么选?我按场景给个参考。

写代码/做AgentClaude Opus 4.8第一选择,SWE-bench Pro 69.2%全场最强,Agent工作流稳定性最好。GPT-5.6 Sol紧随其后,HumanEval 96.4%。预算有限选DeepSeek V4,HumanEval+ 85.7%,开源可自部署。

科学研究/长文档处理Gemini 3.1 Pro,GPQA Diamond 94.3%无敌,200万token上下文能吞一整本书。如果涉及中文文献,Qwen3.8-Max和Kimi K3的中文理解更顺。

前端开发Kimi K3,前端代码竞技场1679 Elo。开源,可自部署。Qwen3.8-Max发布当天登顶前端开发榜,也是第一档选择。

中文写作/内容创作SuperCLUE写作榜上,小米MiMO-V2-Pro-Thinking排第四总分78.9,DeepSeek V4-Flash排第五76.61。豆包Seed 2.1-Pro在OpenCompass均分80.5。日常中文场景,国产模型反而比海外更懂中国用户。

性价比优先/自部署DeepSeek V4-Pro开源3元/6元。Qwen-Flash最低0.2元。Llama 4 Maverick开源MMLU-Pro 81%。GLM-5.3-Flash输入0.8元。这几家是目前开源+低价组合的最优解。

2026年大模型竞争的格局已经清晰了。闭源旗舰在综合能力上还领先,但优势在收窄。开源模型在代码和中文场景上已经追到了同代水平。中国厂商在细分领域实现局部超越,但Agent和深度推理是下一道坎。

对普通人来说,这是好事。选择多了,价格低了,能力天花板还在抬高。坏消息只有一个,没有一个模型能一劳永逸地解决所有问题。你得学会在不同的模型之间切换,根据场景选工具。

这其实不是退步。是成熟。

本文数据来源于LMSys Chatbot Arena、SuperCLUE、OpenCompass等公开评测平台及各模型官方技术报告,截至2026年9月初。不同榜单的评测口径、时间和方法存在差异,排名仅供参考。本文不构成任何投资建议。AI技术发展迅速,模型能力可能随版本更新发生显著变化。

原始来源: 币圆梦

评论 (0)