2026年9月大模型能力榜:谁领跑AI赛道
每个月,LMArena(原 Chatbot Arena)都会用几十万次人类真实盲测对投,给大模型排一张“民意榜”。2026年9月,这份榜出现历史性一刻:三款模型首次集体突破 1500 Elo——这条曾经被认为“不可逾越”的分水岭。本文用最新公开快照,带你看清谁在领跑、谁在逼近。
9月榜首:三强破1500分水岭
LMArena 以盲测 pairwise 对投聚合 Elo 评分,分数越高代表人类偏好越强。2026年9月15日快照显示,文本榜前三全部站上 1500+,且前四被 Anthropic 包揽。
▪︎ Claude Mythos 5(Anthropic)· 1531 Elo
▪︎ Claude Fable 5(Anthropic)· 1525 Elo
▪︎ Claude Opus 5(Anthropic)· 1522 Elo
▪︎ GPT-5.6 Sol(OpenAI)· 1514 Elo
▪︎ Claude Opus 4.8(Anthropic)· 1512 Elo
▪︎ GPT-5.5 Pro(OpenAI)· 1510 Elo
▪︎ GPT-5.5(OpenAI)· 1506 Elo
▪︎ Claude Opus 4.7 / Gemini 3.1 Pro(Anthropic / Google)· 1505 Elo(并列)
▪︎ Kimi K3(Moonshot AI,开源)· 1500 Elo
▪︎ Qwen3.8 Max(阿里云,开源)· 1491 Elo
注:不同快照日期/来源在个别名次上略有出入,本文以 2026-09-15 LMArena 公开快照、按 Elo 为准;榜单每周随投票更新。
真正的变化:开源阵营贴脸前沿
更值得关注的是结构变化。Moonshot 的 Kimi K3 以 1679 Elo 登顶编程(Frontend Code)Arena,成为首个在某一榜单上 outright 登顶的开源模型;在文本榜也站上 1500,与闭源第一梯队持平。
阿里云 Qwen3.8 Max(1491)、智谱 GLM-5.2(1483)同样挤进前沿 Elo 带,且性价比突出——Qwen3.8 Max 价值分达 24.0,GLM-5.2 以 168 tok/s 成为最快可自托管模型之一。
▪︎ 闭源前三被 Anthropic 包揽,OpenAI 的 GPT-5.6 Sol 紧随其后
▪︎ 开源模型首次摸到 1500 分水岭,“前沿俱乐部”不再只属于大厂
▪︎ 中国模型 Kimi K3 / Qwen3.8 Max / GLM-5.2 集体上榜
怎么读这张榜
Elo 衡量“人类更喜欢谁的答案”,不代表单项能力。选模型时:编码看 Kimi K3 / Claude 系列,速度看 Gemini 3.1 Pro(131 tok/s),性价比看 GLM-5.2 / Qwen3.8 Max。榜单每周变动,追新请以 LMArena 官网实时榜为准。
数据来源:LMArena.ai 2026年9月公开快照,交叉核对 Daily AI World、Swfte 等公开整理;封面为免费无版权图。
THE END