← 文章 / AI技术
Ai天梯 2小时前 · 2026-09-23 03:30:52 · 3 阅读

2026年9月大模型能力榜:谁领跑AI赛道

每个月,LMArena(原 Chatbot Arena)都会用几十万次人类真实盲测对投,给大模型排一张“民意榜”。2026年9月,这份榜出现历史性一刻:三款模型首次集体突破 1500 Elo——这条曾经被认为“不可逾越”的分水岭。本文用最新公开快照,带你看清谁在领跑、谁在逼近。

9月榜首:三强破1500分水岭

LMArena 以盲测 pairwise 对投聚合 Elo 评分,分数越高代表人类偏好越强。2026年9月15日快照显示,文本榜前三全部站上 1500+,且前四被 Anthropic 包揽。

▪︎ Claude Mythos 5(Anthropic)· 1531 Elo

▪︎ Claude Fable 5(Anthropic)· 1525 Elo

▪︎ Claude Opus 5(Anthropic)· 1522 Elo

▪︎ GPT-5.6 Sol(OpenAI)· 1514 Elo

▪︎ Claude Opus 4.8(Anthropic)· 1512 Elo

▪︎ GPT-5.5 Pro(OpenAI)· 1510 Elo

▪︎ GPT-5.5(OpenAI)· 1506 Elo

▪︎ Claude Opus 4.7 / Gemini 3.1 Pro(Anthropic / Google)· 1505 Elo(并列)

▪︎ Kimi K3(Moonshot AI,开源)· 1500 Elo

▪︎ Qwen3.8 Max(阿里云,开源)· 1491 Elo

注:不同快照日期/来源在个别名次上略有出入,本文以 2026-09-15 LMArena 公开快照、按 Elo 为准;榜单每周随投票更新。

真正的变化:开源阵营贴脸前沿

更值得关注的是结构变化。Moonshot 的 Kimi K3 以 1679 Elo 登顶编程(Frontend Code)Arena,成为首个在某一榜单上 outright 登顶的开源模型;在文本榜也站上 1500,与闭源第一梯队持平。

阿里云 Qwen3.8 Max(1491)、智谱 GLM-5.2(1483)同样挤进前沿 Elo 带,且性价比突出——Qwen3.8 Max 价值分达 24.0,GLM-5.2 以 168 tok/s 成为最快可自托管模型之一。

▪︎ 闭源前三被 Anthropic 包揽,OpenAI 的 GPT-5.6 Sol 紧随其后

▪︎ 开源模型首次摸到 1500 分水岭,“前沿俱乐部”不再只属于大厂

▪︎ 中国模型 Kimi K3 / Qwen3.8 Max / GLM-5.2 集体上榜

怎么读这张榜

Elo 衡量“人类更喜欢谁的答案”,不代表单项能力。选模型时:编码看 Kimi K3 / Claude 系列,速度看 Gemini 3.1 Pro(131 tok/s),性价比看 GLM-5.2 / Qwen3.8 Max。榜单每周变动,追新请以 LMArena 官网实时榜为准。

数据来源:LMArena.ai 2026年9月公开快照,交叉核对 Daily AI World、Swfte 等公开整理;封面为免费无版权图。

THE END

原始来源: Ai天梯

评论 (0)