← 文章 / AI技术
IT之家 16天前 · 2026-07-09 18:29:03 · 0 阅读

AI 大模型周榜:claude-fable-5 蝉联榜首,国产模型稳定中上游

IT之家 7 月 9 日消息,Arena(arena.ai)平台公布了最新一期大模型对战周榜,本期统计覆盖 2026 年 6 月 29 日 ~7 月 5 日。本周榜首位置依旧由 🇺🇸 Anthropic 的 claude-fable-5 牢牢占据,分数微涨 1 分,美国厂商在头部占据绝对优势,国产模型整体保持稳定,多款模型跻身前 30 行列。

IT之家附各主要领域榜单如下:

本期综合榜整体格局变动不大,头部前 5 名均为 🇺🇸 Anthropic 旗下 Claude 系列模型,彼此之间 ELO 分差在 15 分以内,处于统计误差范围内,视为第一梯队。

前十名全部被美国厂商包揽,排名变动基本在 1~2 位,仅 🇺🇸 gemini-3.5-flash 上升 2 位至第 11 名,是前十名外排名提升最多的模型; 🇺🇸 glm-5.1 下滑 3 位至第 22 名,排名变动相对明显。

国产模型整体处于中上游位置,梯队相对稳定:

阿里 qwen3.7-max-preview 排名最高,位列第 15 名,ELO 1475 分,较上周上升 1 位;

百度 ernie-5.1 位列第 27 名,ELO 1468 分,排名持平;

小米 mimo-v2.5-pro 位列第 29 名,ELO 1466 分,排名持平。

代码榜依然被 🇺🇸 Anthropic 垄断前九席位,头部排名没有变化,🇺🇸 claude-fable-5 以 1563 分稳居第一,领先第二名 🇺🇸 claude-opus-4-7-thinking 仅 10 分,分差在误差范围内。

排名变动较大的是 🇺🇸 glm-5.2 (max),从第 13 位大跌 8 位至第 21 位,ELO 分下降 10 分; 🇺🇸 gemini-3.5-flash 在创意写作榜提升 4 位,但代码榜无明显变动,国产 🇨🇳 qwen3.7-plus 排名上升 2 位进入前 30。

国产模型在代码榜表现亮眼,已有多款进入前 30:

阿里 qwen3.7-max-preview 位列第 10 名,ELO 1526 分,排名持平;

小米 mimo-v2.5-pro 位列第 17 名,ELO 1520 分,较上周上升 1 位;

月之暗面 kimi-k2.6 位列第 28 名,ELO 1512 分,排名持平;

百度 ernie-5.1 位列第 29 名,ELO 1512 分,较上周下降 2 位;

阿里 qwen3.7-plus 位列第 30 名,ELO 1512 分,较上周上升 2 位。

数学榜头部依然被 🇺🇸 Anthropic 占据,🇺🇸 claude-opus-4-6-thinking 以 1518 分稳居第一,🇺🇸 gpt-5.5 排名提升 4 位来到第 8 名,是本次榜单中排名上升最多的模型,🇺🇸 glm-5.2 (max) 排名提升 8 位至第 24 名,变动幅度较大。

国产模型方面,月之暗面 kimi-k2.6 排名提升 2 位至第 13 名,阿里 qwen3.7-max-preview 上升 1 位至第 10 名,整体保持稳定。

长文本榜本周榜首易主,🇺🇸 claude-fable-5 从第二升至第一,ELO 分数达到 1524 分,原榜首 🇺🇸 claude-opus-4-6-thinking 降至第二,两者分差仅 1 分,属于统计误差范围内并列。国产小米 mimo-v2.5-pro 排名上升 1 位至第 14 名,OpenAI gpt-5.5-high 排名提升 3 位至第 16 名,变动较为明显。

总体来看,本周 Arena 大模型周榜整体格局稳定,Anthropic 依然在各榜单头部占据垄断地位,美国厂商头部优势依旧明显。国产模型整体排名保持稳定,阿里 qwen3.7-max-preview 在多个榜单中稳居前 15~20 名,已经进入全球第一梯队末尾水平。下周值得关注国产新模型的动态,以及谷歌、OpenAI 新模型是否会带来排名格局变化。

原始来源: IT之家

评论 (0)