← 文章 / AI技术
The Decoder 10小时前 · 2026-09-06 09:29:17 · 4 阅读

GPT-6 Astra 评分引质疑,Artificial Analysis 重构 Intelligence Index

Image description

Artificial Analysis 发布了 Intelligence Index 4.2 版本,此举很可能是为了回应外界对其基准测试未能反映 GPT-6 Astra 实际进步的批评。

此前,包括 OpenAI 自家评估在内的多项评测都显示 Astra 远远领先于其他模型。Epoch AI 让它在超过 50 项基准测试中拿到 169 分,在 267 个模型中排名第一;ARC-AGI-3 的得分则因测试框架不同而出现大幅甚至极大的跃升。而 Artificial Analysis 给 Astra 的评分只与上一代持平。

在更新后的指数中,GPT-6 Astra 比上一代提升了四分。Anthropic 的 Claude Fable 5.1 仍然位居榜首,Astra 排第二,Meta 排第三。Artificial Analysis 还指出,Astra 每个任务消耗的 token 比其他所有前沿模型都少。在性价比方面,Anthropic、OpenAI、Meta 和智谱 AI 并列领先。

Artificial Analysis Intelligence Index v4.2:Claude Fable 5.1 位居榜首,GPT-6 Astra 排第二,比上一代 Sol 高出四分。此前两款 OpenAI 模型得分持平。| 图片来源:Artificial Analysis

新版本指数增加了两项基准测试:面向真实知识工作场景的 AA-Briefcase,以及 Surge AI 用于 PDF 文档分析的 GDP.pdf。由于各家模型已经把 GPQA-Diamond 考满分,这项测试被移除。私有测试数据的权重现在占到 40%,以增加刷分的难度。此外,Artificial Analysis 还修正了多项基准测试中的评分错误,并调整了评分体系,让结果更加稳定。

Artificial Analysis 表示,为在重大模型发布期间保持评分稳定,其暂缓了对 Intelligence Index 的更新。不过榜单头部变化过于迅速,因此不得不进行临时更新。据悉,V5 版开发已历时八个月,将分阶段推出。

原始来源: The Decoder

评论 (0)