← 文章 / AI技术
Hacker News 3小时前 · 2026-09-05 15:22:34 · 3 阅读

Artificial Analysis Intelligence Index v4.2 更新:引入复杂任务与私有测试集

我们正在加速推进即将发布的 v5 版本中的部分内容,通过中间版本更新紧跟前沿模型的步伐。Index v4.2 引入了更复杂、更贴近现实的任务,并增加了更多私有测试集以防刷榜

Intelligence Index v4.2 更新日志:

+ AA-Briefcase:我们的 agentic 知识工作评测,配有私有测试集

+ Surge 的 GDP.pdf:横跨 4,592 页 PDF 的长上下文文档推理

- GPQA Diamond:一套出色的科学推理评测,如今已被现有模型刷到饱和,故移除

……此外还提高了防刷榜的私有测试集(held-out)权重,并升级了评分基础设施以增强稳健性

本次更新通过更具挑战性、更复杂、更贴近现实任务以及防刷榜的私有测试集,让 Index 更接近真实世界的使用场景。我们为 Index v5 的规划与开发已经持续数月——距离一月份发布 Index v4 已过去 8 个月。

此前我们刻意放缓更新节奏,以保持 Index 在近期多款重磅模型发布期间的稳定性。但鉴于过去几周前沿进展如此之快,我们认为有必要立即发布一次中间更新,确保 Index 对用户而言始终保持足够的相关性和实用性。

除这次中间更新外,我们的团队还在全力开发 Index v5,近期计划推出更多渐进式更新。敬请期待!

Intelligence Index v4.2 变更详情:

➤ 新增 AA-Briefcase:这是我们自主研发的评测,配有私有 held-out 测试集。AA-Briefcase 通过由行业专家构建的复杂项目,考察模型在真实 agentic 知识工作场景中的表现。模型需要完成长达数周的知识工作项目,每个项目包含多个相互关联的任务和数千个输入源文件。AA-Briefcase 结合评分细则(rubric)和两两对比(pairwise)两种打分方式,评估任务的可验证完成度、分析质量和呈现质量,从而全面衡量模型在知识工作中的整体 agentic 能力。

➤ 新增 GDP.pdf:该数据集由 Surge AI 打造,专注于评估单轮专业文档推理能力,覆盖 100 份 PDF 和十个领域。模型需综合分布在 4,592 页上的证据,包括文本、表格、图表、脚注及排除项。评分依据 1,275 条专家撰写的原子标准;核心指标“全通过率”仅在所有标准均满足时才算通过任务。

➤ 引入权重以衡量真实世界用途并防止刷分:指数中 40% 的权重现分配给私有保留测试集,较 v4.1 翻倍。保留数据包括 AA-Briefcase、AA-Omniscience 及 CritPt 的解决方案。此举降低了实验室操纵评估的可能性。在 Index v5 中,保留数据的占比将进一步提升。

➤ 改进评分基础设施:在 AA-LCR v1.1 中,我们新增了评分系统提示词,并修正了答案键中的错误与歧义,从而提升评分准确性。针对 GDPval-AA v2 和 AA-Briefcase,我们优化了采样方法并重新锚定 Elo 等级,使新模型加入时评分更加稳定。对于 SciCode,我们增强了评分沙箱的鲁棒性,确保缓慢但正确的代码执行不被判定为失败。

关键结果:

➤ Anthropic 和 OpenAI 领跑指数:Anthropic 的 Claude Fable 5.1 位居榜首,OpenAI 的 GPT-6 Astra 紧随其后,较 GPT-5.6 Sol 提升 4 分。Meta 是排行榜上排名第三的实验室,其后依次为 SpaceXAI、Moonshot/Kimi、Z.AI 和 Google。

➤ 四家实验室共享每项任务成本帕累托前沿:Anthropic、OpenAI、Meta 和 Z.AI 占据更新后的“每项任务成本”前沿。

➤ GPT-6 Astra 主导输出 token 前沿:GPT-6 Astra 的 token 效率高于智能前沿附近几乎所有其他模型;Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash-Lite 分别位于曲线两端(已排除指数得分低于 25 的模型)

GPT-6 Astra 的 token 效率高于智能前沿附近几乎所有其他模型;Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash-Lite 分别位于曲线两端(已排除指数得分低于 25 的模型)

Claude Fable 5.1 和 Opus 5 领跑 AA-Briefcase 榜单,GPT-6 Astra 紧随其后,Muse Spark 1.3 位列其后。GPT-6 Astra 相比 GPT-5.6 Sol 提升了约 85 个 Elo 分。 AA-Briefcase 是我们前沿自研的内部评测,基于私有留出测试集。该评测在行业专家构建的复杂项目中,测试模型完成真实代理式知识工作任务的能力。每个项目包含数千个相互关联的任务和数千份输入源文件,持续数周。AA-Briefcase 结合量规评分与配对比较评分,综合评估可验证的任务完成情况、分析质量及呈现质量,全面反映模型在知识工作中的整体代理能力。 GPT-6 Astra 以 33.2% 的成绩领跑 GDP.pdf,GPT-5.6 Sol 为 28.2%,Claude Fable 5.1 为 26.2%。 GDP.pdf 由 Surge AI 创建,涵盖 100 份 PDF 和十个领域,评估单轮专业文档推理能力。模型需综合分布在 4,592 页中的证据,包括文本、表格、图表、脚注和排除内容。评分依据 1,275 条专家撰写的原子级标准,"全部通过率"要求每个标准均满足才算通过。 以下是各模型的详细拆解: 详细了解 Artificial Analysis Intelligence Index v4.2,请访问 https://artificialanalysis.ai/methodology/intelligence-benchmarking

最新文章

GPT-6 Astra 基准测试

GPT-6 Astra 在 Artificial Analysis Coding Agent Index 中取得显著提升,以更低成本达到 Fable 5 的水平。在 Intelligence Index 中,它在保持与 GPT-5.6 Sol 相近性能的同时消耗更少 token,但更高的价格抵消了这一下优势

2026 年 9 月 3 日

Muse Spark 1.3:Meta 跻身前沿

Meta Muse Spark 1.3 的独立分析与基准测试

2026年9月2日

Google 发布 Gemini 3.8 Flash,不到四个月内的第四款 Flash 模型

Gemini 3.8 Flash 在 Artificial Analysis Intelligence Index 中得分 59,并登上智能与单位任务成本帕累托前沿

2026年9月2日

原始来源: Hacker News

评论 (0)