← 文章 / 未分类
ainews 7小时前 · 2026-09-03 05:54:26 · 1 阅读

MMLU(大规模多任务语言理解)

MMLU 由 Hendrycks 等人于 2020 年推出,旨在衡量高中生、本科生及专业级别学科的知识广度。涵盖领域从初等数学到国际法再到临床医学,不一而足。每题四选一,随机猜测得分率 25%。人类专家在各自领域顶尖可达约 90%,跨学科专家平均约 80%。

多年来,MMLU 一直是衡量进步的清晰标尺:2020 年 GPT-3 得分约 44%,2022 年 GPT-3.5 约 70%,2023 年 GPT-4 达到 86%,2024 年 Claude 3 Opus 突破 88%。到了 2025–2026 年,Claude Opus 4.7、GPT-5、Gemini 3 Ultra、DeepSeek V4 等所有前沿模型均集中在 88%–92% 区间。该基准事实上已饱和,这之间的差异主要源于题目歧义带来的噪声,而非真正的能力差距。

MMLU 仍被频繁引用,是因为人们熟悉它且数据集固定不变。但各大实验室已转向更难的后继基准:MMLU-Pro(10 个选项而非 4 个,题目更难的,2026 年前沿天花板约 75%)、GPQA Diamond(博士级科学,前沿天花板约 70%)以及 Humanity's Last Exam(精心编排的多数专家也难以应对,前沿天花板约 30%)。如果某款 2026 年发布的新模型主打 MMLU 成绩,那基本是营销信号——他们挑的是最简单的基准,因为难的那些不好看。一份 2026 年的模型卡若显示 MMLU 91% / MMLU-Pro 76% / GPQA Diamond 68%,说明该模型处于前沿梯队。单看 MMLU 数字毫无意义——所有正经模型都能过 88%。

MMLU 是基准饱和的经典案例。了解它为何不再有用,能帮你以审慎眼光看待各种基准宣传——始终追问:用的是哪个基准?哪个版本?当前的前沿天花板在哪里?

相关术语

Benchmark

Eval / evaluation

LLM (Large Language Model)

在对比中查看

ChatGPT vs Claude

Claude vs Gemini

订阅摘要,新术语、技巧和工具更新直达邮箱。

订阅

原始来源: ainews

评论 (0)