MMLU(大规模多任务语言理解)
MMLU 由 Hendrycks 等人于 2020 年推出,旨在衡量高中生、本科生及专业级别学科的知识广度。涵盖领域从初等数学到国际法再到临床医学,不一而足。每题四选一,随机猜测得分率 25%。人类专家在各自领域顶尖可达约 90%,跨学科专家平均约 80%。
多年来,MMLU 一直是衡量进步的清晰标尺:2020 年 GPT-3 得分约 44%,2022 年 GPT-3.5 约 70%,2023 年 GPT-4 达到 86%,2024 年 Claude 3 Opus 突破 88%。到了 2025–2026 年,Claude Opus 4.7、GPT-5、Gemini 3 Ultra、DeepSeek V4 等所有前沿模型均集中在 88%–92% 区间。该基准事实上已饱和,这之间的差异主要源于题目歧义带来的噪声,而非真正的能力差距。
MMLU 仍被频繁引用,是因为人们熟悉它且数据集固定不变。但各大实验室已转向更难的后继基准:MMLU-Pro(10 个选项而非 4 个,题目更难的,2026 年前沿天花板约 75%)、GPQA Diamond(博士级科学,前沿天花板约 70%)以及 Humanity's Last Exam(精心编排的多数专家也难以应对,前沿天花板约 30%)。如果某款 2026 年发布的新模型主打 MMLU 成绩,那基本是营销信号——他们挑的是最简单的基准,因为难的那些不好看。一份 2026 年的模型卡若显示 MMLU 91% / MMLU-Pro 76% / GPQA Diamond 68%,说明该模型处于前沿梯队。单看 MMLU 数字毫无意义——所有正经模型都能过 88%。
MMLU 是基准饱和的经典案例。了解它为何不再有用,能帮你以审慎眼光看待各种基准宣传——始终追问:用的是哪个基准?哪个版本?当前的前沿天花板在哪里?
相关术语
在对比中查看
订阅摘要,新术语、技巧和工具更新直达邮箱。
订阅