跑分没输过,干活没赢过:为什么AI大模型的榜单正在彻底失真?
大模型的分数越来越高,为什么你用着还是不满意?

自媒体博主动不动把某个模型吹上天,你有没有怀疑过真实性?
资料截至2026年9月10日。文中区分厂商公布的成绩、独立评测和个人体验,不把网络讨论当作统一结论。
最近看大模型发布,容易产生一种错觉:人类剩下的难题,似乎只差下一次版本更新。
数学、编程、科学推理,一张张成绩表不断刷新。可轮到自己使用,问题又很熟悉:让它改一段话,它顺便改掉了你的观点;让它核实一个事实,它给出一串看着像真的出处;聊了十几轮,前面说好的要求又丢了。
最烦的还不是它不会,而是它明明能解决更难的问题,却在这些地方反复出错。
这到底是模型被吹过头了,还是我们看错了分数?
翻了一圈近期的发布材料、独立评测和开发者讨论,我觉得有必要把这个问题讲清楚。因为“跑分没用”和“你不会用”,都解释不了全部情况。
9月刚发布的新模型,就提供了一个很好的例子。
Anthropic在9月1日发布了Claude Fable 5.1,OpenAI在9月3日发布GPT-6 Astra,两家都把复杂工作和持续执行任务放在了显眼的位置。Anthropic产品页、OpenAI发布说明
到了9月9日,独立评测机构Artificial Analysis给出的结果是:
| 模型及测试配置 | Intelligence Index得分 | 该评测中的平均每任务成本 |
|---|---|---|
| GPT-6 Astra,max | 53 | 3.26美元 |
| Claude Fable 5.1,max,启用回退机制 | 53 | 7.63美元 |
| GPT-5.6 Sol,max | 47 | 此处不列 |
这是特定版本综合指数的成绩,不是答对题目的百分比,成本也不能直接当作日常聊天价格。Artificial Analysis评测
只看总分,会得到一个很直观的印象:新模型更强,两款旗舰打平。
但同一份评测还写了另一面:Astra在一项职业任务评测GDPval-AA v2中,比Sol下降约45个Elo分;在长程知识工作评测中,分析质量提高了,呈现质量却下降了。同一份独立评测
这就解释了一种完全可能发生的体验:综合榜单认为模型升级了,你做报告却觉得它退步了。
两件事可以同时成立。
总分把不同能力压成了一个数字。你的工作,却可能恰好依赖被压掉的那部分。
一个每天写代码的人,一个需要整理访谈的研究者,一个反复修改中文文章的编辑,根本不是在使用同一组能力。数学推理提高多少,未必能抵消它总把“可能”改成“一定”的毛病。
我们习惯问“哪个模型最强”,却经常省略了后半句:对什么任务,在什么条件下,强在哪里?
而且,博主们也在重新审视自己曾经使用的测试。
开发者Simon Willison有个很出名的习惯:让新模型画一只骑自行车的鹈鹕,用来观察模型生成SVG图形的表现。
7月评测Kimi K3时,他专门写了一篇文章反思这个方法。他发现,这个测试与模型整体能力之间的联系已经明显减弱。某些模型画得更好,并不意味着它们更适合复杂工作。测试尤其没有覆盖他现在最关心的能力:随着对话变长,模型能不能继续可靠地使用工具。Simon Willison原文
这比一句“某某模型翻车了”更有价值。
一个长期亲自测试模型的人,承认自己的尺子已经不够用了。
用户社区里的表达更直接。5月,Reddit的ClaudeAI社区出现了一篇抱怨评测失去参考价值的帖子:发布时各种高分,接入真实的多步骤项目,体验却对不上。9月6日,一篇讨论GPT-6成绩的帖子下面,也有人追问评测框架和幻觉表现。5月用户讨论、9月用户讨论
这些帖子不能证明模型整体退步,更不能代表所有用户。但它们说明,这种落差并非一个人凭空想出来的。
问题在于,很多测试和真实使用,要求模型做的事情并不一样。
一道题通常已经告诉模型,问题是什么、材料是什么、怎样算答对。现实里,我们经常连自己的需求都还没有整理清楚。
“帮我看看这份材料。”
“这个结论是不是太满了?”
“保留原来的意思,但别写得这么像公文。”
模型需要判断哪些内容不能动,哪些地方缺少依据,什么时候应该问一句,什么时候应该直接做。做完还得检查,有没有在解决一个问题时制造另一个问题。
这些能力很难被一道单轮题完整测出来。
《LLMs Get Lost In Multi-Turn Conversation》这项研究就发现,在它测试的六类生成任务中,把一次性交代完整的要求拆成多轮提供,模型表现平均下降39%。研究指出,模型可能过早作出假设,之后又过度依赖最初的错误方向。研究原文
这是针对当时模型和特定实验设计的结果,不能说今天所有模型聊天都会下降39%。但它指出的问题很具体:会回答一个完整问题,不等于能陪用户把问题逐步弄清楚。
还有一层更容易被忽略:你使用的是一个产品,榜单上写的往往是某种配置下的模型。
OpenAI在Astra发布页明确说明,评测取不同推理强度下的最高成绩,研究环境或API的输出也可能因为系统提示和工具差异,与实际ChatGPT不同。OpenAI评测说明
Anthropic则说明,Fable 5.1的部分请求如果触发网络安全或生物相关防护,会转交能力较低的模型处理。Anthropic产品说明
这不是说所有体验问题都能归咎于配置。它只是提醒我们:模型名称相同,不代表工具、推理预算、上下文处理和实际执行过程完全相同。
所以,看到“我这里特别好用”和“我这里特别难用”,不必急着认定其中一方在撒谎。先看看他们到底用了什么、怎么用、做了什么。
评分本身也值得认真检查,但不必一上来就认定厂商作弊。
公开题目可能进入训练材料,模型可能针对评分偏好优化,评测程序也可能有缺陷。这些是不同问题,需要不同证据。
更常见的误读,甚至不需要任何作弊就能发生:把某项能力的高分,当成所有能力都强;把一次成功,当成可以稳定成功;把漂亮的初稿,当成已经完成的工作。
最后一种误读,对普通用户影响最大。
一篇文章十秒钟生成,听起来很快。可如果你需要花半小时检查出处,再花半小时删除套话、恢复原意,这个速度就没有那么惊人。
代码也是一样。生成了多少行,只是过程;能不能通过检查、接入原来的项目、解决原来的问题,才是结果。
连“我感觉效率提高了”,也未必可靠。
METR在2025年的一项随机实验中发现,16名熟悉自己开源项目的开发者使用当时的AI工具后,完成任务反而平均多花19%的时间。他们自己却认为,AI让工作变快了。METR原始研究
这个结果后来经常被拿来证明“AI编程没用”,同样过头了。METR在2026年2月更新中表示,后续研究受到样本选择等问题影响,已经难以准确估计当前收益;研究者认为,开发者现在很可能比2025年初获得了更多加速。METR后续更新
这两份材料放在一起,真正值得记住的是:效率要测,而且要持续测。不能只相信发布会,也不能只相信自己刚刚用完的兴奋感。
那么,对一个大模型来说,什么最重要?
如果站在实际使用者这一边,我会选:在合理成本下,可靠地完成你交给它的任务。
这里的“可靠”,远不止答案正确。
它包括理解你的要求,记住不能改的内容,区分查到的事实和自己的推测,遇到错误后能调整,最后如实告诉你完成了什么。
比如写文章,你给它五份材料,要求保留分歧。它不能因为某一种观点更容易写,就把另外两种悄悄删掉。
你说一句话证据不足,它应该重新核实,而不是只把语气改得委婉,继续保留同一个没有依据的结论。
你要求检查来源,它不能用“已核实”三个字,代替真正打开原文。
这些事情听起来不如解一道数学难题耀眼。但每天使用AI的人,恰恰会被这些细节反复消耗。
尤其是错误能不能被发现,直接影响你敢把多少工作交出去。
一个明确说“这里没有找到可靠来源”的模型,留下的是一个可处理的缺口。一个编好作者、年份和链接的模型,留下的却是一项你可能根本不知道需要检查的错误。
后者输出得越完整,你越容易放松警惕。
同样,听话也不是一味顺着用户。用户提出的前提有错,模型需要指出来;用户的要求已经很清楚,它又不该自作主张替换目标。分清这两种情况,本身就是判断力。
以后再看新模型,我觉得普通人可以给自己留一份很小的测试集,不必复杂,十个经常做的真实任务就够了。
放进去的应该是你实际遇到过的工作:一段总被改坏的文字,一张容易看错的表,一次需要核实出处的查询,一个要连续修改几轮的任务。
用相近的时间预算和工具条件测试。别只记第一次回答漂不漂亮,记下改了几轮、出了什么错、核查花了多久,最后能不能用。关键任务再重复几次,看看第一次是不是碰巧。
这份测试不能宣布谁是世界第一,却能帮你知道,谁更适合留在自己的工作里。
我仍然希望看到模型在难题上拿到更高的分数。那些进步有价值,也可能让过去做不了的事情变得可行。
但对每天坐在电脑前的人来说,还有一个同样实在的问题:
它忙完以后,我究竟少了多少工作,又多了多少需要收拾的地方?