← 文章 / AI技术
牛柳一家人 6小时前 · 2026-09-07 13:12:00 · 4 阅读

AI评测系列-C1-怎么判断一个模型好不好

AI评测系列-C1-怎么判断一个模型好不好

官方榜单一周一变,你的场景十年不变。
判断一个模型好不好,答案从来不在别人的榜单里,在你的评估集里。

写在前面

A 辑我们捅破了榜单的窗户纸:数据污染、刷榜套路、标尺熔化、分数高不等于好用(A2、A3 两篇专门讲的)。你可能已经接受「别只信官方榜」——然后呢?回到自己的项目,还是要选模型。

C 辑来了:把验证方法用到四类具体系统上——模型、RAG、Agent、微调版本。本篇是第一站:怎么判断一个模型好不好

先说结论:选模型不是「看谁分高」,是「谁在我的场景里表现好」。分三步——建评估集、跑对比、算总账

这篇的节奏:先建评估集(地基),再讲成本/速度/质量三角(预算),然后给出一套可复制的多模型对比流程(方法),最后解决两个高频纠结——API 还是开源、官方榜信不信。看完你就能直接上手跑一轮对比。

这一篇也是 C 辑的开门篇——后面几篇的 RAG、Agent、微调验收,全都建立在「先会判断模型」之上。模型选错了,后面所有系统都白搭。


一、先建自己的评估集:别人尝不出你的菜

美食博主把一家店夸上天,你还是会先带家人去试吃一次——因为博主的口味不是你的口味。

评估集就是你的「自家人试吃团」。没有它,你选模型靠的是广告;有了它,你选模型靠的是证据。

怎么建(AI选型系列-B2 那篇《评估数据集怎么建》有完整实操,这里说要点):

• 从真实场景取样:把你过去一个月真实遇到的问题、真实用户问过的问题收集起来,三五十条就能起步,不用等完美

• 标注标准先定好:什么算对、什么算错、什么算「勉强能用」——标准不统一,分数就没有意义(B1 讲过多评委一致性,Cohen's κ 就是量这个的)

• 覆盖你的典型场景:你是做客服的,就放真实客服问题;你是写代码的,就放真实编程任务——别拿别人的通用测试集糊弄自己

评估集长什么样?举个例子(示意,不是让你照抄):一条客服评估样本 = 「用户问题 + 期望回答要点 + 评分标准」。比如问题「订单三天没发货怎么办」,期望要点是「先查物流状态、再说明预计送达时间」,评分标准是「要点覆盖全 + 语气礼貌 = 满分」。这样的样本三五十条,就够第一次跑分了。

评估集的质量有三个检查点:代表性(是不是真实场景的分布,而不是你顺手攒的)、标注一致性(同一道题两个人标,标准是否一致——B1 的 Cohen's κ 就是量这个的)、无泄漏(评估样本不能出现在任何训练数据里,否则分数虚高——这点在微调场景尤其致命,C4 还会再强调)。

算分方式也很朴素:要么算正确率(答对的 ÷ 总数),要么人工逐条打分取平均。A4 那篇《设计你的第一个评估集》讲过管理方法——评估集要当资产维护:版本化、定期增补新样本、防止训练数据混进去。

规模上也有讲究:第一轮筛选,二三十条就够,目的是把明显不行的模型筛掉;进入决赛圈的对比,建议扩到一百条以上(示例规模)——样本越多,分数越稳,越不怕单条样本的运气成分。评分方式看题型:选择题可以自动判分;开放式回答可以用 LLM-as-Judge 辅助打分(B2 讲过原理),但关键样本一定要人工过一遍——自动打分负责量,人工负责把关。

最后,评估集会过时:场景变了(比如客服政策更新),评估集也要跟着更新——评估集过时了,分数再高也没意义。

关于规模再纠正一个误区:评估集不是越大越好,是越像越好——100 条真实客服问题的价值,远大于 1000 条网上抄来的通用题。先把「像」做对,再谈「多」。

没有自己的评估集,你选的不是模型,是广告文案。

二、成本/速度/质量三角:买车先看预算

选车没人只看马力,还看油耗和提车时间。选模型同理,永远在三个角上权衡:

三角  │  它回答的问题  │  怎么测

**质量**  │  活干得好不好  │  你的评估集跑分 + 人工看 badcase

**成本**  │  烧钱快不快  │  API 按 token 计费(AI选型系列-C1 拆过完整账单);开源算算力/电费

**速度**  │  等得久不久  │  首 token 延迟、吞吐(LLM工程系列-C1 讲并发与批处理)

速度还要拆细一点:首 token 延迟(用户按下发送到第一个字出来)影响「感觉快不快」,吞吐(每秒出多少 token)影响「批量场景扛不扛得住」。客服要前者,离线批量分析要后者——两个指标别混着看。

三个角之间的权重怎么定?给你一个示例做法:给三个角各设一个权重,综合分 = 各角分数 × 权重之和,把你的偏好量化成公式。比如客服场景,质量权重 50%、成本 30%、速度 20%(示例权重)——权重你来定,但定了就别改,否则不同模型的对比就不公平。

场景(示例)  │  质量权重  │  成本权重  │  速度权重

在线客服  │  50%  │  30%  │  20%

离线批量分析  │  40%  │  40%  │  20%

实时风控  │  40%  │  10%  │  50%

成本怎么估?API 很简单:官方价格页都有每百万 token 的输入/输出价(示例:输入约 1-2 元、输出约 8-16 元每百万 token,具体以官网为准),拿你的评估集跑一遍,统计总 token 数 × 单价就行。开源自部署更复杂——显存、GPU 时长、电费、人力维护(AI选型系列-C2 拆过),粗算即可,别追求精确。

三个角没有「最优」,只有「适合你的权重」:内部工具可以慢一点、便宜一点;面向用户的客服,速度就是体验。

实操建议:先定预算上限,再在预算内挑质量。预算定得越早,候选越少,纠结越少——这也是 AI选型系列-C4 那张价格全景图的价值:先看清市场上有哪些价位的选手,再动手测。

预算不是限制,是帮你做决定的那把尺子。

三、多模型对比流程:同一赛道跑一圈

赛马为什么公平?因为同一赛道、同一裁判、同一规则。多模型对比也是这个道理:

同一个评估集、同一套评估脚本、同一份提示词,把候选模型挨个跑一遍。

流程大概是这样的:

1. 锁定评估集——第一步建的那份,先别改

2. 列候选名单——3 到 5 个,官方榜 + 社区口碑圈定入围者(入围靠榜单,冠军靠实测)

3. 统一跑分——同一脚本、同一温度参数,避免「换个姿势分数就变」

4. 记录三列账——质量分、成本、延迟,一次跑完一起记

5. 人工看 badcase——分数接近时,翻翻每个模型的错题,看错得可不可接受

记成一张表:

候选模型  │  质量分(评估集)  │  成本(示例:跑 1000 次)  │  延迟(约)  │  备注/badcase 印象

模型 A  │  92  │  约 15 元(示例价)  │  约 1.2 秒  │  长文本偶尔漏细节

模型 B  │  89  │  约 6 元(示例价)  │  约 0.8 秒  │  数学题稳,口语弱

模型 C  │  84  │  约 3 元(示例价)  │  约 0.5 秒  │  便宜快,但复杂任务爱偷懒

注意:上面是示例格式,数字别照抄——你自己跑出来的才算数。

跑的时候有三个最容易翻车的细节:提示词必须一字不差(换个说法,分数可能差好几个点);模型版本要锁死(API 背后悄悄换版本,对比就废了);随机性要控制(温度设为 0,或同题多跑几次取平均,示例做法)。对比评测拼的不是聪明,是纪律。

跑完怎么读结果,也有个顺序:

• 分数差得大(比如差 10 分以上):直接选高的,别犹豫

• 分数接近(差 2-3 分):翻 badcase + 比成本延迟——错题可不可接受,往往比那两分更重要

• 分数波动大:同一个模型同一道题,多跑几次看分数稳不稳——波动大的模型,单次分数不可信

再教一个小技巧:把评估集里最典型的 5 条问题单独拎出来,人工逐个对比各模型的完整回答——看完整回答,比看分数更能建立「手感」。

举个完整示例(示意):评估集 50 条客服问题,三个候选模型各跑一遍,每模型花了约 20 分钟;结果模型 A 质量最高,但成本是 B 的两倍,而 B 和 A 质量只差 3 分——于是选了 B。这个例子想说的是:选型的答案往往不是「最好的」,是「够用且划算的」。

另外,这套对比流程值得沉淀成脚本:评估集、提示词、打分逻辑全部固化成代码,以后每次有新模型、新版本发布,重新跑一遍就行——你的判断就从一次性动作,变成了可重复的流程(D3 会讲怎么把评估自动化)。

还有一个纪律:跑分的时候别偷偷改题。 看到模型 A 分数低,顺手把评估集改一版——分数好看了,但对比也废了。评估集一旦锁定,中途只准增补,不准为某个模型修改。

分数高不一定是冠军,同一赛道跑完,才知道谁在骗人。

四、API vs 开源:两条不同的路

比完分,还要比「怎么用」。API 和开源是两条完全不同的路(AI选型系列-A2 专门讲过这道选择题):

维度  │  商业 API  │  开源模型自部署

上手速度  │  快,注册即用  │  慢,要搭推理服务

成本结构  │  按 token 计费,用得越多越贵  │  一次性算力投入 + 持续运维(LLM工程系列-D4 算过这笔账)

可控性  │  受制于人:改版、限流、涨价你都管不了  │  完全可控,还能量化加速、私有化

数据安全  │  数据出本地(要审合规)  │  数据不出门

适合  │  快速验证、低频场景  │  高频、敏感、长期规模化的场景

一句话:开源不是免费,是把账单从「按 token 计」变成「按人天计」——AI选型系列-C2 那篇《开源私有化部署真实成本》拆过,部署、调优、盯监控全是人天。

还有第三条路:混合。先用 API 验证业务跑不跑得通,量上来了再迁移到开源自部署——这是很多团队的实际路径(AI选型系列-D4 给创业者的建议里就是这套思路)。别把「API 还是开源」当成非此即彼的站队题,当成「不同阶段的路线图」。

最后提醒一句:换模型是有迁移成本的——提示词要调、链路要重测、线上行为要观察,这些隐形成本也要记进总账。有时候旧模型不是最优,但「够用 + 不用动」,也是理性的选择。

再补一个很多人忽略的维度:合规。如果你的业务涉及个人信息或敏感数据,API 方案的数据出境问题可能直接一票否决(AI选型系列-A2 提过)——有些时候不是「想不想用 API」,是「能不能用 API」。

总结成一句:能用 API 解决的先别上开源,这是大多数团队合理的起点(示例观察);只有当成本或控制权成为瓶颈,再谈迁移。

API 买的是省心,开源买的是自由——省心和自由,总得付一样。

五、别只信官方榜:榜单是广告的另一种形式

最后再敲一遍木鱼(A2 已经敲过,这里换个角度):

• 官方榜的题,模型可能提前见过——数据污染是刷榜的老套路,你的题它没见过

• 官方榜测的是「通用」,你的场景是「具体」——一个模型全能 90 分,不代表在你的客服场景里及格

• 官方榜会过时——标尺熔化的背景下,三个月前的第一名可能已经换了人

那官方榜是不是完全没用?不是——要用对方法。读榜时看三件事:

读榜看什么  │  为什么  │  反面教材

**发布时间**  │  榜单三个月就过时  │  拿去年冠军选今年模型

**测试集内容**  │  测的不一定是你干的活  │  测编程的榜,拿去选客服模型

**测试方式**  │  不可复现的分数没法核  │  自家测试集、不公开、不解释

合格的读者把榜单当「情报」,不合格的读者把榜单当「结论」。

再补两个提醒:第一,社区口碑同样要打折看——博主推荐往往有立场(带货、引流),看他给不给评估集、给不给复现方式;第二,别追「最强」——你只需要「在你的场景里够用且划算」的那个,为一个用不上的 5 分多付一倍钱,不叫理性,叫攀比。

所以正确的姿势是:官方榜当「入围名单」,自己的评估集当「冠军决赛」。这也正是 AI选型系列-B1 那篇《不只看 benchmark 怎么在自己的场景上评估模型》的核心——榜单缩小范围,实测决定胜负。

记住:官方榜最大的价值不是告诉你「谁第一」,是告诉你「谁值得测」——它帮你把几百个模型缩小到三五个候选,剩下的活儿,交给你的评估集。

官方榜帮你圈定候选,你自己的评估集决定冠军。

六、一页纸总结:三步走完选型

把全文压缩成一张表,收藏起来随时用:

步骤  │  做什么  │  产出

① 建评估集  │  收集真实样本,定标注标准  │  一份能复用的评估集

② 跑对比  │  3-5 个候选,同一评估集跑分  │  一张对比表(质量/成本/延迟)

③ 算总账  │  结合权重与迁移成本,定 API/开源  │  一个能落地的选型决定

再加四句速查:

• 没评估集,先补评估集,别选型

• 有评估集,同一赛道跑 3-5 个候选

• 分数接近,看 badcase、比成本延迟

• 决赛圈,API/开源按阶段定,别站队

• 迁移成本别忘算,够用比最强重要

这五句背下来,你就超过大多数「看榜单选模型」的人。


下一篇预告

模型选好了,系统要开搭了。如果你的系统要「先查资料、再回答」——那就是 RAG。下一篇 C2:怎么判断一个 RAG 系统好不好?检索准不准、生成忠不忠实,拆成两层来验收。

到 C2 你会看到,这篇的方法论(评估集、对比、看 badcase)会原封不动地用回去——只是对象从「裸模型」变成了「模型 + 检索」的组合。


结尾

回到开头那句话:选模型最贵的不是 API 账单,是选错之后返工的账单。

三步走完——建评估集、跑对比、算总账——你选出来的模型,是「你验证过」的模型,不是「别人说好」的模型。

这套三步法没有用到任何「独家工具」,全是常识级别的动作——但它拼的是纪律:每一步都做到位,不被宣传带节奏,不被分数迷惑。 判断力的门槛从来不在技术,在坚持。

而且这套流程是可复用的:下次出新模型、新版本、新供应商,把评估集重新跑一遍就行——你的判断力会随着评估集的积累越来越值钱。

最后再补一句心里话:选型这道题没有标准答案,但有标准流程——评估集、对比、总账,三步一个都不能少。以后别人给你推荐模型,你就问一句:「在你的评估集上跑的?」——这一句话,就能筛掉大半的瞎推荐。

判断一个模型好不好,你不是在挑一个冠军,你是在给自己建一道验证的流水线。
你的评估集,就是你在 AI 时代的第一份「判断力资产」。
原始来源: 牛柳一家人

评论 (0)