AI评测系列-C1-怎么判断一个模型好不好
AI评测系列-C1-怎么判断一个模型好不好
官方榜单一周一变,你的场景十年不变。
判断一个模型好不好,答案从来不在别人的榜单里,在你的评估集里。
写在前面
A 辑我们捅破了榜单的窗户纸:数据污染、刷榜套路、标尺熔化、分数高不等于好用(A2、A3 两篇专门讲的)。你可能已经接受「别只信官方榜」——然后呢?回到自己的项目,还是要选模型。
C 辑来了:把验证方法用到四类具体系统上——模型、RAG、Agent、微调版本。本篇是第一站:怎么判断一个模型好不好。
先说结论:选模型不是「看谁分高」,是「谁在我的场景里表现好」。分三步——建评估集、跑对比、算总账。
这篇的节奏:先建评估集(地基),再讲成本/速度/质量三角(预算),然后给出一套可复制的多模型对比流程(方法),最后解决两个高频纠结——API 还是开源、官方榜信不信。看完你就能直接上手跑一轮对比。
这一篇也是 C 辑的开门篇——后面几篇的 RAG、Agent、微调验收,全都建立在「先会判断模型」之上。模型选错了,后面所有系统都白搭。
一、先建自己的评估集:别人尝不出你的菜
美食博主把一家店夸上天,你还是会先带家人去试吃一次——因为博主的口味不是你的口味。
评估集就是你的「自家人试吃团」。没有它,你选模型靠的是广告;有了它,你选模型靠的是证据。
怎么建(AI选型系列-B2 那篇《评估数据集怎么建》有完整实操,这里说要点):
• 从真实场景取样:把你过去一个月真实遇到的问题、真实用户问过的问题收集起来,三五十条就能起步,不用等完美
• 标注标准先定好:什么算对、什么算错、什么算「勉强能用」——标准不统一,分数就没有意义(B1 讲过多评委一致性,Cohen's κ 就是量这个的)
• 覆盖你的典型场景:你是做客服的,就放真实客服问题;你是写代码的,就放真实编程任务——别拿别人的通用测试集糊弄自己
评估集长什么样?举个例子(示意,不是让你照抄):一条客服评估样本 = 「用户问题 + 期望回答要点 + 评分标准」。比如问题「订单三天没发货怎么办」,期望要点是「先查物流状态、再说明预计送达时间」,评分标准是「要点覆盖全 + 语气礼貌 = 满分」。这样的样本三五十条,就够第一次跑分了。
评估集的质量有三个检查点:代表性(是不是真实场景的分布,而不是你顺手攒的)、标注一致性(同一道题两个人标,标准是否一致——B1 的 Cohen's κ 就是量这个的)、无泄漏(评估样本不能出现在任何训练数据里,否则分数虚高——这点在微调场景尤其致命,C4 还会再强调)。
算分方式也很朴素:要么算正确率(答对的 ÷ 总数),要么人工逐条打分取平均。A4 那篇《设计你的第一个评估集》讲过管理方法——评估集要当资产维护:版本化、定期增补新样本、防止训练数据混进去。
规模上也有讲究:第一轮筛选,二三十条就够,目的是把明显不行的模型筛掉;进入决赛圈的对比,建议扩到一百条以上(示例规模)——样本越多,分数越稳,越不怕单条样本的运气成分。评分方式看题型:选择题可以自动判分;开放式回答可以用 LLM-as-Judge 辅助打分(B2 讲过原理),但关键样本一定要人工过一遍——自动打分负责量,人工负责把关。
最后,评估集会过时:场景变了(比如客服政策更新),评估集也要跟着更新——评估集过时了,分数再高也没意义。
关于规模再纠正一个误区:评估集不是越大越好,是越像越好——100 条真实客服问题的价值,远大于 1000 条网上抄来的通用题。先把「像」做对,再谈「多」。
没有自己的评估集,你选的不是模型,是广告文案。
二、成本/速度/质量三角:买车先看预算
选车没人只看马力,还看油耗和提车时间。选模型同理,永远在三个角上权衡:
三角 │ 它回答的问题 │ 怎么测
**质量** │ 活干得好不好 │ 你的评估集跑分 + 人工看 badcase
**成本** │ 烧钱快不快 │ API 按 token 计费(AI选型系列-C1 拆过完整账单);开源算算力/电费
**速度** │ 等得久不久 │ 首 token 延迟、吞吐(LLM工程系列-C1 讲并发与批处理)
速度还要拆细一点:首 token 延迟(用户按下发送到第一个字出来)影响「感觉快不快」,吞吐(每秒出多少 token)影响「批量场景扛不扛得住」。客服要前者,离线批量分析要后者——两个指标别混着看。
三个角之间的权重怎么定?给你一个示例做法:给三个角各设一个权重,综合分 = 各角分数 × 权重之和,把你的偏好量化成公式。比如客服场景,质量权重 50%、成本 30%、速度 20%(示例权重)——权重你来定,但定了就别改,否则不同模型的对比就不公平。
场景(示例) │ 质量权重 │ 成本权重 │ 速度权重
在线客服 │ 50% │ 30% │ 20%
离线批量分析 │ 40% │ 40% │ 20%
实时风控 │ 40% │ 10% │ 50%
成本怎么估?API 很简单:官方价格页都有每百万 token 的输入/输出价(示例:输入约 1-2 元、输出约 8-16 元每百万 token,具体以官网为准),拿你的评估集跑一遍,统计总 token 数 × 单价就行。开源自部署更复杂——显存、GPU 时长、电费、人力维护(AI选型系列-C2 拆过),粗算即可,别追求精确。
三个角没有「最优」,只有「适合你的权重」:内部工具可以慢一点、便宜一点;面向用户的客服,速度就是体验。
实操建议:先定预算上限,再在预算内挑质量。预算定得越早,候选越少,纠结越少——这也是 AI选型系列-C4 那张价格全景图的价值:先看清市场上有哪些价位的选手,再动手测。
预算不是限制,是帮你做决定的那把尺子。
三、多模型对比流程:同一赛道跑一圈
赛马为什么公平?因为同一赛道、同一裁判、同一规则。多模型对比也是这个道理:
同一个评估集、同一套评估脚本、同一份提示词,把候选模型挨个跑一遍。
流程大概是这样的:
1. 锁定评估集——第一步建的那份,先别改
2. 列候选名单——3 到 5 个,官方榜 + 社区口碑圈定入围者(入围靠榜单,冠军靠实测)
3. 统一跑分——同一脚本、同一温度参数,避免「换个姿势分数就变」
4. 记录三列账——质量分、成本、延迟,一次跑完一起记
5. 人工看 badcase——分数接近时,翻翻每个模型的错题,看错得可不可接受
记成一张表:
候选模型 │ 质量分(评估集) │ 成本(示例:跑 1000 次) │ 延迟(约) │ 备注/badcase 印象
模型 A │ 92 │ 约 15 元(示例价) │ 约 1.2 秒 │ 长文本偶尔漏细节
模型 B │ 89 │ 约 6 元(示例价) │ 约 0.8 秒 │ 数学题稳,口语弱
模型 C │ 84 │ 约 3 元(示例价) │ 约 0.5 秒 │ 便宜快,但复杂任务爱偷懒
注意:上面是示例格式,数字别照抄——你自己跑出来的才算数。
跑的时候有三个最容易翻车的细节:提示词必须一字不差(换个说法,分数可能差好几个点);模型版本要锁死(API 背后悄悄换版本,对比就废了);随机性要控制(温度设为 0,或同题多跑几次取平均,示例做法)。对比评测拼的不是聪明,是纪律。
跑完怎么读结果,也有个顺序:
• 分数差得大(比如差 10 分以上):直接选高的,别犹豫
• 分数接近(差 2-3 分):翻 badcase + 比成本延迟——错题可不可接受,往往比那两分更重要
• 分数波动大:同一个模型同一道题,多跑几次看分数稳不稳——波动大的模型,单次分数不可信
再教一个小技巧:把评估集里最典型的 5 条问题单独拎出来,人工逐个对比各模型的完整回答——看完整回答,比看分数更能建立「手感」。
举个完整示例(示意):评估集 50 条客服问题,三个候选模型各跑一遍,每模型花了约 20 分钟;结果模型 A 质量最高,但成本是 B 的两倍,而 B 和 A 质量只差 3 分——于是选了 B。这个例子想说的是:选型的答案往往不是「最好的」,是「够用且划算的」。
另外,这套对比流程值得沉淀成脚本:评估集、提示词、打分逻辑全部固化成代码,以后每次有新模型、新版本发布,重新跑一遍就行——你的判断就从一次性动作,变成了可重复的流程(D3 会讲怎么把评估自动化)。
还有一个纪律:跑分的时候别偷偷改题。 看到模型 A 分数低,顺手把评估集改一版——分数好看了,但对比也废了。评估集一旦锁定,中途只准增补,不准为某个模型修改。
分数高不一定是冠军,同一赛道跑完,才知道谁在骗人。
四、API vs 开源:两条不同的路
比完分,还要比「怎么用」。API 和开源是两条完全不同的路(AI选型系列-A2 专门讲过这道选择题):
维度 │ 商业 API │ 开源模型自部署
上手速度 │ 快,注册即用 │ 慢,要搭推理服务
成本结构 │ 按 token 计费,用得越多越贵 │ 一次性算力投入 + 持续运维(LLM工程系列-D4 算过这笔账)
可控性 │ 受制于人:改版、限流、涨价你都管不了 │ 完全可控,还能量化加速、私有化
数据安全 │ 数据出本地(要审合规) │ 数据不出门
适合 │ 快速验证、低频场景 │ 高频、敏感、长期规模化的场景
一句话:开源不是免费,是把账单从「按 token 计」变成「按人天计」——AI选型系列-C2 那篇《开源私有化部署真实成本》拆过,部署、调优、盯监控全是人天。
还有第三条路:混合。先用 API 验证业务跑不跑得通,量上来了再迁移到开源自部署——这是很多团队的实际路径(AI选型系列-D4 给创业者的建议里就是这套思路)。别把「API 还是开源」当成非此即彼的站队题,当成「不同阶段的路线图」。
最后提醒一句:换模型是有迁移成本的——提示词要调、链路要重测、线上行为要观察,这些隐形成本也要记进总账。有时候旧模型不是最优,但「够用 + 不用动」,也是理性的选择。
再补一个很多人忽略的维度:合规。如果你的业务涉及个人信息或敏感数据,API 方案的数据出境问题可能直接一票否决(AI选型系列-A2 提过)——有些时候不是「想不想用 API」,是「能不能用 API」。
总结成一句:能用 API 解决的先别上开源,这是大多数团队合理的起点(示例观察);只有当成本或控制权成为瓶颈,再谈迁移。
API 买的是省心,开源买的是自由——省心和自由,总得付一样。
五、别只信官方榜:榜单是广告的另一种形式
最后再敲一遍木鱼(A2 已经敲过,这里换个角度):
• 官方榜的题,模型可能提前见过——数据污染是刷榜的老套路,你的题它没见过
• 官方榜测的是「通用」,你的场景是「具体」——一个模型全能 90 分,不代表在你的客服场景里及格
• 官方榜会过时——标尺熔化的背景下,三个月前的第一名可能已经换了人
那官方榜是不是完全没用?不是——要用对方法。读榜时看三件事:
读榜看什么 │ 为什么 │ 反面教材
**发布时间** │ 榜单三个月就过时 │ 拿去年冠军选今年模型
**测试集内容** │ 测的不一定是你干的活 │ 测编程的榜,拿去选客服模型
**测试方式** │ 不可复现的分数没法核 │ 自家测试集、不公开、不解释
合格的读者把榜单当「情报」,不合格的读者把榜单当「结论」。
再补两个提醒:第一,社区口碑同样要打折看——博主推荐往往有立场(带货、引流),看他给不给评估集、给不给复现方式;第二,别追「最强」——你只需要「在你的场景里够用且划算」的那个,为一个用不上的 5 分多付一倍钱,不叫理性,叫攀比。
所以正确的姿势是:官方榜当「入围名单」,自己的评估集当「冠军决赛」。这也正是 AI选型系列-B1 那篇《不只看 benchmark 怎么在自己的场景上评估模型》的核心——榜单缩小范围,实测决定胜负。
记住:官方榜最大的价值不是告诉你「谁第一」,是告诉你「谁值得测」——它帮你把几百个模型缩小到三五个候选,剩下的活儿,交给你的评估集。
官方榜帮你圈定候选,你自己的评估集决定冠军。
六、一页纸总结:三步走完选型
把全文压缩成一张表,收藏起来随时用:
步骤 │ 做什么 │ 产出
① 建评估集 │ 收集真实样本,定标注标准 │ 一份能复用的评估集
② 跑对比 │ 3-5 个候选,同一评估集跑分 │ 一张对比表(质量/成本/延迟)
③ 算总账 │ 结合权重与迁移成本,定 API/开源 │ 一个能落地的选型决定
再加四句速查:
• 没评估集,先补评估集,别选型
• 有评估集,同一赛道跑 3-5 个候选
• 分数接近,看 badcase、比成本延迟
• 决赛圈,API/开源按阶段定,别站队
• 迁移成本别忘算,够用比最强重要
这五句背下来,你就超过大多数「看榜单选模型」的人。
下一篇预告
模型选好了,系统要开搭了。如果你的系统要「先查资料、再回答」——那就是 RAG。下一篇 C2:怎么判断一个 RAG 系统好不好?检索准不准、生成忠不忠实,拆成两层来验收。
到 C2 你会看到,这篇的方法论(评估集、对比、看 badcase)会原封不动地用回去——只是对象从「裸模型」变成了「模型 + 检索」的组合。
结尾
回到开头那句话:选模型最贵的不是 API 账单,是选错之后返工的账单。
三步走完——建评估集、跑对比、算总账——你选出来的模型,是「你验证过」的模型,不是「别人说好」的模型。
这套三步法没有用到任何「独家工具」,全是常识级别的动作——但它拼的是纪律:每一步都做到位,不被宣传带节奏,不被分数迷惑。 判断力的门槛从来不在技术,在坚持。
而且这套流程是可复用的:下次出新模型、新版本、新供应商,把评估集重新跑一遍就行——你的判断力会随着评估集的积累越来越值钱。
最后再补一句心里话:选型这道题没有标准答案,但有标准流程——评估集、对比、总账,三步一个都不能少。以后别人给你推荐模型,你就问一句:「在你的评估集上跑的?」——这一句话,就能筛掉大半的瞎推荐。
判断一个模型好不好,你不是在挑一个冠军,你是在给自己建一道验证的流水线。
你的评估集,就是你在 AI 时代的第一份「判断力资产」。