Claude 与训练分类器对比:三项基准测试
在两个数据集上,训练模型明显更胜一筹;第三个数据集上,两者不相上下。
文本分类,该让 AI 助手来做,还是用标注数据训练一个模型?我们使用 StayCharted AI Model Trainer,在三个公开数据集上对比了这两种方案。结论是:因数据集而异。
| 数据集 · 任务 | 测试行数 | Claude Sonnet 5.5 | AI Classifier Model | Dedicated AI Model | Dedicated 对比 Claude |
|---|---|---|---|---|---|
| BANKING77 · 77 类客服意图 | 3,080 | 84.7% | 92.6% | 93.7% | +9.0 个百分点 |
| LEDGAR · 100 类合同条款 | 4,000 | 76.9% | 82.7% | 84.9% | +8.0 个百分点 |
| Medical Abstracts · 5 类疾病分组 | 2,888 | 65.7% | 60.0% | 63.6% | −2.1 个百分点 |
AI Classifier Model 会分别尝试“仅语义”和“词频+语义”两种方法,保留在留出验证数据上表现更好的那个。在 Medical Abstracts 测试中,仅语义方法得分 60.0%,高于词频+语义的 52.0%,因此表中显示 60.0%。这两个方法是分别独立基准测试的结果,产品的自动选择流程并未在该数据集上完整运行过。
换算成每 100 行的错误数:在 BANKING77 上,Dedicated AI Model 出错 6.3 次,Claude 是 15.3 次,不到一半;在 LEDGAR 上是 15.1 对 23.1,少了约三分之一;在 Medical Abstracts 上,Claude 出错 34.3 次,训练模型 36.4 次。
差距的可信程度取决于测试规模和方法。在这几项测试中,各准确率对应的近似 95% 二项误差范围在 ±0.9 到 ±1.8 个百分点之间。这些估算仅反映独立行假设下的抽样不确定性,不包括训练轮次之间的波动或在新数据上的表现。银行和法律任务的差距远超误差范围;医疗任务的结果则很接近,但各个区间有重叠并不意味着两者打平——要判断 2.1 个百分点的差异,还需对同一批数据做配对分析,而我们尚未进行这项分析。
以上是测试集上的测量结果,并不保证在你的数据上同样成立。百分比和错误数对比均经过四舍五入。
同一批测试数据,不同的学习方式
Claude 接收了类别名称和每个类别的单行定义,没有标注示例。StayCharted 的模型基于每个数据集约 10,000 条标注训练行进行训练:BANKING77 为 10,003 条,LEDGAR 和 Medical Abstracts 各 10,000 条。测试行未纳入 StayCharted 的训练数据。 这将基于定义的助手工作流与监督学习进行了对比。它并未隔离模型架构的影响,也未在示例访问权等同的条件下进行对比。- 助手:通过 Amazon Bedrock 使用 Claude Sonnet 5.5,报告中记录为
us.anthropic.claude-sonnet-5-5,使用默认设置,要求每行恰好指定一个类别。 - 输出限制与重试:初始限制为 40 个输出 token。对于空白或截断的回复,使用相同的提示词和 1,024 tokens 进行重试;最终采用最后一次得出的类别。这影响了 408 条银行、138 条法律和 857 条医疗回复。
- 无效答案:重试后,银行类零条、法律类两条、医疗类零条回复未命名有效类别。这些均计为错误。
- 训练方法:AI Classifier Model 在 CPU 上运行;Dedicated AI Model 使用了在 GPU 上微调的 Qwen3.5-4B 模型。它们现有的报告使用了相同的冻结测试行。
- 日期:助手报告日期为 2026 年 10 月 6 日。结果来自此特定配置,而非多次完整基准测试运行的平均值。
当类别是您的约定俗成时,示例最有帮助
银行和法律领域的错误表明了为何类别边界值得关注。在 BANKING77 中,Claude 将 40 条 get_physical_card 消息中的 32 条标记为 change_pin。在 LEDGAR 中,它将有 34 个“豁免”条款标记为“无豁免”,将有 34 个“定义”条款标记为“定义术语”。
带标签的示例可以展示简短定义中不明确的区分。这些结果与该解释相符,但并未证明每个错误的具体原因。提示词定义、数据集约定和训练输入都可能影响对比结果。
这些错误既涉及标注规范,也涉及通用知识。知道豁免条款是什么,并不一定就能厘清特定数据集如何区分“豁免”和“非豁免”,或者团队在处理两个看似合理的银行意图时具体采用的是哪一种。标注示例能让这些边界变得清晰具体。这是对该现象的一种合理解释,而非通过实验独立证实的根本原因。 医学摘要(Medical Abstracts)展示了硬币的另一面。该数据集的五个类别——心血管、消化系统、神经系统、肿瘤及一般病理状况——都基于通用的医学知识。在这类任务中,Claude 的准确率为 65.7%,训练模型的准确率为 63.6%,两者非常接近。它们在较为宽泛的“一般病理状况”类别上都表现吃力,其中 Claude 得分仅为 40.2%;该类别与其他类别可能存在重叠,这或许是导致困难的原因之一。基于通用知识的分类场景适合尝试使用 AI 助手,而受团队内部特定规范影响的分类场景,则更适合比较基于自有示例训练模型的效果。为什么不教 Claude 你的分类标准?
自然的下一步做法是向助手提供你的示例数据。这是可行的,本次基准测试并未涵盖这一点。然而,这种工作流仍然需要一种机制来管理示例、评估结果以及应用修正:- 示例必须在上下文中可用。基于提示词的工作流在分类时会提供示例,或检索相关示例。如果覆盖 77 个或 100 个类别中的每一个,每个类别提供 5 个示例,那么总样本数将达到 385 或 500 个。保存上下文和提示词缓存可以减少重复开销,但它们无法将这些示例转化为针对你的分类标准训练好的模型。
- 选择示例本身也是工作的一部分。哪些类别需要示例?哪些示例能解释边界?检索相似的历史数据是一个选项,但这个过程同样需要配置和评估。
- 修正需要回流到工作流中。当有人修正标签时,应更新共享的提示词、示例或检索源。这一过程可以自动化。在 StayCharted 中,经过审核的修正可以成为下一次运行的训练示例,但不会立即改变已发布的模型。
- 仍需衡量准确率。在包含已知答案的保留数据(held-out rows)上测试任一工作流,特别是针对那些容易混淆的类别。StayCharted 在训练模型时提供这种评估功能。
- 置信度需要在你的数据上实测。助手给出的置信度值未必与你的任务自动对齐。StayCharted 会展示置信度阈值在已评估数据行上的表现,帮你决定哪些内容需要人工审核。高置信度的错误仍然可能漏过去。
- 版本变更需要重新评估。助手模型的更新或下线可能改变分类行为。共享且带版本管理的提示词能帮你掌控整个流程。StayCharted 会持续使用已发布的训练版本,直到你发布新版本为止。
- 团队需要对任务的统一维护定义。不同的提示词可能产生不同的理解。你可以把助手的指令标准化;共享的训练模型是另一种方式,让团队使用同一套分类规则。
- 数据量会改变工程上的权衡。助手 API 可以批量处理数据行、缓存提示词并检索示例。但这些方式仍然消耗模型的输入输出容量。AI Classifier Model 在 CPU 上运行,每次预测不需要随请求发送提示词和示例。本次基准测试并未测量成本和速度上的差异。
这些并不意味着助手就是错误的工具。如果只是一次性的分类,或者分类规则依赖通用知识,助手可能就够用了。但对于自己定义的、需要反复执行的分类工作,StayCharted 把示例、度量和修正集中在一处管理。你还可以把你的助手连接到已训练并测试过的模型。
Claude 被重复提问时基本保持一致
我们对每个数据集的前 500 行重复了完全相同的请求。Claude 在 99.2% 的银行数据行、98.8% 的法律数据行和 97.0% 的医疗数据行上返回了相同的分类结果。
这是在子集上两次尝试之间的一致性,并不代表准确率,也不是对不同提示词的测试。仅凭一致性并不足以构成在这里训练模型的最强理由;匹配标注结果并度量错误才是更值得关注的考量。
根据你的示例和审核需求来做选择
先问自己:这些分类标签从哪里来?如果类别基于通用知识且手头没有标注样本,就先用助手跑一遍,拿结果和你预期的答案核对。如果分类依据是你们团队自定的规则且已有标注好的样本,就用这些样本训练一个模型,并在它没见过的数据上对比效果。无论哪种情况,都要逐类检查错误,而非只看总体分数。 StayCharted 可以利用预测置信度来辅助人工审核的优先级排序。但置信度并非保证:有些错误的预测反而会显得很有把握,且新数据可能与测试集存在差异。 本次基准测试未衡量成本或端到端速度。我们也没有测试 Claude 的聊天界面、ChatGPT、连接器或 Sheets。此外,未测试向 Claude 提供标注样本、替代定义或提示词优化的效果。公开数据集可能已经出现在预训练模型的训练材料中,我们未对此类数据暴露进行审计。 你也可以组合这些工作流:让助手使用你评估过的模型,并配置你选择的权限范围。 如果你想用自己的例子试试,可查看模型页面或免费开始。数据来源与更多结果
上述测量结果来自 StayCharted 的对比报告。下方的数据集来源介绍了公开语料库,它们并非对我们结果的独立验证。
- BANKING77 数据集论文 · StayCharted 银行领域基准测试
- LEDGAR 数据集论文 · StayCharted 法律领域基准测试
- 医学摘要语料库 · StayCharted 医疗领域基准测试
常见问题
训练过的分类器比 Claude 更准确吗?
在三组测试数据中的两组里,训练模型在准确率上具有明显优势。在 BANKING77 数据集上,StayCharted 的专用 AI 模型得分 93.7%,高于 Claude 的 84.7%;在 LEDGAR 上,两者分别为 84.9% 和 76.9%。而在医学摘要(Medical Abstracts)上,两者表现接近:Claude 为 65.7%,训练模型为 63.6%。提升幅度最大的是那些具有特定数据集分类惯例的任务;这些结果并不能证明存在一条通用规则。
2 个百分点的差异有意义吗?
这取决于测试的设计。基于 2,888 行医学测试数据,假设每行数据相互独立,Claude 的 95% 二项式近似误差范围为 ±1.7 个百分点,专用 AI 模型为 ±1.8 个百分点。这些是独立的抽样区间,既不是对差值进行配对检验的结果,也不是衡量多次运行间变异的指标。由于医学领域的得分非常接近,在宣称具有显著性或等效性之前,需要进行配对分析。而在银行和法律领域,9.0 和 8.0 个百分点的差距要大得多。
Claude 是否接收了相同的训练示例?
没有。Claude 仅接收了类别名称和单行定义,未提供标注示例。StayCharted 的模型是从每个数据集约 1,0000 行标注数据中学习的。这比较的是两种工作流程,而非在同等示例访问权限下的模型对比。通过共享提示词或检索等方式在上下文中为助手提供示例是可行的,但本文未对此进行测试。这些示例及其选择过程仍需维护和评估;请参阅本文中的“为什么不教 Claude 你的类别?”。
这是在 Claude 或 ChatGPT 内部测试的吗?
不是。Claude Sonnet 5.5 是通过 Amazon Bedrock 调用的。本文未评估 Claude 和 ChatGPT 的界面、连接器及其与电子表格的集成情况。
置信度能保证答案正确吗?
不能。置信度有助于优先安排复核,但高置信度的预测仍可能是错误的。请在具有代表性的样本上评估模型,并检查其在新数据上的表现。