← 文章 / AI技术
HuggingFace博客 2小时前 · 2026-08-30 02:38:07 · 0 阅读

语音识别中的“刷榜”现象量化研究

公开语音 AI 基准越来越频繁地暗示模型已达到人类水平。然而这些分数并不总能反映模型在真实世界中的表现。由于公开基准是开放的且被广泛使用,模型也可能针对测试本身进行优化。分数上涨,可能只是因为模型学到了基准特有的模式,而非它真正更擅长底层任务。

一个原因在于,传统基准忽视了让语音系统在现实中可靠、自然、切合语境且有效的许多条件与品质。正因如此,我们最近在 Real World VoiceEQOpen-ASR LeaderboardFar-field ASR Leaderboard 中引入了留出集(held-out sets):为了衡量更多真实使用中真正重要的东西。

然而,仅靠更广泛的测量并不能解决问题。这种现象有时被称为"基准优化"(benchmark optimization)或"刷榜"(benchmaxxing),在机器学习领域屡屡被讨论,但在语音识别中一直难以量化。

我们的最新研究引入了三项测试来量化这一现象。我们评估了 11 个广泛使用的开源 ASR 模型,发现其中几个最高分的系统会复现 VoxPopuli 英文数据集和 LibriSpeech(clean、other)数据集的基准转录——即使音频与转录相矛盾、相关词语已被静音,或者音频对两种不同写法同等支持时也是如此。

在某些情况下,模型依赖的似乎不仅是说了什么,还有那些暗示"自己正在被哪个基准测试"的微妙声学线索。结果是,它们的分数夸大了其在一般语音转录上的真实能力。

参考转录分歧(VoxPopuli 案例研究)

VoxPopuli 以包含大量转录错误而闻名(这也是 Artificial Analysis 发布了清洗版的原因)。我们的"共识分歧"探针测试了领先的 ASR 模型遇到这些错误时会发生什么:它们是准确转录音频实际内容,还是照搬基准中错误的参考转录?

为了大规模开展这项测试,我们使用了一组因音素错误率(PER)低而入选的独立模型集成。PER 衡量书面转录与音频中实际语音的贴合程度,是衡量模型忠实转写所听内容的有效代理指标。集成结果可用于标记各模型集体与基准参考转录不一致的案例。随后,我们将这些被标记案例的样本与人工标注进行比对,以验证修正后的转录。

例如,一段 VoxPopuli 音频中清晰可闻 "Thank you, Mr. President" 这句话,但参考转录却漏掉了 "Thank you"。我们测试的 11 个模型中有 6 个复现了基准的错误转录——即便与音频相矛盾,也给出了"预期"的答案。在真实片段上,格式也呈现同样的模式:省略 "Thank you" 的模型同时复现了基准的标点风格,把 "Mr" 写成不带句点的形式;而包含这句可闻短语的模型则倾向写成带句点的 "Mr."。

当我们用新采集的欧盟议会录音音色或通用音色呈现相同内容时,这种行为往往减弱甚至消失。在下面的样本中,对于一段新议会录音的克隆音色,除一个模型外全部"改邪归正",转而忠实转录音频。这表明模型是在对那些帮助其识别"样本属于哪个基准"的声学线索作出反应,从而即便与音频矛盾也产出预期的转录。

该片段的参考转录为 "Mr President, I have another complaint about this procedure, which is that it is not secret."。下面三段音频实际说的都是同一句话,且前面都带一句可闻的 "Thank you,"——克隆音色是对这句真实语句的语音合成再现,因此三段中礼节语都清晰可闻。绿色高亮和 ✅ 表示转录包含了可闻的 "Thank you";红色高亮和 ❌ 表示转录复现了基准中错误的遗漏。所有转录均为未经任何归一化的模型原始输出——大小写和标点与生成结果完全一致,包括某些模型输出的全小写文本。

VoxPopuli 原始录音

同一说话人的声音克隆

在所有模型训练截止日期之后录制的议会说话人克隆

模型 真实片段 同说话人克隆 ep-fresh 克隆
CohereLabs/cohere-transcribe-03-2026 ❌ Mr President… ❌ Mr President… ✅ Thank you, Mr President…
nvidia/canary-qwen-2.5b ❌ Mr President… ❌ Mr President… ✅ Thank you Mr. President…
ibm-granite/granite-speech-4.1-2b ❌ mr president… ❌ mr president… ✅ thank you mr president…
microsoft/Phi-4-multimodal-instruct ❌ Mr President… ❌ Mr President… ❌ Mr President…
nvidia/parakeet-tdt-0.6b-v2 ❌ Mr President… ✅ Thank you, Mr President… ✅ Thank you, Mr. President…
bosonai/higgs-audio-v3-8b-stt-v2 ❌ mr president… ❌ mr president… ✅ thank you mr president…
Qwen/Qwen3-ASR-0.6B-hf ✅ Thank you, Mr. President… ✅ Thank you, Mister President… ✅ Thank you, Mister President…
mistralai/Voxtral-Mini-3B-2507 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
moonshotai/Kimi-Audio-7B-Instruct ✅ Thank you, mr. President… ✅ Thank you, Mr. President… ✅ Thank you, mr. President…
openai/whisper-large-v3 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
moonshine-ai/moonshine-streaming-medium ✅ thank you mr president… ✅ thank you mr president… ✅ thank you mr president…
11 个模型中漏掉礼节语(❌)的数量 6 5 1

Parakeet 是唯一一个在真实片段上复现基准、却在同说话人克隆上转对的"摇摆"模型。Phi-4 则是唯一在 ep-fresh 克隆上仍漏掉礼节语的模型。而当我们改用一个与任何议会录音都无关的通用 TTS 音色重新合成这句话时,全部 11 个模型都恢复了礼节语。

这些结果表明该问题既普遍又有分量。我们的方法在我们分析的 VoxPopuli 测试片段中标记出 40% 存在潜在参考错误,波及全部参考词中约 3% 的词语。

表现出基准优化行为的模型有 18–30% 的概率复现错误的参考转录。下面的散点图将 VoxPopuli 词错误率(WER)置于 x 轴,与各模型复现基准错误参考(而非共识修正)的比率进行对比。WER 最低——即报告基准成绩最强的——模型,也最容易复现这些错误。

Scatterplot comparing VoxPopuli WER to the rate at which each model reproduces the benchmark's incorrect reference transcript.

掩码实体检索

作为对共识分歧探针的延伸,我们刻意把测试数据集音频样本中的数字静音,再让模型转录它所听到的内容。数字在音频中根本不存在,模型不应输出任何数字,更不该输出文本中的那个确切数字。

其中一些数字是半可预测的(尽管对模型来说仍难以猜中),另一些则相当出人意料。下面的片段把两项探针结合起来,既展示了模型如何复现参考转录中的错误(包括一个错误数字),也展示了一个模型甚至自动补全了相当随机的年份(2011)——尽管它已被静音。在下表每个模型的行中:

  • 绿色高亮加删除线,标记模型正确地未予复现的参考转录词语(忠实于音频);
  • 绿色高亮加下划线,标记正确的、忠实于音频的插入内容,用以替代参考转录中的错误措辞;
  • 红色高亮(纯文本)复现了参考转录中音频不支持、属错误的内容:保留 "Mr President"、在音频说的是 "one thousand six hundred" 时写成 "more than 1 amendments"、补出被静音的年份 "2011",或以 "plenary" 结尾。

2011 预算草案(数字已静音)

参考转录 Mr President, in the Committee on Budgets, we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary.
音频实际内容 In the Committee on Budgets, we voted on more than one thousand six hundred amendments to the ⟨silenced⟩ draft budget … voted in the …
CohereLabs/cohere-transcribe-03-2026 Mr President, in the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary.
nvidia/canary-qwen-2.5b Mr President, in the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the plenary
ibm-granite/granite-speech-4.1-2b Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted on in the plenary
microsoft/Phi-4-multimodal-instruct Mr President In the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted on in the plenary.
nvidia/parakeet-tdt-0.6b-v2 Mr President In the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the Protestants.
bosonai/higgs-audio-v3-8b-stt-v2 Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
Qwen/Qwen3-ASR-0.6B-hf Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
mistralai/Voxtral-Mini-3B-2507 Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshotai/Kimi-Audio-7B-Instruct Mr President Ah in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
openai/whisper-large-v3 Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshine-ai/moonshine-streaming-medium Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary

数字还原率在公开基准上最高,在留出集或新采集音频上较低(下图的 ep-fresh 和 libri-fresh)。在 LibriSpeech 上,一些基准成绩最强的模型在约 30–40% 的样本中复现了被静音的数字——尽管数字本身已从音频中移除。对其中几个模型而言,这种效应在新采集数据上有所减弱,说明是环绕四周的基准关联音频——而不仅是文本层面的自动补全——帮助模型"还原"了参考内容。

Recovery rate of masked numbers on public benchmarks versus freshly collected held-out audio.

拼写切换

我们的拼写切换探针测试模型是否会复现基准参考转录中的确切拼写,尽管音频中根本听不出区别。拼写变体指语义和语音完全相同、但可以拼成不同样子的词(1 vs one、Mr. vs mister、John vs Jon、Honor vs Honour 等)。理论上,模型应当一致地偏好其中一种拼写,或以大致随机的比率在两者间交替。如果模型系统性地切换拼写去匹配各基准参考转录中的写法,那就说明模型捕捉到了测试所期待的拼写。

转录文本:"I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE" —— 使用 "any one" 的模型:6/11,使用 "anyone" 的模型:5/11

转录文本:"CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD" —— 使用 "any one" 的模型:2/11,使用 "anyone" 的模型:9/11

在 LibriSpeech 内部,我们测试了一种数据集内切换,涉及一个较旧的空格书写惯例:部分参考转录使用 "any one",另一部分使用 "anyone."。我们测量给定变体的最低命中率,并称之为"切换率"(switch rate)。只使用一种变体的模型切换率为 0%;随机选择的模型切换率期望为 50%;而知道每个测试样本该用哪种变体的模型则能拿到 100% 的切换率。

Switch rate for the "any one" vs "anyone" spacing convention, sorted by model.

第二项探针测试数据集间切换:每个基准在其整个测试语料中始终使用不同的拼写惯例。例如 VoxPopuli 使用缩写 "Mr.",而 LibriSpeech 拼写完整的 "Mister."。

多个模型越过了 50% 的随机选择基线,有些达到约 90% 的切换准确率。这表明模型能够识别一段音频样本来自哪个数据集,并选出该基准所期待的拼写惯例——尽管两种形式听起来完全一样。

Switch rate for the "Mr." vs "Mister" convention across VoxPopuli and LibriSpeech, sorted by model.

定位切换的来源

为了检验这些行为是否泛化到公开基准之外,我们还从相同来源领域采集了模型训练截止日期之后的新数据:VoxPopuli 对应近期的欧洲议会录音,LibriSpeech 对应新近活跃的 LibriVox 朗读者录音。然而,当面对来自同一领域的新采集数据时,许多模型不再匹配参考转录,转而给出更忠实于音频的转录。

其他干预手段也指向同一结论。那些存在于音频中却被参考转录遗漏的短语,在让模型转而翻译音频、或把模型注意力限制在相关音频帧上时,会重新出现。裁掉周围的基准语境,或在其后拼接普通对话音频,同样能让忠实转录回归。而拼接 VoxPopuli 音频则会产生相反的效果,让本忠实于音频的合成或挖掘样本更容易匹配上基准参考。

Effect of steering the amount of surrounding benchmark-associated audio context on transcription behavior.

综合来看,这些结果表明模型有能力忠实转录字面口语内容,却在使用周围的声学语境来决定到底跟随音频,还是执行某套基准特有的转录策略。

结论

我们的研究结果表明,在两个主要开源数据集上,一些模型能够察觉与数据集相关联的声学线索,并相应调整其转录行为。具体而言,模型可能复现音频中没有却出现在参考转录里的词语,以更高比率"还原"被静音的数字,或利用周围声学语境选出特定基准所期待的写法。

对于选型者而言,这些发现凸显了使用完全留出的评测集(如 RW-Voice-EQ Bench 和 Open ASR Leaderboard 所做的)的重要性,也提醒大家不要只盯着单一公开基准上的词错误率。为此,Open ASR Leaderboard 新增了"Benchmark fitting"(基准拟合)标签页,涵盖上述两项分析在全部模型上的结果:量化 (1) VoxPopuli 的参考错误率,以及 (2) 所有公开数据集上的拼写切换。相关脚本已在 GitHub 开源,未经归一化的模型输出也已公开。

我们的发现还提示基准开发者:应避免简单的独立同分布(i.i.d.)测试划分,改用按时间、说话人或其他元数据的切分方式。在训练数据和模型选型流程上提高透明度,也将帮助研究者理解这些行为是如何产生的。

公开基准依然有价值:它们透明、可重复、易于运行,且为研究界所熟知。但只有当我们能区分真正的转录能力提升与那些无法泛化到新音频的"刷榜式"收益时,它们才能发挥最大效用。

更多信息,欢迎阅读我们的完整报告

原始来源: HuggingFace博客

评论 (0)