← 文章 / AI技术
HuggingFace博客 6小时前 · 2026-08-29 14:57:12 · 1 阅读

开放式 ASR 排行榜首次纳入全球南方语言

Voice Arena 携手 Hugging Face,为印地语和印度英语推出开放式 ASR 评测

基准测试决定了行业会开发什么。一款模型如果在 Open ASR Leaderboard 上取得好成绩,就更容易被采用并持续迭代;而排行榜没有衡量的能力,往往得不到改进。近期,排行榜相关工作主要集中在提升评测指标的可信度上:

  1. 采用独立保留的私有数据集
  2. 进行基准适配分析,量化模型究竟是在复现参考转写,还是仅凭音频完成转写。
  3. 弥合规范化器之间的差异,确保正确的预测结果或变体不会受到惩罚。

这些措施让单一指标 WER 更难被刻意优化,但它终究还是一个数字。大量研究表明,ASR 的错误率并不会在所有使用者群体之间均匀分布。研究《自动语音识别中的种族差异》发现,商业系统对黑人说话人的识别效果大约比对白人说话人差一倍;《量化自动语音识别中的偏见》则发现,性别、年龄和口音也会造成进一步差异。这些问题在排行榜上都无从体现,但并不是因为排行榜刻意掩盖了它们,而是因为其测试集只记录了说了什么,几乎没有记录是谁说的。

为弥补这一空白,我们为 Open ASR Leaderboard 引入了两套评测集:Monsoon en-INMonsoon hi-IN。印地语的使用者超过 5 亿,它也是当前多语言标签页中首个印度语族语言,而该标签页此前只覆盖欧洲语言。两套数据集均提供公开分片,可供自行评分;同时保留私有分片,以限制针对特定基准的优化。四个分片中的说话人互不重叠,共包含 4,888 名说话人,并为每人记录了 12 项说话人属性。

采集设计

测试集只有在覆盖某种变化维度时,才能暴露与之相关的失效模式。大多数基准测试都基于现成的音频构建,而 Monsoon 则专门覆盖九个维度:地理位置、年龄、性别、词汇、设备、声学环境、语音类型、语速,以及同一段音频存在多个有效转写的情况。每个维度都可能导致整体 WER 平均来看没问题,却在特定人群上表现失真。

nine axes of variation in the Monsoon collection

因此,采集方式也围绕这些维度设计:

  • 地理位置:在数百个地区招募参与者,而不是在更少的地方进行更长时间的录音。
  • 设备和声学环境:参与者使用自己的手机和网络,在室内外不同场景下录音,而不是统一使用设备在安静房间里录制。
  • 词汇、语音类型和语速:通过提示语引导参与者谈论日常话题,鼓励他们表达观点、提出异议、讲述经历和回忆内容;这些场景更容易出现专有名词、数字和未经排练的表达。
  • 年龄和性别:逐位记录并核验说话人的信息。
  • 多个有效转写:这是参考文本的属性,而非音频本身的属性,后文将专门讨论。

数据集构成

四个划分、两种语言,均通过同一套流程采集。

数据集 语言 时长 说话人 片段长度(平均值 / 中位数) 男/女 地区 邦/联邦属地 设备 风格 转写
Monsoon en-IN 公开集 印度英语 5.62 小时 1,444 9.6 秒 / 10.4 秒 50/50 428 24/6 556 对话式、自发 已规范化,保留不流畅现象
Monsoon en-IN 私有集 印度英语 5.58 小时 1,405 9.6 秒 / 10.4 秒 45/55 420 24/6 560 对话式、自发 已归一化,包含口语不流畅现象
Monsoon hi-IN 公开集 Hindi 1.33 小时 468 6.4 秒 / 5.0 秒 54/46 202 11/3 315 对话式、自发语音 Lattice(接受的正字法变体)
Monsoon hi-IN 私有集 Hindi 4.47 小时 1,571 6.6 秒 / 5.3 秒 55/45 295 12/3 582 对话式、自发语音 Lattice(接受的正字法变体)

数据来自未经脚本引导的双通道自然对话。音频片段从单个声道中切分而来,因此每段只包含一位说话者。除表中列出的字段外,每个片段还记录了职业、受教育程度、婚姻状况、收入区间、手机品牌、当前所在城市,以及在当前地区居住的年限。

以下是公开 Indian English 划分中的五个片段及其元数据:

29 岁女性,来自 Tripura 的 West Tripura。学生,samsung SM-G781B。

32 岁女性,来自 Madhya Pradesh 的 Satna。无业,samsung SM-E146B。

22 岁男性,来自 Bihar 的 Rohtas。学生,motorola moto g54 5G。

27 岁女性,来自 Telangana 的 Warangal。无业,vivo V2247。

57 岁男性,来自 Puducherry。私营企业职员,Xiaomi M2006C3LI。

English 数据集采用标准字符串参考文本,leaderboard 的 normaliser 会合并大多数拼写差异。Hindi 中的拼写变体要多得多,无法通过 normaliser 解决,因为这些变体并不是两种固定规范之间的一一映射。因此,Hindi 数据集提供了一个 lattice:对于转录文本中的每个片段,都列出一组可接受为正确答案的拼写。

说话者覆盖情况

按时长计算,Monsoon 规模不大;按说话者数量计算,它却相当可观。这正是它的设计目标,也是其价值最集中的地方。

除上述字段外的说话者集中度与多样性。

Monsoon hi-IN 公开集 Monsoon hi-IN 私有集 Monsoon en-IN 公开集 Monsoon en-IN 私有集
每位说话者的片段数(平均) 1.61 1.56 1.46 1.48
仅包含一个片段的说话人 261 994 956 924
每位说话人的音频时长(中位数) 8.34 s 8.28 s 12.36 s 12.39 s
前 10 位说话人的占比 6.8% 3.1% 2.8% 2.9%
当前城市数 289 814 641 584
设备制造商数量 18 25 23 20

由此可以看出三个特点,它们关注的都是数据的差异性,而不是规模。

  • 没有哪个说话人的声音主导结果:贡献量最大的 10 位说话人占总时长的比例在 2.8% 到 6.8% 之间,而且超过半数的说话人只出现过一次。Monsoon 上的结果,是数百种不同声音的平均表现,而不是少数几名说话人长时间录音的结果。时长相近的测试集通常恰恰是后者。

  • 地区和手机型号也不会主导结果:印度英语公开测试集覆盖 30 个邦和联邦属地的 428 个原生地区;作为印地语带语言,印地语测试集的地域分布更集中,但仍覆盖 202 个和 295 个地区。录音来自 315 到 582 种不同设备型号,在任何一个子集中,单一型号占比都不超过 2.1%。使用统一硬件采集的语料库容易过拟合某一种麦克风响应,而这个数据集不会。

  • 这里的印度英语并不是单一口音:它代表的是整个印度各地的英语,而不是某个地区的英语。印度六大区域均有覆盖:在公开测试集中,35% 的片段来自南部说话人,东部和中部各占 18%,北部占 16%,西部占 11%。这种地域分布带来的口音差异,会记录在元数据中,而不是停留在笼统的描述上。

元数据字段

Monsoon 每个片段包含 18 列,其中 12 列为元数据;大多数公开 ASR 测试集则只有标识符、转写文本和时长。人口统计字段均已填写或基本完整,贡献者也已同意将这些信息用于此用途。

分组 字段
片段 idaudioaudio_length_slanguage
参考文本 lattice(Hindi)或 text(Indian English)
说话人 speaker_idgenderdate_of_birth
背景 occupationeducational_backgroundmarital_statusincome
地理信息 native_districtnative_statecurrent_cityyears_spent_in_current_district
录音 device_manufacturerdevice_model

这两种语言的地域分布形态不同,而这种形态本身就包含信息。Hindi 数据集主要集中在 Hindi 腰带地区,其中约 40% 的说话人来自北方邦,这正是按人口比例抽样的 Hindi 语料库应有的分布。Indian English 数据集的分布则平坦得多:没有任何一个邦的占比超过 13%,还有三分之一的说话人来自八个人口最多的邦之外。两者的公开数据和私有数据部分在分布上都高度一致。

印度的邦界大多依据语言分布划定,因此地区和邦确实携带着显著的口音信息,这也是我们发布这些字段、而不是将其汇总隐藏的原因。此前已有研究对 Indian ASR 展开过大规模分析:不同地区的错误率约在 4% 到 44% 之间,代表性不足的地区明显落后于 Hindi 腰带和大城市;研究还按音频质量、语速、语句时长、性别、年龄和设备进行了细分。这些实验基于封闭基准,而 Monsoon 让我们能够在公开排行榜的测试集上开展同类分析。

数据收集与质量控制

monsoon_collection_and_annotation_pipeline

要覆盖广泛的地理区域,就必须从数百个地区招募参与者,而不是让少数说话人进行更长时间的录音。如此大规模的分布式招募也会带来小规模采集不会遇到的问题:参与者钻任务规则的空子、将播放的录音当作实时语音提交,以及标注时注意力不集中。针对每种问题,我们都设置了明确的检查机制。

  • 招募与录音:贡献者通过 Voice Arena 社区招募。Voice Arena 是一个全球数字平台,覆盖了语音语料库很少触及的农村和半城市地区。随后,参与者通过点对点界面,围绕指定的日常话题进行双人对话录音,采用双声道录制。贡献者使用自己的手机和网络,其中许多设备性能较低、网络带宽不稳定,因此发布的音频保留了这些实际状况,而不是将其过滤掉。候选贡献者在获得录音权限前,必须先通过语言能力筛查;他们会获得报酬,并签署知情同意书,授权相关数据用于模型训练和发布。项目还根据各语言使用者的人口规模和地理分布,分别设置了单个说话人的录音时长上限,避免少数高产贡献者主导某种语言或某个地区;这些数据集中,超过一半的说话人恰好只贡献了一段录音。

  • 语料 elicitation:大规模采集自然语音本身就颇具挑战,因为如果缺乏结构化引导,贡献者往往只会给出简短、零散的回答。因此,每段对话都会以开放式叙事提示开场,并逐步给出后续问题,涵盖旅行、医疗、农业、教育和数字服务等领域,引导参与者展开较为完整的描述,同时避免把对话变成照稿朗读。候选话题由大语言模型生成,再由母语语言学家审核并结合本地语境进行调整。

  • 质量控制:每段录音在转写前都必须通过一系列筛查。我们使用基于 30 多种语言人工标注数据训练的语言识别模型,核对实际口语是否与指定语言一致;同时使用专用分类器核验说话者性别与自报标签是否相符,但分类器仅用于佐证自报结果,不能替代自报。另有模型用于区分真实的自然对话与预录或回放音频。通过信噪比估计,剔除清晰度低于可理解程度的录音;但自然环境背景噪声会被刻意保留,以维持真实场景语音的声学特征。通过筛查的录音会使用语音活动检测进行切分:连续静音达到两秒时切分,或达到 15 秒的软上限后,在下一处检测到的静音点切分。每个声道独立处理,因此每个片段都只包含一名说话者和一个声道。随后,所有片段还需通过 DNSMOS P.808 检查。

  • 转写:参考转写全部由人工完成。首先,使用内部 ASR 模型生成初稿,这些模型基于领域内数据训练,且没有一个出现在任何公开排行榜上,因此参与评测的系统不可能为自己评分所依据的参考文本提供内容。之后的每个环节均由母语语言学家按照五级流程完成。该流程严格分工:每轮修订后都由另一名标注员独立核验,确保没有语言学家审核自己的结果。首先,语言学家根据声学信号逐段修正初稿;随后由第二名语言学家复核,并标记仍存在的分歧。接下来的各级流程不断重复这一循环,每次都更换标注员,逐步解决模糊的语音实现、语码转换边界、专有名词,以及不同拼写形式之间的正字法一致性问题。数字统一写成文字,确保转写内容与实际说出的内容直接对应。最终级别仍被标记的问题片段,会重新转写后才能纳入数据集。整个过程中,系统会自动监测标注员的行为,标记包含目标文字系统之外字符、字符或单词不自然重复,以及编辑次数异常偏低或偏高的提交。

区域差异

下面以公开的 Indian English 切分为例,展示这些元数据可以支持怎样的评测。这并不是这些数据集要揭示的最终结论,而是一个示例:当每段音频都带有说话人信息后,我们就能回答更多问题。

排行榜上的 8 个模型在这套数据上的 WER 都介于 4.81 和 4.99 之间,最好与最差只相差 0.18 个百分点,在 5 小时数据所能分辨的范围内。按整个语料库排名时,它们几乎没有区别。

但按说话人所在地区分组后,情况就不同了。我们将每位说话人的所属县上卷到所在分区——这是印度内政部对各邦的分组方式——最终得到 5 个样本充足的区域。openai/whisper-large-v3-turbo 在这些区域之间的 WER 波动为 0.46 个百分点。mistralai/Voxtral-Mini-3B-2507 在整个语料库上的 WER 只比它高 0.14 个百分点,但区域间波动达到 1.68 个百分点:在中部地区为 4.38,在东部地区则为 6.06。也就是说,排行榜上几乎难分高下的两个系统,其准确率受说话人来自何处的影响,差距接近 4 倍。

corpus wer against zone range

最难识别的区域也并不固定。ibm-granite/granite-speech-3.3-2b 在北部地区表现最差,microsoft/VibeVoice-ASR-HF 在南部地区最差,mistralai/Voxtral-Mini-3B-2507 则在东部地区最差。如果只是某个地区的语音更难转写,那么所有模型对各区域的难度排序都应该一致。但事实并非如此,这说明问题更多出在模型,而不是音频本身。

地区只是记录的 12 项属性之一,上述区域则是对 428 个县的粗略汇总。同样的分析也可以按年龄、教育程度、职业和手机设备展开;发布的数据文件包含了复现这些结果所需的全部信息。而对于只记录说了什么、不记录其他信息的测试集,这些分析都无从进行。

印地语的书写规范差异

英语的书写变体相对有限。英式与美式拼写、标点、大小写,以及数字和文字之间的差异,大多可以通过规范化处理映射为统一形式,排行榜采用的规范化器也正是如此。但 Hindi 的情况并非如此。日常口语中大量夹杂英语,源自英语的词汇没有固定的天城文拼写,复合词也常常因个人习惯而连写或分写。同一个短语可能有十种甚至更多有效写法,而这些形式无法通过固定映射归并,因为根本不存在一个统一的规范形式可供映射。

english_normaliser

在只有一个参考答案的情况下,WER 会奖励系统写出标注者碰巧采用的那种拼写。即使两个系统对音频内容的识别能力相当,仅仅因为书写形式不同,得分也可能相差几个百分点。

因此,Hindi 数据集采用了 lattice:对于转录中的每个片段,列出所有可接受的正确书写形式。构建这一结构需要大量人工工作。研究人员先从同一段音频的多份 ASR 转录中提取候选变体,再借助语言模型扩展;随后由母语语言学家判断哪些形式适用于该语句,并删去其余形式,确保最终纳入的写法都与实际说法一致。

hindi_oiwer_scoring

因此,对于 Hindi,我们采用由 AI4Bharat 提出的 Orthographically-Informed Word Error Rate(OIWER,书写形式感知词错误率),而不是 WER。系统输出会在每个片段上与可接受形式集合进行对齐,只要采用其中任意一种形式,就算识别正确;只有真正的识别错误才会被计入。

为量化这一影响,我们对同一批识别结果进行了两次评分。将每个 span 的 lattice 展平为第一个候选项后,就会得到传统基准所使用的单一字符串参考答案;理论上,任何一个获认可的候选项都可以作为参考答案,而不同的选择也会产生不同的参考答案。与展平后的参考答案进行评分时,所有系统的错误率都会上升,但上升幅度并不一致,排名也因此发生变化。下图展示了两对排名在两种参考答案之间发生逆转的系统:采用单一参考答案时,系统得分部分取决于其是否复现了标注者的正字法;而使用 lattice 评分时,衡量的则只有识别能力。

WER against OIWER on Monsoon hi

我们还将实现voi-oiwer开源,因此这些数据集上的所有结果都可以直接复现。

参与评测

对于私有划分,只需将模型提交到 Open ASR Leaderboard,Hugging Face 团队会负责运行评测。与之前一样,将模型添加到排行榜的流程在Open ASR Leaderboard GitHub 仓库中进行:

  1. 提交一个 pull request,系统会显示一份模型检查清单。同时,请报告模型在公开数据集上的结果。
  2. 我们会验证公开数据集上的结果,并计算模型在私有数据集上的指标。
  3. 确认我们得到的结果。

Indian-English 以 Voice Arena Monsoon 的形式加入主榜单,默认显示在榜单列中,而不是作为可选开关。因此,所有模型的榜单头部 Average WER 都会纳入这一数据。私有测试集则会与Appen 和 DataoceanAI 的数据一起,汇总到 Private (conversational) 列中。公开和私有 Hindi 数据集都会显示在Multilingual 标签页中;只有支持所有选定语言的模型才会参与排名,因此这一列提供的是同口径比较。你也可以在“Language dataset breakdown”下拉菜单中选择“Hindi”。

接下来

Hindi 清楚地暴露了一个普遍问题:凡是拥有多种书写方式的语言,或是由基准测试尚未覆盖的人群使用的语言,都会同时面临本文提到的两类缺陷。这些数据集本身无法消除问题,但能让问题显现出来:它们把测试集加入业界已经关注的榜单,并记录每位说话者和每条参考文本的足够信息。这样一来,两个系统之间的差异就能追溯到“是谁在说”以及“他们如何书写”,而不会被一个总分掩盖。

这四个数据集属于 Monsoon,是 Voice Arena 面向全球南方地区推出的更大规模数据集计划的一部分。

本文提及的模型 4 个

本文提及的数据集 2 个

本文提及的 Spaces 1 个

本文提及的论文 2 篇

博客中的更多文章

audiospeechbenchmark

衡量语音识别中的基准测试优化

  • +3
57 2026 年 8 月 21 日
audiospeechbenchmark

推出 Real World VoiceEQ:衡量语音 AI 的人类感知质量

  • +9
33 2026 年 7 月 15 日

社区

编辑预览 通过将图片、音频和视频拖入文本输入框、粘贴,或点击此处上传。点击或粘贴此处上传图片 评论

· 注册登录 后发表评论

赞同 8

本文提及的模型 4

本文提及的数据集 2

本文提及的 Spaces 1

本文提及的论文 2

原始来源: HuggingFace博客

评论 (0)