Falcon ASR 语音识别模型正式发布
阿拉伯语词错率:20.92% · 参数量:1.6B · 阿联酋方言词错率(TII 评估):22.73%
我们正式发布 Falcon-ASR,这是一款面向阿拉伯语的 1.6B 参数语音识别模型,特别关注阿联酋方言。该模型由阿布扎比的技术创新研究所(TII)开发,同时支持英语、法语、西班牙语和葡萄牙语。
在评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错率为 20.92%,低于我们所参考的排行榜快照中的最佳已发布结果 23.17%。在针对阿联酋方言的内部评估中,其词错率和字错率在对比系统中均为最低。
我们还支持转写内容的词级时间戳,将每个转录词对应到音频中的具体位置。
识别口语阿拉伯语
阿拉伯语语音因地区、说话者和场景而异。一个能处理正式新闻广播的模型,在面对阿联酋方言对话或电话线路录音时可能表现不佳。此外,相比现代标准阿拉伯语(MSA),阿拉伯语方言的转录语料资源更少,这使得训练和评估更加困难。
我们使用阿联酋方言、MSA、其他海湾及阿拉伯语方言,以及英语数据训练了 Falcon-ASR。我们的目标是转录人们在日常口语中使用的词汇,包括方言形式和语言间的切换。
阿拉伯语基准测试结果
由 ELM Research Center 维护的开放通用阿拉伯语 ASR 排行榜,根据六个测试集的等权平均词错率对系统进行排名,同时报告字错率(CER)。这两项指标的值越低越好。我们对 Falcon-ASR 的评估遵循此协议。
WER 为词错误率,CER 为字错误率。数值越低,性能越好。
我们基于排行榜锁定的清单,在六项基准上评测了 Falcon-ASR。竞品的数据取自 2026 年 9 月 30 日检索的排行榜已公布平均分。在该数据快照中,Falcon-ASR 的平均 WER 比最佳公布成绩低 2.25 个百分点。
阿曼语(Emirati)语音评测
公开评测数据已包含阿曼语(Emirati):Hugging Face 上的 Casablanca 数据集设有阿联酋子集。我们以此为基础,补充内部评测,覆盖更多阿曼语及海湾地区的语音数据。通过留出的录音和经人工校验的转录文本,评估公开子集之外的转录准确性。
在内部阿曼语评测中,Falcon-ASR 的 WER 为 22.73%,CER 为 10.19%:
在本次对比的系统中,Falcon-ASR 的 WER 和 CER 均为最低。其 WER 比次优结果 Qwen3-Omni 低 4.07 个百分点。结果表明,该系统在此评测中的词级和字级转录准确率均有所提升。
面向不同录音条件的训练
训练中加入了背景噪声、语音重叠、音乐、房间混响及电话效应,并覆盖了语速和音调变化。我们对阿曼语录音也做了相同处理,使模型熟悉会议、通话及其他日常录音中可能遇到的各种场景。
英语及其他语言
Falcon-ASR 还能使用相同的模型权重转录英语。在 Hugging Face 开放 ASR 排行榜采用的七个公开英语测试集上,其平均 WER 为 5.74%。
该模型还支持法语、西班牙语和葡萄牙语。五种语言共用同一套权重,无需指定语言参数,输出即为对应语言的转写文本。
模型基础
Falcon-ASR 基于我们的 Falcon3-Audio 工作构建,其架构与训练方法详见论文 Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data。
试用 Falcon ASR
你可以通过我们的 Hugging Face Demo Space 体验 Falcon-ASR 的转写能力。API 接口和原生应用也在规划中,欢迎用你自己的录音来试试这个 Demo。
致谢
感谢 Falcon-Emirati 模型团队在阿拉伯语基础模型方面给予的支持,他们的最新工作可参阅 Falcon-Emirati 博客文章。
同时衷心感谢 Mikhail Lubinets 对算力基础设施的持续支持。
Falcon ASR 发布
我们很高兴推出 Falcon-ASR——我们的阿拉伯语语音识别模型,参数量为 16 亿,并特别针对阿联酋方言做了优化。该模型由阿布扎比技术创新研究院(TII)开发,同时还支持英语、法语、西班牙语和葡萄牙语。
在我们的评测中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错误率(WER)为 20.92%,优于我们所用排行榜榜单上已发布的最佳成绩 23.17%。在针对阿联酋方言的内部评测中,该模型的词错误率和字符错误率均为参与对比的系统中最优。
我们还支持词级时间戳,可以将每词与其在音频中的位置对应起来。
阿拉伯语语音识别
阿拉伯语语音的表达因地区、说话人及录音环境的不同而异。一个模型或许能精准转写正式的官方新闻播报,但在处理带有阿联酋方言的对话或电话录音时却可能表现吃力。此外,现有的阿拉伯各方言有声转写文本资源远少于标准阿拉伯语,这给模型训练和评估带来了额外挑战。
我们在阿联酋方言、标准阿拉伯语及其他海湾地区和阿拉伯方言,以及英语上训练了 Falcon-ASR。我们的目标是让模型能够转写人们日常口语中实际使用的词汇,包括方言表达习惯以及语码转换现象。
阿拉伯语测试结果
由 ELM 研究中心维护的开放式通用阿拉伯语自动语音识别排行榜,根据六个测试集的平均词错率(WER),并赋予每个测试集相同的权重,对各系统进行排名。该榜单同时也展示了字错率(CER)。上述两项指标的数值越低,代表性能越好。我们对模型进行评估时严格遵循了该协议。

WER 即词错率,CER 即字错率。数值越低,性能表现越佳。
我们利用排行榜中固定下来的样本列表,在相同的六个测试集上评估了 Falcon-ASR。竞品模型的数据采用榜单上公布的平均值,这些数据已于 2026 年 9 月 30 日核验无误。该版本的 Falcon-ASR 平均词错率比当时榜单上的最佳已发布成绩低了 2.25 个百分点。
阿联酋方言评估
目前已公开用于评估阿联酋方言的数据:其中 Casablanca 数据集专门包含了阿联酋语料库。为了补充这一覆盖范围,我们还开展了一项内部评估,使用额外的阿联酋语和海湾地区语音录音。这些录音配有专用测试集,以及经过人工核查的参考文本,旨在衡量转写在这些额外语料上的准确性。
在内部阿联酋方言评估中,Falcon-ASR 的词错率为 22.73%,字错率为 10.19%:

在此对比的系统中,Falcon-ASR 记录到了最低的词错率和字错率。其词错率比表现次佳的 Qwen3-Omni 低了 4.07 个百分点。这些结果清晰地表明,Falcon-ASR 在该评估指标下的转写准确性,在词和字两个层面均有显著提升。
针对不同录音条件的训练
训练数据中混入了背景噪声、重叠语音、音乐、回声及电话通话效应,并涵盖了语速与音量的变化。我们对阿联酋语录音也应用了相同的处理流程,以便模型能适应会议、通话及其他日常录音中可能出现的多种环境条件。
英语及其他语言
Falcon-ASR 使用同一套模型参数转写英语语音。在 Hugging Face 开放语音识别基准常用的七套英语测试集上,其平均词错误率(WER)为 5.74%。

该模型同时支持法语、西班牙语和葡萄牙语。五种语言共享同一套参数,无需预先指定目标语言。输出内容为发音语言对应的转写文本。
模型基础
Falcon-ASR 建立在 Falcon3-Audio 的研究成果之上。论文 《Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data》 介绍了 Falcon3-Audio 的架构及其训练方法。

