← 文章 / AI技术
HuggingFace博客 6小时前 · 2026-10-07 08:30:26 · 8 阅读

Falcon-Emirati:让大模型真正懂阿联酋方言与文化

image

试用 Falcon-Emirati →

阿拉伯语其实是同属一个大语系下的多种语言。现代标准阿拉伯语(MSA)是我们新闻和教材中常见的形式,但日常生活中人们极少用这种方式交流。在阿联酋,日常对话、幽默、谈判和讲故事都使用阿联酋阿拉伯语,这是一种海湾方言,拥有独特的词汇、节奏以及与之紧密相连的文化内涵。阿联酋诗歌(尤其是 Nabati 诗歌)、谚语和简短的轶事蕴含着独特的意义,这些意义在逐字直译中往往会荡然无存。一个只懂 MSA 的模型,即使能翻译阿联酋语句子里的每个单词,仍然可能完全误解其真实含义。

Falcon-Emirati-7B 正是为了弥合这一差距而设计。它是基于 Falcon-H1-Arabic 开发的方言专用模型,旨在像母语者那样理解和生成阿联酋阿拉伯语:包括词汇、语气以及背后的文化语境。

基于 Falcon-H1-Arabic 构建

我们并非从零开始。Falcon-Emirati-7B 建立在 Falcon-H1-Arabic 之上,后者是我们今年早些时候在阿拉伯语领域创下多项新纪录的阿拉伯语模型系列。Falcon-H1-Arabic 采用 Falcon-H1 混合架构:状态空间模型(Mamba)与 Transformer 注意力机制在每个块中并行运行,其输出在每个块的投影前融合。这种组合在长序列上保持了 Mamba 的线性时间效率,同时利用注意力机制捕捉长距离依赖关系的精确性,这对于阿拉伯语这种形态丰富语言至关重要。该系列涵盖三个规模(3B、7B 和 34B 参数),上下文窗口支持高达 128K 和 256K token,并且已使用广泛的 MSA 和阿拉伯语方言(海湾、黎凡特、埃及、马格里布)数据以及英语和多语言数据进行过训练。

这给了我们一个很好的起点:一个模型已经对阿拉伯语有广泛理解、能很好地处理长上下文,并且内置了一定的方言基础。Falcon-Emirati-7B 在这个基础上,专门向阿联酋方言深耕——包括词汇、语法,以及通用阿拉伯语模型再强也无法自行掌握的文化知识。

我们特意选择了 7B 版本构建 Falcon-Emirati-7B。它是这个模型家族的甜点位:足够大,能承载方言适配所需的细腻语言特性;又足够小,训练和推理都保持实用。34B 模型或许能进一步提升质量,但训练和部署成本对一个专注方言的对话模型来说并不划算;而 3B 模型又没有足够的空间来承载我们追求的文化和语言理解深度。7B 在质量与训练推理成本之间达到了最佳平衡。

为什么方言适配很难

把一个通用阿拉伯语模型改造成阿联酋方言专家,听起来比从零构建基础模型简单,其实不然。有几个因素让它相当困难:

  • 阿联酋方言主要是口语。它在网络文字中出现的频率远低于 MSA(现代标准阿拉伯语),甚至低于其他海湾和黎凡特方言,因此可用于学习的原始文本本身就少。
  • 含义往往不按字面理解。习语、谚语和诗歌引用依赖共同的文化背景,而非表面词汇。
  • 没有现成的方法论。究竟多少方言数据才够、如何将它与 MSA 和通用阿拉伯语数据混合、哪个训练阶段(继续预训练、SFT 还是偏好优化)对掌握方言最关键——这些问题都没有成熟的文档可参考。

最后一点决定了我们的工作方式。构建 Falcon-Emirati-7B 的过程中,大量工作其实就是反复试错:测试不同的数据配比、训练阶段和监督策略,再结合人工评估和基准分数,找出真正有效的做法。

我们的数据处理方法

在 Falcon-H1-Arabic 预训练的基础上,我们搭建了一条专门面向阿联酋方言的数据管线,数据来自三个互补的来源。

  1. 真实的阿联酋方言网络数据

我们从阿拉伯联合酋长国的网站和论坛爬取并精选了以方言为母语撰写的内容,而非从标准阿拉伯语翻译或音译而来。这是我们获取真实语料的来源:了解阿联酋人实际如何在网络上书写和表达,包括日常措辞、口语化表达,以及真实语境中阿联酋方言与标准阿拉伯语之间自然的交替使用。

  1. 关于阿联酋文化与身份的标准阿拉伯语数据

除了方言文本,我们还引入了专门探讨阿联酋文化、传统和语言的标准阿拉伯语材料:关于当地习俗、价值观、历史和社会规范的文章及参考文献,包括阿联酋人的外界认知与刻板印象。这部分数据并非教模型如何写方言,而是让模型理解当涉及阿联酋话题时,它正在谈论什么,比如传统、礼仪,以及母语者不言自明的文化背景。

  1. 受术语表与风格规则引导的合成数据

仅靠真实的方言文本不足以覆盖聊天模型日常需要处理的广泛话题。因此,我们生成了大量阿联酋方言的合成数据来填补空白。我们并未让生成模型在“海湾风格”阿拉伯语中随意发挥,而是通过专为阿联酋词汇和语法制定的严格规则、术语表和词典进行约束。这些护栏确保了合成输出读起来具有地道的阿联酋特色,而非只是语法正确却不符合方言发音习惯的内容。

寻找合适的适配配方

由于从标准阿拉伯语到方言的适配没有标准公式,我们将训练策略本身视为一个需要通过实验确定的事项。我们进行了消融实验,以确定注入方言数据的具体数量及最佳训练阶段,探讨如何平衡真实爬取数据与合成数据以防止模型过拟合合成模式,以及需要多少标准阿拉伯语文化背景才能使模型在文化上保持接地,而不仅仅是表面流利。在每一步中,我们都结合了自动评分和母语者审核,因为单纯的自动指标无法充分捕捉自然度、语气或文化契合度,不足以作为唯一可信的依据。

评估方法论

我们在整个训练过程中通过两种互补的方法跟踪进展:

母语者人工评估

阿联酋本地母语者直接审查了模型的输出,判断标准不仅限于答案是否正确,还关注听起来是否地道,即语言的流畅度、语气以及文化上的适宜性。这些是基准分数无法体现,但母语者能立刻察觉的细节。

基于 Alyah 的自动化评估

为了进行量化跟踪,我们使用了 Alyah(الياه,意为“北极星”)。这是一个由我们及社区专门发布用于评估阿拉伯语大语言模型(LLM)的阿联酋方言能力的基准测试。Alyah 是一个完全基于母语者的多项选择题基准测试,包含 1,173 个样本,手动采集自阿联酋母语者,涵盖从日常问候、礼仪到修辞手法、传统知识以及阿联酋诗歌等多个类别:这些正是方言和文化差异最关键、通用阿拉伯语模型往往表现不佳的领域。关于 Alyah 构建过程和类别细分的完整详情,请参阅我们的基准测试博客文章;有关基础模型系列的背景信息,则可在Falcon-H1-Arabic 公告中找到。

结果

Falcon-Emirati-7B 在 Alyah 上得分84.83%,领先于我们对比的所有其他阿拉伯语和多语言模型,其中包括一些参数量远超该模型的同类模型。下图展示了它在 Alyah 排行榜上相对于一组具有代表性的领先指令微调模型的位置。

Falcon-Emirati-7B 与领先阿拉伯语及多语言模型在 Alyah 上的对比

Alyah 准确率(%),针对指令微调模型。由于 Falcon-Emirati-7B 是基于 Falcon-H1-Arabic 系列构建的,因此未包含在此对比中。

结果揭示的信息

对比结果中有几点很值得注意。参数规模并不能直接带来方言能力,一些体量最大的多语言模型,得分反而远低于更小但更懂方言的模型。这说明阿联酋方言的能力必须专门训练,不会随着模型变大自动获得。表现最好的模型基本都是阿拉伯语原生或以阿拉伯语为主的模型,这也和我们自己做 ablation 时观察到的结论一致:通用阿拉伯语加上方言覆盖是必要的起点,但要补齐剩下的差距,仍需要针对性的方言专项工作,尤其是在 Alyah 最难的部分,比如诗歌、传统知识,以及语言与方言这个类别本身。

这也与 Alyah 基准发布后的整体发现相吻合:一旦涉及真正的方言和深度文化内容,即便是强大的模型也会出现明显退化。这种差距不会因为模型变大而自行消失,必须依靠专门为方言构建的数据和评测。

超越选择题:LLM-as-Judge 评测

选择题准确率只能说明模型能否在四个选项中认出正确答案,却不能说明当有人直接和它对话时,它是否会主动用阿联酋方言回答。因此除了 Alyah,我们还做了第二项评测:在同样的 1,173 道 Alyah 题目上进行开放式生成,用 LLM 评审(Gemini 3.7 Flash)打分,对比五个模型:Falcon-Emirati-7B、ALLaM-7B-Instruct-preview、gemma-3-27b-it、Jais-2-8B-Chat 和 Fanar-2-27B-Instruct,均选自 Alyah 排行榜上最强的竞争模型。

评审从两个独立维度给每个答案打分:内容是否正确,以及答案是否真的以阿联酋方言而非现代标准阿拉伯语(MSA)返回。我们同时报告部分得分(评审的分级评定)和更严格的通过/不通过版本,外加每个模型放弃回答而不作答的频率。

LLM-judged correctness on open-ended Emirati questions

以 Gemini 3.7 为评审、对 1,173 道 Alyah 题目进行开放式生成后的 LLM 评分正确率。

LLM 评定的方言还原度

同一组测试题的 LLM 方言还原度评测:回答真正使用了阿联酋方言,还是模型默认回退到了 MSA?

Falcon-Emirati-7B 在正确性指标上领先,但两者的真正差距体现在第二张图里。方言还原度方面,Falcon-Emirati-7B 得分为 0.52(部分正确),ALLaM 为 0.05,gemma-3-27b-it 为 0.03,Jais-2-8B-Chat 为 0.02,Fanar-2-27B-Instruct 则基本为 0.00。这不仅是优势略大,在低分端接近两个数量级的差距。实际上,这意味着其他模型往往知道正确答案,但默认用 MSA 输出,即使提问者直接使用了阿联酋方言。Falcon-Emirati-7B 是五款模型中唯一能稳定以提问者所用的方言进行回复的。

Fanar-2-27B-Instruct 在第二方面同样引人注目:它的拒答率远高于其他模型,有 26.2% 的问题被拒绝回答,而对比组中其他模型的拒答率均低于 5%。结合其 0.27(部分正确)的正确性得分——为五款模型中最低——可以推断,该模型面对阿联酋特定内容的意愿和能力都相对较弱,并非仅仅是语域使用不当。

按类别划分的方言还原度

按 Alyah 类别划分的方言还原度(部分正确)。Falcon-Emirati-7B 是唯一能在几乎所有类别中稳定切换至阿联酋方言的模型,其他模型则普遍停留在 MSA 上。

按类别拆解方言保真度,规律就更清晰了。Alyah 的每一个类别都呈现同样的表现,从日常问候到诗歌,说明这并不是针对少数题型学到的窄技巧,而是模型整体默认语体的转变——当预期语体是阿联酋方言时,模型会整体切换过去。竞品模型唯一相对较好的类别是问候与日常表达(Greetings & Daily Expressions),而这恰恰是阿联酋方言与现代标准阿拉伯语(MSA)重叠最多的类别,通用阿拉伯语模型最容易在这里"碰巧听起来像对的"。

逐类别两两对比

作为对同一问题的第三种视角,我们进行了两两盲评:对于每道 Alyah 题目,评审模型(Gemini 3.7 Flash)同时看到 Falcon-Emirati-7B 和一个竞品模型的回答,但不知道各自来源,然后选出更好的那个。下面的雷达图展示了针对三个竞品模型(Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct)按类别的胜率。

pairwise_combined

由 Gemini 3.7 两两盲评得出的各类别胜率:Falcon-Emirati-7B 对阵 Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct。

对阵三个竞品模型,Falcon-Emirati-7B 在大多数类别中胜出,在最依赖方言和文化流畅度的类别里优势尤其明显。对阵 Jais-2-8B-Chat 时,差距最大的是诗歌与创意表达(Poetry & Creative Expression,0.69 vs. 0.31)以及语言与方言(Language & Dialect,0.62 vs. 0.38)。对阵 ALLaM-7B-Instruct-preview 时,同样是这两个类别差距最大:诗歌与创意表达(0.66 vs. 0.34)和语言与方言(0.58 vs. 0.42)。对阵 Fanar-2-27B-Instruct 时,优势是三组对局中最明显的——Falcon-Emirati-7B 赢下了所有类别,其中诗歌与创意表达最高(0.88 vs. 0.12),宗教与社会敏感话题(Religious & Social Sensitivity)次之(0.80 vs. 0.20)。

在问候语和日常用语方面,竞争模型的表现尚可。Falcon-Emirati-7B 惜败于 Jais-2-8B-Chat(0.46 对 0.54),并与 ALLaM-7B-Instruct-preview 打平(均为 0.50),但仍明显优于 Fanar-2-27B-Instruct(0.70 对 0.30)。这一结果与上文方言忠实度分析一致:问候语是爱马蒂方言与现代标准阿拉伯语重叠度最高的领域,因此即便是未经过专项方言训练的通用阿拉伯语模型,在此处也能表现得像母语者。在其他方言特征更鲜明的领域——如诗歌、修辞和传统文化知识——Falcon-Emirati-7B 在所有受测竞争模型面前均保持明显优势。

理解爱马蒂文化

语言不仅是交流工具,更关乎对话背后的文化内涵。我们使用 ArabCulture-Dialogue 基准测试中的阿联酋部分,对 Falcon-Emirati-7B 的文化理解能力进行了评估。该基准专为衡量阿拉伯语文化理解而设计。在多选任务中,模型需从三个选项中选择最符合文化规范的回复。详细分析请参阅研究论文。

我们针对同样的 283 个阿联酋场景测试了全部四个模型,分别采用爱马蒂方言和现代标准阿拉伯语,并设置了不同数量的地点信息变量。

Cultural understanding accuracy: Falcon-Emirati-7B 85.57%, ALLaM 83.39%, Jais-2 73.79%, Fanar-2 71.50%.

在阿联酋多选题任务上的总体准确率,基于两种语言变体和所有地点设置计算的平均值。以下为我们评估结果。

Falcon-Emirati-7B 取得 85.57% 的得分,在受测的四个模型中位居首位,领先于 ALLaM-7B(83.39%)、Jais-2-8B(73.79%)和 Fanar-2-27B(71.50%)。这些结果凸显了该模型在爱马蒂对话中识别符合文化规范回复的能力。

实际运行展示

数据只能反映全貌的一部分,因此下面提供一个实时交互式对比界面。我们将五条真实阿联酋用户指令分别输入 Falcon-Emirati-7B、Fanar-2-27B-Instruct 和 ALLaM-7B-Instruct-preview,以便并排比较。轻扫或使用箭头即可切换不同的指令,点击任意响应即可查看全文。

交互式对比:Falcon-Emirati-7B vs. Fanar-2-27B-Instruct vs. ALLaM-7B-Instruct-preview。测试内容涵盖五条阿联酋指令,涉及开斋节问候、当地历史、诗歌及文化遗产知识。输出结果均为模型直接生成,可能存在错误;高亮部分仅用于标识我方模型,并非事实性评分。

试用 Falcon-Emirati-7B

Falcon-Emirati-7B 已上线至我们的聊天平台。🚀 立即试用: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B

负责任 AI 与局限性

与所有语言模型一样,Falcon-Emirati-7B 可能会反映出训练数据中的偏见,有时也会出错,特别是在面对生僻表达、高度本地化的引用或我们数据稀少的边缘用例时。方言和文化细微差别带有主观性,即使是母语者也未必对“正确答案”达成一致。我们建议依赖该模型处理敏感、官方或高风险任务前,先针对具体应用场景进行评估。我们也非常期待来自阿联酋社区的反馈,以帮助我们未来改进模型和 Alyah 服务。

原始来源: HuggingFace博客

评论 (0)