← 文章 / AI技术
Apple 机器学习 3小时前 · 2026-08-31 13:10:37 · 0 阅读

数据受限下的多语言知识迁移:基于词级干预的方法

作者:Anastasiia Sedova、Natalie Schluter*、Skyler Seto*、Maartje ter Hoeve*

查看论文

跨语言知识迁移对于为训练数据不足的语言构建高性能多语言模型至关重要。当目标语言数据稀缺时,许多涉及科学推理、常识推理和世界知识的下游任务所需的知识主要必须从高资源语言中获取,因此有效的知识迁移尤为关键。现有的跨语言知识迁移方法需要大量平行数据、翻译系统、辅助模型或额外的训练阶段,而这些资源对于许多语言来说基本上都不可用。我们提出了 LINK——一种数据层面的干预方法,通过使用双语词表对预训练数据中高资源部分进行词级替换,从而改善模型预训练过程中的知识迁移。对于给定的替换比例,在部分高资源(英语)训练语料中随机选取的词会被替换为其词级翻译,无需额外的模型训练,仅需一个双语词表,而该词表几乎可以零成本获取,适用于几乎任何语言。在五种模型规模、八种语言上的评估显示,目标语言下游任务有显著提升,且训练速度最高可提升 2 倍以达到同等性能。

  • * 共同贡献者
原始来源: Apple 机器学习

评论 (0)