Apple 机器学习 3小时前 · 2026-08-31 13:10:46 · 0 阅读
数据受限下混合预训练的扩展定律
,
Anastasiia Sedova、Skyler Seto、Natalie Schluter、Pierre Ablin
随着语言模型规模不断扩大,其所需的数据量也在增长——然而许多目标数据源本身就存在规模限制,例如低资源语言或特定领域。一种常见做法是将这类稀缺但高价值的目标数据与丰富的通用数据混合使用,但这带来一个根本性的权衡:目标数据在混合中占比过低,模型就无法充分接触目标领域;而占比过高,则会导致同样的样本被过度重复,造成收益递减乃至过拟合。我们通过超过 2,000 次语言模型训练实验来研究这一权衡,涵盖多种模型规模、目标数据集大小,以及多种数据类型,包括多语言、特定领域和质量过滤的混合数据。在所有设定下,我们发现重复是影响目标领域表现的核心因素,并且混合训练对重复的容忍度远高于单一来源训练:稀缺的目标语料可以重复使用 15–20 次,最优重复次数取决于目标数据规模、计算预算和模型规模。在此基础上,我们提出了一种感知重复次数的混合扩展定律,该定律考虑了重复目标 token 价值递减以及通用数据的正则化作用。通过对该定律进行优化,可以以原则化的方式计算出有效的混合配置,为数据受限场景下的预训练提供实用的混合策略建议。
原始来源: Apple 机器学习