非洲AI时刻来临:从零打造的1.5B模型专攻12种非洲语言,体积小8倍却击败Google、Meta和阿里巴巴
- MORENA 仅有 15 亿参数,却击败了参与测试的 26 个模型
- 这款来自 Vambo AI 的模型从零开始,专为非洲语言打造
- MORENA 表示非洲语言文本所需的 token 数量少于各大竞争对手
Vambo AI 发布了 MORENA,一个 15 亿参数的语言模型,覆盖非洲 12 种语言,外加英语、法语和代码。
开发者表示,它在非洲语言建模和翻译任务上超越了 Google、Meta、Alibaba 和 HuggingFace 的模型,同时体积小了最多 8 倍。
在一项关键基准测试中,这款 LLM 取得 1.408 bpb 的成绩,在 26 个受测模型中排名第一;最接近的对手参数量是它的五倍多,成绩却只有 1.423 bpb。
Latest Videos FromTechRadarWatch full video here:无需借用现成基座的训练
该模型覆盖尼日利亚皮钦语、伊博语、约鲁巴语、豪萨语、斯瓦希里语、绍纳语、祖鲁语、科萨语、卢旺达语、茨瓦纳语、南非荷兰语和恩德贝莱语。
大多数服务这些语言的项目都是在现有 Llama 变体上继续训练,这意味着不得不沿用为英语和编程文本设计的词表。
Vambo AI 的做法不同:在训练开始前就确定了 tokenizer、数据配比和语言列表,此前还对比了几种词表规模的成本与效率。
在相同的文本上,MORENA 的词表编码非洲语言文本所需的 token 比 Gemma 3 少 1.39 倍,比 Llama 3.2 少 1.53 倍。
非洲语言文本每字节消耗 0.249 个 token,英语为 0.234,前者高出约 6%,团队尚无法完全解释这一差异。
最接近的竞争对手 Lugha-Llama-8B 是一个适配非洲语言的 Llama 3.1 变体,成绩为 1.423 bpb,在 12 种语言中有 8 种输给了 MORENA。
相比之下,120 亿参数的 Gemma 消耗的计算资源约为 MORENA 的 11 倍,在同样文本上的成绩却更差。
经过对话微调的 instruct 版本成绩为 1.441 bpb,总体略逊于 Lugha-Llama-8B,但在两者共同覆盖的五种语言中领先,而参数量仅为其约 20%。
经过查看三个示例译文后,该指令模型能将英文渲染为五种非洲语言,chrF++ 得分为 45.8,在统计上与专门的翻译系统持平。
它比大型翻译模型低约 1.4 分,而同等规模的通用模型通常落在 9 到 14 分的区间。
基于 22,000 GPU 小时构建的模型家族
MORENA 预训练期间使用了 251.7B tokens,随后的中期训练阶段又使用了 63B tokens。
据报告,开发过程中耗用了超过 22,000 小时 A100 GPU,相应的计算资源价值约为 40,000 美元。
开发者称,该项目得到了 UNDP、AIHub4SD 和 CINECA 的支持,他们在开发期间提供了计算资源及其他协助。
该项目还包含较小的版本发布,除了主要的 1.5B 模型外,还提供 0.5B 和 0.2B 参数的版本。
据报告,0.5B 变体在覆盖的 12 种语言中的 11 种上,表现均超过所测试的所有外部系统。
0.2B 纳米版本旨在用于语音识别重评分、键盘应用以及文本规范化任务。
该纳米版本处理每字节数据的成本比 Lugha-Llama-8B 低 58 倍,并在单张 A100 GPU 上每秒生成 104 tokens。
该模型还有一个 CPU 兼容版本,可离线运行在笔记本上,适合无法保证 GPU 接入的场景。
这使得开发者能够针对不同计算需求提供多种模型尺寸,而非仅依赖最大的版本。
通过其专注指令的发布版本,MORENA 还支持对话应用、翻译以及与其他 AI 工具 的对接。
来源:Glitch Front