← 文章 / 未分类
ossaihub 1小时前 · 2026-09-02 13:12:29 · 1 阅读

红色睡衣

Together AI 提供的开放数据集和模型,支持大规模训练大型语言模型,并实现可复现的结果

4,981 个 star +0 7 天 +0 30 天 376 个 fork 36 个未解决 issue 趋势

最后提交时间:2026-06-03。Star 数据同步于 2026-09-01。

GitHub → 网站

# RedPajama:可扩展的 LLM 训练数据集与模型

RedPajama 致力于打造可复现、开放的专有 LLM 训练替代方案。通过发布包含超过 3 万亿 token 的数据集和训练模型,Together AI 帮助研究人员和企业构建自己的基础模型。

## 主要特性

  • RedPajama 数据集:包含 3 万亿 token,来源涵盖网页、代码和书籍等多种数据
  • 可复现:公开数据集支持模型复现与研究
  • 基础模型:提供 RedPajama 3B、7B 及更大规模的训练模型
  • 数据透明:清晰记录数据来源与整理过程
  • Instruct 版本:提供经过指令微调、适用于对话场景的模型
  • 研究基础设施:提供数据集整理和模型训练工具
  • Apache 2.0:完全开放,可用于研究和商业用途
  • 社区驱动:由学术界和产业界合作伙伴共同参与
  • 4.9k 个 star、371 个 fork,项目仍在积极维护
  • 企业应用:已被全球研究机构和企业采用

    RedPajama 通过透明、开放的数据集,让更多人能够开展 LLM 训练。

    功能介绍

    RedPajama-V2 是一个大规模开源数据集,包含超过 1,000 亿份文本数据。这些数据来自 84 个 CommonCrawl 快照,并通过 CCNet 流程处理。数据集覆盖 5 种语言(英语、德语、法语、西班牙语和意大利语),提供 30 万亿个去重 token,并附带计算得到的质量信号,包括困惑度分数、语言识别结果和去重元数据。代码仓库包含完整的数据处理流程,包括数据产物准备、质量信号计算,以及精确去重和模糊去重。

    安装与入门

    • 克隆代码仓库,并将 configs/rp_v2.0.conf 复制为 configs/default.conf,以配置环境变量
    • 安装 Docker、Apptainer 和 s5cmd,并配置用于访问数据的 S3 profile
    • 从提供的 URL 下载 English Wikipedia reference classifier,并将其放置到 ${DATA_ROOT}/wikiref-model/en/en-model.bin
  • 按顺序执行流水线:准备数据产物、计算质量信号,最后进行去重

适用场景

  • 使用高质量、多语言数据,大规模训练大型语言模型
  • 研究 LLM 训练中的数据整理、去重和质量信号
  • 在各语言覆盖均衡的条件下,研究跨语言表示学习

注意事项

  • 流水线依赖 Docker 和 Apptainer 容器化;手动执行时,必须统一设置 PYTHONHASHSEED=42,以保证哈希函数的结果可复现
  • 需要访问 S3 存储桶,并配备充足的计算资源(已在 64 核、内存 500GB 以上的机器上测试过 2 亿多份文档)
  • 基于 LSH 的模糊去重需要仔细调参,包括相似度阈值和布隆过滤器容量;README 对具体超参数建议说明较少
  • 多阶段流水线较为复杂,各阶段存在依赖关系;必须先完成数据产物准备,才能进入质量信号计算阶段

使用者

RedPajama 被 Together Computer 以及训练开源 LLM 的学术研究者广泛使用。它已成为开源 LLM 社区的标准基准数据集,Open LLaMA 等模型及其他社区驱动的 LLM 项目都采用了它。

替代方案

  • Common Crawl 原始数据(需要自行构建 CCNet 流水线)
  • The Pile(类似的整理型 LLM 训练数据集,但规模更小)
  • C4 数据集(Google 从网页提取的数据集,仅支持英语)
  • OSCAR(基于多语言 CommonCrawl 的数据集)

结论

如果你需要用于 LLM 训练的超大规模、开放、多语言数据集,以及预先计算好的质量信号和去重产物,RedPajama-V2 值得选择——它针对大规模处理进行了良好工程化设计。如果缺乏大规模数据处理所需的基础设施,或更需要简单易用、开箱即用的数据集,则不建议选择它;这套流水线复杂度高,对资源的要求也很高。

需要了解的概念

OLMoOlmo 2OpenHermes预训练数据混合合成数据供应链风险(AI)涌现能力推理即服务训练数据整理

LLM 基础领域的更多内容

原始来源: ossaihub

评论 (0)