在GPU集群上训练535B MoE大模型,解决专家并行与通信效率问题
JAX负责数值计算与自动微分,XLA编译到加速器,Levanter为训练框架;因JAX/XLA GPU环境缺现成专家并行方案,团队自行实现EP
CRFM 开发的大规模语言模型训练框架,支持高效分布式训练。