verl 是一个高效灵活的强化学习后训练框架,专为大语言模型设计,支持 PPO、GRPO 等多种 RL 算法,提供混合并行训练策略,帮助研究者和工程师快速进行模型对齐,降低 RLHF 等后训练任务的技术门槛。