Hugging Face Blog·· 2024-06-12AI 评分
Hugging Face TRL 推出 RLOO Trainer,把强化学习重新带回 RLHF
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 的在线 RLHF 替代方案。RLOO 只需加载策略、参考策略和奖励模型 3 份模型,比 PPO 少约 50-70% 显存,1B 模型上快 2 倍、6.9B 模型上快达 3 倍,响应胜率与 PPO 相当并持续优于 DPO 等离线方法。
当前提供 AI 导读,完整正文请阅读原文。
来源:Hugging Face Blog · huggingface.co