跳到正文
原文
Hugging Face Blog·· 2024-06-12AI 评分42

Hugging Face TRL 推出 RLOO Trainer,把强化学习重新带回 RLHF

AI 导读

Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 的在线 RLHF 替代方案。RLOO 只需加载策略、参考策略和奖励模型 3 份模型,比 PPO 少约 50-70% 显存,1B 模型上快 2 倍、6.9B 模型上快达 3 倍,响应胜率与 PPO 相当并持续优于 DPO 等离线方法。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co