跳到正文
原文
Hugging Face Blog·· 2026-01-27AI 评分38

解锁 GPT-OSS 的智能体 RL 训练:一次实践复盘

AI 导读

Hugging Face 博客复盘了用 verl 框架对 GPT-OSS 进行智能体强化学习训练时遇到的问题与修复。团队发现 GPT-OSS-20B 训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不一致,使 PPO 的 importance sampling ratio 偏离 1;修复后该方案同样适用于 GPT-OSS-120B。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co