跳到正文
原文
Hugging Face Blog·· 2026-05-07AI 评分22

vLLM V0 到 V1 迁移:RL 训练中先对齐正确性再改目标

AI 导读

PipelineRL 在 vLLM V0 到 V1 迁移中通过四项修复让 V1 与 V0 参考轨迹对齐:启用 processed_logprobs、显式关闭 prefix caching 与 async scheduling、匹配 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co