Hugging Face·· 2026-05-07AI 评分46
vLLM 从 V0 到 V1 迁移:强化学习中后端正确性优先于目标修正
vLLM V0 to V1: Correctness Before Corrections in RL
AI 导读
PipelineRL 在将推理引擎从 vLLM 0.8.5(V0)迁移至 0.18.1(V1)时,发现训练与推理不一致会导致 KL 散度与奖励等训练动态偏离。团队通过配置采样处理后的 logprobs、关闭前缀缓存与异步调度等运行时默认项、对齐在途权重更新路径以及在最终投影层使用 fp32 lm_head 四项修复,成功使 V1 训练轨迹与 V0 保持一致。
来源:Hugging Face · huggingface.co