跳到正文
原文
Hugging Face·· 2025-08-07精选AI 评分62

Hugging Face TRL 全面支持视觉语言模型对齐训练

Vision Language Model Alignment in TRL ⚡️

AI 导读

Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。

推荐理由

TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。

来源:Hugging Face · huggingface.co