Hugging Face·· 2024-07-10精选AI 评分69
Hugging Face TRL 支持视觉语言模型 DPO 微调实践指南
Preference Optimization for Vision Language Models
AI 导读
Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。
推荐理由
原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。
来源:Hugging Face · huggingface.co