Hugging Face·· 2023-09-29精选AI 评分61
如何通过 TRL 使用 DDPO 微调 Stable Diffusion 模型
Finetune Stable Diffusion Models with DDPO via TRL
AI 导读
Hugging Face 在 TRL 库中集成了 DDPOTrainer,支持通过去噪扩散策略优化(DDPO)使用强化学习微调 Stable Diffusion 模型。该方法将去噪过程建模为多步马尔可夫决策过程,配合美学评分奖励模型提升生成质量。训练要求至少单张 A100 GPU,官方提供了配套脚本与 LoRA 超参数调优建议。
推荐理由
文章给出了用强化学习对齐图像扩散模型的工程配置与调优经验,为改善生成画质提供了现成范式。
来源:Hugging Face · huggingface.co