Hugging Face·· 2023-08-08精选AI 评分70
使用 DPO 微调 Llama 2:Hugging Face TRL 实战教程
Fine-tune Llama 2 with DPO
AI 导读
Hugging Face 在 TRL 库中集成了 Direct Preference Optimization(DPO)训练器,并提供了微调 Llama 2 7B 模型的完整教程与代码。
推荐理由
给出了省去独立奖励模型的 DPO 对齐实操方案,读者可直接参考代码降低大语言模型的对齐成本。
来源:Hugging Face · huggingface.co