跳到正文
原文
Hugging Face·· 2026-06-03AI 评分49

超越聊天机器人:直接偏好优化(DPO)在非对话任务中的应用

Direct Preference Optimization Beyond Chatbots

AI 导读

DharmaOCR 团队将 DPO 应用于结构化 OCR 任务,利用模型自身的失败输出构建拒绝偏好对,使测试模型族的文本退化率平均降低 59.4%。该训练阶段在所有测试模型中均有效降低了循环重复,峰值降幅达 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%),通过整段级别的偏好信号弥补了 SFT 无法显式惩罚退化循环的结构性缺陷。

来源:Hugging Face · huggingface.co