跳到正文
原文
OpenAI·· 2019-09-19精选AI 评分74

OpenAI 基于人类偏好微调 GPT-2 语言模型

Fine-tuning GPT-2 from human preferences

AI 导读

OpenAI 基于人类反馈对 774M 参数的 GPT-2 语言模型进行了微调,成功匹配了外部人类标注者的偏好。在摘要任务中,标注者倾向于选择直接从输入整句复制的句子,导致模型也学会了复制,该任务共使用了 60k 条人类标注,而简单风格续写任务仅需 5k 条。此项研究旨在让安全技术更贴近人机交流场景,以探索人类价值观的对齐方法。

推荐理由

原文通过微调实验展示了人类反馈对模型行为的引导作用,同时指出了标注偏好偏差直接影响输出模式的现象。

来源:OpenAI · openai.com