跳到正文
原文
OpenAI·· 2020-09-04精选AI 评分64

OpenAI 采用人类反馈强化学习训练文本摘要模型

Learning to summarize with human feedback

AI 导读

OpenAI 宣布将基于人类反馈的强化学习(RLHF)应用于语言模型训练,以此提升模型生成文本摘要的质量。

来源:OpenAI · openai.com