OpenAI·2020-09-04 15:00· 2020-09-04精选AI 评分64OpenAI 采用人类反馈强化学习训练文本摘要模型Learning to summarize with human feedbackAI 导读OpenAI 宣布将基于人类反馈的强化学习(RLHF)应用于语言模型训练,以此提升模型生成文本摘要的质量。来源:OpenAI · openai.com#论文/研究#数据/训练#OpenAI