OpenAI·· 2017-06-13精选AI 评分73
OpenAI 与 DeepMind 提出基于人类偏好学习的算法
Learning from human preferences
AI 导读
OpenAI 联合 DeepMind 安全团队研发出一种新算法,能够通过让人类在两种候选行为中选择更优项来推断人类意图。该方法旨在消除人工编写复杂目标函数的需要,避免因代理目标不准确而导致不可控或危险的行为。
推荐理由
算法通过让人类在两种行为中二选一的方式推断意图,减少了手动编写复杂目标函数带来的安全风险。
来源:OpenAI · openai.com