跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 61–64 条 · 共 64 条
7月20日周四
  1. OpenAI74

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。

    推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。

6月13日周二
  1. OpenAI73

    OpenAI 与 DeepMind 提出基于人类偏好学习的算法

    OpenAI 联合 DeepMind 安全团队研发出一种新算法,能够通过让人类在两种候选行为中选择更优项来推断人类意图。该方法旨在消除人工编写复杂目标函数的需要,避免因代理目标不准确而导致不可控或危险的行为。

    推荐理由:算法通过让人类在两种行为中二选一的方式推断意图,减少了手动编写复杂目标函数带来的安全风险。

4月6日周四
  1. OpenAI63

    OpenAI 发现无监督情感神经元

    OpenAI 研发了一种无监督学习系统,仅通过训练预测亚马逊评论文本中的下一个字符,就能学习到极佳的情感表征。该模型无需人工情感标签监督即可提取高质量特征。

    推荐理由:该研究表明仅通过预测文本中的下一个字符,模型无需人工标注也能自发学习到高质量的情感表征。

6月21日周二
  1. OpenAI73

    OpenAI 与 Google Brain 等联合发表论文《Concrete Problems in AI Safety》

    OpenAI 与 UC 伯克利、斯坦福以及主导该研究的 Google Brain 研究团队联合发表论文《Concrete Problems in AI Safety》。该论文围绕确保现代机器学习系统按预期运行的目标,系统探讨了多项具体的 AI 安全研究问题。

    推荐理由:论文梳理了确保现代机器学习系统按预期运行的具体问题,有助于理解早期 AI 安全与对齐的核心研究方向。