OpenAI 研究发现深度神经网络中的“深度双重下降”现象
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 正式发布 GPT-2 分阶段发布的最终版本,公开了拥有 1.5B 参数的最大版本模型、代码与模型权重。团队同时提供模型以辅助检测生成内容,希望为未来更强大模型的负责任发布流程提供完整的测试案例。
推荐理由:OpenAI 完整走完分阶段发布流程并开放 1.5B 权重,为大模型负责任发布与生成内容检测提供了参考样本。
OpenAI 训练神经网络控制仿人机械手成功还原魔方,整个训练过程完全在仿真环境中进行。该方案复用了 OpenAI Five 的强化学习代码,并结合了自动域随机化(ADR)技术,使机械手在物理世界中能够承受未曾见过的外部扰动。这表明强化学习可以用于解决现实环境中需要高灵巧度的物理任务。
推荐理由:研究展示了借助自动域随机化技术在纯模拟环境中训练强化学习策略并成功迁移至真实物理硬件的方法。
OpenAI 基于人类反馈对 774M 参数的 GPT-2 语言模型进行了微调,成功匹配了外部人类标注者的偏好。在摘要任务中,标注者倾向于选择直接从输入整句复制的句子,导致模型也学会了复制,该任务共使用了 60k 条人类标注,而简单风格续写任务仅需 5k 条。此项研究旨在让安全技术更贴近人机交流场景,以探索人类价值观的对齐方法。
推荐理由:原文通过微调实验展示了人类反馈对模型行为的引导作用,同时指出了标注偏好偏差直接影响输出模式的现象。
OpenAI 正式发布拥有 774M 参数的 GPT-2 语言模型。这是继 2 月发布 124M 小型模型与 5 月分阶段发布 355M 中型模型之后,结合潜在滥用与社会效益研究所推进的新版本;团队还同时开源了一份促进机构间模型共享合作的法律协议,并发布了关于协调 AI 研究社区发布规范的技术报告。
推荐理由:OpenAI 推进其分阶段发布策略并公开 774M 参数模型,同时给出了与科研社区协作探讨发布规范的技术报告。
微软向 OpenAI 投资 10 亿美元并建立合作关系,以支持构建广泛受益的通用人工智能(AGI)。双方将在 Microsoft Azure 中联合开发可扩展至 AGI 的软硬件平台与 Azure AI 超级计算技术,同时微软将成为 OpenAI 的独家云服务提供商。
推荐理由:微软以 10 亿美元投资与独家云服务绑定 OpenAI 的算力基础设施,展现了前沿模型研发与头部云厂商深度结合的合作范式。
OpenAI 推出深度神经网络 MuseNet,可使用 10 种不同乐器生成 4 分钟的音乐作品,并融合乡村音乐、莫扎特以及披头士等多样风格。该模型没有经过显式的音乐规则编程,而是采用与 GPT-2 相同的通用无监督 Transformer 架构,通过在数十万个 MIDI 文件中学习预测下一个 token 来掌握和声、节奏与音乐风格。
推荐理由:该成果展示了将文本序列建模方法直接迁移至符号音乐生成的实现路径,体现了早期大模型架构的通用泛化潜力。
OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。
推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。
OpenAI 宣布成立名为 OpenAI LP 的利润上限公司,以快速加大对算力和人才的投入。新架构同时引入了制衡机制,旨在保障推进其既定使命。
推荐理由:该架构在非营利使命与筹集算力及人才资金之间寻求平衡,展示了前沿研究机构探索商业重组的关键路径。
OpenAI 训练了一个大规模无监督语言模型,能在无需特定任务训练的情况下生成连贯段落,并在多个语言建模基准上取得 SOTA 表现。该模型同时具备执行初步阅读理解、机器翻译、问答和摘要的能力。
推荐理由:该成果展示了大规模无监督预训练在无需微调下直接泛化到多种下游任务的潜力。
OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL,旨在帮助学习者成长为熟练的深度强化学习实践者。该项目整合了清晰的强化学习代码示例、教学练习、配套文档和教程。
推荐理由:该项目提供了深度强化学习的代码示例与配套练习,适合希望系统掌握强化学习工程落地的开发者参考。
OpenAI 研发了随机网络蒸馏(Random Network Distillation,RND),这是一种基于预测奖励驱动强化学习智能体通过好奇心探索环境的方法。该方法在经典强化学习测试游戏 Montezuma's Revenge 上的表现首次超过了人类平均水平。
推荐理由:原文提出了基于好奇心驱动强化学习智能体探索的方法,为解决稀疏奖励环境下的探索难题提供了具体思路。
OpenAI Five 在三局两胜制的基准比赛中战胜了由 99.95% 分位 Dota 选手组成的人类队伍。对手阵容包括 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾为 Dota 职业选手。整场比赛在现场观众及 10 万名同时在线直播观众面前进行。
推荐理由:该基准对抗展示了强化学习系统在复杂团队策略游戏中战胜高水平人类选手的实际表现。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积简化了此前可逆生成模型的架构。该模型能够生成逼真的高分辨率图像,支持高效采样,并能提取可用于操控数据属性的特征。OpenAI 同步开源了模型代码并提供在线可视化工具。
推荐理由:原文介绍了基于可逆卷积的生成模型 Glow 及其架构简化,读者可以了解基于流的生成模型与属性操纵方法。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已经开始在 Dota 2 游戏中击败业余人类玩家战队。
OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。
推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。
OpenAI 发布分析显示,自 2012 年以来最大 AI 训练任务消耗的算力呈指数级增长,翻倍周期约为 3.4 个月。该指标在此期间已累计增长超过 300,000 倍,增速远超摩尔定律 2 年翻倍的幅度。算力提升是推动 AI 进步的关键动力,随着趋势延续需要提前准备应对远超当前能力的系统影响。
推荐理由:给出 2012 年以来 AI 训练算力每 3.4 个月翻倍的具体测算,为理解模型能力演进提供了量化基准。
OpenAI 表示 Dota 2 的研发进展表明,在充足算力支持下,自博弈机制能推动机器学习系统从远低于人类水平迅速提升至超人类水平。该系统在单月内从勉强匹配高分玩家跨越到击败顶尖职业选手;与受限于既有数据的监督学习相比,自博弈系统的可用训练数据会随着智能体能力的提升而自动改善。
推荐理由:OpenAI 对比了监督学习与自博弈机制的差异,说明了在算力充足时数据质量随模型迭代自进化的路径。
OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。
OpenAI 联合 DeepMind 安全团队研发出一种新算法,能够通过让人类在两种候选行为中选择更优项来推断人类意图。该方法旨在消除人工编写复杂目标函数的需要,避免因代理目标不准确而导致不可控或危险的行为。
推荐理由:算法通过让人类在两种行为中二选一的方式推断意图,减少了手动编写复杂目标函数带来的安全风险。