基于互联网的深度学习:通过 DeDLOC 协作训练语言模型
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
OpenAI 在多模态模型 CLIP 中发现了多模态神经元,这类神经元无论面对字面、象征还是抽象概念形式,都会对同一概念产生响应。该发现解释了 CLIP 分类非常规视觉表现形式的能力,也为理解多模态模型所学关联与偏见提供了关键切入点。
推荐理由:研究揭示了模型内部存在跨形态响应的神经元,为解析多模态表征机制和模型偏见提供了可解释性视角。
OpenAI 宣布将基于人类反馈的强化学习(RLHF)应用于语言模型训练,以此提升模型生成文本摘要的质量。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 训练神经网络控制仿人机械手成功还原魔方,整个训练过程完全在仿真环境中进行。该方案复用了 OpenAI Five 的强化学习代码,并结合了自动域随机化(ADR)技术,使机械手在物理世界中能够承受未曾见过的外部扰动。这表明强化学习可以用于解决现实环境中需要高灵巧度的物理任务。
推荐理由:研究展示了借助自动域随机化技术在纯模拟环境中训练强化学习策略并成功迁移至真实物理硬件的方法。
OpenAI 基于人类反馈对 774M 参数的 GPT-2 语言模型进行了微调,成功匹配了外部人类标注者的偏好。在摘要任务中,标注者倾向于选择直接从输入整句复制的句子,导致模型也学会了复制,该任务共使用了 60k 条人类标注,而简单风格续写任务仅需 5k 条。此项研究旨在让安全技术更贴近人机交流场景,以探索人类价值观的对齐方法。
推荐理由:原文通过微调实验展示了人类反馈对模型行为的引导作用,同时指出了标注偏好偏差直接影响输出模式的现象。
OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。
推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。
OpenAI 研发了随机网络蒸馏(Random Network Distillation,RND),这是一种基于预测奖励驱动强化学习智能体通过好奇心探索环境的方法。该方法在经典强化学习测试游戏 Montezuma's Revenge 上的表现首次超过了人类平均水平。
推荐理由:原文提出了基于好奇心驱动强化学习智能体探索的方法,为解决稀疏奖励环境下的探索难题提供了具体思路。
OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。
推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。
OpenAI 发布分析显示,自 2012 年以来最大 AI 训练任务消耗的算力呈指数级增长,翻倍周期约为 3.4 个月。该指标在此期间已累计增长超过 300,000 倍,增速远超摩尔定律 2 年翻倍的幅度。算力提升是推动 AI 进步的关键动力,随着趋势延续需要提前准备应对远超当前能力的系统影响。
推荐理由:给出 2012 年以来 AI 训练算力每 3.4 个月翻倍的具体测算,为理解模型能力演进提供了量化基准。
OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。
OpenAI 联合 DeepMind 安全团队研发出一种新算法,能够通过让人类在两种候选行为中选择更优项来推断人类意图。该方法旨在消除人工编写复杂目标函数的需要,避免因代理目标不准确而导致不可控或危险的行为。
推荐理由:算法通过让人类在两种行为中二选一的方式推断意图,减少了手动编写复杂目标函数带来的安全风险。
OpenAI 研发了一种无监督学习系统,仅通过训练预测亚马逊评论文本中的下一个字符,就能学习到极佳的情感表征。该模型无需人工情感标签监督即可提取高质量特征。
推荐理由:该研究表明仅通过预测文本中的下一个字符,模型无需人工标注也能自发学习到高质量的情感表征。
OpenAI 与 UC 伯克利、斯坦福以及主导该研究的 Google Brain 研究团队联合发表论文《Concrete Problems in AI Safety》。该论文围绕确保现代机器学习系统按预期运行的目标,系统探讨了多项具体的 AI 安全研究问题。
推荐理由:论文梳理了确保现代机器学习系统按预期运行的具体问题,有助于理解早期 AI 安全与对齐的核心研究方向。