OpenAI 推出 ChatGPT 插件功能
OpenAI 宣布在 ChatGPT 中初步支持插件功能。插件是专为大语言模型设计且以安全为核心原则的工具,可帮助 ChatGPT 访问最新信息、执行计算以及调用第三方服务。
推荐理由:OpenAI 推出插件机制让大模型接入外部工具,扩展了获取最新信息、执行计算与调用第三方服务的能力。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 宣布在 ChatGPT 中初步支持插件功能。插件是专为大语言模型设计且以安全为核心原则的工具,可帮助 ChatGPT 访问最新信息、执行计算以及调用第三方服务。
推荐理由:OpenAI 推出插件机制让大模型接入外部工具,扩展了获取最新信息、执行计算与调用第三方服务的能力。
OpenAI 宣布推出大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型是其深度学习扩展工作的最新里程碑,虽然在许多真实世界场景中表现仍不及人类,但在各项专业和学术基准测试中展现出人类水平。
推荐理由:OpenAI 推出支持图文输入的多模态模型 GPT-4,其在专业和学术基准上的表现展示了扩展深度学习的能力边界。
OpenAI 推出了一款经过专门训练的分类器,用于区分 AI 生成的文本与人类撰写的文本。
OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。
推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。
OpenAI 为 DALL·E 推出 Outpainting 外绘功能。用户可以通过扩展画面生成任意尺寸的图像,在原有画幅之外延展视觉内容。
OpenAI 提出视频预训练(VPT)方法,通过海量无标注人类游戏视频与少量承包商标注数据训练神经网络玩《我的世界》。模型直接使用键盘与鼠标等人类原生接口,经微调后可完成通常需要熟练玩家操作 20 分钟以上(约 24,000 次动作)的合成钻石工具任务。该成果展示了从网络视频中学习行为模式并迈向通用计算机操作智能体的路径。
推荐理由:该研究展示了利用海量未标注人类视频与少量操作数据预训练模型的方法,为构建通用的计算机操作智能体提供了可行路径。
OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。
推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。
OpenAI 宣布其 API 即日起取消候补名单限制,向所有开发者直接开放。官方表示,安全研究方面的进展让更大范围的开放成为可能。
OpenAI 宣布推出 OpenAI Codex 的改进版本,该 AI 系统能够将自然语言转换为代码。该模型即日起通过 API 开启私测(private beta)。
推荐理由:Codex 将自然语言转化为代码并通过 API 开放私测,为开发者提供了基于自然语言生成代码的直接途径。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 训练神经网络控制仿人机械手成功还原魔方,整个训练过程完全在仿真环境中进行。该方案复用了 OpenAI Five 的强化学习代码,并结合了自动域随机化(ADR)技术,使机械手在物理世界中能够承受未曾见过的外部扰动。这表明强化学习可以用于解决现实环境中需要高灵巧度的物理任务。
推荐理由:研究展示了借助自动域随机化技术在纯模拟环境中训练强化学习策略并成功迁移至真实物理硬件的方法。
OpenAI 正式发布拥有 774M 参数的 GPT-2 语言模型。这是继 2 月发布 124M 小型模型与 5 月分阶段发布 355M 中型模型之后,结合潜在滥用与社会效益研究所推进的新版本;团队还同时开源了一份促进机构间模型共享合作的法律协议,并发布了关于协调 AI 研究社区发布规范的技术报告。
推荐理由:OpenAI 推进其分阶段发布策略并公开 774M 参数模型,同时给出了与科研社区协作探讨发布规范的技术报告。
OpenAI 推出深度神经网络 MuseNet,可使用 10 种不同乐器生成 4 分钟的音乐作品,并融合乡村音乐、莫扎特以及披头士等多样风格。该模型没有经过显式的音乐规则编程,而是采用与 GPT-2 相同的通用无监督 Transformer 架构,通过在数十万个 MIDI 文件中学习预测下一个 token 来掌握和声、节奏与音乐风格。
推荐理由:该成果展示了将文本序列建模方法直接迁移至符号音乐生成的实现路径,体现了早期大模型架构的通用泛化潜力。
OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。
推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。
OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL,旨在帮助学习者成长为熟练的深度强化学习实践者。该项目整合了清晰的强化学习代码示例、教学练习、配套文档和教程。
推荐理由:该项目提供了深度强化学习的代码示例与配套练习,适合希望系统掌握强化学习工程落地的开发者参考。
OpenAI 研发了随机网络蒸馏(Random Network Distillation,RND),这是一种基于预测奖励驱动强化学习智能体通过好奇心探索环境的方法。该方法在经典强化学习测试游戏 Montezuma's Revenge 上的表现首次超过了人类平均水平。
推荐理由:原文提出了基于好奇心驱动强化学习智能体探索的方法,为解决稀疏奖励环境下的探索难题提供了具体思路。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积简化了此前可逆生成模型的架构。该模型能够生成逼真的高分辨率图像,支持高效采样,并能提取可用于操控数据属性的特征。OpenAI 同步开源了模型代码并提供在线可视化工具。
推荐理由:原文介绍了基于可逆卷积的生成模型 Glow 及其架构简化,读者可以了解基于流的生成模型与属性操纵方法。
OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。
推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。
OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。
OpenAI 联合 DeepMind 安全团队研发出一种新算法,能够通过让人类在两种候选行为中选择更优项来推断人类意图。该方法旨在消除人工编写复杂目标函数的需要,避免因代理目标不准确而导致不可控或危险的行为。
推荐理由:算法通过让人类在两种行为中二选一的方式推断意图,减少了手动编写复杂目标函数带来的安全风险。