OpenAI 推出音乐生成模型 Jukebox 并开源代码与权重
OpenAI 推出音乐生成神经网络 Jukebox,能够以原始音频形式生成涵盖多种流派和艺术家风格的音乐,并包含基础的人声演唱。官方同时开源了模型权重与代码,并提供了用于浏览和试听生成音频样本的工具。
推荐理由:该模型直接以原始音频形式生成音乐与歌声,并开放了代码与权重供社区探索。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 推出音乐生成神经网络 Jukebox,能够以原始音频形式生成涵盖多种流派和艺术家风格的音乐,并包含基础的人声演唱。官方同时开源了模型权重与代码,并提供了用于浏览和试听生成音频样本的工具。
推荐理由:该模型直接以原始音频形式生成音乐与歌声,并开放了代码与权重供社区探索。
OpenAI 正式发布 GPT-2 分阶段发布的最终版本,公开了拥有 1.5B 参数的最大版本模型、代码与模型权重。团队同时提供模型以辅助检测生成内容,希望为未来更强大模型的负责任发布流程提供完整的测试案例。
推荐理由:OpenAI 完整走完分阶段发布流程并开放 1.5B 权重,为大模型负责任发布与生成内容检测提供了参考样本。
OpenAI 正式发布拥有 774M 参数的 GPT-2 语言模型。这是继 2 月发布 124M 小型模型与 5 月分阶段发布 355M 中型模型之后,结合潜在滥用与社会效益研究所推进的新版本;团队还同时开源了一份促进机构间模型共享合作的法律协议,并发布了关于协调 AI 研究社区发布规范的技术报告。
推荐理由:OpenAI 推进其分阶段发布策略并公开 774M 参数模型,同时给出了与科研社区协作探讨发布规范的技术报告。
OpenAI 推出深度神经网络 MuseNet,可使用 10 种不同乐器生成 4 分钟的音乐作品,并融合乡村音乐、莫扎特以及披头士等多样风格。该模型没有经过显式的音乐规则编程,而是采用与 GPT-2 相同的通用无监督 Transformer 架构,通过在数十万个 MIDI 文件中学习预测下一个 token 来掌握和声、节奏与音乐风格。
推荐理由:该成果展示了将文本序列建模方法直接迁移至符号音乐生成的实现路径,体现了早期大模型架构的通用泛化潜力。
OpenAI 训练了一个大规模无监督语言模型,能在无需特定任务训练的情况下生成连贯段落,并在多个语言建模基准上取得 SOTA 表现。该模型同时具备执行初步阅读理解、机器翻译、问答和摘要的能力。
推荐理由:该成果展示了大规模无监督预训练在无需微调下直接泛化到多种下游任务的潜力。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积简化了此前可逆生成模型的架构。该模型能够生成逼真的高分辨率图像,支持高效采样,并能提取可用于操控数据属性的特征。OpenAI 同步开源了模型代码并提供在线可视化工具。
推荐理由:原文介绍了基于可逆卷积的生成模型 Glow 及其架构简化,读者可以了解基于流的生成模型与属性操纵方法。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已经开始在 Dota 2 游戏中击败业余人类玩家战队。