OpenAI 推出音乐生成模型 MuseNet
OpenAI 推出深度神经网络 MuseNet,可使用 10 种不同乐器生成 4 分钟的音乐作品,并融合乡村音乐、莫扎特以及披头士等多样风格。该模型没有经过显式的音乐规则编程,而是采用与 GPT-2 相同的通用无监督 Transformer 架构,通过在数十万个 MIDI 文件中学习预测下一个 token 来掌握和声、节奏与音乐风格。
推荐理由:该成果展示了将文本序列建模方法直接迁移至符号音乐生成的实现路径,体现了早期大模型架构的通用泛化潜力。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 推出深度神经网络 MuseNet,可使用 10 种不同乐器生成 4 分钟的音乐作品,并融合乡村音乐、莫扎特以及披头士等多样风格。该模型没有经过显式的音乐规则编程,而是采用与 GPT-2 相同的通用无监督 Transformer 架构,通过在数十万个 MIDI 文件中学习预测下一个 token 来掌握和声、节奏与音乐风格。
推荐理由:该成果展示了将文本序列建模方法直接迁移至符号音乐生成的实现路径,体现了早期大模型架构的通用泛化潜力。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积简化了此前可逆生成模型的架构。该模型能够生成逼真的高分辨率图像,支持高效采样,并能提取可用于操控数据属性的特征。OpenAI 同步开源了模型代码并提供在线可视化工具。
推荐理由:原文介绍了基于可逆卷积的生成模型 Glow 及其架构简化,读者可以了解基于流的生成模型与属性操纵方法。