Kakao Brain 联合 Hugging Face 开源 ALIGN、ViT 模型及 COYO-700M 数据集
Kakao Brain 联合 Hugging Face 开源了包含 7 亿图文对的 COYO 数据集,以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型。
推荐理由:原文对比了开源模型与原版 Google 实现的指标差异,并配套开源了 7 亿图文对训练集,对复现跨模态预训练具备参考价值。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Kakao Brain 联合 Hugging Face 开源了包含 7 亿图文对的 COYO 数据集,以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型。
推荐理由:原文对比了开源模型与原版 Google 实现的指标差异,并配套开源了 7 亿图文对训练集,对复现跨模态预训练具备参考价值。
rinna 正式发布日语文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本文化与表达习惯的图像。该模型在约 1 亿带有日文说明的图文数据上微调,通过引入日语分词器并分阶段联合训练文本编码器与潜在扩散模型,模型与代码已在 Hugging Face 和 GitHub 开源。
推荐理由:文章详细拆解了如何用两阶段微调将英文扩散模型迁移至小样本小语种,为本土化文生图适配提供了清晰方法。
OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。
推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。
BigScience 联合 Hugging Face 正式开源 1760 亿参数的多语言大语言模型 BLOOM,支持生成 46 种自然语言和 13 种编程语言的文本。
推荐理由:该项目完全公开了百亿级多语言模型的权重、训练检查点与优化器状态,为开源社区研究前沿模型底层机制提供了完整范本。
OpenAI 发布了 GPT-3 和 Codex 的新版本,新增在现有文本中编辑或插入内容的功能。这项更新让两款模型不再局限于顺向补全现有文本,能够直接对已有内容进行修改和填充。
推荐理由:新版本改变了此前只能顺向补全文本的工作模式,允许开发者直接在现有文本中进行针对性编辑与内容插入。
OpenAI 推出 InstructGPT 模型并将其部署为 API 上的默认语言模型。该模型基于对齐研究并采用人类在环训练,相比 GPT-3 能够更好地遵循用户意图,同时表现出更高的真实性并降低了有害内容输出。
推荐理由:原文给出了通过对齐研究训练 InstructGPT 并替代 GPT-3 成为 API 默认模型的实践,读者可据此了解模型遵循意图与降低毒性的改进路径。
OpenAI 宣布推出 OpenAI Codex 的改进版本,该 AI 系统能够将自然语言转换为代码。该模型即日起通过 API 开启私测(private beta)。
推荐理由:Codex 将自然语言转化为代码并通过 API 开放私测,为开发者提供了基于自然语言生成代码的直接途径。
OpenAI 训练了名为 DALL·E 的神经网络,能够根据自然语言可表达的广泛概念直接从文本标题生成图像。
OpenAI 推出音乐生成神经网络 Jukebox,能够以原始音频形式生成涵盖多种流派和艺术家风格的音乐,并包含基础的人声演唱。官方同时开源了模型权重与代码,并提供了用于浏览和试听生成音频样本的工具。
推荐理由:该模型直接以原始音频形式生成音乐与歌声,并开放了代码与权重供社区探索。
OpenAI 正式发布 GPT-2 分阶段发布的最终版本,公开了拥有 1.5B 参数的最大版本模型、代码与模型权重。团队同时提供模型以辅助检测生成内容,希望为未来更强大模型的负责任发布流程提供完整的测试案例。
推荐理由:OpenAI 完整走完分阶段发布流程并开放 1.5B 权重,为大模型负责任发布与生成内容检测提供了参考样本。
OpenAI 正式发布拥有 774M 参数的 GPT-2 语言模型。这是继 2 月发布 124M 小型模型与 5 月分阶段发布 355M 中型模型之后,结合潜在滥用与社会效益研究所推进的新版本;团队还同时开源了一份促进机构间模型共享合作的法律协议,并发布了关于协调 AI 研究社区发布规范的技术报告。
推荐理由:OpenAI 推进其分阶段发布策略并公开 774M 参数模型,同时给出了与科研社区协作探讨发布规范的技术报告。
OpenAI 推出深度神经网络 MuseNet,可使用 10 种不同乐器生成 4 分钟的音乐作品,并融合乡村音乐、莫扎特以及披头士等多样风格。该模型没有经过显式的音乐规则编程,而是采用与 GPT-2 相同的通用无监督 Transformer 架构,通过在数十万个 MIDI 文件中学习预测下一个 token 来掌握和声、节奏与音乐风格。
推荐理由:该成果展示了将文本序列建模方法直接迁移至符号音乐生成的实现路径,体现了早期大模型架构的通用泛化潜力。
OpenAI 训练了一个大规模无监督语言模型,能在无需特定任务训练的情况下生成连贯段落,并在多个语言建模基准上取得 SOTA 表现。该模型同时具备执行初步阅读理解、机器翻译、问答和摘要的能力。
推荐理由:该成果展示了大规模无监督预训练在无需微调下直接泛化到多种下游任务的潜力。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积简化了此前可逆生成模型的架构。该模型能够生成逼真的高分辨率图像,支持高效采样,并能提取可用于操控数据属性的特征。OpenAI 同步开源了模型代码并提供在线可视化工具。
推荐理由:原文介绍了基于可逆卷积的生成模型 Glow 及其架构简化,读者可以了解基于流的生成模型与属性操纵方法。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已经开始在 Dota 2 游戏中击败业余人类玩家战队。