使用 🤗 Transformers 微调 Whisper 实现多语言语音识别教程
Hugging Face 发布了使用 🤗 Transformers 微调 OpenAI Whisper 模型的完整分步指南,用于低资源语言及多语言自动语音识别(ASR)任务。
推荐理由:教程提供了基于少量音频适配低资源语言的端到端微调范式与代码,可直接迁移至各类小语种语音识别场景。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
Hugging Face 发布了使用 🤗 Transformers 微调 OpenAI Whisper 模型的完整分步指南,用于低资源语言及多语言自动语音识别(ASR)任务。
推荐理由:教程提供了基于少量音频适配低资源语言的端到端微调范式与代码,可直接迁移至各类小语种语音识别场景。
OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。
推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。
OpenAI 为 DALL·E 推出 Outpainting 外绘功能。用户可以通过扩展画面生成任意尺寸的图像,在原有画幅之外延展视觉内容。
OpenAI 宣布 DALL·E 正式开启测试版,计划在接下来的数周内从候补名单中邀请 100 万名用户体验。用户可以使用每月自动充值的免费额度生成图像,并支持以 15 美元购买额外 115 次生成的点数。
推荐理由:原文给出了测试资格发放规模和点数定价方案,读者可以据此了解其早期的测试节奏与计费模式。
OpenAI 提出视频预训练(VPT)方法,通过海量无标注人类游戏视频与少量承包商标注数据训练神经网络玩《我的世界》。模型直接使用键盘与鼠标等人类原生接口,经微调后可完成通常需要熟练玩家操作 20 分钟以上(约 24,000 次动作)的合成钻石工具任务。该成果展示了从网络视频中学习行为模式并迈向通用计算机操作智能体的路径。
推荐理由:该研究展示了利用海量未标注人类视频与少量操作数据预训练模型的方法,为构建通用的计算机操作智能体提供了可行路径。
OpenAI 发布了 GPT-3 和 Codex 的新版本,新增在现有文本中编辑或插入内容的功能。这项更新让两款模型不再局限于顺向补全现有文本,能够直接对已有内容进行修改和填充。
推荐理由:新版本改变了此前只能顺向补全文本的工作模式,允许开发者直接在现有文本中进行针对性编辑与内容插入。
OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。
推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。
OpenAI 推出 InstructGPT 模型并将其部署为 API 上的默认语言模型。该模型基于对齐研究并采用人类在环训练,相比 GPT-3 能够更好地遵循用户意图,同时表现出更高的真实性并降低了有害内容输出。
推荐理由:原文给出了通过对齐研究训练 InstructGPT 并替代 GPT-3 成为 API 默认模型的实践,读者可据此了解模型遵循意图与降低毒性的改进路径。
OpenAI 在其 API 中推出全新的 embeddings 端点,方便开发者处理自然语言和代码任务。该接口可直接用于语义搜索、聚类、主题建模以及文本分类等场景。
推荐理由:官方提供了新的嵌入向量端点,便于开发者直接用于语义搜索、代码理解和分类等任务。
OpenAI 推出针对特定应用的 GPT-3 定制功能,开发者可以通过单条命令完成模型微调。
OpenAI 宣布其 API 即日起取消候补名单限制,向所有开发者直接开放。官方表示,安全研究方面的进展让更大范围的开放成为可能。
OpenAI 训练出一个解决小学数学应用题的新系统,准确率接近微调版 GPT-3 模型的两倍。该系统解题表现约为真实儿童的 90%,在一组 9 至 12 岁儿童得分 60% 的相同测试集问题上取得了 55% 的成绩。
推荐理由:材料对比了新系统与微调 GPT-3 及学龄儿童的答题成绩,展示了模型在小学多步数学推理任务上的具体表现。
OpenAI 宣布推出 OpenAI Codex 的改进版本,该 AI 系统能够将自然语言转换为代码。该模型即日起通过 API 开启私测(private beta)。
推荐理由:Codex 将自然语言转化为代码并通过 API 开放私测,为开发者提供了基于自然语言生成代码的直接途径。
OpenAI 发布 Triton 1.0,这是一种面向神经网络的开源类 Python 编程语言。该语言允许没有 CUDA 经验的研究人员编写高效的 GPU 代码,多数情况下其运行性能可与专家编写的代码相媲美。
推荐理由:该开源语言降低了算子开发门槛,让没有相关经验的研究者也能写出性能媲美专家的高效代码。
OpenAI 在多模态模型 CLIP 中发现了多模态神经元,这类神经元无论面对字面、象征还是抽象概念形式,都会对同一概念产生响应。该发现解释了 CLIP 分类非常规视觉表现形式的能力,也为理解多模态模型所学关联与偏见提供了关键切入点。
推荐理由:研究揭示了模型内部存在跨形态响应的神经元,为解析多模态表征机制和模型偏见提供了可解释性视角。
OpenAI 训练了名为 DALL·E 的神经网络,能够根据自然语言可表达的广泛概念直接从文本标题生成图像。
OpenAI 宣布将基于人类反馈的强化学习(RLHF)应用于语言模型训练,以此提升模型生成文本摘要的质量。
OpenAI 正式发布 OpenAI API,为开发者提供访问其最新研发的 AI 模型的接口。
OpenAI 推出音乐生成神经网络 Jukebox,能够以原始音频形式生成涵盖多种流派和艺术家风格的音乐,并包含基础的人声演唱。官方同时开源了模型权重与代码,并提供了用于浏览和试听生成音频样本的工具。
推荐理由:该模型直接以原始音频形式生成音乐与歌声,并开放了代码与权重供社区探索。
OpenAI 宣布将机构内部的深度学习框架全面标准化为 PyTorch。