基于互联网的深度学习:通过 DeDLOC 协作训练语言模型
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
Hugging Face 联合亚马逊推出基于 Amazon SageMaker 的全新推理解决方案,上线了专用的 Hugging Face 推理深度学习容器(DLC)与推理工具套件。
推荐理由:原文给出了基于 DLC 容器在 SageMaker 部署 Transformer 模型的完整代码与参数范式,适合工程团队评估模型云端托管流程。
Hugging Face Hub 宣布正式集成句子与段落嵌入框架 Sentence Transformers,上线超过 90 个覆盖 100 多种语言的预训练模型。平台同步推出了特征提取和句子相似度计算的交互式微件,并提供托管 Inference API 供开发者进行程序化调用。用户还可通过简单的代码直接将模型上传至 Hub,自动生成模型卡片以便在开源社区中分享。
推荐理由:该文梳理了嵌入模型在 Hub 上的托管、在线体验与 API 调用方式,为开发者分享和验证语义检索模型提供了清晰流程。
Gradio 2.0 正式支持仅用一行代码为 Hugging Face Model Hub 上的模型构建 Web GUI 交互界面。该功能默认调用 Hugging Face 托管的 Inference API,也支持本地安装 transformers 运行。此外,新版本支持将多个模型并行对比或串联构建工作流,便于快速搭建多模型复合应用。
推荐理由:读者可以通过该方案掌握仅用单行代码为开源模型构建交互界面,并将多个模型进行串联或并联组合的轻量演示方法。
Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。
推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。
OpenAI 推出音乐生成神经网络 Jukebox,能够以原始音频形式生成涵盖多种流派和艺术家风格的音乐,并包含基础的人声演唱。官方同时开源了模型权重与代码,并提供了用于浏览和试听生成音频样本的工具。
推荐理由:该模型直接以原始音频形式生成音乐与歌声,并开放了代码与权重供社区探索。
Hugging Face 发布实践教程,演示如何使用其 Transformers 与 Tokenizers 库从零构建并训练一个 84M 参数的世界语语言模型 EsperBERTo。
推荐理由:文章给出了用开源库从分词到预训练与微调的完整工程流程,读者可以直接参考这套范式构建低资源语种模型。
OpenAI 正式发布 GPT-2 分阶段发布的最终版本,公开了拥有 1.5B 参数的最大版本模型、代码与模型权重。团队同时提供模型以辅助检测生成内容,希望为未来更强大模型的负责任发布流程提供完整的测试案例。
推荐理由:OpenAI 完整走完分阶段发布流程并开放 1.5B 权重,为大模型负责任发布与生成内容检测提供了参考样本。