Hugging Face 推出 PEFT 库,支持消费级硬件高效微调大模型
Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。
推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。
推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。
Hugging Face 宣布在 Diffusers 库中正式支持 LoRA 训练与推理,可用于 Stable Diffusion 的全微调与 Dreambooth。
推荐理由:Diffusers 官方支持 LoRA 微调与推理,读者可借此将权重文件压缩至约 3MB 并在消费级显卡上完成训练。
Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。
推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。
Hugging Face 发布了使用 🤗 Transformers 微调 OpenAI Whisper 模型的完整分步指南,用于低资源语言及多语言自动语音识别(ASR)任务。
推荐理由:教程提供了基于少量音频适配低资源语言的端到端微调范式与代码,可直接迁移至各类小语种语音识别场景。
Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。
推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。
OpenAI 推出针对特定应用的 GPT-3 定制功能,开发者可以通过单条命令完成模型微调。
Hugging Face 详细介绍了如何从零预训练 Python 代码生成模型 CodeParrot,并开源了配套的 50GB 清洗后数据集与模型权重。
推荐理由:提供了从数据去重、分词到分布式预训练的完整工程实现,读者可直接复用其流式训练与多卡加速脚本。
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。
推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。
OpenAI 宣布将基于人类反馈的强化学习(RLHF)应用于语言模型训练,以此提升模型生成文本摘要的质量。
Hugging Face 发布实践教程,演示如何使用其 Transformers 与 Tokenizers 库从零构建并训练一个 84M 参数的世界语语言模型 EsperBERTo。
推荐理由:文章给出了用开源库从分词到预训练与微调的完整工程流程,读者可以直接参考这套范式构建低资源语种模型。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 基于人类反馈对 774M 参数的 GPT-2 语言模型进行了微调,成功匹配了外部人类标注者的偏好。在摘要任务中,标注者倾向于选择直接从输入整句复制的句子,导致模型也学会了复制,该任务共使用了 60k 条人类标注,而简单风格续写任务仅需 5k 条。此项研究旨在让安全技术更贴近人机交流场景,以探索人类价值观的对齐方法。
推荐理由:原文通过微调实验展示了人类反馈对模型行为的引导作用,同时指出了标注偏好偏差直接影响输出模式的现象。
OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。
推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。
OpenAI 发布分析显示,自 2012 年以来最大 AI 训练任务消耗的算力呈指数级增长,翻倍周期约为 3.4 个月。该指标在此期间已累计增长超过 300,000 倍,增速远超摩尔定律 2 年翻倍的幅度。算力提升是推动 AI 进步的关键动力,随着趋势延续需要提前准备应对远超当前能力的系统影响。
推荐理由:给出 2012 年以来 AI 训练算力每 3.4 个月翻倍的具体测算,为理解模型能力演进提供了量化基准。
OpenAI 表示 Dota 2 的研发进展表明,在充足算力支持下,自博弈机制能推动机器学习系统从远低于人类水平迅速提升至超人类水平。该系统在单月内从勉强匹配高分玩家跨越到击败顶尖职业选手;与受限于既有数据的监督学习相比,自博弈系统的可用训练数据会随着智能体能力的提升而自动改善。
推荐理由:OpenAI 对比了监督学习与自博弈机制的差异,说明了在算力充足时数据质量随模型迭代自进化的路径。
OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。