Databricks 为 Hugging Face Datasets 增加 Spark 支持,模型微调数据处理提速达 40%
Databricks 宣布向 Hugging Face Datasets 代码库提交原生 Spark 支持,推出 Dataset.from_spark 接口,将大模型训练与微调的数据处理耗时最高缩短 40%。
Databricks 宣布向 Hugging Face Datasets 代码库提交原生 Spark 支持,推出 Dataset.from_spark 接口,将大模型训练与微调的数据处理耗时最高缩短 40%。
Hugging Face 介绍了如何利用 Transformers 库与微软 Graphormer 模型执行图分类任务。该流程需安装 transformers(>= 4.27.2)与 datasets,以 Stanford OGB 的 ogbg-molhiv 数据集为例演示了图数据格式规范及图结构特征预处理。
Hugging Face 联合开源联邦学习框架 Substra 推出演示 Space,展示如何在保护数据隐私的前提下跨多数据源协同训练 AI 模型。联邦学习通过仅在服务器间传输模型权重而非本地原始数据,打破医疗等敏感领域的数据孤岛,并曾成功应用于包含 10 家药企的 MELLODDY 项目及乳腺癌研究。
Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。
推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。
Hugging Face 与联邦学习框架 Flower 结合,支持在多客户端之间联合训练语言模型。该方案以 IMDB 影评序列分类为任务,微调预训练 Transformer 模型 distilBERT。开发者可通过继承 `flwr.client.NumPyClient` 实现本地训练与评测,在不共享数据的前提下向服务器同步模型参数。
Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。
推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。
Hugging Face 宣布在 Diffusers 库中正式支持 LoRA 训练与推理,可用于 Stable Diffusion 的全微调与 Dreambooth。
推荐理由:Diffusers 官方支持 LoRA 微调与推理,读者可借此将权重文件压缩至约 3MB 并在消费级显卡上完成训练。
Hugging Face 联合微软推出 Optimum 与 ONNX Runtime 的训练集成方案,通过 ORTTrainer 接口帮助 Transformer 模型训练提速 35% 以上。
Hugging Face 实现了在 AWS 上利用英特尔第四代至强 Sapphire Rapids 集群加速 PyTorch Transformer 分布式训练。
Hugging Face 发布音频数据集完整指南,详解如何利用 🤗 Datasets 库高效获取与预处理语音数据。教程演示了一行代码加载数据、动态重采样音频、通过 map 与 filter 进行特征映射和样本过滤,并重点介绍了无需预先下载即可逐样本处理 TB 级音频的流式模式(streaming mode)。
Habana Gaudi2 在模型训练与推理性能上约为 Nvidia A100 80GB 的两倍。在 BERT 预训练中,Gaudi2 吞吐量最高达 1835.8 samples/s(A100 为 1082.6 samples/s);Stable Diffusion 推理延迟达 0.925 秒/图,比 A100 快 2.84 倍。
Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。
推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。
Hugging Face 的无代码训练工具 AutoTrain 正式支持计算机视觉领域的图像分类任务。用户无需编写代码,只需上传本地数据或选用 Hugging Face Hub 数据集,系统便会自动测试多种模型架构,且 5 个候选模型搭配少于 500 张图片的训练可免费使用。训练完成的模型会自动托管至 Hub,并支持直接通过内置推理小部件测试。
Hugging Face 官方发布指南,详解如何使用 NVIDIA 开发的 Megatron-LM 框架在多 GPU 上预训练大语言模型,并将其转换接入 Transformers 生态。
Hugging Face 宣布为 Datasets 库更新音频与图像文档,正式将标准化数据处理能力从纯文本拓展至多模态数据。新版本在快速入门中展示了端到端的多模态加载流程,并新增将数据直接转为 tf.data.Dataset 的 to_tf_dataset 函数。
Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。
推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。
Hugging Face 深度强化学习课程推出策略梯度教程,指导读者使用 PyTorch 从零实现 Reinforce 算法,并在 CartPole-v1、PixelCopter 和 Pong 环境中完成验证。该方法通过梯度上升直接优化策略并输出动作概率分布,更适用于高维及连续动作空间,但同时存在易收敛至局部最优与训练方差较高的局限。
Hugging Face 介绍了通过 Accelerate 库集成 DeepSpeed ZeRO 优化大模型训练的方法,支持无需修改代码或仅做极少配置调整即可缓解显存不足问题。
用户可通过 AWS EC2 DL1 实例使用 Habana Gaudi 加速器微调 Transformer 模型,其训练性价比相比最新 GPU 实例提升最高 40%。借助 Optimum Habana 库微调 BERT 模型,仅耗时 2 分 12 秒即可完成 GLUE MRPC 任务评测。结合 AWS Spot 实例还能将每小时运行成本从 $13.11 降低 70% 至 $3.93。
Hugging Face 发布了使用 Transformers 与 Datasets 库微调视觉 Transformer 进行图像分类的实践教程。文章以 beans 豆叶病害数据集与 google/vit-base-patch16-224-in21k 预训练模型为例,演示了如何通过 ViTImageProcessor 动态处理图像特征,并配置 Trainer 完成训练与评估。
Hugging Face 推出数据集测量工具 Data Measurements Tool(DMT),结合开源 Python 库与 Streamlit 无代码界面,帮助开发者在线分析与比较机器学习数据集。
开发者可通过 Intel 至强可扩展 CPU 集群结合 Intel Extension for PyTorch 与 oneCCL 库,加速 PyTorch 模型的分布式微调。
面对微软与 NVIDIA 推出 530B 参数 Megatron-Turing NLG 带来的高能耗与近 $100M 成本,行业无需盲目追逐超大模型。DistilBERT 减小 40% 体积且提速 60% 仍保留 97% 理解力,BigScience 的 T0 缩小 16x 却在多任务上超越 GPT-3。实际应用应优先选择预训练小模型、微调技术与高效云设施,以低成本实现高质量解决方案。
Hugging Face 社区基于 JAX/Flax 与 7 块 TPU v3-8,系统阐述了利用 10 亿句对训练通用句子嵌入(Sentence Embedding)模型的实践方案。
开发者团队在 Hugging Face 社区活动中使用 RSICD 等遥感数据集微调了 OpenAI 的 CLIP 模型,实现了通过自然语言文本检索大型卫星图像库的功能。训练过程中结合了图像变换以及基于 Marian MT 的回译文本增强技术,显著减轻了过拟合问题。目前该微调模型与交互 Demo 已在 Hugging Face 开放下载和体验。
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
OpenAI 最新研究发现,通过在小规模精选数据集上进行微调,能够针对特定的行为价值观改善大语言模型的行为表现。
Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。
推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。
Hugging Face 联合 Amazon SageMaker 推出深度学习容器(DLC),可通过 SageMaker Python SDK 一行代码启动分布式训练。
Hugging Face 研究人员总结了构建与调试神经网络的实用方法,建议开发者在建模前先搁置算法,深入分析原始数据分布与标签质量。随后应从 word2vec、fastText 搭配逻辑回归等简单基准开始测试,建立合理的对照指标,而非直接盲目套用 BERT 等复杂架构。在实现模型后,可通过在 16 个样本的小 batch 上去除正则化并跑通 0-loss 过拟合,以此验证代码实现的正确性。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 推进了基于能量的模型(EBMs)稳定且可扩展的训练,实现了优于现有模型的样本质量与泛化能力。EBMs 在生成阶段通过消耗更多算力持续优化输出结果,在低温条件下能够生成媲美 GANs 的样本,同时具备基于似然模型的模式覆盖保证。
OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。
推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。
OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。
OpenAI 宣布推出软件平台 Universe,用于在各类游戏、网站及其他应用程序中评估和训练 AI 的通用智能。