Hugging Face 推出 PEFT 库,支持消费级硬件高效微调大模型
Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。
推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。
Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。
推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。
在 5 天农场游戏开发系列教程第 5 部分中,作者演示了利用 ChatGPT 协作生成游戏故事大纲、游戏介绍与商店物品描述的流程。测试指出大语言模型容易复用已有情节且在长篇叙事中易陷入重复,直接商用还存在潜在的法律与伦理风险。因此建议将 ChatGPT 用于大纲构思和细节头脑风暴,并依靠人工多轮交互微调来敲定内容。
Hugging Face 评测了在 Intel Sapphire Rapids 架构与开源硬件加速库 Optimum Intel 下 PyTorch Transformers 模型的推理加速表现。
Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。
推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。
开发者可将 Stable Diffusion 的 Image2Image 融入传统 2D 工作流,通过手绘草图与 AI 反复迭代快速生成游戏素材。制作时可通过调节去噪强度控制画面变化幅度,并结合 Photoshop 手动修正局部细节,不到 10 分钟即可输出可用的游戏图标。针对容易出现偏差的道具,还可通过调整提示词或结合 Dreambooth、LoRA 等定制技术提升生成精度。
Hugging Face 宣布在 Diffusers 库中正式支持 LoRA 训练与推理,可用于 Stable Diffusion 的全微调与 Dreambooth。
推荐理由:Diffusers 官方支持 LoRA 微调与推理,读者可借此将权重文件压缩至约 3MB 并在消费级显卡上完成训练。
Hugging Face 联合微软推出 Optimum 与 ONNX Runtime 的训练集成方案,通过 ORTTrainer 接口帮助 Transformer 模型训练提速 35% 以上。
当前文本生成 3D(text-to-3D)技术尚未达到可直接实际应用于游戏开发的阶段。虽然已有 DreamFusion、Point-E 及 CLIP-NeRF 等探索,但多数基于神经辐射场(NeRF)的视角合成,而游戏运行核心依赖网格(mesh)。即便通过 NeRF 转网格方案,其生成结果也类似摄影测量,无法直接投入游戏,仍需要大量专业手动后期处理。
在 5 天 AI 农场游戏开发教程的第 2 部分中,开发者使用 ChatGPT 辅助玩法设计,落地了作物多样性与成长激励机制。文章结合 Transformer 架构与 RLHF 解释了大语言模型原理,并指出模型存在“看似合理却给出错误内容”的局限。作者建议将 ChatGPT 作为头脑风暴与加速开发的辅助工具,而非完全替代人工流程。
Hugging Face 实现了在 AWS 上利用英特尔第四代至强 Sapphire Rapids 集群加速 PyTorch Transformer 分布式训练。
Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。
推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。
Hugging Face 正式推出免编程的图形化模型卡片创建工具 Model Card Creator Tool 及配套指南。更新后的标准化模板已集成至 huggingface_hub 库,提供默认提示引导用户重点补充偏差、风险和限制等信息。该方案降低了非技术人员参与模型文档协作的门槛,后续还将与 Hub 的 Evaluate 评测工具打通以支持自动导入评估结果。
Hugging Face 发布音频数据集完整指南,详解如何利用 🤗 Datasets 库高效获取与预处理语音数据。教程演示了一行代码加载数据、动态重采样音频、通过 map 与 filter 进行特征映射和样本过滤,并重点介绍了无需预先下载即可逐样本处理 TB 级音频的流式模式(streaming mode)。
Habana Gaudi2 在模型训练与推理性能上约为 Nvidia A100 80GB 的两倍。在 BERT 预训练中,Gaudi2 吞吐量最高达 1835.8 samples/s(A100 为 1082.6 samples/s);Stable Diffusion 推理延迟达 0.925 秒/图,比 A100 快 2.84 倍。
Elixir 社区发布 Bumblebee 库,通过纯 Elixir 实现了 Hugging Face Transformers,支持从 GPT2 到 Stable Diffusion 等多类模型。
Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。
推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。
Hugging Face 发布蛋白质深度学习教程,面向生物学家与机器学习从业者解释如何将大语言模型的迁移学习范式迁移到蛋白质建模。文章对比了文本与氨基酸序列的特征映射,介绍了蛋白质折叠模型 ESMFold 以及序列分类和 token 分类任务。作者还提供了基于 PyTorch 与 TensorFlow 的实操 Notebook,支持快速接入 ESM-2 或 ProtBERT 进行微调并分享至社区。
Hugging Face 发布技术教程,演示如何使用 Transformers 库中的 TimeSeriesTransformer 模型结合 GluonTS 实现概率时间序列预测。
Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。
推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。
中科大与微软提出的离散潜空间扩散模型 VQ-Diffusion 已集成至 Hugging Face Diffusers 库,支持通过极简代码加载预训练权重。该模型基于 VQ-VAE 将图像转为离散 token,并在离散空间中完成加噪与双向 Transformer 去噪,在保证生成质量的同时将推理速度较自回归模型提升最高 15 倍。
Hugging Face 宣布启动 2023 年实习生招聘计划,面向各种背景的申请者共同解决前沿 AI 与机器学习问题。开放岗位涵盖 Accelerate、Text to Speech、具身智能(Embodied AI)、LLM 分布式训练框架与数据集构建,以及社会影响评估和 AI 艺术工具等方向。候选人需注册 Hugging Face 账号并通过官方招聘门户提交申请。
Hugging Face 宣布将于 11 月 30 日举办扩散模型线上直播活动,以配合其与 Jonathan Whitaker 合作推出的免费扩散模型课程。
Hugging Face 宣布与 arXiv 达成合作,通过 arXivLabs 在 arXiv 论文页面新增 Demo 标签页。用户无需在本地配置环境或运行代码,即可直接在浏览器中试用社区或作者基于 Gradio、Streamlit 构建的开源交互式应用。这一功能提升了学术论文的可复现性与传播度,便于更广泛的人群探索和验证模型效果。
推荐理由:arXiv 论文页面直接集成 Hugging Face Spaces 演示,方便研究者和开发者无需配置环境即可在线验证模型效果。
Hugging Face 宣布在 Optimum Intel 中集成 Intel OpenVINO,支持在各类 Intel 处理器上通过 OpenVINO Runtime 运行 Transformers 模型推理。该首发版本基于 OpenVINO 2022.2,支持利用 NNCF 对 BERT 等模型执行训练后静态量化与量化感知训练,官方实测 ViT 模型量化后准确率保持在 87.6%。
Hugging Face 在 Evaluate 库中引入了用于评估因果语言模型偏见的度量工具,涵盖毒性、语言极性与刻板印象测试。文章以 GPT-2 模型为例,演示了结合 WinoBias 和 BOLD 等数据集提示词,调用 toxicity、regard 和 honest 指标对模型生成文本进行量化打分的具体代码流程。作者指出当前评测集覆盖的偏见范围有限,建议组合使用多种指标进行综合评估。
Hugging Face Diffusers 在 0.5.1 版本加入对 JAX 和 Flax 的支持,允许开发者在 Google TPU 设备上高效并行运行 Stable Diffusion 推理。
推荐理由:原文给出了利用 JAX 的 pmap 与 TPU 多核并行加速图像生成的具体范式,读者可直接复用其编译与分发逻辑。
Hugging Face 宣布与 DataCite 合作,支持用户直接在 Hub 仓库设置中为模型或数据集生成数字对象唯一标识符(DOI)。DOI 绑定版本、URL 和描述等元数据并提供永久链接,访客可在资产页面一键获取引用信息。当模型或数据集发布新版本时,DOI 支持更新以精准追踪特定版本。
Hugging Face 的无代码训练工具 AutoTrain 正式支持计算机视觉领域的图像分类任务。用户无需编写代码,只需上传本地数据或选用 Hugging Face Hub 数据集,系统便会自动测试多种模型架构,且 5 个候选模型搭配少于 500 张图片的训练可免费使用。训练完成的模型会自动托管至 Hub,并支持直接通过内置推理小部件测试。
Hugging Face 推出首期“伦理与社会”通讯,分享其在机器学习伦理落地与治理方面的最新实践。平台近期支持用户直接对 Hub 上的模型、数据与 Spaces 反馈意见,并于本周上线标记(flag)功能以举报伦理和法律问题。此外,团队还推出了评测库、数据偏见分析代码与模型训练碳排追踪工具,并正在制定新型负责任 AI 许可协议。
Hugging Face 官方发布指南,详解如何使用 NVIDIA 开发的 Megatron-LM 框架在多 GPU 上预训练大语言模型,并将其转换接入 Transformers 生态。
开发者可在 Hugging Face Spaces 中通过 Gradio 结合 3Dmol.js 或 gradio_molecule3d 组件,在浏览器中实现蛋白质 3D 结构可视化。
Hugging Face 向白宫科技政策办公室与国家科学基金会提交反馈,针对美国国家人工智能研究资源(NAIRR)中期报告提出系统建议。其呼吁任命技术与伦理专家为顾问、推行 Model Cards 等文档标准,并提供 AutoTrain 等低代码工具降低跨学科门槛。此外还建议制定负责任 AI 许可(Responsible AI Licenses)防范滥用,以多语言资源赋能多元研究者。
Hugging Face 宣布为 Datasets 库更新音频与图像文档,正式将标准化数据处理能力从纯文本拓展至多模态数据。新版本在快速入门中展示了端到端的多模态加载流程,并新增将数据直接转为 tf.data.Dataset 的 to_tf_dataset 函数。
Hugging Face 的 Transformers 库现已支持在 TensorFlow 中使用 XLA 编译文本生成,推理速度最高可较以往提升 100x,甚至超越 PyTorch。该优化需配合 transformers >= 4.21.0 使用,并完全兼容贪婪解码、采样及 Beam Search 等常用生成参数控制。
Hugging Face 官方发布了使用 TensorFlow Serving(TF Serving)部署 Transformers 视觉模型的完整实践指南。教程以图像分类模型 Vision Transformer(ViT)为例,演示了如何将图像归一化、缩放及标签映射等前/后处理逻辑内嵌至 SavedModel 计算图,以降低数据传输载荷与训练推理偏差。
Hugging Face 深度强化学习课程介绍了 Advantage Actor Critic(A2C)算法,旨在解决策略梯度算法因蒙特卡洛采样产生的高方差问题。A2C 结合控制动作的 Actor 与评估价值的 Critic,通过混合架构降低方差并提升训练稳定性。课程配套使用 Stable-Baselines3 与 PyBullet 仿真环境训练双足和蜘蛛机器人行走。
Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。
推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。
BigScience 联合 Hugging Face 正式开源 1760 亿参数的多语言大语言模型 BLOOM,支持生成 46 种自然语言和 13 种编程语言的文本。
推荐理由:该项目完全公开了百亿级多语言模型的权重、训练检查点与优化器状态,为开源社区研究前沿模型底层机制提供了完整范本。
Hugging Face 深度强化学习课程推出策略梯度教程,指导读者使用 PyTorch 从零实现 Reinforce 算法,并在 CartPole-v1、PixelCopter 和 Pong 环境中完成验证。该方法通过梯度上升直接优化策略并输出动作概率分布,更适用于高维及连续动作空间,但同时存在易收敛至局部最优与训练方差较高的局限。
Hugging Face 分享了利用 Sentence Transformers 库开展首个机器学习项目的实操指南。该库可将句子、段落和图像转化为密集向量表示,并通过 util.cos_sim 等内置函数计算余弦相似度以支持语义搜索。开发者能通过加载 msmarco-MiniLM-L-6-v3 模型及 Hugging Face Hub 数据集,快速探索聚类、知识蒸馏和推荐系统等实际应用。