面向低资源语音识别微调 MMS Adapter 模型教程
Hugging Face 介绍了基于 Meta MMS-1B 模型微调 Adapter 实现低资源语音识别的完整工程方法。该方案通过冻结基础模型、仅训练各语种约 2.5M 参数的 Adapter 层,能在 10 到 20 分钟内完成收敛并取得极低词错误率。适配权重可以单独保存为小体积文件,便于多语种切换与轻量化分发。
Hugging Face 介绍了基于 Meta MMS-1B 模型微调 Adapter 实现低资源语音识别的完整工程方法。该方案通过冻结基础模型、仅训练各语种约 2.5M 参数的 Adapter 层,能在 10 到 20 分钟内完成收敛并取得极低词错误率。适配权重可以单独保存为小体积文件,便于多语种切换与轻量化分发。
Hugging Face 发布全新内容政策(Content Policy),针对机器学习模型与系统的开发及部署风险确立了审核规范。新政策将“同意”(Consent)作为核心价值,重点保护涉及用户所见内容以及个人身份、形象与表达呈现的相关权益。平台明确禁止针对用户和官方团队的攻击骚扰行为,并鼓励通过 Community Tab 协同解决争议。
开发者现可将 Elixir 开源笔记本 Livebook 作为应用直接部署至 Hugging Face Spaces。官方演示了在 15 分钟内构建基于 Whisper 的语音聊天应用,展示了与 Hugging Face 模型的集成、多用户协作及并发机器学习模型服务能力。Livebook 现已提供 Spaces Docker 模板,支持用户免费运行和编写笔记本。
AMD 正式加入 Hugging Face 硬件合作伙伴计划,双方将针对 AMD 旗下的 CPU、GPU 及 AI 加速芯片深度优化 Transformer 模型的训练与推理性能。
推荐理由:合作打破了深度学习硬件生态的单一依赖,为开发者在训练与推理端提供了基于 AMD 平台的替代方案与成本参考。
Hugging Face 面向美术馆、图书馆、档案馆和博物馆(GLAM)提供 Hub 资源应用与贡献方案。平台已托管超 190,000 个机器学习模型、33,000 个数据集及 100,000 个演示应用。机构可通过任务与语言筛选现成模型、利用 Spaces 托管 Gradio 或 Streamlit 应用,并支持在浏览器免代码上传 CSV 数据集。
Hugging Face Hub 宣布集成 DuckDB,支持用户直接使用 SQL 查询 Hub 上存储的超过 5 万个公开数据集。Dataset Viewer 会自动将公开数据集转换为 Parquet 格式并切分为 500MB 分片,开发者通过 /parquet 接口获取文件 URL 后,利用 DuckDB 的 httpfs 扩展即可直接对远程文件执行复杂分析查询。
推荐理由:HF Hub 将公开数据集自动转为 Parquet 分片,开发者可直接借助 DuckDB 远程运行 SQL 分析而无需完整下载数据。
Hugging Face 正式上线 Meta AI 旗下 fastText 模型的官方镜像,涵盖全部 157 种语言的词向量以及最新的语种识别模型。开发者可通过 huggingface_hub 便捷下载并调用模型,执行词向量特征提取、近邻词查询和文本语种检测等任务。该集成同时在 Hugging Face 模型页面支持文本分类与特征提取的交互式 widget 体验。
Hugging Face 全面支持阿布扎比技术创新研究所(TII)开源的 Falcon 系列大模型(Falcon-7B 与 Falcon-40B),并提供推理、量化与微调工具链。
推荐理由:原文给出了 Falcon 系列模型在消费级与企业级硬件上的量化推理配置,以及结合 QLoRA 单卡微调的完整代码范式。
Hugging Face 发布了在 Unity 游戏中集成语音识别功能的实现教程,指导开发者通过其官方 Unity API 将语音转换为文本。内容涵盖麦克风音频采集、44100 Hz 的 WAV 格式二进制编码、调用 AutomaticSpeechRecognition 接口以及 UI 交互状态管理等完整代码。该方案可用于游戏内语音指令、NPC 对话及无障碍交互等开发场景。
Hugging Face 宣布举办首届开源 AI Game Jam,活动将于 7 月 7 日至 9 日举行,鼓励开发者利用开源 AI 工具在周末完成游戏制作。参赛作品需支持 Web 或 Windows 平台,且必须在游戏或工作流中整合至少一款开源 AI 工具(如 Stable Diffusion)。赛事免费对所有个人及团队开放,将按趣味性、创意和主题维度评选作品。
Hugging Face 推出面向 Amazon SageMaker 的大语言模型推理容器(LLM DLC),基于 Text Generation Inference(TGI)构建,支持在托管环境中高效部署开源模型。
推荐理由:文章介绍了基于 TGI 的 SageMaker 专用推理容器,提供了从环境配置到多卡部署开源大模型的完整调用范式。
BERTopic 正式集成至 Hugging Face Hub。文中展示了利用该工具提取的 NLP 领域主题聚类结果,涵盖对话(14247 次)、语音识别(1833 次)、模型微调(1369 次)与文本摘要(1109 次)等数十个细分方向的关键词及频数分布。
针对 Stable Diffusion 在 CPU 等硬件上的推理延迟问题,团队结合 OpenVINO NNCF 的量化感知训练(QAT)、知识蒸馏与 Token Merging 构建了优化工作流。相比 PyTorch,该方案在 CPU 上实现了 5.1x 推理加速与 4x 模型体积缩减。整个优化过程仅需单张 24 GB 显存 GPU 微调 4096 次迭代,耗时不足一天。
Hugging Face 联合 EleutherAI 与 Stability AI 宣布,模型权重存储库 safetensors 已通过 Trail of Bits 的外部安全审计,未发现导致任意代码执行的严重漏洞。
推荐理由:safetensors 通过外部安全审计消除了 pickle 带来的代码执行隐患,为开源模型生态推进安全且高效的权重分发标准奠定了基础。
Hugging Face 宣布与 IBM 合作,将其开源库及模型生态深度集成至 IBM 面向企业的 watsonx.ai 工作室。watsonx.ai 基于 RedHat OpenShift 构建并支持云端与本地部署,底层集成了 transformers、accelerate、peft 及 Text Generation Inference 等核心工具。
Hugging Face 发布在单张 AMD GPU 上运行 Vicuna-13B 模型的实操指南,借助 ROCm 平台和 GPTQ 4-bit 量化技术降低显存占用。
Hugging Face 宣布入选法国数据保护局(CNIL)的“强化支持项目”,成为从 40 余家候选企业中选出的 3 家获支持公司之一。该项目旨在帮助具备强劲经济潜力的企业在 AI 领域理解并履行数据保护义务。Hugging Face 将借助该支持进一步推进 GDPR 合规,并深化在 BigScience 与 BigCode 等项目中的数据隐私实践。
Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。
推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。
Hugging Face 与 ServiceNow 联合发起的 BigCode 项目正式发布 15B 参数的代码大语言模型 StarCoderBase 以及面向 Python 微调的 StarCoder。
推荐理由:原文详细披露了 15B 代码模型的训练数据清洗流程与评测对比,为开发者构建开源代码补全与技术助手提供了可迁移基准。
Hugging Face 发布 Unity API 插件指南,指导开发者在 Unity 项目中直接接入 Hugging Face Inference API。开发者可通过 Unity Package Manager 使用 Git URL 完成安装,并在配置向导中绑定 API 密钥与自定义模型端点。该插件支持对话、文本生成、文生图、语音识别等多种任务,所有调用均通过异步回调处理。
Hugging Face 发布了结合 TensorFlow 与 TPU 从零端到端训练语言模型的实践指南。教程利用 XLA 和 TPUStrategy 解决了以往的兼容痛点,涵盖训练分词器、分片序列化 TFRecord 上传至 GCS 以及通过数据并行完成模型拟合的全流程。该方案展示了在 GPU 算力短缺背景下,将现有训练管线迁移至 TPU Pod 的低改造成本路径。
Databricks 宣布向 Hugging Face Datasets 代码库提交原生 Spark 支持,推出 Dataset.from_spark 接口,将大模型训练与微调的数据处理耗时最高缩短 40%。
Hugging Face 宣布正式上线面向中文用户的官方博客(hf.co/blog/zh),由志愿者团队翻译技术博客以及 Transformer、扩散模型和强化学习等课程资源。平台高度评价了 ChatGLM、RWKV、HuggingGPT 等中国社区成果,并将联合 PaddlePaddle、Datawhale 等伙伴持续推进课程培训、黑客松与模型微调等开源协作。
Hugging Face 官方发布了在 Hugging Face Spaces 托管 Unity 网页端可玩游戏的完整步骤教程。用户可基于 Static HTML 模板创建 Space,将 Unity 构建目标设为 WebGL 并禁用压缩,可选配置官方定制模板后完成构建。最后借助 Git-LFS 追踪大文件并推送到 Space 仓库,即可在线游玩与分享游戏。
Hugging Face 与 AWS 合作优化 AWS Inferentia2 上的 Transformers 模型推理性能。实测数据显示,Inferentia2 平均延迟比 NVIDIA A10G GPU 降低 4.5x,比上一代 Inferentia1 降低 4x,最大实例尺寸可支持 175B 参数模型。
Hugging Face 介绍了如何利用 Transformers 库与微软 Graphormer 模型执行图分类任务。该流程需安装 transformers(>= 4.27.2)与 datasets,以 Stanford OGB 的 ogbg-molhiv 数据集为例演示了图数据格式规范及图结构特征预处理。
Hugging Face 联合开源联邦学习框架 Substra 推出演示 Space,展示如何在保护数据隐私的前提下跨多数据源协同训练 AI 模型。联邦学习通过仅在服务器间传输模型权重而非本地原始数据,打破医疗等敏感领域的数据孤岛,并曾成功应用于包含 10 家药企的 MELLODDY 项目及乳腺癌研究。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 平台上超过 150,000 个开源模型及 Inference Endpoints 服务引入 Snorkel Flow 平台。
Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。
推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。
Hugging Face 详细介绍了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 上加速 Stable Diffusion 推理的多种方法与基准测试。
Hugging Face 与联邦学习框架 Flower 结合,支持在多客户端之间联合训练语言模型。该方案以 IMDB 影评序列分类为任务,微调预训练 Transformer 模型 distilBERT。开发者可通过继承 `flwr.client.NumPyClient` 实现本地训练与评测,在不共享数据的前提下向服务器同步模型参数。
Hugging Face 宣布增强 Hub 对 Jupyter Notebook 的托管支持,新增原生界面渲染以及一键跳转 Google Colab 运行功能。托管的 ipynb 文件不再直接以原始 JSON 呈现,而是转为易读的可视化排版,便于开发者与模型、数据集协同管理并展示复现过程。
Hugging Face 正式发布 TRL 与 PEFT 库的集成,支持在单张 24GB 消费级 GPU(如 RTX 4090)上对 20B 参数大语言模型运行基于人类反馈的强化学习(RLHF)微调。
推荐理由:通过 8-bit 量化与适配器动态切换避免双模型副本占用,为显存受限环境下跑通 RLHF 提供了具体工程参考。
Hugging Face 在 Diffusers 库中集成 ControlNet 并推出 StableDiffusionControlNetPipeline,原生支持基于空间条件的高精度图像生成。
推荐理由:原文梳理了多条件控制的调用接口与显存优化方案,开发者可据此在工程中快速落地可控生图。
Hugging Face 宣布为 Diffusers 库发布伦理框架,旨在规范维护者对社区贡献的技术决策,并应对扩散模型的潜在负面社会影响。该准则确立了透明度、一致性、简洁性、易用性、可复现性与责任六大原则。团队同时列举了支持安全部署的具体机制,包括 Safe Stable Diffusion、Hub 仓库分阶段发布、偏见评估及 OpenRAIL 许可。
Hugging Face 通过专家加速计划协助 Witty Works 改进包容性写作助手,解决了早期基于 spaCy 方案无法识别语境相关词的问题。团队采用 Sentence Transformers 架构与 SetFit 少样本微调框架,每个目标词仅需 15-20 个标注句子即可完成训练。最终模型选用 mpnet-base-v2 搭配逻辑回归与 KNN,并在 Azure 上实现低延迟部署。
消费奖励平台 Fetch 借助 AWS 与 Hugging Face 专家加速计划,将第三方黑盒方案替换为自研 AI 工具,节省了 30% 的开发时间。该方案依托 Amazon SageMaker、AWS Inferentia 加速器与 Transformers 模型,用于每日处理超 1100 万张收据,不仅提升了数据洞察粒度,还将处理延迟降低了 50%。
Hugging Face 宣布与亚马逊云科技 AWS 达成扩大的长期战略合作,将 AWS 作为首选云服务提供商。开发者可在 Amazon SageMaker 和 EC2 上利用 AWS Trainium 与 AWS Inferentia 等专用芯片,快速完成 Hugging Face 模型的训练、微调与部署。双方旨在降低生成式 AI 的使用与算力成本,加速下一代开源模型的构建与落地。
推荐理由:原文披露了 Hugging Face 与 AWS 在专用芯片及 SageMaker 工具链上的深度整合,开发者可以据此评估在云端部署与微调开源模型的成本及方案。
Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。
推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。
Mantis 团队分享了将生产环境 CPU 模型推理从 AWS ECS 迁移至 Hugging Face Inference Endpoints 的实践与评测。实测显示在 4 核 8GB 的 CPU 规格下,官方容器推理延迟约为 80ms,比自建 ECS 容器提速超过一倍。尽管月度托管费用高出 24% 至 50%,但省去了打包 Docker 镜像与维护基础设施的流程,大幅降低了工程认知负担。