跳到正文

#Hugging Face

今日 0 条
6月19日周一
6月15日周四
  1. Hugging Face39

    Hugging Face 发布全新内容准则与政策

    Hugging Face 发布全新内容政策(Content Policy),针对机器学习模型与系统的开发及部署风险确立了审核规范。新政策将“同意”(Consent)作为核心价值,重点保护涉及用户所见内容以及个人身份、形象与表达呈现的相关权益。平台明确禁止针对用户和官方团队的攻击骚扰行为,并鼓励通过 Community Tab 协同解决争议。

  2. Hugging Face48

    将 Livebook 笔记本作为应用部署至 Hugging Face Spaces

    开发者现可将 Elixir 开源笔记本 Livebook 作为应用直接部署至 Hugging Face Spaces。官方演示了在 15 分钟内构建基于 Whisper 的语音聊天应用,展示了与 Hugging Face 模型的集成、多用户协作及并发机器学习模型服务能力。Livebook 现已提供 Spaces Docker 模板,支持用户免费运行和编写笔记本。

6月13日周二
6月12日周一
  1. Hugging Face36

    面向美术馆、图书馆、档案馆与博物馆(GLAM)的 Hugging Face Hub 指南

    Hugging Face 面向美术馆、图书馆、档案馆和博物馆(GLAM)提供 Hub 资源应用与贡献方案。平台已托管超 190,000 个机器学习模型、33,000 个数据集及 100,000 个演示应用。机构可通过任务与语言筛选现成模型、利用 Spaces 托管 Gradio 或 Streamlit 应用,并支持在浏览器免代码上传 CSV 数据集。

6月7日周三
  1. Hugging Face72

    Hugging Face Hub 集成 DuckDB 支持对超 5 万个数据集执行 SQL 查询

    Hugging Face Hub 宣布集成 DuckDB,支持用户直接使用 SQL 查询 Hub 上存储的超过 5 万个公开数据集。Dataset Viewer 会自动将公开数据集转换为 Parquet 格式并切分为 500MB 分片,开发者通过 /parquet 接口获取文件 URL 后,利用 DuckDB 的 httpfs 扩展即可直接对远程文件执行复杂分析查询。

    推荐理由:HF Hub 将公开数据集自动转为 Parquet 分片,开发者可直接借助 DuckDB 远程运行 SQL 分析而无需完整下载数据。

6月6日周二
  1. Hugging Face41

    fastText 正式入驻 Hugging Face Hub

    Hugging Face 正式上线 Meta AI 旗下 fastText 模型的官方镜像,涵盖全部 157 种语言的词向量以及最新的语种识别模型。开发者可通过 huggingface_hub 便捷下载并调用模型,执行词向量特征提取、近邻词查询和文本语种检测等任务。该集成同时在 Hugging Face 模型页面支持文本分类与特征提取的交互式 widget 体验。

6月5日周一
6月2日周五
  1. Hugging Face52

    在 Unity 中使用 Hugging Face 实现 AI 语音识别教程

    Hugging Face 发布了在 Unity 游戏中集成语音识别功能的实现教程,指导开发者通过其官方 Unity API 将语音转换为文本。内容涵盖麦克风音频采集、44100 Hz 的 WAV 格式二进制编码、调用 AutomaticSpeechRecognition 接口以及 UI 交互状态管理等完整代码。该方案可用于游戏内语音指令、NPC 对话及无障碍交互等开发场景。

6月1日周四
  1. Hugging Face36

    Hugging Face 宣布举办首届开源 AI Game Jam

    Hugging Face 宣布举办首届开源 AI Game Jam,活动将于 7 月 7 日至 9 日举行,鼓励开发者利用开源 AI 工具在周末完成游戏制作。参赛作品需支持 Web 或 Windows 平台,且必须在游戏或工作流中整合至少一款开源 AI 工具(如 Stable Diffusion)。赛事免费对所有个人及团队开放,将按趣味性、创意和主题维度评选作品。

5月31日周三
5月25日周四
  1. Hugging Face49

    使用 NNCF 与 🤗 Optimum 优化 Intel CPU 上的 Stable Diffusion

    针对 Stable Diffusion 在 CPU 等硬件上的推理延迟问题,团队结合 OpenVINO NNCF 的量化感知训练(QAT)、知识蒸馏与 Token Merging 构建了优化工作流。相比 PyTorch,该方案在 CPU 上实现了 5.1x 推理加速与 4x 模型体积缩减。整个优化过程仅需单张 24 GB 显存 GPU 微调 4096 次迭代,耗时不足一天。

5月23日周二
  1. Hugging Face77

    Hugging Face 宣布 Safetensors 完成外部安全审计并将成为默认模型格式

    Hugging Face 联合 EleutherAI 与 Stability AI 宣布,模型权重存储库 safetensors 已通过 Trail of Bits 的外部安全审计,未发现导致任意代码执行的严重漏洞。

    推荐理由:safetensors 通过外部安全审计消除了 pickle 带来的代码执行隐患,为开源模型生态推进安全且高效的权重分发标准奠定了基础。

5月15日周一
  1. Hugging Face38

    Hugging Face 入选法国数据保护局 CNIL 强化支持项目

    Hugging Face 宣布入选法国数据保护局(CNIL)的“强化支持项目”,成为从 40 余家候选企业中选出的 3 家获支持公司之一。该项目旨在帮助具备强劲经济潜力的企业在 AI 领域理解并履行数据保护义务。Hugging Face 将借助该支持进一步推进 GDPR 合规,并深化在 BigScience 与 BigCode 等项目中的数据隐私实践。

5月11日周四
  1. Hugging Face79

    Hugging Face 推出 Assisted Generation 解码方案以降低文本生成延迟

    Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。

    推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。

5月4日周四
5月1日周一
  1. Hugging Face55

    Hugging Face Unity API 安装与使用指南

    Hugging Face 发布 Unity API 插件指南,指导开发者在 Unity 项目中直接接入 Hugging Face Inference API。开发者可通过 Unity Package Manager 使用 Git URL 完成安装,并在配置向导中绑定 API 密钥与自定义模型端点。该插件支持对话、文本生成、文生图、语音识别等多种任务,所有调用均通过异步回调处理。

4月27日周四
  1. Hugging Face55

    基于 TensorFlow 与 TPU 使用 Transformers 训练语言模型教程

    Hugging Face 发布了结合 TensorFlow 与 TPU 从零端到端训练语言模型的实践指南。教程利用 XLA 和 TPUStrategy 解决了以往的兼容痛点,涵盖训练分词器、分片序列化 TFRecord 上传至 GCS 以及通过数据并行完成模型拟合的全流程。该方案展示了在 GPU 算力短缺背景下,将现有训练管线迁移至 TPU Pod 的低改造成本路径。

4月26日周三
4月24日周一
  1. Hugging Face45

    Hugging Face 推出中文官方博客,深化与中国 AI 社区合作

    Hugging Face 宣布正式上线面向中文用户的官方博客(hf.co/blog/zh),由志愿者团队翻译技术博客以及 Transformer、扩散模型和强化学习等课程资源。平台高度评价了 ChatGLM、RWKV、HuggingGPT 等中国社区成果,并将联合 PaddlePaddle、Datawhale 等伙伴持续推进课程培训、黑客松与模型微调等开源协作。

4月21日周五
  1. Hugging Face54

    如何在 Hugging Face Spaces 中托管 Unity 游戏

    Hugging Face 官方发布了在 Hugging Face Spaces 托管 Unity 网页端可玩游戏的完整步骤教程。用户可基于 Static HTML 模板创建 Space,将 Unity 构建目标设为 WebGL 并禁用压缩,可选配置官方定制模板后完成构建。最后借助 Git-LFS 追踪大文件并推送到 Space 仓库,即可在线游玩与分享游戏。

4月17日周一
4月14日周五
4月12日周三
  1. Hugging Face41

    基于 Substra 构建隐私保护型 AI

    Hugging Face 联合开源联邦学习框架 Substra 推出演示 Space,展示如何在保护数据隐私的前提下跨多数据源协同训练 AI 模型。联邦学习通过仅在服务器间传输模型权重而非本地原始数据,打破医疗等敏感领域的数据孤岛,并曾成功应用于包含 10 家药企的 MELLODDY 项目及乳腺癌研究。

4月6日周四
4月5日周三
  1. Hugging Face81

    StackLLaMA:使用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。

    推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。

3月28日周二
3月27日周一
3月23日周四
3月9日周四
  1. Hugging Face76

    Hugging Face 推出 TRL 与 PEFT 集成:支持在 24GB 消费级 GPU 上对 20B 模型进行 RLHF 微调

    Hugging Face 正式发布 TRL 与 PEFT 库的集成,支持在单张 24GB 消费级 GPU(如 RTX 4090)上对 20B 参数大语言模型运行基于人类反馈的强化学习(RLHF)微调。

    推荐理由:通过 8-bit 量化与适配器动态切换避免双模型副本占用,为显存受限环境下跑通 RLHF 提供了具体工程参考。

3月3日周五
3月2日周四
  1. Hugging Face39

    Diffusers 库开发伦理准则

    Hugging Face 宣布为 Diffusers 库发布伦理框架,旨在规范维护者对社区贡献的技术决策,并应对扩散模型的潜在负面社会影响。该准则确立了透明度、一致性、简洁性、易用性、可复现性与责任六大原则。团队同时列举了支持安全部署的具体机制,包括 Safe Stable Diffusion、Hub 仓库分阶段发布、偏见评估及 OpenRAIL 许可。

3月1日周三
  1. Hugging Face31

    Hugging Face 如何加速 Witty Works 写作助手的开发

    Hugging Face 通过专家加速计划协助 Witty Works 改进包容性写作助手,解决了早期基于 spaCy 方案无法识别语境相关词的问题。团队采用 Sentence Transformers 架构与 SetFit 少样本微调框架,每个目标词仅需 15-20 个标注句子即可完成训练。最终模型选用 mpnet-base-v2 搭配逻辑回归与 KNN,并在 Azure 上实现低延迟部署。

2月23日周四
  1. Hugging Face31

    Fetch 借助 AWS 与 Hugging Face 整合 AI 工具,节省 30% 开发时间

    消费奖励平台 Fetch 借助 AWS 与 Hugging Face 专家加速计划,将第三方黑盒方案替换为自研 AI 工具,节省了 30% 的开发时间。该方案依托 Amazon SageMaker、AWS Inferentia 加速器与 Transformers 模型,用于每日处理超 1100 万张收据,不仅提升了数据洞察粒度,还将处理延迟降低了 50%。

2月21日周二
  1. Hugging Face67

    Hugging Face 与 AWS 达成战略合作以降低 AI 使用门槛

    Hugging Face 宣布与亚马逊云科技 AWS 达成扩大的长期战略合作,将 AWS 作为首选云服务提供商。开发者可在 Amazon SageMaker 和 EC2 上利用 AWS Trainium 与 AWS Inferentia 等专用芯片,快速完成 Hugging Face 模型的训练、微调与部署。双方旨在降低生成式 AI 的使用与算力成本,加速下一代开源模型的构建与落地。

    推荐理由:原文披露了 Hugging Face 与 AWS 在专用芯片及 SageMaker 工具链上的深度整合,开发者可以据此评估在云端部署与微调开源模型的成本及方案。

2月15日周三
  1. Hugging Face75

    使用 BLIP-2 实现零样本图像到文本生成指南

    Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。

    推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。

  2. Hugging Face54

    为什么我们选择迁移到 Hugging Face Inference Endpoints

    Mantis 团队分享了将生产环境 CPU 模型推理从 AWS ECS 迁移至 Hugging Face Inference Endpoints 的实践与评测。实测显示在 4 核 8GB 的 CPU 规格下,官方容器推理延迟约为 80ms,比自建 ECS 容器提速超过一倍。尽管月度托管费用高出 24% 至 50%,但省去了打包 Docker 镜像与维护基础设施的流程,大幅降低了工程认知负担。