跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 301–320 条 · 共 348 条
3月6日周一
3月3日周五
2月21日周二
  1. Hugging Face67

    Hugging Face 与 AWS 达成战略合作以降低 AI 使用门槛

    Hugging Face 宣布与亚马逊云科技 AWS 达成扩大的长期战略合作,将 AWS 作为首选云服务提供商。开发者可在 Amazon SageMaker 和 EC2 上利用 AWS Trainium 与 AWS Inferentia 等专用芯片,快速完成 Hugging Face 模型的训练、微调与部署。双方旨在降低生成式 AI 的使用与算力成本,加速下一代开源模型的构建与落地。

    推荐理由:原文披露了 Hugging Face 与 AWS 在专用芯片及 SageMaker 工具链上的深度整合,开发者可以据此评估在云端部署与微调开源模型的成本及方案。

2月15日周三
  1. Hugging Face75

    使用 BLIP-2 实现零样本图像到文本生成指南

    Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。

    推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。

2月10日周五
  1. Hugging Face83

    Hugging Face 推出 PEFT 库,支持消费级硬件高效微调大模型

    Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。

    推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。

2月8日周三
  1. Hugging Face67

    SpeechT5 正式接入 Hugging Face Transformers 支持多语音任务

    Hugging Face 宣布微软亚洲研究院提出的 SpeechT5 模型正式接入 Transformers 库,支持文本转语音、语音转换和语音识别等任务。SpeechT5 基于统一的 Transformer 编解码器架构,通过共享预训练表征并配合特定任务的预处理和后处理网络实现多任务适配。官方同步在 Hugging Face Hub 提供了模型权重、HiFi-GAN 声码器支持以及调用示例代码。

    推荐理由:统一架构的 SpeechT5 接入降低了语音多任务开发成本,开发者可直接复用官方代码实现识别与合成。

2月3日周五
  1. Hugging Face62

    Hugging Face 深入解析视觉语言模型与 Transformers 实践指南

    Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。

    推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。

1月30日周一
  1. Hugging Face64

    Hugging Face 汇总计算机视觉生态现状与工具链支持

    Hugging Face 官方发文汇总其生态在计算机视觉领域的全套支持能力,目前已覆盖 8 项核心视觉任务、3000 多个模型和 100 多个数据集。平台在 Transformers、Diffusers 与 timm 中提供了统一的推理 Pipelines、Trainer 微调接口及零样本视觉模型,同时兼容卷积与 Transformer 架构。

    推荐理由:文章系统梳理了从模型微调到部署的计算机视觉工具链,读者可据此全面了解开源生态对主流视觉任务的接入方式。

1月26日周四
1月19日周四
12月21日周三
  1. Hugging Face60

    基于 Hugging Face Transformers 的 CLIPSeg 零样本图像分割实战指南

    Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。

    推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。

12月9日周五
  1. Hugging Face76

    Hugging Face 图解人类反馈强化学习(RLHF)核心流程

    Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。

    推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。

12月1日周四
  1. Hugging Face80

    在 Apple Silicon 上通过 Core ML 运行 Stable Diffusion 指南

    Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。

    推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。

11月21日周一
  1. Hugging Face67

    Hugging Face 发布文档智能指南:用开源多模态模型加速企业文档处理

    Hugging Face 梳理了文档智能领域的开源技术方案,涵盖 OCR、图像分类、版面分析、文档解析、表格识别和视觉问答六大核心场景。文章系统对比了 LayoutLM 系列流水线方案与 Donut、PaliGemma 等端到端视觉语言模型的性能表现与商用许可差异。团队建议企业从微调开源预训练模型入手,并根据输入分辨率、标注边界框与具体任务指标设计评估流程。

    推荐理由:文章系统梳理了文档智能的六大任务分类与代表性开源模型,为企业选择端到端多模态方案或传统流水线提供了实践参考。

11月17日周四
  1. Hugging Face76

    Hugging Face 与 arXiv 达成合作,论文页面上线机器学习 Demo 体验标签

    Hugging Face 宣布与 arXiv 达成合作,通过 arXivLabs 在 arXiv 论文页面新增 Demo 标签页。用户无需在本地配置环境或运行代码,即可直接在浏览器中试用社区或作者基于 Gradio、Streamlit 构建的开源交互式应用。这一功能提升了学术论文的可复现性与传播度,便于更广泛的人群探索和验证模型效果。

    推荐理由:arXiv 论文页面直接集成 Hugging Face Spaces 演示,方便研究者和开发者无需配置环境即可在线验证模型效果。

11月7日周一
11月3日周四
10月19日周三
  1. Hugging Face78

    Hugging Face 推出大规模文本嵌入基准 MTEB

    Hugging Face 推出大规模文本嵌入基准 MTEB,涵盖 8 项任务、56 个数据集以及多达 112 种语言,并同步上线汇总超 2000 项测试结果的公开排行榜。开发者可通过开源库 pip install mteb 评测任意嵌入模型,并将生成的元数据提交至 Hugging Face Hub 排行榜展示。

    推荐理由:原文给出了覆盖56个数据集与112种语言的文本嵌入评测方案,读者可以据此选用统一基准评估模型表现并提交结果。

10月13日周四
10月12日周三
  1. Hugging Face64

    Hugging Face 优化 BLOOM 模型推理性能的工程实践复盘

    Hugging Face 团队复盘了为 176B 参数 BLOOM 模型构建高效推理服务的全过程,最终将推理延迟降低 5 倍至 71ms/token,并将吞吐量提升了 50 倍。

    推荐理由:原文详尽记录了 176B 大模型从流水线并行转向张量并行与算子融合的实战过程,其性能排坑和测量经验对大模型推理工程很有参考价值。