跳到正文

#Hugging Face

今日 0 条
6月29日周三
  1. Hugging Face30

    如何用 Sentence Transformers 开启你的首个机器学习项目

    Hugging Face 分享了利用 Sentence Transformers 库开展首个机器学习项目的实操指南。该库可将句子、段落和图像转化为密集向量表示,并通过 util.cos_sim 等内置函数计算余弦相似度以支持语义搜索。开发者能通过加载 msmarco-MiniLM-L-6-v3 模型及 Hugging Face Hub 数据集,快速探索聚类、知识蒸馏和推荐系统等实际应用。

6月28日周二
  1. Hugging Face68

    Hugging Face 发布 Evaluation on the Hub 免代码模型评测工具

    Hugging Face 推出基于 AutoTrain 的评测工具 Evaluation on the Hub,支持用户无需编写代码即可在 Hub 上的任意数据集上评测任意模型。该工具通过 Spaces 界面提供配置与排行榜展示,评测任务完成后会自动向对应模型的 Model Card 提交 Pull Request,将验证后的指标直接写入模型元数据中。

    推荐理由:该功能将评测流水线与模型卡片元数据打通,读者可以借此实现免代码的一致性复现和榜单对比。

5月9日周一
  1. Hugging Face62

    Hugging Face 完成 1 亿美元 C 轮融资,加速开源机器学习生态建设

    Hugging Face 宣布完成由 Lux Capital 领投的 1 亿美元 C 轮融资,红杉资本、Coatue 等机构参投。该笔资金将用于继续投入开源研究与产品开发,推进聚集超 1,000 名研究人员的 BigScience 开源多语言大语言模型训练,并持续扩张团队规模。

    推荐理由:原文披露了融资领投方及平台托管规模等数据,展示了开源机器学习社区在商业化与生态建设上的关键节点。

5月4日周三
  1. Hugging Face56

    Hugging Face 深度强化学习入门教程

    Hugging Face 发布免费深度强化学习课程第一单元,系统讲解从基础强化学习到深度强化学习的核心理论框架。内容涵盖马尔可夫决策过程、状态与动作空间、奖励折扣、探索与利用权衡,以及基于策略和基于价值的两大求解路径,并附带月球着陆器智能体实操训练与 Hub 模型上传教程。

4月26日周二
4月13日周三
3月28日周一
  1. Hugging Face55

    Hugging Face 在 Transformers 库中集成离线强化学习模型 Decision Transformer

    Hugging Face 宣布将离线强化学习方法 Decision Transformer 集成至 transformers 库和 Hugging Face Hub。官方同步上线了 9 个面向 Gym 连续控制任务的预训练权重,并提供了自回归推理代码与 Colab 示例。用户可以通过设定目标回报直接调节策略输出,团队后续计划支持 Atari 环境的卷积 Decision Transformer。

3月16日周三
2月11日周五
1月21日周五
12月21日周二
  1. Hugging Face80

    Hugging Face 正式收购机器学习交互界面库 Gradio

    Hugging Face 宣布收购机器学习演示工具 Gradio,Gradio 团队将正式加入 Hugging Face。Gradio 始于 2019 年斯坦福大学的研究协作需求,支持通过简易界面分享文本、语音和视频等多模态模型 Demo,目前已有超过 30 万个演示应用基于其构建。团队加入后将继续推进 Gradio 的开源生态,让任何具备浏览器的人都能更便捷地访问和测试机器学习模型。

    推荐理由:该收购将交互界面工具与模型托管生态整合,使开发者能够更低门槛地向非技术人员分享与测试模型。

11月29日周一
11月19日周五
11月15日周一
10月26日周二
  1. Hugging Face42

    大语言模型:新的摩尔定律?

    面对微软与 NVIDIA 推出 530B 参数 Megatron-Turing NLG 带来的高能耗与近 $100M 成本,行业无需盲目追逐超大模型。DistilBERT 减小 40% 体积且提速 60% 仍保留 97% 理解力,BigScience 的 T0 缩小 16x 却在多任务上超越 GPT-3。实际应用应优先选择预训练小模型、微调技术与高效云设施,以低成本实现高质量解决方案。

10月25日周一
10月20日周三
  1. Hugging Face33

    Hugging Face:代码化机器学习时代已经到来

    Hugging Face 指出机器学习正加速融入软件工程与 DevOps 规范,通过 MLOps 流程将模型快速推向生产环境已成核心关键。Kaggle 调查显示 75% 的受访者使用云服务,行业正从从零训练模型转向直接微调现有模型。同时 Transformer 架构已从 NLP 拓展至计算机视觉和语音等领域,成为通用的 ML 架构并大幅节省算力成本。

10月13日周三
  1. Hugging Face39

    使用遥感卫星图像与文本标注微调 CLIP

    开发者团队在 Hugging Face 社区活动中使用 RSICD 等遥感数据集微调了 OpenAI 的 CLIP 模型,实现了通过自然语言文本检索大型卫星图像库的功能。训练过程中结合了图像变换以及基于 Marian MT 的回译文本增强技术,显著减轻了过拟合问题。目前该微调模型与交互 Demo 已在 Hugging Face 开放下载和体验。

10月5日周二
  1. Hugging Face63

    如何使用 Gradio 在 Hugging Face Spaces 中展示机器学习项目

    Hugging Face 介绍了利用 Gradio 在 Hugging Face Spaces 中托管与展示机器学习 Demo 的完整流程,允许开发者通过几行代码调用 Inference API 快速上线交互界面。

    推荐理由:文章给出了通过 Gradio 在 Hugging Face Spaces 部署模型的具体步骤,开发者可直接参考代码模板搭建轻量交互应用。

  2. Hugging Face61

    使用 Streamlit 在 Hugging Face Spaces 托管模型与数据集教程

    Hugging Face 官方演示了如何利用 Streamlit 在 Hugging Face Spaces 上搭建并托管机器学习模型与数据集的交互应用。教程以复现 Write with Transformer 文本补全为例,展示了通过侧边栏控件调整生成参数以及结合 Datasets 流式加载和可视化库展示数据的方法。

    推荐理由:文章给出了结合 Streamlit 在 Spaces 上搭建模型交互界面与可视化数据集的完整代码,便于快速上手部署应用。

7月15日周四
  1. Hugging Face64

    基于互联网的深度学习:通过 DeDLOC 协作训练语言模型

    Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。

    推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。

7月13日周二
6月3日周四
  1. Hugging Face49

    少样本学习实践:GPT-Neo 与 Hugging Face Accelerated Inference API

    开发者可结合 EleutherAI 的 GPT-Neo 与 Hugging Face Accelerated Inference API,在推理阶段通过少量示例完成少样本学习。该托管 API 支持超 10,000 个模型,提供最高 100x 速度提升。针对参数规模比 GPT-3(175B)小约 60 倍的 GPT-Neo(2.7B),通常需要 3-4 个示例并调节温度等超参数以保证生成质量。

4月16日周五
  1. Hugging Face74

    Hugging Face 推出 PyTorch 分布式训练库 Accelerate

    Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。

    推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。

4月8日周四
3月31日周三
  1. Hugging Face50

    解析 BigBird 的块稀疏注意力机制

    BigBird 类 RoBERTa 模型已集成至 Hugging Face Transformers,通过块稀疏注意力将支持的序列长度拓展至 4096。该机制结合了滑动注意力、全局 token 与随机 token 来近似 BERT 的全注意力矩阵,在保留长距离依赖的同时大幅降低计算复杂度。模型已在长文档摘要和长上下文问答等多项长序列任务上达到 SOTA。

9月10日周四
  1. Hugging Face42

    用于更小更快语言模型的块稀疏矩阵

    Hugging Face 发布扩展库 pytorch_block_sparse,通过块稀疏矩阵乘法使神经网络更小、更快速。库中提供的 BlockSparseLinear 可直接替换 torch.nn.Linear,并支持动态修改现有模型直接进行常规训练。该扩展基于 NVIDIA CUTLASS 构建,在 75% 稀疏度下比对应稠密矩阵速度快约 2 倍,内存消耗减少 4 倍。