如何用 Sentence Transformers 开启你的首个机器学习项目
Hugging Face 分享了利用 Sentence Transformers 库开展首个机器学习项目的实操指南。该库可将句子、段落和图像转化为密集向量表示,并通过 util.cos_sim 等内置函数计算余弦相似度以支持语义搜索。开发者能通过加载 msmarco-MiniLM-L-6-v3 模型及 Hugging Face Hub 数据集,快速探索聚类、知识蒸馏和推荐系统等实际应用。
Hugging Face 分享了利用 Sentence Transformers 库开展首个机器学习项目的实操指南。该库可将句子、段落和图像转化为密集向量表示,并通过 util.cos_sim 等内置函数计算余弦相似度以支持语义搜索。开发者能通过加载 msmarco-MiniLM-L-6-v3 模型及 Hugging Face Hub 数据集,快速探索聚类、知识蒸馏和推荐系统等实际应用。
Hugging Face 推出基于 AutoTrain 的评测工具 Evaluation on the Hub,支持用户无需编写代码即可在 Hub 上的任意数据集上评测任意模型。该工具通过 Spaces 界面提供配置与排行榜展示,评测任务完成后会自动向对应模型的 Model Card 提交 Pull Request,将验证后的指标直接写入模型元数据中。
推荐理由:该功能将评测流水线与模型卡片元数据打通,读者可以借此实现免代码的一致性复现和榜单对比。
Hugging Face 介绍了通过 Accelerate 库集成 DeepSpeed ZeRO 优化大模型训练的方法,支持无需修改代码或仅做极少配置调整即可缓解显存不足问题。
Hugging Face 宣布完成由 Lux Capital 领投的 1 亿美元 C 轮融资,红杉资本、Coatue 等机构参投。该笔资金将用于继续投入开源研究与产品开发,推进聚集超 1,000 名研究人员的 BigScience 开源多语言大语言模型训练,并持续扩张团队规模。
推荐理由:原文披露了融资领投方及平台托管规模等数据,展示了开源机器学习社区在商业化与生态建设上的关键节点。
Hugging Face 发布免费深度强化学习课程第一单元,系统讲解从基础强化学习到深度强化学习的核心理论框架。内容涵盖马尔可夫决策过程、状态与动作空间、奖励折扣、探索与利用权衡,以及基于策略和基于价值的两大求解路径,并附带月球着陆器智能体实操训练与 Hub 模型上传教程。
用户可通过 AWS EC2 DL1 实例使用 Habana Gaudi 加速器微调 Transformer 模型,其训练性价比相比最新 GPU 实例提升最高 40%。借助 Optimum Habana 库微调 BERT 模型,仅耗时 2 分 12 秒即可完成 GLUE MRPC 任务评测。结合 AWS Spot 实例还能将每小时运行成本从 $13.11 降低 70% 至 $3.93。
Hugging Face 机器学习工程师 Lewis Tunstall 在《机器学习专家》访谈中,分享了他合著新书《Natural Language Processing with Transformers》的经历及模型优化实践。
Hugging Face 宣布将离线强化学习方法 Decision Transformer 集成至 transformers 库和 Hugging Face Hub。官方同步上线了 9 个面向 Gym 连续控制任务的预训练权重,并提供了自回归推理代码与 Colab 示例。用户可以通过设定目标回报直接调节策略输出,团队后续计划支持 Atari 环境的卷积 Decision Transformer。
Hugging Face 官方发布教程,展示如何结合 datasets 库的新图像特性、CLIP 与 FAISS 构建基于文本检索图像的应用。
Hugging Face 发布了使用 Transformers 与 Datasets 库微调视觉 Transformer 进行图像分类的实践教程。文章以 beans 豆叶病害数据集与 google/vit-base-patch16-224-in21k 预训练模型为例,演示了如何通过 ViTImageProcessor 动态处理图像特征,并配置 Trainer 完成训练与评估。
Hugging Face 宣布将 PyTorch 深度强化学习库 Stable-Baselines3 集成至 Hugging Face Hub。开发者只需安装 huggingface_hub 与 huggingface_sb3,即可在 Hub 上托管、分享自己的模型,或直接加载社区预训练好的强化学习智能体。
Hugging Face 宣布收购机器学习演示工具 Gradio,Gradio 团队将正式加入 Hugging Face。Gradio 始于 2019 年斯坦福大学的研究协作需求,支持通过简易界面分享文本、语音和视频等多模态模型 Demo,目前已有超过 30 万个演示应用基于其构建。团队加入后将继续推进 Gradio 的开源生态,让任何具备浏览器的人都能更便捷地访问和测试机器学习模型。
推荐理由:该收购将交互界面工具与模型托管生态整合,使开发者能够更低门槛地向非技术人员分享与测试模型。
Hugging Face 推出数据集测量工具 Data Measurements Tool(DMT),结合开源 Python 库与 Streamlit 无代码界面,帮助开发者在线分析与比较机器学习数据集。
开发者可通过 Intel 至强可扩展 CPU 集群结合 Intel Extension for PyTorch 与 oneCCL 库,加速 PyTorch 模型的分布式微调。
Hugging Face 发布了使用 Transformers 库微调 XLS-R(Wav2Vec2 跨语言后继版本)进行低资源语音识别(ASR)的完整教程。指南以 Common Voice 土耳其语数据集为例,详细介绍了音频重采样至 16kHz、构建字符词表、配置 Wav2Vec2CTCTokenizer 与 Wav2Vec2FeatureExtractor 的流程。
面对微软与 NVIDIA 推出 530B 参数 Megatron-Turing NLG 带来的高能耗与近 $100M 成本,行业无需盲目追逐超大模型。DistilBERT 减小 40% 体积且提速 60% 仍保留 97% 理解力,BigScience 的 T0 缩小 16x 却在多任务上超越 GPT-3。实际应用应优先选择预训练小模型、微调技术与高效云设施,以低成本实现高质量解决方案。
Hugging Face 社区基于 JAX/Flax 与 7 块 TPU v3-8,系统阐述了利用 10 亿句对训练通用句子嵌入(Sentence Embedding)模型的实践方案。
Hugging Face 指出机器学习正加速融入软件工程与 DevOps 规范,通过 MLOps 流程将模型快速推向生产环境已成核心关键。Kaggle 调查显示 75% 的受访者使用云服务,行业正从从零训练模型转向直接微调现有模型。同时 Transformer 架构已从 NLP 拓展至计算机视觉和语音等领域,成为通用的 ML 架构并大幅节省算力成本。
开发者团队在 Hugging Face 社区活动中使用 RSICD 等遥感数据集微调了 OpenAI 的 CLIP 模型,实现了通过自然语言文本检索大型卫星图像库的功能。训练过程中结合了图像变换以及基于 Marian MT 的回译文本增强技术,显著减轻了过拟合问题。目前该微调模型与交互 Demo 已在 Hugging Face 开放下载和体验。
Hugging Face 介绍了利用 Gradio 在 Hugging Face Spaces 中托管与展示机器学习 Demo 的完整流程,允许开发者通过几行代码调用 Inference API 快速上线交互界面。
推荐理由:文章给出了通过 Gradio 在 Hugging Face Spaces 部署模型的具体步骤,开发者可直接参考代码模板搭建轻量交互应用。
Hugging Face 官方演示了如何利用 Streamlit 在 Hugging Face Spaces 上搭建并托管机器学习模型与数据集的交互应用。教程以复现 Write with Transformer 文本补全为例,展示了通过侧边栏控件调整生成参数以及结合 Datasets 流式加载和可视化库展示数据的方法。
推荐理由:文章给出了结合 Streamlit 在 Spaces 上搭建模型交互界面与可视化数据集的完整代码,便于快速上手部署应用。
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
Hugging Face 宣布与 NLP 库 spaCy 达成集成,用户可将 spaCy 管道模型直接上传至 Hugging Face Hub 共享与使用。集成支持通过 spacy-huggingface-hub 库使用单条命令上传打包模型并自动生成模型卡片,同时推理 API 原生支持命名实体识别(NER)交互式控件与 HTTP 请求调用。
开发者可结合 EleutherAI 的 GPT-Neo 与 Hugging Face Accelerated Inference API,在推理阶段通过少量示例完成少样本学习。该托管 API 支持超 10,000 个模型,提供最高 100x 速度提升。针对参数规模比 GPT-3(175B)小约 60 倍的 GPT-Neo(2.7B),通常需要 3-4 个示例并调节温度等超参数以保证生成质量。
Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。
推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。
Hugging Face 联合 Amazon SageMaker 推出深度学习容器(DLC),可通过 SageMaker Python SDK 一行代码启动分布式训练。
BigBird 类 RoBERTa 模型已集成至 Hugging Face Transformers,通过块稀疏注意力将支持的序列长度拓展至 4096。该机制结合了滑动注意力、全局 token 与随机 token 来近似 BERT 的全注意力矩阵,在保留长距离依赖的同时大幅降低计算复杂度。模型已在长文档摘要和长上下文问答等多项长序列任务上达到 SOTA。
Hugging Face 发布扩展库 pytorch_block_sparse,通过块稀疏矩阵乘法使神经网络更小、更快速。库中提供的 BlockSparseLinear 可直接替换 torch.nn.Linear,并支持动态修改现有模型直接进行常规训练。该扩展基于 NVIDIA CUTLASS 构建,在 75% 稀疏度下比对应稠密矩阵速度快约 2 倍,内存消耗减少 4 倍。