跳到正文

#数据/训练

今日 0 条
8月7日周四
  1. Hugging Face62

    Hugging Face TRL 全面支持视觉语言模型对齐训练

    Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。

    推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。

7月29日周二
7月18日周五
  1. Hugging Face41

    Arc 虚拟细胞挑战赛入门指南

    Arc Institute 推出虚拟细胞挑战赛(Virtual Cell Challenge),要求参赛者训练模型预测利用 CRISPR 沉默基因对细胞产生的影响。挑战赛提供约 300k 单细胞 RNA 测序数据,其中训练集含 220k 细胞及约 38k 对照细胞。Arc 还提供了基线方案 STATE,由基于 Llama 架构的状态转换模型与类 BERT 的状态嵌入模型组成。

7月16日周三
  1. Hugging Face65

    Hugging Face 发布 Ettin 模型套件,提供同数据训练的成对 Encoder 与 Decoder

    Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。

    推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。

7月8日周二
  1. Hugging Face53

    Hugging Face 详解高效多模态数据管道构建

    Hugging Face 团队针对多模态模型训练中 GPU 空转及无效填充 token 占比过高的问题,分享了一套分阶段优化的多模态数据管道方案。该方案借鉴了 Eagle 2 的平衡背包算法,通过 PyTorch IterableDataset 与生产者-消费者多线程队列,同时对 token 长度与图像数量进行约束打包,在大幅减少填充开销的同时保证了各 GPU 间的工作负载均衡。

  2. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

3月26日周三
  1. Hugging Face62

    使用 Sentence Transformers 训练与微调重排模型指南

    Hugging Face 发布使用 Sentence Transformers 训练和微调交叉编码器重排(Reranker)模型的实践指南,系统拆解了数据集准备、难负样本挖掘、损失函数选择与评估流程。

    推荐理由:文章系统拆解了重排模型微调中的难负样本挖掘与损失函数配置,展示了特定领域微调超越大尺寸通用模型的路径。

2月27日周四
  1. Hugging Face43

    Hugging Face 与 IISc 达成合作,推动印度多语言模型构建

    印度科学理工学院(IISc)及 ARTPARK 与 Hugging Face 达成合作,向全球开发者开放多模态多语言开源数据集 Vaani。该数据集已覆盖 54 种语言,第一阶段涉及 80 个地区的数据已开源,包含 790 小时转录音频子集。项目由 IISc 与 Google 等发起,最终目标采集全印 773 个地区的 15 万小时语音,目前正向另外 100 个地区扩展。

2月12日周三
  1. Hugging Face67

    Hugging Face 推出视频生成数据集构建工具与处理流程

    Hugging Face 推出了一套用于视频生成模型微调的数据集构建工具与开源脚本,包含获取、过滤与打标的三阶段流水线。该流程通过 yt-dlp 和场景切分脚本提取片段,结合专用模型进行水印检测、美学评分、NSFW 过滤与运动评估,并支持使用 Florence-2 或 Qwen2VL 生成多粒度描述。

    推荐理由:给出了视频数据清洗的三阶段流水线与具体过滤阈值,读者可直接参考该方案构建视频生成模型的微调数据集。

1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。

11月4日周一
  1. Hugging Face57

    Argilla 2.4 发布:支持在 UI 中无代码构建 Hub 微调与评测数据集

    开源数据标注工具 Argilla 发布 2.4 版本,新增无需编写代码即可在 UI 中直接从 Hugging Face Hub 导入公开数据集的功能。该功能支持用户自定义标注问题与字段,便于构建模型微调与评测数据集并收集人类反馈。工具推荐部署在 Hugging Face Spaces 并默认启用 HF OAuth 进行协作标注,同时保留了 Python SDK 导入方式。

10月16日周三
  1. Hugging Face68

    Hugging Face 修复 Transformers 梯度累加计算偏差

    Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。

    推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。

10月9日周三
9月23日周一
7月10日周三
  1. Hugging Face69

    Hugging Face TRL 支持视觉语言模型 DPO 微调实践指南

    Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。

    推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。

7月8日周一
  1. Hugging Face62

    Hugging Face 推出四项全新数据集搜索与过滤功能

    Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。

    推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。

6月25日周二
  1. Hugging Face30

    XLSCOUT 在 Hugging Face 专家支持下推出专利领域嵌入模型 ParaEmbed 2.0

    XLSCOUT 联合 Hugging Face 专家支持项目推出面向专利与知识产权的专有嵌入模型 ParaEmbed 2.0,相较于 2023 年 10 月发布的 ParaEmbed 1.0 准确率提升 23%。该模型基于专家整理的多领域专利数据微调,并通过 Hugging Face 的 TEI 部署将生产推理吞吐量提升至约每秒 2700 个嵌入向量,全面支持查新、专利无效检索及自动化撰写等工具。

6月24日周一
  1. Hugging Face36

    Hugging Face 探讨构建更优 AI:数据质量的重要性

    Hugging Face 发布伦理与社会简报指出,构建更优 AI 系统必须优先保障数据质量,强调优质数据不仅取决于规模与准确度,更在于契合具体任务需求。评估数据质量的核心维度涵盖相关性、全面性、时效性以及偏见消除,可有效防止模型过拟合并降低计算资源消耗。实现高质量数据需贯穿去重、内容过滤、领域专家与人工反馈,并建立清晰的数据治理框架。

6月20日周四
6月12日周三
5月28日周二
  1. Hugging Face69

    Sentence Transformers 嵌入模型训练与微调完整指南

    Hugging Face 发布了使用 Sentence Transformers 训练与微调嵌入模型的实用指南,系统解析了基于 SentenceTransformerTrainer 的训练架构。文章涵盖数据集列顺序与损失函数匹配、评估器设置以及多数据集混合训练策略,支持对不同业务场景定制语义相似度计算。新版本底层重构后原生支持分布式训练和监控回调,并完全兼容旧版 fit 方法。

    推荐理由:教程系统梳理了新版嵌入模型的训练与评估流程,读者可以掌握多数据集混训和损失函数匹配的具体实现规范。

4月4日周四
3月20日周三
  1. Hugging Face73

    Hugging Face 详解 Cosmopedia:如何构建用于大模型预训练的大规模合成数据集

    Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。

    推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。

  2. Hugging Face68

    GaLore 如何助力消费级硬件训练大语言模型

    Hugging Face 介绍了内存高效训练方案 GaLore 的技术原理及其在 Transformers 库中的集成实践。GaLore 利用梯度的内在低秩特性,在优化器处理前将梯度投影到低维子空间,可减少超过 82.5% 的优化器状态显存占用,配合 8-bit 优化器和按层更新机制后,支持在 NVIDIA RTX 4090 等消费级 GPU 上训练 7B 参数模型。

    推荐理由:文章给出了 GaLore 结合 8-bit 优化器在消费级显卡上训练大模型的机制与 Transformers 代码实现。

3月4日周一
2月23日周五
  1. Hugging Face66

    在 Hugging Face 中微调 Gemma 模型的实践指南

    Hugging Face 官方发布了使用 Transformers 和 PEFT 库对 Google Gemma 模型进行高效微调的操作指南。教程演示了如何结合 bitsandbytes 的 QLoRA 4-bit 量化加载 gemma-2b,并使用 TRL 的 SFTTrainer 训练名言格式生成。

    推荐理由:原文提供了可直接复用的代码与配置,读者可以据此在消费级 GPU 或 TPU 上以低显存成本微调 Gemma 模型。

2月16日周五
  1. Hugging Face75

    Hugging Face 实践指南:如何用开源合成数据低成本训练专用小模型

    Hugging Face 发布实践方案,演示如何使用开源大模型 Mixtral-8x7B 生成合成标注数据,并通过 AutoTrain 蒸馏微调出约 0.13B 参数的专用 RoBERTa 模型。

    推荐理由:文章给出了用开源大模型生成合成数据并训练专用小模型的完整方案,展示了高并发文本任务大幅压降推理成本的可行路径。

1月19日周五
1月18日周四
1月10日周三
  1. Hugging Face80

    Hugging Face 介绍 Unsloth 与 TRL 集成:大语言模型微调提速可达 2 倍且节省显存

    Hugging Face 介绍了轻量级微调库 Unsloth 及其与 TRL 工具集的无缝集成,在保证精度零损失的前提下可将大语言模型微调提速最高 2.7 倍并减少最多 74% 显存占用。

    推荐理由:文中展示了通过重写反向传播与 Triton 内核加速微调的具体实现,为在有限显存下微调开源模型提供了现成的集成方案。

1月2日周二
11月7日周二
  1. Hugging Face41

    Prodigy-HF 发布:直接集成 Hugging Face

    Explosion 推出 Prodigy-HF 插件,为数据标注工具 Prodigy 提供直接集成 Hugging Face 生态的代码配方。用户可通过单条命令直接微调 Hugging Face Hub 上的 Transformer 模型,支持 NER 与文本分类任务,并能利用模型预测辅助后续标注。此外,该插件还支持将标注好的数据集直接上传发布至 Hugging Face Hub。

9月28日周四
8月8日周二
6月29日周四
6月12日周一
  1. Hugging Face36

    面向美术馆、图书馆、档案馆与博物馆(GLAM)的 Hugging Face Hub 指南

    Hugging Face 面向美术馆、图书馆、档案馆和博物馆(GLAM)提供 Hub 资源应用与贡献方案。平台已托管超 190,000 个机器学习模型、33,000 个数据集及 100,000 个演示应用。机构可通过任务与语言筛选现成模型、利用 Spaces 托管 Gradio 或 Streamlit 应用,并支持在浏览器免代码上传 CSV 数据集。

6月7日周三
  1. Hugging Face72

    Hugging Face Hub 集成 DuckDB 支持对超 5 万个数据集执行 SQL 查询

    Hugging Face Hub 宣布集成 DuckDB,支持用户直接使用 SQL 查询 Hub 上存储的超过 5 万个公开数据集。Dataset Viewer 会自动将公开数据集转换为 Parquet 格式并切分为 500MB 分片,开发者通过 /parquet 接口获取文件 URL 后,利用 DuckDB 的 httpfs 扩展即可直接对远程文件执行复杂分析查询。

    推荐理由:HF Hub 将公开数据集自动转为 Parquet 分片,开发者可直接借助 DuckDB 远程运行 SQL 分析而无需完整下载数据。

4月27日周四
  1. Hugging Face55

    基于 TensorFlow 与 TPU 使用 Transformers 训练语言模型教程

    Hugging Face 发布了结合 TensorFlow 与 TPU 从零端到端训练语言模型的实践指南。教程利用 XLA 和 TPUStrategy 解决了以往的兼容痛点,涵盖训练分词器、分片序列化 TFRecord 上传至 GCS 以及通过数据并行完成模型拟合的全流程。该方案展示了在 GPU 算力短缺背景下,将现有训练管线迁移至 TPU Pod 的低改造成本路径。