跳到正文

#数据/训练

今日 0 条
10月2日周五
  1. Hugging Face45

    AutoSynthData:为企业级 AI 智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。

10月1日周四
  1. Hugging Face40

    Olmo-core 3 发布:面向大型 MoE 的开源可扩展训练基础设施

    开源大语言模型训练框架 Olmo-core 3 发布,采用重新设计的 MoE 训练系统,支持将模型扩展至万亿参数规模。新架构改用 DDP 并支持 MXFP8,在 8 块 NVIDIA B300 GPU 上测试 47B MoE 的吞吐提升约 2.7 倍至 52,000 tokens/s/GPU。在 512 块 B300 集群上,其 1.2 万亿参数模型最高吞吐达到 858 TFLOP/s/GPU。

9月29日周二
9月10日周四
9月3日周四
  1. Hugging Face67

    通过 100 步 GRPO 微调提升 350M 小模型的结构化输出能力

    Hugging Face 发布了一套低成本微调方案,使用 TRL 库和 GRPO 算法在 100 个训练步内显著提升小模型的结构化输出合规性。实验基于约 500 条样本对 LFM2.5-350M 进行 LoRA 微调,在 IFStruct 基准上的整体通过率从 22.6% 提升至 29.7%,其中 JSON 格式通过率从 18.0% 跃升至 31.9%。

    推荐理由:教程展示了如何在免费 GPU 上仅用百步强化学习微调端侧小模型,为端侧结构化提取任务提供了低成本可复现方案。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

7月21日周二
  1. Hugging Face64

    Hugging Face 开源手持机器人操作数据采集系统 Grabette

    Hugging Face 与合作方开源了低成本机器人操作数据采集系统 Grabette,用户无需整机机器人即可通过手持夹爪录制操作并生成训练数据集。Grabette 硬件物料成本约 490 欧元,配备双相机和 IMU 跟踪 6 自由度轨迹,并配套 120 欧元的机械臂执行端夹爪 Gripette。

    推荐理由:该系统开源了低成本手持采集硬件与浏览器端处理管线,大幅降低了具身智能真实世界训练数据的采集门槛与硬件成本。

7月16日周四
  1. Hugging Face35

    面对更新的模型,DharmaOCR 依然保持优势

    专精巴西葡萄牙语的 OCR 模型 DharmaOCR 凭借监督微调与 DPO 训练,在葡萄牙语基准评测中超越了较新的多语言模型。测试显示,DharmaOCR 取得 0.925 分,显著领先于 Mistral OCR4(0.798 分)与 Unlimited-OCR(0.7587 分)。该模型将全部参数专用于目标语言,并通过 DPO 抑制退化输出,有效提升了实际推理的稳定性。

7月6日周一
  1. Hugging Face59

    Photoroom 解读文生图模型 PRX 数据策略:大规模图像预训练与工程流水线

    Photoroom 公开了其 7B 文生图模型 PRX 的预训练数据策略与工程流水线,系统拆解了从数据格式、VLM 重打标到过滤与分布式流式传输的完整方案。团队采用 Lance 进行多维数据检索与交互探索、MDS 进行分布式流式读取,并选用 Qwen3-VL-8B 生成详尽长描述以显著改善图像生成质量。

6月25日周四
5月27日周三
5月5日周二
4月22日周三
3月31日周二
  1. Hugging Face76

    Hugging Face 正式发布后训练库 TRL v1.0

    Hugging Face 正式发布大语言模型后训练库 TRL v1.0,标志着该项目从实验性研究代码库正式演进为具备语义化版本稳定承诺的基础设施。该版本现已实现超过 75 种后训练方法,并采用将核心稳定层与实验层明确隔离的设计,以在限制过度抽象的同时应对快速演进的算法生态。后续团队将重点推进异步 GRPO 训练、MoE 分布式扩展以及面向智能体可读的结构化训练诊断信号。

    推荐理由:文章详细阐述了在后训练范式快速迭代下,框架如何通过双层稳定性契约与限制抽象设计平衡维护成本与灵活性。

3月21日周六
  1. Hugging Face61

    如何在一天内微调领域专属 Embedding 模型

    NVIDIA 推出一套端到端 Embedding 模型微调方案,利用单张 80GB GPU 和 NeMo 工具链,可在一天内将通用模型适配到垂直领域。该流程使用 LLM 自动生成包含多跳推理的合成数据并挖掘难负例,微调 Llama-Nemotron-Embed-1B-v2 后可直接导出 TensorRT 引擎并接入 NIM 部署。

    推荐理由:教程提供了一套从无标注文档自动生成问答对到难负例挖掘的完整方案,有助于开发者低成本提升垂直领域检索召回率。

3月10日周二
  1. Hugging Face59

    Hugging Face 梳理 16 个开源 RL 库:大模型异步训练架构的经验与设计实践

    Hugging Face 调研了 verl、PipelineRL 等 16 个开源强化学习库,系统梳理了将推理生成与训练解耦的异步强化学习架构设计。文章从编排原语、Rollout 缓存、权重同步、陈旧性管理、局部 Rollout、LoRA 支持及分布式训练后端七个维度进行横向对比,指出 Ray 编排与 NCCL 广播为主流方案,而 MoE 专家并行与适配器同步正成为关键差异点。

3月9日周一
2月20日周五
2月6日周五
  1. Hugging Face60

    SyGra 2.0.0 推出可视化合成数据生成环境 SyGra Studio

    ServiceNow 旗下开源工具 SyGra 2.0.0 正式推出可视化环境 SyGra Studio,将合成数据生成转换为交互式画布操作。用户可直接在画布中配置模型与数据源、实时预览样本数据,并借助提示词变量提示、断点调试和 Monaco 编辑器完成端到端流编排。所有画布操作均会自动同步生成 SyGra 图配置与执行脚本,并支持实时监控运行延迟与 token 成本。

    推荐理由:文章展示了如何通过画布拖拽与实时预览替代传统配置,适合需要构建定制合成数据流水线的工程团队参考。

10月27日周一
  1. Hugging Face68

    Hugging Face 升级 datasets 流式加载功能,请求减少 100 倍且吞吐提速 2 倍

    Hugging Face 宣布全面优化 datasets 库与 huggingface_hub 的流式读取功能,在大规模训练场景下将启动请求减少 100 倍,数据文件解析速度提升 10 倍,流式吞吐量提升最高 2 倍。

    推荐理由:展示了如何通过持久化缓存与预取优化流式数据管道,帮助大规模模型训练摆脱本地磁盘空间与下载时延的瓶颈。

9月26日周五
9月16日周二
  1. Hugging Face60

    Hugging Face 发布 LeRobotDataset v3.0:支持大规模机器人数据集与原生流式读取

    Hugging Face 正式发布机器人数据集格式 LeRobotDataset v3.0,旨在解决机器人学习扩展至数百万回合(episode)时的文件系统瓶颈。

    推荐理由:新格式通过多片段打包合并与原生流式加载化解了百万级数据的单文件存储瓶颈,为具身智能训练提供了低门槛的大规模数据处理方案。

9月11日周四
  1. Hugging Face63

    Together AI 支持直接微调 Hugging Face Hub 上的任意大语言模型

    Together AI 与 Hugging Face 联合推出新功能,允许开发者直接利用 Together AI 基础设施微调 Hugging Face Hub 上的兼容大语言模型。用户只需选择官方模板模型作为硬件与配置基准,即可通过 API 对 100B 参数以内的 CausalLM 模型发起微调。该集成支持双向同步,不仅能拉取公开或私有仓库模型,还可在训练完成后自动将结果推回 Hub。

    推荐理由:原文给出了利用预设模板微调任意社区模型的操作机制,读者可以据此降低自建训练集群的运维门槛。

9月10日周三
  1. Hugging Face67

    Jupyter Agent:训练大语言模型在 Notebook 中进行推理

    Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。

    推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。

9月3日周三
8月8日周五
  1. Hugging Face49

    Accelerate ND-Parallel:高效多 GPU 训练指南

    Accelerate 联合 Axolotl 提供了在训练脚本中组合任意并行策略的 ND-Parallel 方案。开发者可通过 `ParallelismConfig` 类或 Axolotl 配置灵活设置数据并行(DP)、完全分片数据并行(FSDP)、张量并行(TP)与上下文并行(CP)的维度。该指南详细解析了多种并行策略的原理与组合方法,帮助降低跨设备通信开销并高效训练大模型。

  2. Hugging Face74

    Hugging Face 推出开源无代码数据集工具 AI Sheets

    Hugging Face 推出开源无代码数据集处理工具 AI Sheets,支持在类似电子表格的界面中直接调用 Hub 上的开源模型或本地模型来构建、清洗、转换和丰富数据集。

    推荐理由:该工具通过类似电子表格的交互降低了调用开源模型清洗与丰富数据集的门槛,编辑单元格即可直接转换为少样本提示词。

8月7日周四
  1. Hugging Face62

    Hugging Face TRL 全面支持视觉语言模型对齐训练

    Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。

    推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。

7月18日周五
  1. Hugging Face41

    Arc 虚拟细胞挑战赛入门指南

    Arc Institute 推出虚拟细胞挑战赛(Virtual Cell Challenge),要求参赛者训练模型预测利用 CRISPR 沉默基因对细胞产生的影响。挑战赛提供约 300k 单细胞 RNA 测序数据,其中训练集含 220k 细胞及约 38k 对照细胞。Arc 还提供了基线方案 STATE,由基于 Llama 架构的状态转换模型与类 BERT 的状态嵌入模型组成。

7月16日周三
  1. Hugging Face65

    Hugging Face 发布 Ettin 模型套件,提供同数据训练的成对 Encoder 与 Decoder

    Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。

    推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。

7月8日周二
  1. Hugging Face53

    Hugging Face 详解高效多模态数据管道构建

    Hugging Face 团队针对多模态模型训练中 GPU 空转及无效填充 token 占比过高的问题,分享了一套分阶段优化的多模态数据管道方案。该方案借鉴了 Eagle 2 的平衡背包算法,通过 PyTorch IterableDataset 与生产者-消费者多线程队列,同时对 token 长度与图像数量进行约束打包,在大幅减少填充开销的同时保证了各 GPU 间的工作负载均衡。

3月26日周三
  1. Hugging Face62

    使用 Sentence Transformers 训练与微调重排模型指南

    Hugging Face 发布使用 Sentence Transformers 训练和微调交叉编码器重排(Reranker)模型的实践指南,系统拆解了数据集准备、难负样本挖掘、损失函数选择与评估流程。

    推荐理由:文章系统拆解了重排模型微调中的难负样本挖掘与损失函数配置,展示了特定领域微调超越大尺寸通用模型的路径。

10月16日周三
  1. Hugging Face68

    Hugging Face 修复 Transformers 梯度累加计算偏差

    Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。

    推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。

9月23日周一
7月10日周三
  1. Hugging Face69

    Hugging Face TRL 支持视觉语言模型 DPO 微调实践指南

    Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。

    推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。

7月8日周一
  1. Hugging Face62

    Hugging Face 推出四项全新数据集搜索与过滤功能

    Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。

    推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。

4月4日周四
3月4日周一