跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 21–40 条 · 共 77 条
7月29日周二
7月16日周三
  1. Hugging Face65

    Hugging Face 发布 Ettin 模型套件,提供同数据训练的成对 Encoder 与 Decoder

    Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。

    推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。

7月8日周二
  1. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

3月26日周三
  1. Hugging Face62

    使用 Sentence Transformers 训练与微调重排模型指南

    Hugging Face 发布使用 Sentence Transformers 训练和微调交叉编码器重排(Reranker)模型的实践指南,系统拆解了数据集准备、难负样本挖掘、损失函数选择与评估流程。

    推荐理由:文章系统拆解了重排模型微调中的难负样本挖掘与损失函数配置,展示了特定领域微调超越大尺寸通用模型的路径。

2月12日周三
  1. Hugging Face67

    Hugging Face 推出视频生成数据集构建工具与处理流程

    Hugging Face 推出了一套用于视频生成模型微调的数据集构建工具与开源脚本,包含获取、过滤与打标的三阶段流水线。该流程通过 yt-dlp 和场景切分脚本提取片段,结合专用模型进行水印检测、美学评分、NSFW 过滤与运动评估,并支持使用 Florence-2 或 Qwen2VL 生成多粒度描述。

    推荐理由:给出了视频数据清洗的三阶段流水线与具体过滤阈值,读者可直接参考该方案构建视频生成模型的微调数据集。

2月11日周二
2月2日周日
  1. Hugging Face70

    Hugging Face 公布 Open-R1 首周进展:TRL 集成 GRPO 与合成数据工程方案

    Hugging Face 公布了旨在开源复现 DeepSeek-R1 训练管线与数据集的 Open-R1 项目首周进展,成功复现了各尺寸蒸馏模型在 MATH-500 上的评测表现。

    推荐理由:文章给出了利用 TRL 集成 GRPO 以及多节点流式请求生成合成数据的具体配置,为开源社区复现长链条推理模型提供了工程参考。

1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。

12月24日周二
  1. Hugging Face63

    在 PyTorch 中可视化与理解 GPU 显存占用

    Hugging Face 发布教程,详细讲解如何使用 PyTorch 内置快照工具可视化显存,并拆解训练周期中显存占用的具体阶段。文章推导了涵盖模型参数、优化器状态、梯度和激活值的显存估算公式,同时给出了基于参数量估算激活值的线性经验公式。

    推荐理由:教程拆解了模型参数、优化器状态与激活值在训练周期的显存占用,并给出了通用的显存估算经验公式。

12月16日周一
  1. Hugging Face67

    Hugging Face 推出无代码合成数据生成工具 Synthetic Data Generator

    Hugging Face 推出无代码应用 Synthetic Data Generator,支持用户通过自然语言提示词快速生成文本分类与对话微调数据集。该工具底层由 distilabel 和 Hugging Face 免费文本生成 API 驱动,生成结果可无缝导入 Argilla 评估并结合 AutoTrain 完成免代码模型训练。

    推荐理由:该工具通过无代码流程将自然语言描述直接转化为微调数据集并打通训练链路,为非技术人员构建专属模型提供了完整路径。

10月24日周四
10月16日周三
  1. Hugging Face68

    Hugging Face 修复 Transformers 梯度累加计算偏差

    Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。

    推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。

10月1日周二
9月23日周一
9月17日周二
  1. Hugging Face71

    Hugging Face 为数据集推出 SQL 控制台

    Hugging Face 在 Hub 数据集页面推出 SQL 控制台(SQL Console),支持用户直接在浏览器中对数据集执行 SQL 查询。该功能基于 DuckDB WASM 构建,无需后端服务器即可在浏览器本地运行,支持完整的 DuckDB 语法、结果导出为 Parquet 文件及链接分享。

    推荐理由:原文给出了在浏览器内使用 DuckDB WASM 交互式查询 Hugging Face 数据集的完整机制与内存限制,读者可以借此简化微调前的数据筛选流程。

8月20日周二
7月10日周三
  1. Hugging Face69

    Hugging Face TRL 支持视觉语言模型 DPO 微调实践指南

    Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。

    推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。

7月8日周一
  1. Hugging Face62

    Hugging Face 推出四项全新数据集搜索与过滤功能

    Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。

    推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。

6月27日周四
5月28日周二
  1. Hugging Face69

    Sentence Transformers 嵌入模型训练与微调完整指南

    Hugging Face 发布了使用 Sentence Transformers 训练与微调嵌入模型的实用指南,系统解析了基于 SentenceTransformerTrainer 的训练架构。文章涵盖数据集列顺序与损失函数匹配、评估器设置以及多数据集混合训练策略,支持对不同业务场景定制语义相似度计算。新版本底层重构后原生支持分布式训练和监控回调,并完全兼容旧版 fit 方法。

    推荐理由:教程系统梳理了新版嵌入模型的训练与评估流程,读者可以掌握多数据集混训和损失函数匹配的具体实现规范。