跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 41–60 条 · 共 77 条
4月29日周一
  1. Hugging Face68

    StarCoder2-15B-Instruct 发布:基于全透明自我对齐管线的开源代码大模型

    Hugging Face 等联合发布 StarCoder2-15B-Instruct-v0.1,采用完全透明且宽松许可的自我对齐管线训练代码能力。该流程让模型自身基于开源种子代码提取概念、生成指令并通过执行沙箱自验证筛选数据,无需人工标注或闭源模型蒸馏。模型在 HumanEval 取得 72.6 分并超越 CodeLlama-70B-Instruct,训练管线与数据集已全部开源。

    推荐理由:该方案通过自身生成与沙盒执行验证构建指令微调数据,为摆脱闭源模型蒸馏依赖提供了可复现的训练路径。

3月20日周三
  1. Hugging Face73

    Hugging Face 详解 Cosmopedia:如何构建用于大模型预训练的大规模合成数据集

    Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。

    推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。

  2. Hugging Face68

    GaLore 如何助力消费级硬件训练大语言模型

    Hugging Face 介绍了内存高效训练方案 GaLore 的技术原理及其在 Transformers 库中的集成实践。GaLore 利用梯度的内在低秩特性,在优化器处理前将梯度投影到低维子空间,可减少超过 82.5% 的优化器状态显存占用,配合 8-bit 优化器和按层更新机制后,支持在 NVIDIA RTX 4090 等消费级 GPU 上训练 7B 参数模型。

    推荐理由:文章给出了 GaLore 结合 8-bit 优化器在消费级显卡上训练大模型的机制与 Transformers 代码实现。

3月15日周五
  1. Hugging Face63

    Hugging Face 开源 WebSight 数据集:包含 200 万对网页截图与 HTML 代码

    Hugging Face 开源了多模态合成数据集 WebSight-v0.2,包含 200 万对网页截图与 HTML 代码,旨在训练模型将网页设计截图直接转换为可用代码。该版本引入了真实图片并改用 Tailwind CSS,同时展示了据此微调的视觉语言模型 Sightseer 的前端还原能力。目前数据集、技术报告与 Colab 演示均已对外开放。

    推荐理由:通过构建结合真实图片与 Tailwind CSS 的两百万对合成数据,为设计稿转网页前端代码提供了标准化的多模态训练基准。

2月23日周五
  1. Hugging Face66

    在 Hugging Face 中微调 Gemma 模型的实践指南

    Hugging Face 官方发布了使用 Transformers 和 PEFT 库对 Google Gemma 模型进行高效微调的操作指南。教程演示了如何结合 bitsandbytes 的 QLoRA 4-bit 量化加载 gemma-2b,并使用 TRL 的 SFTTrainer 训练名言格式生成。

    推荐理由:原文提供了可直接复用的代码与配置,读者可以据此在消费级 GPU 或 TPU 上以低显存成本微调 Gemma 模型。

2月16日周五
  1. Hugging Face75

    Hugging Face 实践指南:如何用开源合成数据低成本训练专用小模型

    Hugging Face 发布实践方案,演示如何使用开源大模型 Mixtral-8x7B 生成合成标注数据,并通过 AutoTrain 蒸馏微调出约 0.13B 参数的专用 RoBERTa 模型。

    推荐理由:文章给出了用开源大模型生成合成数据并训练专用小模型的完整方案,展示了高并发文本任务大幅压降推理成本的可行路径。

1月10日周三
  1. Hugging Face80

    Hugging Face 介绍 Unsloth 与 TRL 集成:大语言模型微调提速可达 2 倍且节省显存

    Hugging Face 介绍了轻量级微调库 Unsloth 及其与 TRL 工具集的无缝集成,在保证精度零损失的前提下可将大语言模型微调提速最高 2.7 倍并减少最多 74% 显存占用。

    推荐理由:文中展示了通过重写反向传播与 Triton 内核加速微调的具体实现,为在有限显存下微调开源模型提供了现成的集成方案。

1月2日周二
10月24日周二
  1. Hugging Face62

    Hugging Face 详解基于 PPO 的 RLHF 工程实现细节

    Hugging Face 研究团队复现了 OpenAI 2019 年的 RLHF 代码库,并发布了开源复现代码与工程实现细节清单。文章拆解了奖励模型归一化、拒绝采样、每步 KL 惩罚等机制,重点发现 PyTorch 与 TensorFlow 在 Adam 优化器公式实现上的差异会导致 PyTorch 在训练初期梯度更新过于激进,并在较大模型中引发严重的 KL 散度震荡。

    推荐理由:文章拆解了复现早期RLHF算法的核心工程细节,指出了PyTorch与TensorFlow优化器差异对训练稳定性的影响。

9月29日周五
  1. Hugging Face61

    如何通过 TRL 使用 DDPO 微调 Stable Diffusion 模型

    Hugging Face 在 TRL 库中集成了 DDPOTrainer,支持通过去噪扩散策略优化(DDPO)使用强化学习微调 Stable Diffusion 模型。该方法将去噪过程建模为多步马尔可夫决策过程,配合美学评分奖励模型提升生成质量。训练要求至少单张 A100 GPU,官方提供了配套脚本与 LoRA 超参数调优建议。

    推荐理由:文章给出了用强化学习对齐图像扩散模型的工程配置与调优经验,为改善生成画质提供了现成范式。

8月22日周二
8月8日周二
6月12日周一
  1. Hugging Face69

    Hugging Face 实测基模型能否像人类一样评估标注数据

    Hugging Face 团队联合 Scale AI 展开实测,对比了 GPT-4 与专业人类标注员在评估开源模型表现时的差异。测试显示 GPT-4 虽能维持模型间的大致相对排名,但存在显著的位置偏置、长度偏好,并倾向于给蒸馏自 OpenAI 风格的模型打高分,甚至将人类示范排在开源模型之后。两者打分相关性在头脑风暴等高熵生成任务中可达 0.60,但在代码等低熵任务中降至 0.33。

    推荐理由:该研究对比了 GPT-4 与专业人类标注员在模型评估上的打分差异,揭示出大模型评测存在位置偏好和长度偏置。

6月7日周三
  1. Hugging Face72

    Hugging Face Hub 集成 DuckDB 支持对超 5 万个数据集执行 SQL 查询

    Hugging Face Hub 宣布集成 DuckDB,支持用户直接使用 SQL 查询 Hub 上存储的超过 5 万个公开数据集。Dataset Viewer 会自动将公开数据集转换为 Parquet 格式并切分为 500MB 分片,开发者通过 /parquet 接口获取文件 URL 后,利用 DuckDB 的 httpfs 扩展即可直接对远程文件执行复杂分析查询。

    推荐理由:HF Hub 将公开数据集自动转为 Parquet 分片,开发者可直接借助 DuckDB 远程运行 SQL 分析而无需完整下载数据。

5月24日周三
5月16日周二
  1. Hugging Face68

    BigCode 背后的大规模近似去重实践

    Hugging Face 博客系统讲解了 BigScience 与 BigCode 在大语言模型和代码模型训练数据上使用的 MinHash + LSH 文档级近似去重流程,涵盖 shingling 分词、指纹计算、LSH 分桶以及用 union find 或 Spark 做连通分量聚类的实现细节。

    推荐理由:原文完整走通 MinHash 与 LSH 的工程细节并给出规模化实测配置,可直接迁移到自有数据集的去重流程。

4月25日周二
4月5日周三
  1. Hugging Face81

    StackLLaMA:使用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。

    推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。

3月24日周五
3月6日周一