跳到正文

#数据/训练

今日 0 条
10月2日周五
  1. Hugging Face45

    AutoSynthData:为企业级 AI 智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。

10月1日周四
  1. Hugging Face40

    Olmo-core 3 发布:面向大型 MoE 的开源可扩展训练基础设施

    开源大语言模型训练框架 Olmo-core 3 发布,采用重新设计的 MoE 训练系统,支持将模型扩展至万亿参数规模。新架构改用 DDP 并支持 MXFP8,在 8 块 NVIDIA B300 GPU 上测试 47B MoE 的吞吐提升约 2.7 倍至 52,000 tokens/s/GPU。在 512 块 B300 集群上,其 1.2 万亿参数模型最高吞吐达到 858 TFLOP/s/GPU。

9月29日周二
9月10日周四
9月3日周四
  1. Hugging Face67

    通过 100 步 GRPO 微调提升 350M 小模型的结构化输出能力

    Hugging Face 发布了一套低成本微调方案,使用 TRL 库和 GRPO 算法在 100 个训练步内显著提升小模型的结构化输出合规性。实验基于约 500 条样本对 LFM2.5-350M 进行 LoRA 微调,在 IFStruct 基准上的整体通过率从 22.6% 提升至 29.7%,其中 JSON 格式通过率从 18.0% 跃升至 31.9%。

    推荐理由:教程展示了如何在免费 GPU 上仅用百步强化学习微调端侧小模型,为端侧结构化提取任务提供了低成本可复现方案。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

7月21日周二
  1. Hugging Face64

    Hugging Face 开源手持机器人操作数据采集系统 Grabette

    Hugging Face 与合作方开源了低成本机器人操作数据采集系统 Grabette,用户无需整机机器人即可通过手持夹爪录制操作并生成训练数据集。Grabette 硬件物料成本约 490 欧元,配备双相机和 IMU 跟踪 6 自由度轨迹,并配套 120 欧元的机械臂执行端夹爪 Gripette。

    推荐理由:该系统开源了低成本手持采集硬件与浏览器端处理管线,大幅降低了具身智能真实世界训练数据的采集门槛与硬件成本。

7月16日周四
  1. Hugging Face35

    面对更新的模型,DharmaOCR 依然保持优势

    专精巴西葡萄牙语的 OCR 模型 DharmaOCR 凭借监督微调与 DPO 训练,在葡萄牙语基准评测中超越了较新的多语言模型。测试显示,DharmaOCR 取得 0.925 分,显著领先于 Mistral OCR4(0.798 分)与 Unlimited-OCR(0.7587 分)。该模型将全部参数专用于目标语言,并通过 DPO 抑制退化输出,有效提升了实际推理的稳定性。

7月6日周一
  1. Hugging Face59

    Photoroom 解读文生图模型 PRX 数据策略:大规模图像预训练与工程流水线

    Photoroom 公开了其 7B 文生图模型 PRX 的预训练数据策略与工程流水线,系统拆解了从数据格式、VLM 重打标到过滤与分布式流式传输的完整方案。团队采用 Lance 进行多维数据检索与交互探索、MDS 进行分布式流式读取,并选用 Qwen3-VL-8B 生成详尽长描述以显著改善图像生成质量。

6月25日周四
6月18日周四
  1. Hugging Face68

    Hugging Face 评测超越 LoRA 的微调方法

    Hugging Face 在统一基准下对比了 PEFT 库中的多种参数高效微调方法,结果显示 LoRA 并非所有场景下的最优选择。在 Llama-3.2-3B 数学推理任务中,带稳定秩初始化的 LoRA 准确率达到 53.2%,而 Lily 达到 54.9%,LoRA-FA 则更加节省显存;在图像生成测试中,OFT 在相似度得分与显存占用上均优于 LoRA。

    推荐理由:实测在统一硬件和基准下对比了多种高效微调技术,揭示了 LoRA 之外的帕累托最优解,为微调权衡提供了可迁移参考。

6月3日周三
  1. Hugging Face49

    超越聊天机器人:直接偏好优化(DPO)在非对话任务中的应用

    DharmaOCR 团队将 DPO 应用于结构化 OCR 任务,利用模型自身的失败输出构建拒绝偏好对,使测试模型族的文本退化率平均降低 59.4%。该训练阶段在所有测试模型中均有效降低了循环重复,峰值降幅达 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%),通过整段级别的偏好信号弥补了 SFT 无法显式惩罚退化循环的结构性缺陷。

5月27日周三
5月12日周二
  1. Hugging Face45

    AWS 基础模型训练与推理的核心构建块

    Hugging Face 解析了在 AWS 基础设施上运行基础模型全生命周期的分层架构,重点探讨其与开源软件生态的集成。硬件层涵盖配备 NVIDIA H100、H200 的 EC2 P5 实例,以及搭载 Blackwell B200 和 B300 的 P6 实例。系统结合高带宽网络与分布式存储,通过 Slurm、Kubernetes 及 PyTorch、JAX 协同应对扩展瓶颈。

5月7日周四
  1. Hugging Face46

    vLLM 从 V0 到 V1 迁移:强化学习中后端正确性优先于目标修正

    PipelineRL 在将推理引擎从 vLLM 0.8.5(V0)迁移至 0.18.1(V1)时,发现训练与推理不一致会导致 KL 散度与奖励等训练动态偏离。团队通过配置采样处理后的 logprobs、关闭前缀缓存与异步调度等运行时默认项、对齐在途权重更新路径以及在最终投影层使用 fp32 lm_head 四项修复,成功使 V1 训练轨迹与 V0 保持一致。

5月5日周二
4月29日周三
  1. Hugging Face65

    IBM 开源 Granite 4.1 系列大模型

    IBM 宣布以 Apache 2.0 协议开源 Granite 4.1 系列稠密大语言模型,包含 3B、8B 和 30B 三种尺寸,支持最高 512K 上下文。

    推荐理由:技术报告详述了五阶段退火预训练与四阶段强化学习流程,为端侧与企业级小参数稠密模型的构建提供了完整工程参考。

4月22日周三
4月16日周四
  1. Hugging Face50

    Ecom-RLVE:面向电商对话智能体的自适应可验证环境

    Ecom-RLVE 框架将可验证强化学习扩展至多轮电商对话,推出包含 8 个工具增强型环境的 EcomRLVE-GYM。该平台具备 12 轴自适应难度体系,完全通过算法代码计算任务收益与幻觉惩罚,无需人工或大模型裁判。团队基于 DAPO 算法训练 Qwen 3 8B 模型 300 步,验证了环境扩展能有效提升电商智能体的真实任务完成能力。

3月31日周二
  1. Hugging Face76

    Hugging Face 正式发布后训练库 TRL v1.0

    Hugging Face 正式发布大语言模型后训练库 TRL v1.0,标志着该项目从实验性研究代码库正式演进为具备语义化版本稳定承诺的基础设施。该版本现已实现超过 75 种后训练方法,并采用将核心稳定层与实验层明确隔离的设计,以在限制过度抽象的同时应对快速演进的算法生态。后续团队将重点推进异步 GRPO 训练、MoE 分布式扩展以及面向智能体可读的结构化训练诊断信号。

    推荐理由:文章详细阐述了在后训练范式快速迭代下,框架如何通过双层稳定性契约与限制抽象设计平衡维护成本与灵活性。

3月21日周六
  1. Hugging Face61

    如何在一天内微调领域专属 Embedding 模型

    NVIDIA 推出一套端到端 Embedding 模型微调方案,利用单张 80GB GPU 和 NeMo 工具链,可在一天内将通用模型适配到垂直领域。该流程使用 LLM 自动生成包含多跳推理的合成数据并挖掘难负例,微调 Llama-Nemotron-Embed-1B-v2 后可直接导出 TensorRT 引擎并接入 NIM 部署。

    推荐理由:教程提供了一套从无标注文档自动生成问答对到难负例挖掘的完整方案,有助于开发者低成本提升垂直领域检索召回率。

3月10日周二
  1. Hugging Face59

    Hugging Face 梳理 16 个开源 RL 库:大模型异步训练架构的经验与设计实践

    Hugging Face 调研了 verl、PipelineRL 等 16 个开源强化学习库,系统梳理了将推理生成与训练解耦的异步强化学习架构设计。文章从编排原语、Rollout 缓存、权重同步、陈旧性管理、局部 Rollout、LoRA 支持及分布式训练后端七个维度进行横向对比,指出 Ray 编排与 NCCL 广播为主流方案,而 MoE 专家并行与适配器同步正成为关键差异点。

3月9日周一
2月20日周五
2月6日周五
  1. Hugging Face60

    SyGra 2.0.0 推出可视化合成数据生成环境 SyGra Studio

    ServiceNow 旗下开源工具 SyGra 2.0.0 正式推出可视化环境 SyGra Studio,将合成数据生成转换为交互式画布操作。用户可直接在画布中配置模型与数据源、实时预览样本数据,并借助提示词变量提示、断点调试和 Monaco 编辑器完成端到端流编排。所有画布操作均会自动同步生成 SyGra 图配置与执行脚本,并支持实时监控运行延迟与 token 成本。

    推荐理由:文章展示了如何通过画布拖拽与实时预览替代传统配置,适合需要构建定制合成数据流水线的工程团队参考。

1月29日周四
1月20日周二
  1. Hugging Face44

    Differential Transformer V2

    Differential Transformer V2(DIFF V2)正式公开,通过将 Query 头翻倍但保持 KV 头数量不变,无需自定义注意力算子即可达到媲美标准 Transformer 的解码速度。该版本还移除了 V1 中的逐头 RMSNorm,解决了大规模预训练时的梯度暴增与数值不稳定问题,并可消除注意力黑洞,相关代码已在 GitHub 开源。

12月11日周四
  1. OpenAI60

    OpenAI 更新 GPT-5.2 系统卡片

    OpenAI 发布 GPT-5.2 的系统卡片更新,说明该系列模型的综合安全缓解方案与 GPT-5 及 GPT-5.1 基本一致。GPT-5.2 同样基于多样化数据集训练,数据来源包括公开互联网信息、第三方合作数据以及用户和研究人员提供或生成的内容。

    推荐理由:读者可以从中了解 GPT-5.2 沿用了前代模型的安全缓解方案,并查看其训练数据来源构成。

10月27日周一
  1. Hugging Face68

    Hugging Face 升级 datasets 流式加载功能,请求减少 100 倍且吞吐提速 2 倍

    Hugging Face 宣布全面优化 datasets 库与 huggingface_hub 的流式读取功能,在大规模训练场景下将启动请求减少 100 倍,数据文件解析速度提升 10 倍,流式吞吐量提升最高 2 倍。

    推荐理由:展示了如何通过持久化缓存与预取优化流式数据管道,帮助大规模模型训练摆脱本地磁盘空间与下载时延的瓶颈。

9月26日周五
9月16日周二
  1. Hugging Face60

    Hugging Face 发布 LeRobotDataset v3.0:支持大规模机器人数据集与原生流式读取

    Hugging Face 正式发布机器人数据集格式 LeRobotDataset v3.0,旨在解决机器人学习扩展至数百万回合(episode)时的文件系统瓶颈。

    推荐理由:新格式通过多片段打包合并与原生流式加载化解了百万级数据的单文件存储瓶颈,为具身智能训练提供了低门槛的大规模数据处理方案。

9月11日周四
  1. Hugging Face63

    Together AI 支持直接微调 Hugging Face Hub 上的任意大语言模型

    Together AI 与 Hugging Face 联合推出新功能,允许开发者直接利用 Together AI 基础设施微调 Hugging Face Hub 上的兼容大语言模型。用户只需选择官方模板模型作为硬件与配置基准,即可通过 API 对 100B 参数以内的 CausalLM 模型发起微调。该集成支持双向同步,不仅能拉取公开或私有仓库模型,还可在训练完成后自动将结果推回 Hub。

    推荐理由:原文给出了利用预设模板微调任意社区模型的操作机制,读者可以据此降低自建训练集群的运维门槛。

9月10日周三
  1. Hugging Face67

    Jupyter Agent:训练大语言模型在 Notebook 中进行推理

    Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。

    推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。

9月3日周三
8月21日周四
  1. Hugging Face66

    NVIDIA 发布 600 万条多语言推理数据集与 Nemotron Nano 2 9B 模型

    NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。

    推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。

8月8日周五
  1. Hugging Face49

    Accelerate ND-Parallel:高效多 GPU 训练指南

    Accelerate 联合 Axolotl 提供了在训练脚本中组合任意并行策略的 ND-Parallel 方案。开发者可通过 `ParallelismConfig` 类或 Axolotl 配置灵活设置数据并行(DP)、完全分片数据并行(FSDP)、张量并行(TP)与上下文并行(CP)的维度。该指南详细解析了多种并行策略的原理与组合方法,帮助降低跨设备通信开销并高效训练大模型。

  2. Hugging Face74

    Hugging Face 推出开源无代码数据集工具 AI Sheets

    Hugging Face 推出开源无代码数据集处理工具 AI Sheets,支持在类似电子表格的界面中直接调用 Hub 上的开源模型或本地模型来构建、清洗、转换和丰富数据集。

    推荐理由:该工具通过类似电子表格的交互降低了调用开源模型清洗与丰富数据集的门槛,编辑单元格即可直接转换为少样本提示词。

8月7日周四
  1. Hugging Face62

    Hugging Face TRL 全面支持视觉语言模型对齐训练

    Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。

    推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。