AutoSynthData:为企业级 AI 智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。
ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。
开源大语言模型训练框架 Olmo-core 3 发布,采用重新设计的 MoE 训练系统,支持将模型扩展至万亿参数规模。新架构改用 DDP 并支持 MXFP8,在 8 块 NVIDIA B300 GPU 上测试 47B MoE 的吞吐提升约 2.7 倍至 52,000 tokens/s/GPU。在 512 块 B300 集群上,其 1.2 万亿参数模型最高吞吐达到 858 TFLOP/s/GPU。
OpenAI 发布前沿 AI 训练安全用例的早期指南。该指南主要涵盖技术保障措施、运营规范以及对模型未对齐事件的调查流程。
Hugging Face 介绍了在 HF Jobs 上结合 TRL v1.14 与 vLLM 运行无需 NCCL 的 LoRA 异步 GRPO 方案,通过存储桶在训练与推理容器间同步适配器权重。
Hugging Face 发布了一套低成本微调方案,使用 TRL 库和 GRPO 算法在 100 个训练步内显著提升小模型的结构化输出合规性。实验基于约 500 条样本对 LFM2.5-350M 进行 LoRA 微调,在 IFStruct 基准上的整体通过率从 22.6% 提升至 29.7%,其中 JSON 格式通过率从 18.0% 跃升至 31.9%。
推荐理由:教程展示了如何在免费 GPU 上仅用百步强化学习微调端侧小模型,为端侧结构化提取任务提供了低成本可复现方案。
研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。
Hugging Face 与合作方开源了低成本机器人操作数据采集系统 Grabette,用户无需整机机器人即可通过手持夹爪录制操作并生成训练数据集。Grabette 硬件物料成本约 490 欧元,配备双相机和 IMU 跟踪 6 自由度轨迹,并配套 120 欧元的机械臂执行端夹爪 Gripette。
推荐理由:该系统开源了低成本手持采集硬件与浏览器端处理管线,大幅降低了具身智能真实世界训练数据的采集门槛与硬件成本。
专精巴西葡萄牙语的 OCR 模型 DharmaOCR 凭借监督微调与 DPO 训练,在葡萄牙语基准评测中超越了较新的多语言模型。测试显示,DharmaOCR 取得 0.925 分,显著领先于 Mistral OCR4(0.798 分)与 Unlimited-OCR(0.7587 分)。该模型将全部参数专用于目标语言,并通过 DPO 抑制退化输出,有效提升了实际推理的稳定性。
Photoroom 公开了其 7B 文生图模型 PRX 的预训练数据策略与工程流水线,系统拆解了从数据格式、VLM 重打标到过滤与分布式流式传输的完整方案。团队采用 Lance 进行多维数据检索与交互探索、MDS 进行分布式流式读取,并选用 Qwen3-VL-8B 生成详尽长描述以显著改善图像生成质量。
NVIDIA 推出开源库 NeMo AutoModel,基于 Hugging Face Transformers v5 引入专家并行、DeepEP 通信融合分发与 TransformerEngine 算子。
Hugging Face 在 TRL 中推出了基于 Hub Bucket 的增量权重同步功能,解决了异步强化学习训练中每步向推理引擎同步全量模型的带宽与暂停开销。
推荐理由:利用低学习率下大量权重数值不变的特性,通过对象存储同步增量权重,为跨集群异步强化学习训练提供了低成本落地方案。
OpenAI 推出新型超级计算机网络协议 MRC(Multipath Reliable Connection),并通过 OCP 发布。该协议旨在提升大规模 AI 训练集群的韧性与性能表现。
Google DeepMind 提出新型分布式训练架构 Decoupled DiLoCo,支持在跨地域低带宽网络环境下高容错训练大语言模型。该架构将算力拆分为独立的计算岛并采用异步数据流,在局部硬件故障时系统可自愈且不中断整体训练。
OpenMed 构建了端到端蛋白质 AI 流水线,仅耗费 $165 与 55 GPU-hours 训练出跨 25 个物种的 4 个生产级 mRNA 模型。评测中 312M 参数的 CodonRoBERTa-large-v2 取得 4.10 困惑度与 0.40 的 CAI 相关性,性能显著优于 ModernBERT。
Hugging Face 正式发布大语言模型后训练库 TRL v1.0,标志着该项目从实验性研究代码库正式演进为具备语义化版本稳定承诺的基础设施。该版本现已实现超过 75 种后训练方法,并采用将核心稳定层与实验层明确隔离的设计,以在限制过度抽象的同时应对快速演进的算法生态。后续团队将重点推进异步 GRPO 训练、MoE 分布式扩展以及面向智能体可读的结构化训练诊断信号。
推荐理由:文章详细阐述了在后训练范式快速迭代下,框架如何通过双层稳定性契约与限制抽象设计平衡维护成本与灵活性。
NVIDIA 推出一套端到端 Embedding 模型微调方案,利用单张 80GB GPU 和 NeMo 工具链,可在一天内将通用模型适配到垂直领域。该流程使用 LLM 自动生成包含多跳推理的合成数据并挖掘难负例,微调 Llama-Nemotron-Embed-1B-v2 后可直接导出 TensorRT 引擎并接入 NIM 部署。
推荐理由:教程提供了一套从无标注文档自动生成问答对到难负例挖掘的完整方案,有助于开发者低成本提升垂直领域检索召回率。
Hugging Face Hub 推出可变对象存储功能 Storage Buckets,为训练检查点、优化器状态和日志等无需版本控制的中间产物提供类 S3 存储。
推荐理由:针对训练检查点等中间产物缺乏轻量存储的痛点,该方案通过分块去重降低了传输和存储成本,适合需要打通训练与托管工作流的团队。
Hugging Face 调研了 verl、PipelineRL 等 16 个开源强化学习库,系统梳理了将推理生成与训练解耦的异步强化学习架构设计。文章从编排原语、Rollout 缓存、权重同步、陈旧性管理、局部 Rollout、LoRA 支持及分布式训练后端七个维度进行横向对比,指出 Ray 编排与 NCCL 广播为主流方案,而 MoE 专家并行与适配器同步正成为关键差异点。
Hugging Face 在 Accelerate、Transformers Trainer 及 TRL 库中全面集成了 Ulysses 序列并行方案,用于支持超长上下文大模型的高效训练。
Hugging Face 介绍了结合 Unsloth 与 Hugging Face Jobs 进行大语言模型微调的方法,支持通过 Claude Code 或 Codex 等编码智能体用提示词自动启动训练。
推荐理由:原文给出了结合编码智能体与 Unsloth 在云端自动微调小模型的完整流程,读者可据此降低轻量模型的端侧训练门槛。
ServiceNow 旗下开源工具 SyGra 2.0.0 正式推出可视化环境 SyGra Studio,将合成数据生成转换为交互式画布操作。用户可直接在画布中配置模型与数据源、实时预览样本数据,并借助提示词变量提示、断点调试和 Monaco 编辑器完成端到端流编排。所有画布操作均会自动同步生成 SyGra 图配置与执行脚本,并支持实时监控运行延迟与 token 成本。
推荐理由:文章展示了如何通过画布拖拽与实时预览替代传统配置,适合需要构建定制合成数据流水线的工程团队参考。
Hugging Face 宣布全面优化 datasets 库与 huggingface_hub 的流式读取功能,在大规模训练场景下将启动请求减少 100 倍,数据文件解析速度提升 10 倍,流式吞吐量提升最高 2 倍。
推荐理由:展示了如何通过持久化缓存与预取优化流式数据管道,帮助大规模模型训练摆脱本地磁盘空间与下载时延的瓶颈。
NVIDIA 开源面向日本主权 AI 开发的合成画像数据集 Nemotron-Personas-Japan,采用 CC BY 4.0 协议发布。该数据集基于日本官方人口与劳动统计数据生成,包含 100 万条记录、共 600 万个自然日语人物画像,覆盖 1500 多个职业分类与约 14 亿 token。
Hugging Face 正式发布机器人数据集格式 LeRobotDataset v3.0,旨在解决机器人学习扩展至数百万回合(episode)时的文件系统瓶颈。
推荐理由:新格式通过多片段打包合并与原生流式加载化解了百万级数据的单文件存储瓶颈,为具身智能训练提供了低门槛的大规模数据处理方案。
Together AI 与 Hugging Face 联合推出新功能,允许开发者直接利用 Together AI 基础设施微调 Hugging Face Hub 上的兼容大语言模型。用户只需选择官方模板模型作为硬件与配置基准,即可通过 API 对 100B 参数以内的 CausalLM 模型发起微调。该集成支持双向同步,不仅能拉取公开或私有仓库模型,还可在训练完成后自动将结果推回 Hub。
推荐理由:原文给出了利用预设模板微调任意社区模型的操作机制,读者可以据此降低自建训练集群的运维门槛。
Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。
推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。
SandboxAQ 在 Hugging Face 开源药物研发数据集 SAIR,包含 524 万个蛋白质-配体 3D 复合物结构及实验 IC₅₀ 活性数据,采用 CC BY 4.0 协议。
Accelerate 联合 Axolotl 提供了在训练脚本中组合任意并行策略的 ND-Parallel 方案。开发者可通过 `ParallelismConfig` 类或 Axolotl 配置灵活设置数据并行(DP)、完全分片数据并行(FSDP)、张量并行(TP)与上下文并行(CP)的维度。该指南详细解析了多种并行策略的原理与组合方法,帮助降低跨设备通信开销并高效训练大模型。
Hugging Face 推出开源无代码数据集处理工具 AI Sheets,支持在类似电子表格的界面中直接调用 Hub 上的开源模型或本地模型来构建、清洗、转换和丰富数据集。
推荐理由:该工具通过类似电子表格的交互降低了调用开源模型清洗与丰富数据集的门槛,编辑单元格即可直接转换为少样本提示词。
Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。
推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。
Arc Institute 推出虚拟细胞挑战赛(Virtual Cell Challenge),要求参赛者训练模型预测利用 CRISPR 沉默基因对细胞产生的影响。挑战赛提供约 300k 单细胞 RNA 测序数据,其中训练集含 220k 细胞及约 38k 对照细胞。Arc 还提供了基线方案 STATE,由基于 Llama 架构的状态转换模型与类 BERT 的状态嵌入模型组成。
Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。
推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。
Hugging Face 团队针对多模态模型训练中 GPU 空转及无效填充 token 占比过高的问题,分享了一套分阶段优化的多模态数据管道方案。该方案借鉴了 Eagle 2 的平衡背包算法,通过 PyTorch IterableDataset 与生产者-消费者多线程队列,同时对 token 长度与图像数量进行约束打包,在大幅减少填充开销的同时保证了各 GPU 间的工作负载均衡。
Hugging Face 发布使用 Sentence Transformers 训练和微调交叉编码器重排(Reranker)模型的实践指南,系统拆解了数据集准备、难负样本挖掘、损失函数选择与评估流程。
推荐理由:文章系统拆解了重排模型微调中的难负样本挖掘与损失函数配置,展示了特定领域微调超越大尺寸通用模型的路径。
Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。
推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。
Hugging Face 详细公开了开源视频数据集 FineVideo 的构建流程,涵盖从 1.9M 原始视频筛选至 43k 视频(约 3.4k 小时)的多阶段技术细节。
推荐理由:原文完整拆解了从海量视频筛选、多模型标注到结构化解析的管线,对构建多模态视频训练集有直接工程参考价值。
Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。
推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。
Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。
推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。
OpenAI 宣布改进微调 API 并扩展定制模型计划。新功能旨在帮助开发者对模型微调获得更多控制权,并提供了与 OpenAI 合作构建定制模型的新途径。
Hugging Face 与 Argilla 联合推出“Data is Better Together”计划,通过在 Hugging Face Spaces 上集成支持账号直接登录的 Argilla 实例,降低社区协同标注数据集的门槛。