AutoSynthData:为企业级 AI 智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。
ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。
OpenAI 发布前沿 AI 训练安全用例的早期指南。该指南主要涵盖技术保障措施、运营规范以及对模型未对齐事件的调查流程。
研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。
Google DeepMind 提出新型分布式训练架构 Decoupled DiLoCo,支持在跨地域低带宽网络环境下高容错训练大语言模型。该架构将算力拆分为独立的计算岛并采用异步数据流,在局部硬件故障时系统可自愈且不中断整体训练。
Ecom-RLVE 框架将可验证强化学习扩展至多轮电商对话,推出包含 8 个工具增强型环境的 EcomRLVE-GYM。该平台具备 12 轴自适应难度体系,完全通过算法代码计算任务收益与幻觉惩罚,无需人工或大模型裁判。团队基于 DAPO 算法训练 Qwen 3 8B 模型 300 步,验证了环境扩展能有效提升电商智能体的真实任务完成能力。
Differential Transformer V2(DIFF V2)正式公开,通过将 Query 头翻倍但保持 KV 头数量不变,无需自定义注意力算子即可达到媲美标准 Transformer 的解码速度。该版本还移除了 V1 中的逐头 RMSNorm,解决了大规模预训练时的梯度暴增与数值不稳定问题,并可消除注意力黑洞,相关代码已在 GitHub 开源。
NVIDIA 开源面向日本主权 AI 开发的合成画像数据集 Nemotron-Personas-Japan,采用 CC BY 4.0 协议发布。该数据集基于日本官方人口与劳动统计数据生成,包含 100 万条记录、共 600 万个自然日语人物画像,覆盖 1500 多个职业分类与约 14 亿 token。
SandboxAQ 在 Hugging Face 开源药物研发数据集 SAIR,包含 524 万个蛋白质-配体 3D 复合物结构及实验 IC₅₀ 活性数据,采用 CC BY 4.0 协议。
NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。
推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。
OpenAI 在 GPT-5 中引入了全新的 safe-completions 方法,通过以输出为中心的安全训练来处理双重用途提示词(dual-use prompts)。该方法摆脱了以往一刀切式的硬性拒绝(hard refusals),在提供更细致回复的同时,兼顾并提升了 AI 回答应答的安全性与实用性。
Hugging Face 详细公开了开源视频数据集 FineVideo 的构建流程,涵盖从 1.9M 原始视频筛选至 43k 视频(约 3.4k 小时)的多阶段技术细节。
推荐理由:原文完整拆解了从海量视频筛选、多模型标注到结构化解析的管线,对构建多模态视频训练集有直接工程参考价值。
一致性模型(Consistency Models)是一类新兴的生成模型。该模型无需进行对抗训练,即可在单步之内采样生成高质量数据。
Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。
推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。
OpenAI 最新研究发现,通过在小规模精选数据集上进行微调,能够针对特定的行为价值观改善大语言模型的行为表现。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 推进了基于能量的模型(EBMs)稳定且可扩展的训练,实现了优于现有模型的样本质量与泛化能力。EBMs 在生成阶段通过消耗更多算力持续优化输出结果,在低温条件下能够生成媲美 GANs 的样本,同时具备基于似然模型的模式覆盖保证。