AutoSynthData:为企业级 AI 智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。
ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。
ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。
OpenAI 发布前沿 AI 训练安全用例的早期指南。该指南主要涵盖技术保障措施、运营规范以及对模型未对齐事件的调查流程。
OpenAI 最新经济研究展示了员工如何突破传统岗位界限应用 AI。该研究指出了哪些新型工作活动正在演变为日常业务中的固定组成部分,揭示了 AI 对日常工作模式的重构。
OpenAI 分享了针对纳维-斯托克斯千禧年大奖难题的 AI 生成解答。该成果包含完整的技术说明报告,以及基于 Lean 交互式定理证明器给出的形式化证明。
推荐理由:OpenAI 公开了借助 AI 尝试解决千禧年数学难题的研究,展示了形式化验证在复杂前沿科学探索中的具体落地方式。
AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。
研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。
OpenAI 发布了在数学与理论计算机科学领域长期未解难题上的十项新研究成果。相关进展涵盖了几何学、密码学以及计算复杂性理论等多个研究方向。
OpenAI 最新研究显示,AI 正在拓展员工的工作范畴。ChatGPT 用户正开始跨职能承担多样化任务,进而重塑传统岗位的职责与工作边界。
IBM Research 推出企业级 Java 跨框架迁移评测基准 ScarfBench,用于评估 AI Agent 在 Spring、Jakarta EE 与 Quarkus 之间迁移后是否能成功构建、部署并保持原有行为。
DiScoFormer 采用 Transformer 架构,无需重新训练即可通过单次前向传播同时估计分布的密度与分值。在 100 维测试中,它相比经调优的核密度估计(KDE)将分值误差降低约 6.5 倍、密度误差降低超过 37 倍。模型还支持在推理阶段利用二者的一致性损失实现即时自适应,可良好泛化至未见过的多模态及非高斯分布。
OpenAI 最新研究论文展示了 AI 智能体对工作方式的改变。研究指出,AI 智能体能够执行耗时更长、更复杂的任务,并在多种工作岗位与角色中提升生产力。
ServiceNow 等机构提出 MosaicLeaks 基准与 PA-DR 强化学习方法,评估并解决深度研究智能体在多跳检索中通过外部搜索查询累积泄露本地私有信息的“拼图效应”。
研究人员使用 OpenAI 推理模型辅助罕见病诊断,在先前未确诊的疑难病例中成功识别出 18 例新诊断。该研究展示了 AI 模型在协助医生排查儿童罕见遗传疾病方面的实际应用效果。
OpenAI 提出部署模拟(Deployment Simulation)方法,利用真实对话数据在模型发布前预测其行为表现。该方法旨在提前评估潜在风险,提高模型安全性和评估准确率。
Google DeepMind 公布了在塞拉利昂开展的预注册对照试验结果,使用基于 LearnLM 定制的 Guided Learning 辅助教学让学生的数学成绩提升 0.258 个标准差,相当于在 8 周内取得了 1.2 至 1.7 年的学习进度。
推荐理由:该研究通过随机对照试验量化了苏格拉底式 AI 辅导对学生数学成绩的促进作用,为教育场景下的模型落地提供了实证数据与操作手册。
生物学团队借助 Google DeepMind 的 Co-Scientist 系统,加速逆转细胞衰老相关的基因线索筛选与海量实验数据分析。Co-Scientist 检索数万篇文献后提出了 20 多个候选基因因子,其中部分假说已获实验室验证并成功促使细胞恢复更年轻状态。此外,该系统将原本需要研究人员耗时多达 6 个月的筛选数据文献关联分析缩短至数天。
剑桥大学 Clare Bryant 教授正利用 AI 系统 Co-Scientist 寻找病原体跨物种传播引发严重疾病的分子开关。通过分析研究提案与未公开实验数据,Co-Scientist 帮助团队将假说靶点从候选蛋白质精准缩小至特定氨基酸。这一原本通常需要 2 至 3 年实验的氨基酸筛选过程,借助该工具预计缩短至 6 个月完成。
爱丁堡大学团队利用 Google DeepMind 的 Co-Scientist 系统分析文献并生成新假说,加速了代谢功能障碍相关脂肪性肝炎(MASH)的机制探索与候选组合疗法筛选。
斯坦福大学医学院团队在《Advanced Science》发表研究,利用 Google DeepMind 的 Co-Scientist 系统从现有药物文献中筛选治疗肝纤维化的老药新用候选药。
推荐理由:该研究给出了 AI 系统筛选老药新用并在活体人类细胞中实验验证的对比数据,为科研智能体在生物医药发现中的实际表现提供了直接参考。
Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。
推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。
OpenAI 提出一项全新分析框架,涵盖 921 种职业和 1.48 亿个美国就业岗位。该框架旨在评估劳动力受 AI 的影响,识别哪些角色正面临自动化风险、业务重组、需求增长或极小的 AI 冲击。
Google DeepMind 提出新型分布式训练架构 Decoupled DiLoCo,支持在跨地域低带宽网络环境下高容错训练大语言模型。该架构将算力拆分为独立的计算岛并采用异步数据流,在局部硬件故障时系统可自愈且不中断整体训练。
Ecom-RLVE 框架将可验证强化学习扩展至多轮电商对话,推出包含 8 个工具增强型环境的 EcomRLVE-GYM。该平台具备 12 轴自适应难度体系,完全通过算法代码计算任务收益与幻觉惩罚,无需人工或大模型裁判。团队基于 DAPO 算法训练 Qwen 3 8B 模型 300 步,验证了环境扩展能有效提升电商智能体的真实任务完成能力。
Google DeepMind 发布了首个用于测量 AI 有害操纵的实证评估工具包,并公开了涵盖英美印三国 10,000 多名参与者的 9 项研究成果。该研究系统衡量了模型在金融和健康等高风险决策场景中的操纵倾向与实际有效性,开源了开展该类实验所需的全部材料。相关评估指标已纳入其前沿安全框架,用于测试 Gemini 3 Pro 等前沿大模型。
推荐理由:该研究公开了测量 AI 有害操纵的实证工具包,为行业量化大模型在金融与健康等场景中的诱导风险提供了可复用的实验框架。
Google DeepMind 发布新论文提出测量 AGI 进展的认知分类框架,并联合 Kaggle 设立 20 万美元奖金池启动评测黑客松。该框架从认知科学等领域提炼出感知、注意、学习、记忆、推理、元认知、执行功能与社会认知等 10 项核心能力,采用留出测试集和人类基线对比的三阶段协议评估模型。
OpenAI 最新研究显示,美国人每天向 ChatGPT 发送近 300 万条关于薪酬和收入的提问。这些高频咨询正在帮助求职者与劳动者获取报酬参考,并进一步缩小薪资信息差距。
OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。
推荐理由:研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。
一项最新预印本研究将单负振幅扩展至引力子。GPT-5.2 Pro 在该量子引力研究中协助推导并验证了非零引力子树图振幅。
Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。
推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。
OpenAI 与 Ginkgo Bioworks 的云自动化能力相结合构建自主实验室,通过闭环实验将无细胞蛋白质合成成本降低了 40%。
推荐理由:展示了大模型与自动化实验室闭环实验的落地成效,提供了前沿模型降低生物合成实验成本的具体数据。
Differential Transformer V2(DIFF V2)正式公开,通过将 Query 头翻倍但保持 KV 头数量不变,无需自定义注意力算子即可达到媲美标准 Transformer 的解码速度。该版本还移除了 V1 中的逐头 RMSNorm,解决了大规模预训练时的梯度暴增与数值不稳定问题,并可消除注意力黑洞,相关代码已在 GitHub 开源。
Google DeepMind 推出统一 AI 模型 D4RT(Dynamic 4D Reconstruction and Tracking),用于时空维度的动态 4D 场景重建与点追踪。
OpenAI 推出了一套真实世界评测框架,用于衡量 AI 加速湿实验生物研究的能力。该研究利用 GPT-5 优化分子克隆方案,探讨了 AI 辅助实验的前景以及潜在风险。
推荐理由:该研究将模型评估延伸至湿实验生物场景,为考察前沿大模型在物理实验中的效用与风险提供了参考维度。
OpenAI 发布 GPT-5.2 的系统卡片更新,说明该系列模型的综合安全缓解方案与 GPT-5 及 GPT-5.1 基本一致。GPT-5.2 同样基于多样化数据集训练,数据来源包括公开互联网信息、第三方合作数据以及用户和研究人员提供或生成的内容。
推荐理由:读者可以从中了解 GPT-5.2 沿用了前代模型的安全缓解方案,并查看其训练数据来源构成。
科研人员利用 AlphaFold 预测光合作用关键酶甘油酸激酶的结构并进行分子改造,成功设计出可在 65 °C 高温下保持稳定的杂合酶。密歇根州立大学团队通过比对植物与温泉嗜热藻类的酶结构,准确定位了植物酶在高温下易形变失稳的关键区域。研究人员随后用藻类刚性结构替换不稳定片段,为后续培育耐高温农作物提供了具体分子方案。
密苏里大学研究团队结合冷冻电镜与 AlphaFold,成功绘制出构成坏胆固醇(LDL)分子骨架的关键蛋白质 apoB100 的原子级分辨率结构。该蛋白质因体积极大且与脂质复杂连接困扰学界 50 年,结构显示其呈现包裹 LDL 颗粒的笼状外壳与带状支撑结构。这一突破为理解坏胆固醇致病机理以及研发心血管疾病靶向治疗方案提供了关键结构依据。
推荐理由:研究展示了AlphaFold结合冷冻电镜解析超大复杂蛋白的实践路径,为心血管疾病靶向研发提供了分子层面的结构依据。
加州大学洛杉矶分校(UCLA)教授 Ernest Ryu 与 GPT-5 合作解决了优化理论中的一个关键问题。该成果展现了 AI 在加速数学发现与学术研究中的作用。
OpenAI 介绍了利用 GPT-5 加速数学、物理、生物和计算机科学进展的首批研究案例。相关实验展示了研究人员与 AI 协作生成证明、发掘新见解并加快科学发现节奏的具体尝试。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡片,概述了为该模型实施的全面安全防护措施。内容涵盖针对有害任务与提示词注入的模型级专项安全训练,以及智能体沙箱环境和可配置网络访问等产品级缓解措施。