OpenAI 分享纳维-斯托克斯千禧年大奖难题的 AI 生成解法与 Lean 证明
OpenAI 分享了针对纳维-斯托克斯千禧年大奖难题的 AI 生成解答。该成果包含完整的技术说明报告,以及基于 Lean 交互式定理证明器给出的形式化证明。
推荐理由:OpenAI 公开了借助 AI 尝试解决千禧年数学难题的研究,展示了形式化验证在复杂前沿科学探索中的具体落地方式。
OpenAI 分享了针对纳维-斯托克斯千禧年大奖难题的 AI 生成解答。该成果包含完整的技术说明报告,以及基于 Lean 交互式定理证明器给出的形式化证明。
推荐理由:OpenAI 公开了借助 AI 尝试解决千禧年数学难题的研究,展示了形式化验证在复杂前沿科学探索中的具体落地方式。
AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。
研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。
研究人员使用 OpenAI 推理模型辅助罕见病诊断,在先前未确诊的疑难病例中成功识别出 18 例新诊断。该研究展示了 AI 模型在协助医生排查儿童罕见遗传疾病方面的实际应用效果。
IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。
OpenAI 介绍了如何利用思维链监控来研究内部编码智能体的对齐失范问题。该方法通过分析真实部署环境中的行为来检测潜在风险,进而强化 AI 安全防护机制。
推荐理由:文章阐述了在内部编码智能体实际部署中利用思维链监控对齐失范的方法,为智能体安全防线建设提供了实践参考。
Google DeepMind 发布新论文提出测量 AGI 进展的认知分类框架,并联合 Kaggle 设立 20 万美元奖金池启动评测黑客松。该框架从认知科学等领域提炼出感知、注意、学习、记忆、推理、元认知、执行功能与社会认知等 10 项核心能力,采用留出测试集和人类基线对比的三阶段协议评估模型。
OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。
推荐理由:研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。
一项最新预印本研究将单负振幅扩展至引力子。GPT-5.2 Pro 在该量子引力研究中协助推导并验证了非零引力子树图振幅。
Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。
推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。
OpenAI 推出新评测基准 FrontierScience,用于测试 AI 在物理、化学和生物学领域的推理能力。该基准旨在衡量模型在执行真实科学研究任务方面的进展。
加州大学洛杉矶分校(UCLA)教授 Ernest Ryu 与 GPT-5 合作解决了优化理论中的一个关键问题。该成果展现了 AI 在加速数学发现与学术研究中的作用。
OpenAI 正在探索机制可解释性,以深入理解神经网络的推理过程。其提出的全新稀疏模型方法有望提高 AI 系统的透明度,并帮助实现更安全、更可靠的模型行为。
OpenAI 推出全新评测基准 IndQA,用于评估 AI 系统在印度语言环境下的表现。该基准由领域专家联合构建,涵盖 12 种语言和 10 个知识领域,旨在测试模型的文化理解与推理能力。
NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。
推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。
专为阿拉伯语大语言模型打造的 STEM 与代码评测基准 3LM 正式推出,包含 865 道真实教材题、1,744 道合成题及改编的代码评测集。
Hugging Face 与 Adyen 联合推出面向多步推理的数据分析智能体评测基准 DABstep,包含源自真实支付业务场景的 450 多个分析任务。目前主流模型在困难任务上的准确率均未突破 20%,其中 o3-mini 以 16% 领跑,DeepSeek-R1 达到 13% 并在调用成本与表现平衡上表现突出。
OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。
推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。
OpenAI 探讨通过证明者-验证者博弈(Prover-Verifier Games)提升语言模型输出的可读性。该方法使 AI 解决方案更加清晰、更易于验证,从而让人类与机器都能更好地信任模型输出。
Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。
Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。
OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。
推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。