跳到正文

#推理

今日 0 条
9月8日周二
  1. OpenAI68

    OpenAI 分享纳维-斯托克斯千禧年大奖难题的 AI 生成解法与 Lean 证明

    OpenAI 分享了针对纳维-斯托克斯千禧年大奖难题的 AI 生成解答。该成果包含完整的技术说明报告,以及基于 Lean 交互式定理证明器给出的形式化证明。

    推荐理由:OpenAI 公开了借助 AI 尝试解决千禧年数学难题的研究,展示了形式化验证在复杂前沿科学探索中的具体落地方式。

9月2日周三
  1. Hugging Face54

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计大语言模型评测基准

    AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

6月18日周四
4月15日周三
  1. Hugging Face51

    深入剖析 VAKRA 基准:AI 智能体的推理、工具调用与失效模式

    IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。

3月19日周四
  1. OpenAI65

    OpenAI 如何监控内部编码智能体的对齐失范问题

    OpenAI 介绍了如何利用思维链监控来研究内部编码智能体的对齐失范问题。该方法通过分析真实部署环境中的行为来检测潜在风险,进而强化 AI 安全防护机制。

    推荐理由:文章阐述了在内部编码智能体实际部署中利用思维链监控对齐失范的方法,为智能体安全防线建设提供了实践参考。

3月18日周三
  1. Google DeepMind51

    Google DeepMind 提出评估 AGI 进展的认知能力框架

    Google DeepMind 发布新论文提出测量 AGI 进展的认知分类框架,并联合 Kaggle 设立 20 万美元奖金池启动评测黑客松。该框架从认知科学等领域提炼出感知、注意、学习、记忆、推理、元认知、执行功能与社会认知等 10 项核心能力,采用留出测试集和人类基线对比的三阶段协议评估模型。

3月5日周四
  1. OpenAI66

    OpenAI 研究发现推理模型难以控制思维链,有助于提升安全可监控性

    OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。

    推荐理由:研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。

3月4日周三
2月10日周二
  1. Google DeepMind75

    Google DeepMind 利用 Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。

    推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。

12月16日周二
11月24日周一
11月13日周四
11月4日周二
8月21日周四
  1. Hugging Face66

    NVIDIA 发布 600 万条多语言推理数据集与 Nemotron Nano 2 9B 模型

    NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。

    推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。

8月1日周五
2月4日周二
12月20日周五
  1. OpenAI66

    OpenAI 推出审思对齐策略:利用推理能力提升语言模型安全性

    OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。

    推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。

7月17日周三
4月23日周二
  1. Hugging Face46

    Hugging Face 推出 Open CoT Leaderboard

    Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。

4月16日周二
  1. Hugging Face68

    Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测

    Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。

    推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。

3月5日周二
  1. Hugging Face45

    ConTextual 发布:测试多模态大模型在富文本场景下的图文联合推理能力

    加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。

2月2日周五
  1. Hugging Face49

    NPHardEval 排行榜:通过计算复杂度与动态更新揭示大语言模型推理能力

    Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。

2月2日周三
  1. OpenAI62

    OpenAI 研发 Lean 神经定理证明器并求解部分奥数题

    OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。

    推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。