跳到正文

#推理

今日 0 条
10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,重点强化长程复杂工作流推理、软件工程与网络安全防御能力。该模型将输出 token 上限从 64K 提升至 1M,在 DeepSWE v1.1 评测中达到 77.9%,上线尝鲜定价为每百万输入 tokens 2 美元、输出 tokens 10 美元(缓存输入优惠 95%)。

    推荐理由:官方披露了将输出上限扩至1M tokens的技术指标与内部工程迁移实测数据,便于评估长程任务执行能力。

9月30日周三
9月9日周三
9月8日周二
  1. OpenAI68

    OpenAI 分享纳维-斯托克斯千禧年大奖难题的 AI 生成解法与 Lean 证明

    OpenAI 分享了针对纳维-斯托克斯千禧年大奖难题的 AI 生成解答。该成果包含完整的技术说明报告,以及基于 Lean 交互式定理证明器给出的形式化证明。

    推荐理由:OpenAI 公开了借助 AI 尝试解决千禧年数学难题的研究,展示了形式化验证在复杂前沿科学探索中的具体落地方式。

9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 与专用于网络安全的 Gemini 3.8 Flash Cyber,在维持与 3.7 Flash 相同速率及价格(每百万输入 token $0.75、输出 $3.75)的前提下显著提升了软件工程和复杂推理能力。

    推荐理由:新模型在维持低成本的同时强化了自主编码与网络防御能力,适合需要多步推理且看重成本效益的开发者评估落地。

9月2日周三
  1. Hugging Face54

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计大语言模型评测基准

    AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

8月14日周五
  1. Hugging Face82

    Hugging Face 发布 2026 年夏季开源模型观察报告

    Hugging Face 发布 2026 年夏季开源模型生态报告,总结了 1 至 8 月平台公开模型库增至 2.96 百万个背景下的关键趋势。数据显示关注度与实际工程采用存在明显分化,千问(Qwen)以超过 15 万个衍生模型成为社区的核心基座模型,中国机构在开源超大参数规模上持续推进且开源许可整体更宽松。

    推荐理由:结合平台真实下载与衍生数据,梳理了开源生态中关注度与实际工程落地的显著脱节,为技术选型和生态布局提供了客观参照。

8月13日周四
7月29日周三
7月15日周三
6月18日周四
6月17日周三
  1. Hugging Face84

    智谱开源 GLM-5.2 旗舰模型:支持 1M 上下文与长流程编码任务

    智谱推出新一代旗舰开源模型 GLM-5.2,采用 MIT 协议完全开源,原生支持 1M token 上下文,主打面向长流程(long-horizon)的软件工程与智能体任务。

    推荐理由:GLM-5.2 将实用工程评测与 1M 上下文推理架构结合,为需要长时间自主运行的编码智能体提供了兼顾开源与高吞吐的落地参考。

6月5日周五
5月14日周四
5月7日周四
  1. OpenAI68

    OpenAI 在 API 中推出新实时语音模型

    OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。

    推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。

4月28日周二
  1. Hugging Face77

    NVIDIA 发布 Nemotron 3 Nano Omni:支持文档、音视频与智能体的长上下文多模态全能模型

    NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。

    推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。

4月24日周五
4月15日周三
  1. Hugging Face51

    深入剖析 VAKRA 基准:AI 智能体的推理、工具调用与失效模式

    IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强具身空间推理与仪表读取能力

    Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。

    推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。

3月19日周四
  1. OpenAI65

    OpenAI 如何监控内部编码智能体的对齐失范问题

    OpenAI 介绍了如何利用思维链监控来研究内部编码智能体的对齐失范问题。该方法通过分析真实部署环境中的行为来检测潜在风险,进而强化 AI 安全防护机制。

    推荐理由:文章阐述了在内部编码智能体实际部署中利用思维链监控对齐失范的方法,为智能体安全防线建设提供了实践参考。

3月18日周三
  1. Google DeepMind51

    Google DeepMind 提出评估 AGI 进展的认知能力框架

    Google DeepMind 发布新论文提出测量 AGI 进展的认知分类框架,并联合 Kaggle 设立 20 万美元奖金池启动评测黑客松。该框架从认知科学等领域提炼出感知、注意、学习、记忆、推理、元认知、执行功能与社会认知等 10 项核心能力,采用留出测试集和人类基线对比的三阶段协议评估模型。

3月17日周二
3月16日周一
3月9日周一
3月6日周五
3月5日周四
  1. OpenAI66

    OpenAI 研究发现推理模型难以控制思维链,有助于提升安全可监控性

    OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。

    推荐理由:研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。

3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月20日周五
  1. Hugging Face81

    GGML 与 llama.cpp 团队加入 Hugging Face

    GGML 与 llama.cpp 团队宣布正式加入 Hugging Face,双方将合作推进本地 AI 与端侧推理技术。Georgi Gerganov 团队将继续全职维护 llama.cpp 并保持技术方向与社区治理的完全自主,项目保持 100% 开源。后续双方将重点实现从 Transformers 库向 llama.cpp 的近乎一键式模型交付,并优化 GGML 生态的打包与部署体验。

    推荐理由:这标志着开源模型生态与端侧推理核心基础设施深度绑定,有助于消除新模型从定义到本地运行的技术断层。

  2. Google DeepMind80

    Google 发布 Gemini 3.1 Pro

    Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。

    推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。

2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版,面向科学与工程挑战

    Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。

    推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。

2月10日周二
  1. Google DeepMind75

    Google DeepMind 利用 Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。

    推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。

2月5日周四
  1. OpenAI68

    OpenAI 发布 GPT-5.3-Codex 系统卡片

    OpenAI 发布 GPT-5.3-Codex 系统卡片,将其定位为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码表现以及 GPT-5.2 的推理与专业知识能力。

    推荐理由:官方阐明了该模型结合编码能力与专业推理的技术定位,可作为评估智能体编程工具演化路径的参考。

1月27日周二