跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 21–40 条 · 共 60 条
3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月20日周五
  1. Hugging Face81

    GGML 与 llama.cpp 团队加入 Hugging Face

    GGML 与 llama.cpp 团队宣布正式加入 Hugging Face,双方将合作推进本地 AI 与端侧推理技术。Georgi Gerganov 团队将继续全职维护 llama.cpp 并保持技术方向与社区治理的完全自主,项目保持 100% 开源。后续双方将重点实现从 Transformers 库向 llama.cpp 的近乎一键式模型交付,并优化 GGML 生态的打包与部署体验。

    推荐理由:这标志着开源模型生态与端侧推理核心基础设施深度绑定,有助于消除新模型从定义到本地运行的技术断层。

  2. Google DeepMind80

    Google 发布 Gemini 3.1 Pro

    Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。

    推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。

2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版,面向科学与工程挑战

    Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。

    推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。

2月10日周二
  1. Google DeepMind75

    Google DeepMind 利用 Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。

    推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。

2月5日周四
  1. OpenAI68

    OpenAI 发布 GPT-5.3-Codex 系统卡片

    OpenAI 发布 GPT-5.3-Codex 系统卡片,将其定位为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码表现以及 GPT-5.2 的推理与专业知识能力。

    推荐理由:官方阐明了该模型结合编码能力与专业推理的技术定位,可作为评估智能体编程工具演化路径的参考。

1月15日周四
1月6日周二
12月18日周四
  1. OpenAI76

    OpenAI 推出 GPT-5.2-Codex

    OpenAI 推出专精编码的模型 GPT-5.2-Codex。该模型具备长程推理能力,支持大规模代码重构,并增强了网络安全能力。

    推荐理由:原文明确了模型聚焦长程推理与大规模代码重构,有助于读者快速掌握其在代码智能体场景的演进方向。

12月17日周三
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3 Flash 模型

    Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。

    推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。

12月11日周四
  1. OpenAI80

    OpenAI 展示 GPT-5.2 在科学与数学研究领域的进展

    OpenAI 介绍 GPT-5.2 在数学与科学基准上的表现,该模型在 GPQA Diamond 和 FrontierMath 等测试中取得 SOTA 成绩,是其目前在数学和科学领域最强的模型。官方展示了相关能力在实际科研中的进展,包括解决开放性理论问题并生成可靠的数学推导。

    推荐理由:官方展示了该模型在开放理论难题与推导演算中的实际表现,读者可以据此评估其在前沿科研中的辅助能力。

  2. OpenAI90

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。

    推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。

11月19日周三
  1. Hugging Face66

    ServiceNow 发布 Apriel-H1:通过蒸馏打造高效 Mamba 混合推理模型

    ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。

    推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:整合 Gemini 核心的 3D 虚拟世界具身智能体

    Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。

    推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。

  2. OpenAI85

    OpenAI 面向开发者推出 GPT-5.1

    OpenAI 宣布 GPT-5.1 正式在 API 中上线。该版本带来更快的自适应推理、扩展的提示词缓存(prompt caching)与更强的编码性能,并新增了 apply_patch 和 shell 工具。

    推荐理由:GPT-5.1 正式接入 API 并增强编码能力,开发者可结合新增的补丁与终端工具评估其对研发流程的提效效果。

10月30日周四
  1. Hugging Face68

    MiniMax 解读 M2 智能体对齐:交错思考与全轨迹泛化

    MiniMax 团队复盘了 M2 模型的后训练 Agent 对齐经验,提出智能体泛化不仅是增加工具种类,更要适应全操作空间扰动。团队指出单次前置思考无法应对外部环境变化,M2 采用在任务全流程随时触发的交错思考机制,以维持长程连贯性。官方提醒开发者在调用 M2 时必须保留包含思考步骤的完整会话上下文,避免因丢弃思维链导致性能下降。

    推荐理由:团队复盘了基准高分与现实失效的断层,提出将交错思考与全轨迹扰动训练结合以提升通用鲁棒性。

10月29日周三