跳到正文

#推理

今日 0 条
10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,重点强化长程复杂工作流推理、软件工程与网络安全防御能力。该模型将输出 token 上限从 64K 提升至 1M,在 DeepSWE v1.1 评测中达到 77.9%,上线尝鲜定价为每百万输入 tokens 2 美元、输出 tokens 10 美元(缓存输入优惠 95%)。

    推荐理由:官方披露了将输出上限扩至1M tokens的技术指标与内部工程迁移实测数据,便于评估长程任务执行能力。

9月29日周二
  1. Simon Willison84

    Anthropic 发布 Claude Sonnet 5.5 并上线免费层

    Anthropic 正式推出 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上且成本更低,并已直接作为 claude.ai 免费层的使用模型。实测显示其在部分编码任务上表现接近 Opus 5.5,但在极高思考模式下可能消耗大量 token 导致输出中断;官方同时确认 Haiku 5.5 将在未来几周内推出。

    推荐理由:Anthropic 将新模型直接下放到免费层,实测展示了其思考模式下的成本表现,为评估免费端生产力提供了参考。

9月23日周三
  1. Latent Space84

    Anthropic 发布 Claude Opus 5.5 与 OpenAI 推出 GPT-6 Sol,大模型 API 迎来降价潮

    Anthropic 正式推出 Claude 5.5 系列首款模型 Claude Opus 5.5,具备接近 Fable 5.1 的能力且单任务成本号称降低约 40%,OpenAI 也随即推出降价 50% 的 GPT-6 Sol 与 Luna。

    推荐理由:文章系统梳理了两款新模型的基准表现与 token 计费细节,读者可以借此评估高强度推理下的真实成本变化与架构选型。

9月22日周二
  1. Latent Space73

    小米发布 MiMo-V2.6-Pro 开源全模态模型,以约 300 万美元完成强化学习训练

    小米发布 MiMo-V2.6 系列原生全模态开源大模型,其中旗舰款 MiMo-V2.6-Pro 拥有 1.02T 总参数和 42B 激活参数,并在 Artificial Analysis 评测中登顶开源权重榜首。该模型采用 MIT 协议开源,强化学习阶段耗时 130 小时、耗资约 260 万美元,团队采用全异步架构和最高 1M 上下文训练,并承诺开源相关训练套件与数千个强化学习环境。

9月9日周三
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 与专用于网络安全的 Gemini 3.8 Flash Cyber,在维持与 3.7 Flash 相同速率及价格(每百万输入 token $0.75、输出 $3.75)的前提下显著提升了软件工程和复杂推理能力。

    推荐理由:新模型在维持低成本的同时强化了自主编码与网络防御能力,适合需要多步推理且看重成本效益的开发者评估落地。

7月29日周三
7月15日周三
6月17日周三
  1. Hugging Face84

    智谱开源 GLM-5.2 旗舰模型:支持 1M 上下文与长流程编码任务

    智谱推出新一代旗舰开源模型 GLM-5.2,采用 MIT 协议完全开源,原生支持 1M token 上下文,主打面向长流程(long-horizon)的软件工程与智能体任务。

    推荐理由:GLM-5.2 将实用工程评测与 1M 上下文推理架构结合,为需要长时间自主运行的编码智能体提供了兼顾开源与高吞吐的落地参考。

6月5日周五
5月7日周四
  1. OpenAI68

    OpenAI 在 API 中推出新实时语音模型

    OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。

    推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。

4月28日周二
  1. Hugging Face77

    NVIDIA 发布 Nemotron 3 Nano Omni:支持文档、音视频与智能体的长上下文多模态全能模型

    NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。

    推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。

4月24日周五
4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强具身空间推理与仪表读取能力

    Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。

    推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。

3月17日周二
3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月20日周五
  1. Google DeepMind80

    Google 发布 Gemini 3.1 Pro

    Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。

    推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。

2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版,面向科学与工程挑战

    Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。

    推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。

2月5日周四
  1. OpenAI68

    OpenAI 发布 GPT-5.3-Codex 系统卡片

    OpenAI 发布 GPT-5.3-Codex 系统卡片,将其定位为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码表现以及 GPT-5.2 的推理与专业知识能力。

    推荐理由:官方阐明了该模型结合编码能力与专业推理的技术定位,可作为评估智能体编程工具演化路径的参考。

1月6日周二
12月18日周四
  1. OpenAI76

    OpenAI 推出 GPT-5.2-Codex

    OpenAI 推出专精编码的模型 GPT-5.2-Codex。该模型具备长程推理能力,支持大规模代码重构,并增强了网络安全能力。

    推荐理由:原文明确了模型聚焦长程推理与大规模代码重构,有助于读者快速掌握其在代码智能体场景的演进方向。

12月17日周三
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3 Flash 模型

    Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。

    推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。

12月11日周四
  1. OpenAI90

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。

    推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。

11月19日周三
  1. Hugging Face66

    ServiceNow 发布 Apriel-H1:通过蒸馏打造高效 Mamba 混合推理模型

    ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。

    推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:整合 Gemini 核心的 3D 虚拟世界具身智能体

    Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。

    推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。

  2. OpenAI85

    OpenAI 面向开发者推出 GPT-5.1

    OpenAI 宣布 GPT-5.1 正式在 API 中上线。该版本带来更快的自适应推理、扩展的提示词缓存(prompt caching)与更强的编码性能,并新增了 apply_patch 和 shell 工具。

    推荐理由:GPT-5.1 正式接入 API 并增强编码能力,开发者可结合新增的补丁与终端工具评估其对研发流程的提效效果。

10月29日周三
9月12日周五
8月5日周二
  1. Hugging Face93

    OpenAI 发布开源模型家族 GPT OSS,Hugging Face 全面支持部署与微调

    OpenAI 正式发布开源开放权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b 两款 MoE 架构纯文本推理模型,采用 Apache 2.0 许可证。

    推荐理由:原文详细梳理了该系列模型的量化方案、显存门槛以及在主流推理框架中的适配方法,适合需要本地部署或微调的开发者参考。

  2. Hugging Face64

    在 DeepResearch Bench 上评测开源 Llama Nemotron 模型

    NVIDIA 的 AI-Q 深度研究智能体在 DeepResearch Bench 的搜索增强大语言模型榜单中取得 40.52 的总分,位列完全开源架构榜首。

    推荐理由:文章呈现了开源大模型结合检索架构在深度研究基准上的实测表现,为构建本地可部署的智能体工作流提供了参数选型与评测参考。

7月10日周四
  1. Hugging Face56

    Numina 联合 Kimi 发布形式化推理模型 Kimina-Prover-72B

    Numina 与 Kimi 团队联合发布形式化定理证明模型 Kimina-Prover-72B 及其 8B、1.7B 蒸馏版本,在 miniF2F 基准测试中取得 92.2% 的通过率。模型基于 Qwen 架构并通过 Kimi k1.5 强化学习流程训练,引入测试时强化学习搜索框架以自主递归生成和复用引理。此外,系统集成了针对 Lean 报错信息的错误修复机制,显著提升了多轮证明迭代中的样本效率。

7月8日周二
  1. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。