跳到正文

#推理

今日 0 条
1月15日周四
1月8日周四
1月6日周二
12月24日周三
12月18日周四
  1. OpenAI76

    OpenAI 推出 GPT-5.2-Codex

    OpenAI 推出专精编码的模型 GPT-5.2-Codex。该模型具备长程推理能力,支持大规模代码重构,并增强了网络安全能力。

    推荐理由:原文明确了模型聚焦长程推理与大规模代码重构,有助于读者快速掌握其在代码智能体场景的演进方向。

12月17日周三
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3 Flash 模型

    Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。

    推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。

12月16日周二
12月11日周四
  1. OpenAI80

    OpenAI 展示 GPT-5.2 在科学与数学研究领域的进展

    OpenAI 介绍 GPT-5.2 在数学与科学基准上的表现,该模型在 GPQA Diamond 和 FrontierMath 等测试中取得 SOTA 成绩,是其目前在数学和科学领域最强的模型。官方展示了相关能力在实际科研中的进展,包括解决开放性理论问题并生成可靠的数学推导。

    推荐理由:官方展示了该模型在开放理论难题与推导演算中的实际表现,读者可以据此评估其在前沿科研中的辅助能力。

  2. OpenAI90

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。

    推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。

11月25日周二
11月24日周一
11月19日周三
  1. Hugging Face66

    ServiceNow 发布 Apriel-H1:通过蒸馏打造高效 Mamba 混合推理模型

    ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。

    推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:整合 Gemini 核心的 3D 虚拟世界具身智能体

    Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。

    推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。

  2. OpenAI85

    OpenAI 面向开发者推出 GPT-5.1

    OpenAI 宣布 GPT-5.1 正式在 API 中上线。该版本带来更快的自适应推理、扩展的提示词缓存(prompt caching)与更强的编码性能,并新增了 apply_patch 和 shell 工具。

    推荐理由:GPT-5.1 正式接入 API 并增强编码能力,开发者可结合新增的补丁与终端工具评估其对研发流程的提效效果。

11月4日周二
10月30日周四
  1. Hugging Face68

    MiniMax 解读 M2 智能体对齐:交错思考与全轨迹泛化

    MiniMax 团队复盘了 M2 模型的后训练 Agent 对齐经验,提出智能体泛化不仅是增加工具种类,更要适应全操作空间扰动。团队指出单次前置思考无法应对外部环境变化,M2 采用在任务全流程随时触发的交错思考机制,以维持长程连贯性。官方提醒开发者在调用 M2 时必须保留包含思考步骤的完整会话上下文,避免因丢弃思维链导致性能下降。

    推荐理由:团队复盘了基准高分与现实失效的断层,提出将交错思考与全轨迹扰动训练结合以提升通用鲁棒性。

10月29日周三
9月12日周五
9月10日周三
  1. Hugging Face67

    Jupyter Agent:训练大语言模型在 Notebook 中进行推理

    Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。

    推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。

8月21日周四
  1. Hugging Face66

    NVIDIA 发布 600 万条多语言推理数据集与 Nemotron Nano 2 9B 模型

    NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。

    推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。

8月7日周四
  1. OpenAI89

    OpenAI 面向开发者推出 GPT-5 API

    OpenAI 正式在 API 平台面向开发者推出 GPT-5。该模型具备高推理性能,为开发者提供了新的控制项,并在实际编码任务中表现突出。

    推荐理由:官方在 API 平台面向开发者推出 GPT-5,重点突出推理能力、开发者控制项以及真实编程任务表现。

  2. OpenAI92

    OpenAI GPT-5 系统卡

    OpenAI 发布 GPT-5 系统卡(System Card),介绍了支撑快速与高智能响应的统一模型路由系统。该系统通过调度 gpt-5-main、gpt-5-thinking 以及轻量级的 gpt-5-thinking-nano 等不同模型版本,针对多样化任务需求与开发者场景进行了定向优化。

    推荐理由:该文档说明了多版本模型的统一路由机制,便于开发者了解其在不同任务负载下的分发策略与适配方案。

8月5日周二
  1. Hugging Face93

    OpenAI 发布开源模型家族 GPT OSS,Hugging Face 全面支持部署与微调

    OpenAI 正式发布开源开放权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b 两款 MoE 架构纯文本推理模型,采用 Apache 2.0 许可证。

    推荐理由:原文详细梳理了该系列模型的量化方案、显存门槛以及在主流推理框架中的适配方法,适合需要本地部署或微调的开发者参考。

  2. OpenAI84

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 模型卡

    OpenAI 推出 gpt-oss-120b 和 gpt-oss-20b 两款开源权重推理模型。两款模型在 Apache 2.0 许可证和 gpt-oss 使用政策下分发,并公开了对应的模型卡文档。

    推荐理由:OpenAI 开放了两款不同参数规模的开源权重推理模型并采用 Apache 2.0 协议,为本地部署与推理研究提供了新选择。

  3. OpenAI76

    OpenAI 发布开源权重模型 gpt-oss-120b 与 gpt-oss-20b

    OpenAI 正式发布开源权重语言模型 gpt-oss-120b 与 gpt-oss-20b,采用 Apache 2.0 许可证。两款模型在同尺寸开源模型的推理任务中表现更优,具备强大的工具调用能力,并针对消费级硬件上的高效部署进行了优化。

    推荐理由:模型采用宽松开源协议并在消费级硬件优化部署,为开发者低成本构建兼具推理与工具调用能力的本地应用提供了参考。

  4. Hugging Face64

    在 DeepResearch Bench 上评测开源 Llama Nemotron 模型

    NVIDIA 的 AI-Q 深度研究智能体在 DeepResearch Bench 的搜索增强大语言模型榜单中取得 40.52 的总分,位列完全开源架构榜首。

    推荐理由:文章呈现了开源大模型结合检索架构在深度研究基准上的实测表现,为构建本地可部署的智能体工作流提供了参数选型与评测参考。

8月1日周五
7月10日周四
  1. Hugging Face56

    Numina 联合 Kimi 发布形式化推理模型 Kimina-Prover-72B

    Numina 与 Kimi 团队联合发布形式化定理证明模型 Kimina-Prover-72B 及其 8B、1.7B 蒸馏版本,在 miniF2F 基准测试中取得 92.2% 的通过率。模型基于 Qwen 架构并通过 Kimi k1.5 强化学习流程训练,引入测试时强化学习搜索框架以自主递归生成和复用引理。此外,系统集成了针对 Lean 报错信息的错误修复机制,显著提升了多轮证明迭代中的样本效率。

7月8日周二
  1. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

6月4日周三
  1. Hugging Face45

    在 nanoVLM 中从零实现 KV cache

    nanoVLM 代码库从零实现了 KV cache,使模型生成速度提升了 38%。该实现基于纯 PyTorch 开发,通过在注意力模块和语言模型中缓存已计算的键值(K 与 V),消除了自回归生成时全序列重复计算的冗余,将单步解码转化为轻量级的增量更新。

5月23日周五
  1. OpenAI76

    OpenAI Operator 底层模型升级为 o3

    OpenAI 宣布将智能体产品 Operator 原有的 GPT-4o 底层模型替换为基于 OpenAI o3 的版本。此外,Operator 的 API 版本仍将继续基于 GPT-4o 运行。

    推荐理由:原文明确了 Operator 智能体底座切换为推理模型 o3 且 API 维持原状的调整,可作为跟踪其落地形态的参考。

4月30日周三
  1. Hugging Face66

    深入解析 Qwen-3 对话模板带来的 4 个关键设计变化

    Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。

    推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。

4月16日周三
  1. OpenAI85

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 与 o4-mini 的系统卡,展示两款模型在前沿推理能力基础上结合完整工具链的实际表现。模型支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索以及记忆功能。

    推荐理由:系统卡展示了模型在深度推理与全套工具链结合下的能力边界,有助于读者评估复杂任务的工作流集成路径。

2月27日周四
2月13日周四
2月4日周二