Google DeepMind 发布 Gemini 3.1 Flash-Lite
Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。
推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。
推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。
GGML 与 llama.cpp 团队宣布正式加入 Hugging Face,双方将合作推进本地 AI 与端侧推理技术。Georgi Gerganov 团队将继续全职维护 llama.cpp 并保持技术方向与社区治理的完全自主,项目保持 100% 开源。后续双方将重点实现从 Transformers 库向 llama.cpp 的近乎一键式模型交付,并优化 GGML 生态的打包与部署体验。
推荐理由:这标志着开源模型生态与端侧推理核心基础设施深度绑定,有助于消除新模型从定义到本地运行的技术断层。
Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。
推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。
Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。
推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。
Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。
推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。
OpenAI 发布 GPT-5.3-Codex 系统卡片,将其定位为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码表现以及 GPT-5.2 的推理与专业知识能力。
推荐理由:官方阐明了该模型结合编码能力与专业推理的技术定位,可作为评估智能体编程工具演化路径的参考。
OpenAI 发布 GPT-5.3-Codex,定位为 Codex 原生智能体。该模型将前沿编码性能与通用推理相结合,旨在支持长周期、现实世界中的技术工作。
Hugging Face 联合开源社区推出基于 OpenAI Responses API 扩展的开源推理标准 Open Responses,旨在替代传统的 Chat Completion 接口以原生适配 Agent 工作流。
推荐理由:该标准将服务端智能体循环与原始推理流暴露规范化,有助于开发者摆脱传统对话补全接口并统一多模型调用方案。
NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,登顶 Physical AI Bench 和 Physical Reasoning 榜单。
推荐理由:原文给出了模型参数规模与上下文窗口升级细节,读者可以据此评估其在机器人规划与端云部署上的适配度。
OpenAI 推出专精编码的模型 GPT-5.2-Codex。该模型具备长程推理能力,支持大规模代码重构,并增强了网络安全能力。
推荐理由:原文明确了模型聚焦长程推理与大规模代码重构,有助于读者快速掌握其在代码智能体场景的演进方向。
Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。
推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。
OpenAI 介绍 GPT-5.2 在数学与科学基准上的表现,该模型在 GPQA Diamond 和 FrontierMath 等测试中取得 SOTA 成绩,是其目前在数学和科学领域最强的模型。官方展示了相关能力在实际科研中的进展,包括解决开放性理论问题并生成可靠的数学推导。
推荐理由:官方展示了该模型在开放理论难题与推导演算中的实际表现,读者可以据此评估其在前沿科研中的辅助能力。
OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。
推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。
ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。
推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。
OpenAI 推出面向 Codex 的智能体编程模型 GPT-5.1-Codex-Max。该模型速度更快且更智能,专为长时间、项目级工作设计,同时增强了推理能力并提升了 token 效率。
推荐理由:原文介绍了面向项目级代码任务的智能体模型特性,读者可以了解其在长程任务与推理效率上的定位。
Google DeepMind 发布新一代前沿模型 Gemini 3 Pro 预览版,并公布了面向更复杂推理任务的 Gemini 3 Deep Think 模式。
推荐理由:新模型在推理基准与长周期规划上超越前代,开发者可借此评估复杂工具调用与终端编码的落地表现。
Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。
推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。
OpenAI 宣布 GPT-5.1 正式在 API 中上线。该版本带来更快的自适应推理、扩展的提示词缓存(prompt caching)与更强的编码性能,并新增了 apply_patch 和 shell 工具。
推荐理由:GPT-5.1 正式接入 API 并增强编码能力,开发者可结合新增的补丁与终端工具评估其对研发流程的提效效果。
MiniMax 团队复盘了 M2 模型的后训练 Agent 对齐经验,提出智能体泛化不仅是增加工具种类,更要适应全操作空间扰动。团队指出单次前置思考无法应对外部环境变化,M2 采用在任务全流程随时触发的交错思考机制,以维持长程连贯性。官方提醒开发者在调用 M2 时必须保留包含思考步骤的完整会话上下文,避免因丢弃思维链导致性能下降。
推荐理由:团队复盘了基准高分与现实失效的断层,提出将交错思考与全轨迹扰动训练结合以提升通用鲁棒性。
OpenAI 推出面向安全分类的开放权重推理模型 gpt-oss-safeguard。该模型支持开发者直接应用并持续迭代自定义安全策略,以适配不同场景的审核需求。
推荐理由:OpenAI 将推理能力引入安全分类并开放权重,使开发者能够在本地或私有环境中灵活迭代自定义安全策略。