OpenAI 展示 GPT-5.2 在科学与数学研究领域的进展
OpenAI 介绍 GPT-5.2 在数学与科学基准上的表现,该模型在 GPQA Diamond 和 FrontierMath 等测试中取得 SOTA 成绩,是其目前在数学和科学领域最强的模型。官方展示了相关能力在实际科研中的进展,包括解决开放性理论问题并生成可靠的数学推导。
推荐理由:官方展示了该模型在开放理论难题与推导演算中的实际表现,读者可以据此评估其在前沿科研中的辅助能力。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 介绍 GPT-5.2 在数学与科学基准上的表现,该模型在 GPQA Diamond 和 FrontierMath 等测试中取得 SOTA 成绩,是其目前在数学和科学领域最强的模型。官方展示了相关能力在实际科研中的进展,包括解决开放性理论问题并生成可靠的数学推导。
推荐理由:官方展示了该模型在开放理论难题与推导演算中的实际表现,读者可以据此评估其在前沿科研中的辅助能力。
OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。
推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。
Google DeepMind 正式推出基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),目前已在 Google AI Studio 和 Vertex AI 向开发者开启付费预览。
推荐理由:该模型重点强化了文字渲染与画面物理控制,并支持结合搜索检索生成事实性图表,展示了高保真图像生成的实用落地路径。
Google DeepMind 推出图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建并融合推理与实时检索知识。
推荐理由:原文给出了多图角色一致性与多语言文本渲染等具体能力,读者可以据此评估其在设计工作流中的可用度。
ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。
推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。
OpenAI 推出面向 Codex 的智能体编程模型 GPT-5.1-Codex-Max。该模型速度更快且更智能,专为长时间、项目级工作设计,同时增强了推理能力并提升了 token 效率。
推荐理由:原文介绍了面向项目级代码任务的智能体模型特性,读者可以了解其在长程任务与推理效率上的定位。
Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。
推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。
Google DeepMind 发布新一代前沿模型 Gemini 3 Pro 预览版,并公布了面向更复杂推理任务的 Gemini 3 Deep Think 模式。
推荐理由:新模型在推理基准与长周期规划上超越前代,开发者可借此评估复杂工具调用与终端编码的落地表现。
Google DeepMind 与 Google Research 推出天气预测模型 WeatherNext 2,预测速度提升 8 倍且分辨率精确至 1 小时。
推荐理由:原文阐明了函数生成网络如何通过单项边缘训练推导出复杂联合气象预测,为高分辨率多情景预测提供了计算效率参考。
Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。
推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。
OpenAI 宣布 GPT-5.1 正式在 API 中上线。该版本带来更快的自适应推理、扩展的提示词缓存(prompt caching)与更强的编码性能,并新增了 apply_patch 和 shell 工具。
推荐理由:GPT-5.1 正式接入 API 并增强编码能力,开发者可结合新增的补丁与终端工具评估其对研发流程的提效效果。
OpenAI 宣布升级 GPT-5 系列并推出 GPT-5.1,带来更具亲和力且能力更强的模型。新版本提供了自定义 ChatGPT 语气和风格的新方式,并自当天起面向付费用户逐步推送。
推荐理由:OpenAI 针对 GPT-5 系列推出 5.1 升级,重点改进对话体验并支持自定义语气风格,付费用户可直接评估日常交互变化。
OpenAI 推出面向安全分类的开放权重推理模型 gpt-oss-safeguard。该模型支持开发者直接应用并持续迭代自定义安全策略,以适配不同场景的审核需求。
推荐理由:OpenAI 将推理能力引入安全分类并开放权重,使开发者能够在本地或私有环境中灵活迭代自定义安全策略。
OpenAI 推出新一代视频生成模型 Sora 2,支持同步对话与音效生成。文内同时注明 Sora 原产品已不再可用。
OpenAI 宣布在构建 Sora 2 和 Sora app 时将安全置于核心基石地位,以应对前沿视频模型与新型社交创作平台带来的安全挑战。官方表示其应对路径将依托具体的安全防护措施展开。
OpenAI 发布 Sora 2 系统卡,推出新一代前沿视频与音频生成模型。在初代 Sora 的基础上,Sora 2 引入了更精确的物理规律、更清晰的真实感、同步音频、更强的可控性以及更广的风格表现范围。
推荐理由:原文给出了新一代视频与音频生成模型的改进方向,读者可以据此了解其在物理规律与音视频同步上的能力变化。
Hugging Face 开源 Smol2Operator,提出了一套将轻量级视觉语言模型转化为图形界面自动化智能体的完整后训练方案,并开放了训练配方、数据工具与开源模型。
推荐理由:该方案展示了小体量视觉模型通过两阶段后训练和统一动作空间建立图形界面操作能力的完整流程,便于低成本复现端侧操作智能体。
OpenAI 在 GPT-5 系统卡片补充说明中推出新模型 GPT-5-Codex,该版本专门针对 Codex 中的智能体编码进行了优化。该模型能够根据任务复杂度动态调整思考投入,对简单对话或小任务快速响应,并在面对复杂任务时自主工作更长时间。
推荐理由:原文披露了该模型针对智能体编码的自适应思考机制,读者可以了解它如何依据任务复杂度动态分配推理算力。
Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。
推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。
Google 正式发布面向端侧场景的轻量多语言嵌入模型 EmbeddingGemma,拥有 308M 参数与 2K 上下文窗口,量化后内存占用低于 200MB。
推荐理由:材料详细展示了基于 Gemma 3 改造的双向编码架构与 MRL 维度裁剪特性,读者可以据此评估其在端侧小显存环境下的检索替换可行性。