Google DeepMind 发布开源模型 Gemma 4
Google DeepMind 正式发布 Gemma 4 开源模型系列,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,并采用 Apache 2.0 许可证。
推荐理由:原文公开了涵盖端侧到桌面规模的四款模型规格与多模态能力,并且改用商业友好的开源许可,方便开发者评估本地部署与二次开发成本。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 正式发布 Gemma 4 开源模型系列,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,并采用 Apache 2.0 许可证。
推荐理由:原文公开了涵盖端侧到桌面规模的四款模型规格与多模态能力,并且改用商业友好的开源许可,方便开发者评估本地部署与二次开发成本。
Hugging Face 推出 OpenClaw 等开源智能体的模型迁移指南,帮助受 Anthropic 访问限制影响的用户切换至开源模型。方案提供两条路径,用户可通过 Hugging Face Inference Providers 调用 GLM-5 等云端模型,也可结合 llama.cpp 本地运行 Qwen3.5-35B-A3B 以实现零 API 成本和数据隐私。
推荐理由:文章给出了将智能体迁移至托管开源接口与本地运行的具体配置,为受闭源限制的用户提供了替代方案。
ChatGPT 推出基于 Agentic Commerce Protocol 的沉浸式视觉购物功能,支持商品发现、并排对比以及商家集成。用户可在对话中直接浏览商品并进行多维度对比。
推荐理由:展现了智能体协议连接电商商家的具体方式,有助于理解生成式对话界面向交易与导购场景的演进。
ServiceNow AI 团队推出端到端语音智能体评测框架 EVA,联合评估任务准确性与对话交互体验。框架采用端到端音频模拟架构,首发包含 50 个航空业务场景的测试集,覆盖级联与原生音频等 20 款系统。评测结果显示任务完成度高的智能体往往交互体验更差,且专有名词转写是导致交互中断的主要瓶颈。
推荐理由:该框架将任务准确率与对话交互体验联合度量,为语音智能体的全流程实测提供了可参考的基准方案。
OpenAI 介绍了如何利用思维链监控来研究内部编码智能体的对齐失范问题。该方法通过分析真实部署环境中的行为来检测潜在风险,进而强化 AI 安全防护机制。
推荐理由:文章阐述了在内部编码智能体实际部署中利用思维链监控对齐失范的方法,为智能体安全防线建设提供了实践参考。
H Company 正式发布多模态计算机操作模型 Holotron-12B,基于 NVIDIA 开源模型后训练构建并已上线 Hugging Face。该模型采用混合 SSM 与注意力架构以减少显存占用,在单张 H100 搭配 vLLM 运行且并发达到 100 时吞吐量达到 8.9k tokens/s,并在 WebVoyager 基准测试中取得 80.5% 的表现。
推荐理由:该模型结合混合状态空间模型架构优化并发推理,展现了降低显存占用并提升智能体长上下文吞吐量的方法。
OpenAI 推出 GPT-5.4 mini 和 nano,作为 GPT-5.4 的轻量且更快速版本。两款模型针对编码、工具调用、多模态推理以及大吞吐量 API 与子智能体工作负载进行了专门优化。
OpenAI 阐述了 ChatGPT 抵御提示词注入与社会工程攻击的安全设计思路。系统主要通过在智能体工作流中限制高风险操作,并严格保护敏感数据来防范潜在攻击。
推荐理由:文章介绍了智能体防御提示词注入的防护思路,读者可据此参考在工作流中限制高风险操作与保护敏感数据的方法。
OpenAI 介绍了如何利用 Responses API、shell 工具和托管容器构建智能体运行时。该方案支持智能体在包含文件、工具和状态的环境中安全且可扩展地执行任务。
推荐理由:原文阐述了结合容器与命令行工具扩展 API 的方案,为开发者构建带状态与文件支持的智能体运行时提供了架构参考。
OpenAI 发布面向专业工作的前沿模型 GPT-5.4,具备更强的能力与效率表现。该模型支持 1M token 上下文窗口,并在编程、计算机操作以及工具搜索等任务上提供顶尖能力。
推荐理由:官方公布了该模型在编程、计算机控制与百万上下文等核心升级,读者可据此评估其在专业复杂工作流中的适配度。
OpenAI 与亚马逊宣布达成战略合作,将 OpenAI 的 Frontier 平台引入 AWS。双方将合作拓展 AI 基础设施建设,并推进定制模型与企业级 AI 智能体的落地。
推荐理由:OpenAI 与 AWS 达成合作将其平台引入云端,为企业级智能体部署与定制模型提供了新的云基础设施选项。
Hugging Face 介绍了结合 Unsloth 与 Hugging Face Jobs 进行大语言模型微调的方法,支持通过 Claude Code 或 Codex 等编码智能体用提示词自动启动训练。
推荐理由:原文给出了结合编码智能体与 Unsloth 在云端自动微调小模型的完整流程,读者可据此降低轻量模型的端侧训练门槛。
Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。
推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。
OpenAI 发布 GPT-5.3-Codex 系统卡片,将其定位为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码表现以及 GPT-5.2 的推理与专业知识能力。
推荐理由:官方阐明了该模型结合编码能力与专业推理的技术定位,可作为评估智能体编程工具演化路径的参考。
OpenAI 发布 GPT-5.3-Codex,定位为 Codex 原生智能体。该模型将前沿编码性能与通用推理相结合,旨在支持长周期、现实世界中的技术工作。
OpenAI 介绍了如何通过 Codex App Server 嵌入 Codex 智能体,并解析了其底座的构建方式。该服务采用双向 JSON-RPC API,可支持流式进度呈现、工具调用、审批以及代码 diff 等功能。
推荐理由:文章介绍了通过双向 JSON-RPC API 嵌入代码智能体的方案,为开发者集成智能体运行环境提供了接口设计参考。
OpenAI 推出面向 macOS 的 Codex 客户端,定位为 AI 编码与软件开发控制中心。该应用支持运行多个智能体、并行工作流以及长时间运行的任务。
推荐理由:原文介绍了支持多智能体与并行工作流的桌面控制中心,读者可据此了解官方原生编码工具的产品形态。
OpenAI 深入解析了 Codex 智能体的循环运行机制,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词并优化性能。该内容展示了代码智能体在底层调用与任务调度上的工程实现细节。
推荐理由:原文解析了 Codex CLI 编排循环机制,开发者可据此了解基于 Responses API 搭建代码智能体的工程实现。
Hugging Face 联合开源社区推出基于 OpenAI Responses API 扩展的开源推理标准 Open Responses,旨在替代传统的 Chat Completion 接口以原生适配 Agent 工作流。
推荐理由:该标准将服务端智能体循环与原始推理流暴露规范化,有助于开发者摆脱传统对话补全接口并统一多模型调用方案。
Hugging Face 发布了一份实操指南,演示如何利用 NVIDIA DGX Spark 与开源机器人 Reachy Mini 及其仿真器构建桌面多模态 AI 智能体。
推荐理由:文章给出了结合意图路由、多模态流处理与实体硬件仿真的完整搭建步骤,为本地具身智能体开发提供了清晰的模块化参考架构。