ServiceNow 开源 AprielGuard:面向现代大语言模型与 Agent 系统的 8B 安全护栏模型
ServiceNow 开源了 8B 参数的安全护栏模型 AprielGuard,用于检测大语言模型及 Agent 系统中的 16 类安全风险和提示词注入等对抗攻击。
推荐理由:模型将内容安全与智能体对抗防御统一到单模型中,为复杂工作流提供了可解释推理与低延迟双模式落地方案。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
ServiceNow 开源了 8B 参数的安全护栏模型 AprielGuard,用于检测大语言模型及 Agent 系统中的 16 类安全风险和提示词注入等对抗攻击。
推荐理由:模型将内容安全与智能体对抗防御统一到单模型中,为复杂工作流提供了可解释推理与低延迟双模式落地方案。
Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。
推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。
IBM Research 宣布开源通用 AI 智能体框架 CUGA(Configurable Generalist Agent)正式上线 Hugging Face Spaces,并基于 Apache 2.0 协议开源。
推荐理由:IBM Research 将可配置通用智能体 CUGA 接入 Hugging Face Spaces,提供了在开源模型上低成本搭建多工具工作流的完整架构实践。
Google DeepMind 推出更新版 Gemini 2.5 Flash 原生音频模型(Gemini 2.5 Flash Native Audio),全面提升了多轮对话、复杂指令遵循以及函数调用能力。
推荐理由:更新侧重于工具调用精度与实时语音同传,为构建低延迟语音智能体和跨语言对话提供了工程参考。
OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。
推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。
OpenAI 宣布在 Linux 基金会旗下联合成立 Agentic AI 基金会(Agentic AI Foundation),并捐赠 AGENTS.md。该基金会旨在支持安全 AI 智能体的开放与互操作标准制定。
推荐理由:OpenAI 通过联合成立基金会并捐赠规范,推动跨平台的智能体互操作与安全标准建设。
Google DeepMind 宣布支持美国白宫与能源部(DOE)的 Genesis 任务,为全美 17 所国家实验室的研究人员提供前沿科学 AI 模型与智能体工具。
推荐理由:原文给出了合作背景与工具开放时间表,读者可以据此了解前沿科学 AI 智能体如何深度接入国家级实验室科研体系。
OpenAI 推出面向 Codex 的智能体编程模型 GPT-5.1-Codex-Max。该模型速度更快且更智能,专为长时间、项目级工作设计,同时增强了推理能力并提升了 token 效率。
推荐理由:原文介绍了面向项目级代码任务的智能体模型特性,读者可以了解其在长程任务与推理效率上的定位。
Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。
推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。
Google DeepMind 发布新一代前沿模型 Gemini 3 Pro 预览版,并公布了面向更复杂推理任务的 Gemini 3 Deep Think 模式。
推荐理由:新模型在推理基准与长周期规划上超越前代,开发者可借此评估复杂工具调用与终端编码的落地表现。
Google DeepMind 推出智能体开发平台 Google Antigravity,现已面向个人开发者免费开启公开预览版。该平台将传统 IDE 拓展为兼具同步代码编辑与异步任务编排的双界面形态,支持智能体自主操作终端、调用浏览器并生成任务工件供人工校验反馈。
推荐理由:平台展示了从传统编辑器走向多智能体异步调度的设计细节,有助于开发者理解全自主软件工程界面的演进方向。
Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。
推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。
MiniMax 团队复盘了 M2 模型的后训练 Agent 对齐经验,提出智能体泛化不仅是增加工具种类,更要适应全操作空间扰动。团队指出单次前置思考无法应对外部环境变化,M2 采用在任务全流程随时触发的交错思考机制,以维持长程连贯性。官方提醒开发者在调用 M2 时必须保留包含思考步骤的完整会话上下文,避免因丢弃思维链导致性能下降。
推荐理由:团队复盘了基准高分与现实失效的断层,提出将交错思考与全轨迹扰动训练结合以提升通用鲁棒性。
Meta 与 Hugging Face 联合发布 OpenEnv Hub 及 OpenEnv 0.1 规范,为 AI 智能体构建标准化、具备沙箱隔离的安全运行环境。
推荐理由:原文明确了智能体沙箱环境的规范标准与共享平台,有助于开发者统一强化学习后训练与推理部署中的工具交互层。
Hugging Face 正式发布 Swift Transformers 1.0,面向苹果平台的端侧模型工具库正式进入稳定阶段。新版本将 Tokenizers 与 Hub 拆分为独立顶级模块,集成全新高速 swift-jinja 模板库,全面支持 Swift 6,并借助现代 Core ML API 优化有状态模型的键值缓存。
推荐理由:该版本将分词与下载模块解耦并支持现代苹果计算框架,便于开发者在端侧快速集成工具调用与本地推理能力。
OpenAI 面向移动端 Pro 用户推出 ChatGPT Pulse 预览版。Pulse 是一项主动式体验,能够根据用户的历史聊天、反馈以及日历等关联应用主动进行调研,并交付个性化更新。
推荐理由:该功能展示了 ChatGPT 从被动应答转向结合日历与历史对话主动调研的工作机制,有助于了解主动智能体体验的落地形态。
Hugging Face 开源 Smol2Operator,提出了一套将轻量级视觉语言模型转化为图形界面自动化智能体的完整后训练方案,并开放了训练配方、数据工具与开源模型。
推荐理由:该方案展示了小体量视觉模型通过两阶段后训练和统一动作空间建立图形界面操作能力的完整流程,便于低成本复现端侧操作智能体。
OpenAI 在 GPT-5 系统卡片补充说明中推出新模型 GPT-5-Codex,该版本专门针对 Codex 中的智能体编码进行了优化。该模型能够根据任务复杂度动态调整思考投入,对简单对话或小任务快速响应,并在面对复杂任务时自主工作更长时间。
推荐理由:原文披露了该模型针对智能体编码的自适应思考机制,读者可以了解它如何依据任务复杂度动态分配推理算力。
Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。
推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。
Hugging Face 发布科研检索 MCP 工具与接入指南,支持 AI 智能体通过自然语言跨 arXiv、GitHub 与 Hugging Face 关联检索论文、代码与模型资产。
推荐理由:原文梳理了从手动检索到脚本再到协议调用的演进,读者可借此将文献与代码跨平台检索接入智能体工作流。