跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 81–100 条 · 共 120 条
12月23日周二
  1. Hugging Face62

    ServiceNow 开源 AprielGuard:面向现代大语言模型与 Agent 系统的 8B 安全护栏模型

    ServiceNow 开源了 8B 参数的安全护栏模型 AprielGuard,用于检测大语言模型及 Agent 系统中的 16 类安全风险和提示词注入等对抗攻击。

    推荐理由:模型将内容安全与智能体对抗防御统一到单模型中,为复杂工作流提供了可解释推理与低延迟双模式落地方案。

12月17日周三
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3 Flash 模型

    Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。

    推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。

12月16日周二
12月13日周六
12月11日周四
  1. OpenAI90

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 正式发布面向日常专业工作的 GPT-5.2 前沿模型,具备 SOTA 级别的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,旨在支持更快、更可靠的智能体工作流。

    推荐理由:官方明确了该模型面向专业工作和智能体工作流的定位,读者可据此评估其在推理与编码场景中的接入价值。

12月9日周二
11月24日周一
  1. Google DeepMind71

    Google DeepMind 支持美国能源部 Genesis 任务,向 17 所国家实验室开放科学 AI 工具

    Google DeepMind 宣布支持美国白宫与能源部(DOE)的 Genesis 任务,为全美 17 所国家实验室的研究人员提供前沿科学 AI 模型与智能体工具。

    推荐理由:原文给出了合作背景与工具开放时间表,读者可以据此了解前沿科学 AI 智能体如何深度接入国家级实验室科研体系。

11月19日周三
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 3 系列模型与智能体开发平台 Google Antigravity

    Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。

    推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。

  2. Google DeepMind85

    Google DeepMind 推出智能体开发平台 Google Antigravity

    Google DeepMind 推出智能体开发平台 Google Antigravity,现已面向个人开发者免费开启公开预览版。该平台将传统 IDE 拓展为兼具同步代码编辑与异步任务编排的双界面形态,支持智能体自主操作终端、调用浏览器并生成任务工件供人工校验反馈。

    推荐理由:平台展示了从传统编辑器走向多智能体异步调度的设计细节,有助于开发者理解全自主软件工程界面的演进方向。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:整合 Gemini 核心的 3D 虚拟世界具身智能体

    Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。

    推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。

10月30日周四
  1. Hugging Face68

    MiniMax 解读 M2 智能体对齐:交错思考与全轨迹泛化

    MiniMax 团队复盘了 M2 模型的后训练 Agent 对齐经验,提出智能体泛化不仅是增加工具种类,更要适应全操作空间扰动。团队指出单次前置思考无法应对外部环境变化,M2 采用在任务全流程随时触发的交错思考机制,以维持长程连贯性。官方提醒开发者在调用 M2 时必须保留包含思考步骤的完整会话上下文,避免因丢弃思维链导致性能下降。

    推荐理由:团队复盘了基准高分与现实失效的断层,提出将交错思考与全轨迹扰动训练结合以提升通用鲁棒性。

10月23日周四
9月26日周五
  1. Hugging Face61

    Hugging Face 发布 Swift Transformers 1.0

    Hugging Face 正式发布 Swift Transformers 1.0,面向苹果平台的端侧模型工具库正式进入稳定阶段。新版本将 Tokenizers 与 Hub 拆分为独立顶级模块,集成全新高速 swift-jinja 模板库,全面支持 Swift 6,并借助现代 Core ML API 优化有状态模型的键值缓存。

    推荐理由:该版本将分词与下载模块解耦并支持现代苹果计算框架,便于开发者在端侧快速集成工具调用与本地推理能力。

9月25日周四
  1. OpenAI70

    OpenAI 推出 ChatGPT Pulse 移动端预览版

    OpenAI 面向移动端 Pro 用户推出 ChatGPT Pulse 预览版。Pulse 是一项主动式体验,能够根据用户的历史聊天、反馈以及日历等关联应用主动进行调研,并交付个性化更新。

    推荐理由:该功能展示了 ChatGPT 从被动应答转向结合日历与历史对话主动调研的工作机制,有助于了解主动智能体体验的落地形态。

9月23日周二
  1. Hugging Face69

    Hugging Face 发布 Smol2Operator:轻量级 GUI 操作智能体后训练方案与开源模型

    Hugging Face 开源 Smol2Operator,提出了一套将轻量级视觉语言模型转化为图形界面自动化智能体的完整后训练方案,并开放了训练配方、数据工具与开源模型。

    推荐理由:该方案展示了小体量视觉模型通过两阶段后训练和统一动作空间建立图形界面操作能力的完整流程,便于低成本复现端侧操作智能体。

9月15日周一
  1. OpenAI80

    GPT-5 系统卡片补充说明:OpenAI 推出 GPT-5-Codex

    OpenAI 在 GPT-5 系统卡片补充说明中推出新模型 GPT-5-Codex,该版本专门针对 Codex 中的智能体编码进行了优化。该模型能够根据任务复杂度动态调整思考投入,对简单对话或小任务快速响应,并在面对复杂任务时自主工作更长时间。

    推荐理由:原文披露了该模型针对智能体编码的自适应思考机制,读者可以了解它如何依据任务复杂度动态分配推理算力。

9月10日周三
  1. Hugging Face67

    Jupyter Agent:训练大语言模型在 Notebook 中进行推理

    Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。

    推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。

8月18日周一