跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 41–60 条 · 共 120 条
6月9日周二
  1. Hugging Face74

    AI 智能体如何通过串联两个 Hugging Face Spaces 构建 3D 巴黎画廊

    AI 智能体通过串联两个 Hugging Face Spaces 实现了从文本提示词到 3D 巴黎展馆的自动化构建与部署。Gradio Spaces 现均提供 agents.md 说明文件,智能体无需编写集成代码即可直接读取 API 规范并调用图像生成与 TripoSplat 3D 高斯泼溅重建服务。

    推荐理由:文章展示了通过 agents.md 规范让智能体串联多个模型空间的方法,为跨模型自动化生成与工程组装提供了可直接复用的工作流。

6月8日周一
  1. Hugging Face66

    开源社区联合推进 OpenEnv:打造智能体强化学习交互协议层

    Hugging Face 宣布 OpenEnv 成立多方联合治理委员会,并将其明确为智能体强化学习环境的标准化互操作协议层。OpenEnv 基于客户端与服务端架构提供类 Gymnasium API,通过 HTTP、WebSocket 和 Docker 部署并原生兼容 MCP,不绑定具体的奖励计算逻辑。

    推荐理由:原文阐述了 OpenEnv 作为环境互操作协议层的设计与多机构治理路线,为开源智能体训练提供了标准化的环境交互与部署方案。

6月4日周四
6月2日周二
  1. Hugging Face73

    Holo3.1 系列模型发布:主打本地推理与跨环境电脑操作智能体

    H company 发布 Holo3.1 系列电脑操作模型,涵盖 0.8B、4B、9B 及 35B-A3B 四种尺寸,重点提升桌面、网页和移动端的跨环境鲁棒性与本地执行能力。新版本在 AndroidWorld 移动基准上表现提升明显,并新增对函数调用的原生支持;同时官方推出了 FP8、NVFP4 和 Q4 GGUF 等量化权重,支持在消费级硬件或本地网络中纯离线运行。

    推荐理由:该系列通过量化权重和轻量尺寸将电脑操作智能体扩展至本地端侧,为注重隐私与低延迟的自动化工作流提供了可落地的开源模型方案。

5月25日周一
  1. Hugging Face62

    Hugging Face 发布 AI 智能体术语指南:厘清 Harness、Scaffold 与核心概念

    Hugging Face 发布 AI 智能体核心术语指南,厘清当前行业中容易混淆的关键概念。文章将智能体系统解构为模型、定义行为的脚手架(Scaffolding)与驱动循环的执行层(Harness),指出智能体即为模型与执行层的结合。文中还系统界定了上下文工程、策略、技能、子智能体以及强化学习训练中的环境、Trainer、Rollout 与奖励机制。

    推荐理由:文章厘清了脚手架与执行层等混淆概念,帮助开发者在构建与评测智能体时建立清晰的系统分层认知。

5月18日周一
  1. Google DeepMind70

    Google DeepMind 推出 Project Genie 街景模拟功能并面向 Google AI Ultra 用户开放

    Google DeepMind 宣布在世界模型实验原型 Project Genie 中上线 Street View 锚定功能,并逐步向全球 Google AI Ultra 订阅者开放。用户可选择美国境内地点并结合自定义风格与角色,生成基于真实街景图像的可交互虚拟环境。该能力由 Maps Imagery Grounding 技术支持,旨在为 AI 智能体与机器人提供更贴近现实的交互仿真环境。

    推荐理由:原文展示了通用世界模型 Genie 结合街景生成可交互真实场景的能力,有助于了解世界模型在环境仿真中的落地进展。

5月17日周日
  1. Google DeepMind66

    Google DeepMind 推出 Gemini for Science 科学研究 AI 工具集

    Google DeepMind 推出科学工具与实验集合 Gemini for Science,旨在通过通用智能体加速科研探索。套件在 Google Labs 推出三项实验工具,涵盖基于 Co-Scientist 的假设生成、基于 AlphaEvolve 与 ERA 的并行计算发现,以及基于 NotebookLM 的文献结构化洞察。

    推荐理由:文章详细梳理了多智能体与算法工具在假说生成、计算实验与文献分析中的具体机制,展现了AI介入科研全流程的工程路径。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash:主打智能体与编码能力并面向全球上线

    Google DeepMind 正式推出 Gemini 3.5 系列模型并首发 Gemini 3.5 Flash,主打复杂长流程智能体工作流与编码任务。该模型在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,生成速度达其他前沿模型的 4 倍且成本大幅降低。

    推荐理由:该模型在保持高速低成本的同时大幅提升了智能体与编码基准得分,读者可据此评估长流程任务的自动化落地可行性。

5月12日周二
  1. Google DeepMind77

    Google DeepMind 推出科学研究多智能体系统 Co-Scientist

    Google DeepMind 推出基于 Gemini 构建的科研多智能体系统 Co-Scientist,用于在生命科学等领域自主生成、论证与迭代科研假说,相关成果已在 Nature 发表。

    推荐理由:系统利用多智能体辩论与天梯淘汰机制演进科学假说,读者可以了解大模型如何从文献检索走向严密的端到端科研推导。

5月6日周三
4月30日周四
  1. Google DeepMind65

    Google DeepMind 推出 AI 协诊医生研究计划并探索多模态远程医疗

    Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。

    推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。

4月28日周二
  1. Hugging Face77

    NVIDIA 发布 Nemotron 3 Nano Omni:支持文档、音视频与智能体的长上下文多模态全能模型

    NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。

    推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。

4月24日周五
4月23日周四
4月22日周三
  1. OpenAI69

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),该智能体由 Codex 驱动并在云端运行。它旨在自动化复杂工作流,帮助团队在多种工具间安全扩展工作。

    推荐理由:展示了由 Codex 驱动的云端智能体形态,读者可以借此了解团队跨工具协同工作流的自动化方向。

4月16日周四
  1. OpenAI72

    OpenAI 更新 macOS 与 Windows 版 Codex 应用

    OpenAI 更新了面向 macOS 和 Windows 的 Codex 桌面应用程序,新增计算机使用(computer use)、应用内浏览、图像生成、记忆(memory)以及插件功能。该更新旨在进一步加速开发者的日常工作流。

    推荐理由:更新集中引入了计算机控制与应用内浏览等能力,展示了代码工具向通用桌面操作演进的具体方向。

  2. Hugging Face72

    Hugging Face 推出 transformers-to-mlx Skill 与测试套件,加速模型移植到 Apple MLX

    Hugging Face 推出基于 Claude Code 的 transformers-to-mlx 技能与独立测试套件,辅助开发者将 transformers 架构模型规范地移植到 Apple MLX 框架的 mlx-lm 库。

    推荐理由:它展示了如何将项目规范与独立验证流程封装为技能,在保证提交质量的同时降低开源模型跨框架迁移门槛。

4月15日周三
  1. Hugging Face75

    HCompany 推出浏览器 AI 扩展 HoloTab

    HCompany 推出基于其 Holo3 模型的 Chrome 扩展 HoloTab,支持在任意网站上通过提示词自动执行界面导航与表单填写等任务。扩展内置 Routines 功能,用户只需录制一次网页操作与语音讲解,即可生成自动化流程并支持随时重跑或定时执行。该扩展已在 Chrome 应用商店免费开放。

    推荐理由:原文展示了如何通过录制屏幕与语音解说生成自动化例程,使普通用户能直接在浏览器中复现复杂的跨网页任务。