跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 121–140 条 · 共 144 条
6月6日周五
  1. Hugging Face61

    Hugging Face 发布 GUI 智能体评测套件 ScreenSuite

    Hugging Face 发布 GUI 智能体评测套件 ScreenSuite,旨在提供更易用、全面的视觉语言模型(VLM)智能体能力评测工具。该套件整合统一了 13 个主流基准,覆盖感知定位、单步动作及多步任务三大类,并支持 E2B 远程沙盒以及基于 Docker 本地部署 Ubuntu 桌面和 Android 虚拟环境。

    推荐理由:该基准统一了 13 个 GUI 测试集并坚持纯视觉输入,为评估多模态模型操作桌面和手机的能力提供了可复现的统一测试标准。

5月23日周五
  1. OpenAI76

    OpenAI Operator 底层模型升级为 o3

    OpenAI 宣布将智能体产品 Operator 原有的 GPT-4o 底层模型替换为基于 OpenAI o3 的版本。此外,Operator 的 API 版本仍将继续基于 GPT-4o 运行。

    推荐理由:原文明确了 Operator 智能体底座切换为推理模型 o3 且 API 维持原状的调整,可作为跟踪其落地形态的参考。

5月16日周五
  1. OpenAI76

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明:Codex

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明,披露了基于云端的编码智能体 Codex 及其底层模型 codex-1。codex-1 是针对软件工程优化的 o3 版本,通过强化学习在多种环境的真实编程任务中训练,能够贴合人类代码风格与 PR 偏好,并迭代运行测试直至通过。

    推荐理由:该补充文件披露了编码智能体 Codex 及其底层模型的训练细节,有助于了解大模型针对软件工程进行强化学习的具体路径。

4月30日周三
  1. Hugging Face66

    深入解析 Qwen-3 对话模板带来的 4 个关键设计变化

    Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。

    推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。

4月25日周五
  1. Hugging Face76

    Hugging Face 展示如何用 50 行代码基于 MCP 构建轻量智能体

    Hugging Face 开源了 `@huggingface/mcp-client` 包并撰文展示如何基于模型上下文协议(MCP)用 50 行 TypeScript 代码构建轻量 AI 智能体 Tiny Agents。

    推荐理由:文章拆解了如何将 MCP 客户端与大模型工具调用结合,通过简短的循环逻辑实现智能体控制流,适合开发者搭建轻量级智能体架构。

3月20日周四
  1. OpenAI71

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型。开发者首次可以直接指示文本转语音模型以特定风格说话(例如像富有同情心的客服代表),为语音智能体带来了更高水平的定制能力。

    推荐理由:新模型允许开发者直接用提示词控制语音风格,为语音智能体的定制与拟人交互提供了更灵活的控制方式。

2月4日周二
2月3日周一
  1. OpenAI83

    OpenAI 推出 Deep Research

    OpenAI 推出基于推理的 Deep Research 智能体,能够综合大量在线信息并为用户完成多步骤研究任务。该功能即日起面向 Pro 用户开放,随后将提供给 Plus 和 Team 用户。

    推荐理由:原文说明了该智能体结合推理与多步信息综合的能力定位,并给出了面向不同订阅层级的开放安排。

1月24日周五
  1. Hugging Face67

    Hugging Face 为 smolagents 引入视觉语言模型原生支持

    Hugging Face 宣布开源智能体框架 smolagents 正式支持视觉语言模型(VLM),使智能体能够在任务流程中原生处理图像。框架不仅支持在任务启动时批量传入图像,还允许通过步骤回调函数动态捕获浏览器截图并写入观测记忆。官方结合 helium 自动化工具与 Qwen2-VL 等模型,演示了让视觉智能体自主浏览网页并提取信息的实现流程。

    推荐理由:原文展示了如何通过回调函数动态传入截图让智能体观察网页,为构建基于视觉的浏览器工作流提供了直接参考。

12月31日周二
  1. Hugging Face81

    Hugging Face 推出 smolagents:用代码执行动作的轻量智能体库

    Hugging Face 正式推出轻量智能体库 smolagents,主打让大语言模型直接编写可执行代码而非生成 JSON 来执行外部操作,并计划替代旧版 transformers.agents。该库将核心抽象控制在约千行代码内,支持通过 E2B 沙箱安全运行,并可借助 LiteLLM 接入开源或闭源大模型,支持直接在 Hugging Face Hub 上共享与加载自定义工具。

    推荐理由:文章系统阐释了用可执行代码代替JSON调用工具的优势,为构建轻量Agent提供了清晰的工程范式。

9月16日周一
7月1日周一
  1. Hugging Face75

    Transformers Code Agent 取得 GAIA 基准评测验证集第一

    Hugging Face 介绍了基于 Transformers Agents 构建的 Code Agent 在 GAIA 智能体基准评测中的方案,在验证集以 44.2% 的成绩位列第一,测试集得分 33.3% 位列第二。团队核心采用由智能体直接编写并执行 Python 代码而非生成 JSON 字典的交互范式,搭配基于 AST 构建的安全 Python 解释器以及轻量级多智能体编排和周期性规划机制。

    推荐理由:团队通过实测对比了代码动作与传统 JSON 动作的步骤消耗与性能差异,为构建复杂工具调用智能体提供了安全代码执行与规划架构参考。

5月13日周一
1月24日周三
  1. Hugging Face63

    Hugging Face 评测开源大模型作为 LangChain 智能体的表现

    Hugging Face 评估了多款开源大语言模型在 LangChain ReAct 架构下担任智能体的表现,结果显示 Mixtral-8x7B 在未经专门微调的情况下超越了 GPT-3.5。测试集整合了 HotpotQA、GSM8K 及 GAIA,重点考察模型在网络搜索与计算器调用上的多步推理能力;而借助工具支持,Mixtral-8x7B 在 GSM8K 零样本测试中的准确率达到了 73%。

    推荐理由:文章通过工具调用评测展示了开源模型驱动智能体工作流的可行性,读者可参考其 ReAct 实现与评估方法优化智能体搭建。

1月10日周三
11月6日周一
  1. OpenAI95

    OpenAI 在 DevDay 发布 GPT-4 Turbo 与多款开发者产品

    OpenAI 在 DevDay 开发者大会上发布 GPT-4 Turbo,支持 128K 上下文窗口且调用价格更低。本次更新还同步推出了 Assistants API、具备视觉理解能力的 GPT-4 Turbo with Vision 以及 DALL·E 3 API 等多项开发者工具。

    推荐理由:OpenAI 在 DevDay 发布支持 128K 上下文且价格更低的 GPT-4 Turbo 与 Assistants API,集中更新了模型与开发者工具。

7月24日周一
  1. Hugging Face65

    Hugging Face 推出 Agents.js,支持在 JavaScript 中为大语言模型集成工具

    Hugging Face 推出开源库 Agents.js,允许开发者在浏览器或 Node.js 环境中通过 JavaScript 为大语言模型接入工具。该库开箱即用支持多种多模态工具,允许自由扩展自定义工具和模型,并通过 npm 包 `@huggingface/agents` 分发。官方同时提醒,因运行依赖动态执行模型生成的代码,在不可信环境中建议先通过代码生成接口审查内容后再行评估。

    推荐理由:该库为前端和 Node.js 开发者在 JavaScript 环境中调度多模态工具与大语言模型提供了轻量且可扩展的实现方案。

6月23日周四
  1. OpenAI74

    OpenAI 通过视频预训练(VPT)让模型学会玩《我的世界》

    OpenAI 提出视频预训练(VPT)方法,通过海量无标注人类游戏视频与少量承包商标注数据训练神经网络玩《我的世界》。模型直接使用键盘与鼠标等人类原生接口,经微调后可完成通常需要熟练玩家操作 20 分钟以上(约 24,000 次动作)的合成钻石工具任务。该成果展示了从网络视频中学习行为模式并迈向通用计算机操作智能体的路径。

    推荐理由:该研究展示了利用海量未标注人类视频与少量操作数据预训练模型的方法,为构建通用的计算机操作智能体提供了可行路径。