跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 101–120 条 · 共 120 条
8月5日周二
  1. Hugging Face64

    在 DeepResearch Bench 上评测开源 Llama Nemotron 模型

    NVIDIA 的 AI-Q 深度研究智能体在 DeepResearch Bench 的搜索增强大语言模型榜单中取得 40.52 的总分,位列完全开源架构榜首。

    推荐理由:文章呈现了开源大模型结合检索架构在深度研究基准上的实测表现,为构建本地可部署的智能体工作流提供了参数选型与评测参考。

7月31日周四
  1. Hugging Face68

    用 Python 实现 MCP 服务器:基于 Gradio 构建 AI 试衣助手

    Hugging Face 介绍了通过 Gradio 的 MCP 集成在 Python 中快速搭建 MCP 服务器的方法,只需在 launch() 中设置 mcp_server=True 即可将应用端点自动转换为 LLM 工具。

    推荐理由:展示了如何用 Gradio 将 Python 函数与 Hugging Face 空间封装为 MCP 服务,适合需要为 Agent 接入多模态工具的开发者参考。

7月17日周四
  1. OpenAI78

    OpenAI 发布 ChatGPT agent 系统卡片

    OpenAI 发布 ChatGPT agent 系统卡片,详细介绍了其整合研究、浏览器自动化与代码工具的智能体模型。该模型在 OpenAI 的预备框架(Preparedness Framework)指导下部署了相应的安全保障措施。

    推荐理由:系统卡片展示了该智能体整合研究、浏览器自动化与代码工具的方式,读者可借此了解其在预备框架下的安全规范。

  2. Hugging Face67

    Gradio 5.38.0 针对 MCP 服务器推出五项重要改进

    Gradio 在 5.38.0 版本中为 MCP 服务器功能推出五项核心更新,全面提升 AI 智能体与工具调用的交互体验。新版本引入了文件上传辅助服务以支持本地文件直接传入,支持流式传输实时进度通知,并提供 gr.load_openapi 实现一行代码将 OpenAPI 规范转为 MCP 服务器。此外,更新还新增了通过 gr.Header 自动提取请求头鉴权信息的能力,并允许开发者自定义工具描述。

    推荐理由:更新简化了开发者将现有 API 和本地文件接入 MCP 生态的工程流程,有助于降低智能体工具调用的构建成本。

7月10日周四
5月23日周五
  1. OpenAI76

    OpenAI Operator 底层模型升级为 o3

    OpenAI 宣布将智能体产品 Operator 原有的 GPT-4o 底层模型替换为基于 OpenAI o3 的版本。此外,Operator 的 API 版本仍将继续基于 GPT-4o 运行。

    推荐理由:原文明确了 Operator 智能体底座切换为推理模型 o3 且 API 维持原状的调整,可作为跟踪其落地形态的参考。

4月30日周三
  1. Hugging Face66

    深入解析 Qwen-3 对话模板带来的 4 个关键设计变化

    Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。

    推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。

4月25日周五
  1. Hugging Face76

    Hugging Face 展示如何用 50 行代码基于 MCP 构建轻量智能体

    Hugging Face 开源了 `@huggingface/mcp-client` 包并撰文展示如何基于模型上下文协议(MCP)用 50 行 TypeScript 代码构建轻量 AI 智能体 Tiny Agents。

    推荐理由:文章拆解了如何将 MCP 客户端与大模型工具调用结合,通过简短的循环逻辑实现智能体控制流,适合开发者搭建轻量级智能体架构。

2月4日周二
1月24日周五
  1. Hugging Face67

    Hugging Face 为 smolagents 引入视觉语言模型原生支持

    Hugging Face 宣布开源智能体框架 smolagents 正式支持视觉语言模型(VLM),使智能体能够在任务流程中原生处理图像。框架不仅支持在任务启动时批量传入图像,还允许通过步骤回调函数动态捕获浏览器截图并写入观测记忆。官方结合 helium 自动化工具与 Qwen2-VL 等模型,演示了让视觉智能体自主浏览网页并提取信息的实现流程。

    推荐理由:原文展示了如何通过回调函数动态传入截图让智能体观察网页,为构建基于视觉的浏览器工作流提供了直接参考。

7月1日周一
  1. Hugging Face75

    Transformers Code Agent 取得 GAIA 基准评测验证集第一

    Hugging Face 介绍了基于 Transformers Agents 构建的 Code Agent 在 GAIA 智能体基准评测中的方案,在验证集以 44.2% 的成绩位列第一,测试集得分 33.3% 位列第二。团队核心采用由智能体直接编写并执行 Python 代码而非生成 JSON 字典的交互范式,搭配基于 AST 构建的安全 Python 解释器以及轻量级多智能体编排和周期性规划机制。

    推荐理由:团队通过实测对比了代码动作与传统 JSON 动作的步骤消耗与性能差异,为构建复杂工具调用智能体提供了安全代码执行与规划架构参考。

5月13日周一
1月24日周三
  1. Hugging Face63

    Hugging Face 评测开源大模型作为 LangChain 智能体的表现

    Hugging Face 评估了多款开源大语言模型在 LangChain ReAct 架构下担任智能体的表现,结果显示 Mixtral-8x7B 在未经专门微调的情况下超越了 GPT-3.5。测试集整合了 HotpotQA、GSM8K 及 GAIA,重点考察模型在网络搜索与计算器调用上的多步推理能力;而借助工具支持,Mixtral-8x7B 在 GSM8K 零样本测试中的准确率达到了 73%。

    推荐理由:文章通过工具调用评测展示了开源模型驱动智能体工作流的可行性,读者可参考其 ReAct 实现与评估方法优化智能体搭建。

1月10日周三
7月24日周一
  1. Hugging Face65

    Hugging Face 推出 Agents.js,支持在 JavaScript 中为大语言模型集成工具

    Hugging Face 推出开源库 Agents.js,允许开发者在浏览器或 Node.js 环境中通过 JavaScript 为大语言模型接入工具。该库开箱即用支持多种多模态工具,允许自由扩展自定义工具和模型,并通过 npm 包 `@huggingface/agents` 分发。官方同时提醒,因运行依赖动态执行模型生成的代码,在不可信环境中建议先通过代码生成接口审查内容后再行评估。

    推荐理由:该库为前端和 Node.js 开发者在 JavaScript 环境中调度多模态工具与大语言模型提供了轻量且可扩展的实现方案。

6月23日周四
  1. OpenAI74

    OpenAI 通过视频预训练(VPT)让模型学会玩《我的世界》

    OpenAI 提出视频预训练(VPT)方法,通过海量无标注人类游戏视频与少量承包商标注数据训练神经网络玩《我的世界》。模型直接使用键盘与鼠标等人类原生接口,经微调后可完成通常需要熟练玩家操作 20 分钟以上(约 24,000 次动作)的合成钻石工具任务。该成果展示了从网络视频中学习行为模式并迈向通用计算机操作智能体的路径。

    推荐理由:该研究展示了利用海量未标注人类视频与少量操作数据预训练模型的方法,为构建通用的计算机操作智能体提供了可行路径。

4月15日周一
  1. OpenAI89

    OpenAI Five 战胜 Dota 2 世界冠军战队 OG

    OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。

    推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。

10月31日周三
  1. OpenAI70

    OpenAI 提出基于预测奖励的强化学习方法 RND

    OpenAI 研发了随机网络蒸馏(Random Network Distillation,RND),这是一种基于预测奖励驱动强化学习智能体通过好奇心探索环境的方法。该方法在经典强化学习测试游戏 Montezuma's Revenge 上的表现首次超过了人类平均水平。

    推荐理由:原文提出了基于好奇心驱动强化学习智能体探索的方法,为解决稀疏奖励环境下的探索难题提供了具体思路。