最新精选
第 121–140 条 · 共 144 条Hugging Face 发布 GUI 智能体评测套件 ScreenSuite,旨在提供更易用、全面的视觉语言模型(VLM)智能体能力评测工具。该套件整合统一了 13 个主流基准,覆盖感知定位、单步动作及多步任务三大类,并支持 E2B 远程沙盒以及基于 Docker 本地部署 Ubuntu 桌面和 Android 虚拟环境。
推荐理由:该基准统一了 13 个 GUI 测试集并坚持纯视觉输入,为评估多模态模型操作桌面和手机的能力提供了可复现的统一测试标准。
Hugging Face 为 huggingface_hub 客户端 SDK 扩展了 MCP Client 支持,并推出约 70 行代码的 Python 版 Tiny Agents。
推荐理由:文章详细拆解了如何用精简代码通过 MCP 接入外部工具,为开发者提供了极低门槛的智能体实现范式。
OpenAI 宣布将智能体产品 Operator 原有的 GPT-4o 底层模型替换为基于 OpenAI o3 的版本。此外,Operator 的 API 版本仍将继续基于 GPT-4o 运行。
推荐理由:原文明确了 Operator 智能体底座切换为推理模型 o3 且 API 维持原状的调整,可作为跟踪其落地形态的参考。
OpenAI 发布 o3 与 o4-mini 系统卡补充说明,披露了基于云端的编码智能体 Codex 及其底层模型 codex-1。codex-1 是针对软件工程优化的 o3 版本,通过强化学习在多种环境的真实编程任务中训练,能够贴合人类代码风格与 PR 偏好,并迭代运行测试直至通过。
推荐理由:该补充文件披露了编码智能体 Codex 及其底层模型的训练细节,有助于了解大模型针对软件工程进行强化学习的具体路径。
Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。
推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。
Hugging Face 开源了 `@huggingface/mcp-client` 包并撰文展示如何基于模型上下文协议(MCP)用 50 行 TypeScript 代码构建轻量 AI 智能体 Tiny Agents。
推荐理由:文章拆解了如何将 MCP 客户端与大模型工具调用结合,通过简短的循环逻辑实现智能体控制流,适合开发者搭建轻量级智能体架构。
OpenAI 在 API 中推出新一代音频模型。开发者首次可以直接指示文本转语音模型以特定风格说话(例如像富有同情心的客服代表),为语音智能体带来了更高水平的定制能力。
推荐理由:新模型允许开发者直接用提示词控制语音风格,为语音智能体的定制与拟人交互提供了更灵活的控制方式。
Hugging Face 启动 24 小时冲刺项目并开源 Open Deep Research,旨在基于 smolagents 库复现 OpenAI Deep Research 的网络搜索与复杂推理能力。
推荐理由:材料展示了用代码替代传统调用协议带来的推理步数缩减与性能变化,开发者可直接参考其工具链设计。
OpenAI 推出基于推理的 Deep Research 智能体,能够综合大量在线信息并为用户完成多步骤研究任务。该功能即日起面向 Pro 用户开放,随后将提供给 Plus 和 Team 用户。
推荐理由:原文说明了该智能体结合推理与多步信息综合的能力定位,并给出了面向不同订阅层级的开放安排。
Hugging Face 宣布开源智能体框架 smolagents 正式支持视觉语言模型(VLM),使智能体能够在任务流程中原生处理图像。框架不仅支持在任务启动时批量传入图像,还允许通过步骤回调函数动态捕获浏览器截图并写入观测记忆。官方结合 helium 自动化工具与 Qwen2-VL 等模型,演示了让视觉智能体自主浏览网页并提取信息的实现流程。
推荐理由:原文展示了如何通过回调函数动态传入截图让智能体观察网页,为构建基于视觉的浏览器工作流提供了直接参考。
Hugging Face 正式推出轻量智能体库 smolagents,主打让大语言模型直接编写可执行代码而非生成 JSON 来执行外部操作,并计划替代旧版 transformers.agents。该库将核心抽象控制在约千行代码内,支持通过 E2B 沙箱安全运行,并可借助 LiteLLM 接入开源或闭源大模型,支持直接在 Hugging Face Hub 上共享与加载自定义工具。
推荐理由:文章系统阐释了用可执行代码代替JSON调用工具的优势,为构建轻量Agent提供了清晰的工程范式。
Hugging Face 在 HuggingChat 中上线 Community Tools 功能,允许用户将平台上的任意公开 Space 转化为大语言模型可直接调用的外部工具。
推荐理由:原文展示了如何将公开 Space 转化为模型可调用的外部工具,为在对话界面中低成本集成多模态生成与私有知识检索提供了具体路径。
Hugging Face 介绍了基于 Transformers Agents 构建的 Code Agent 在 GAIA 智能体基准评测中的方案,在验证集以 44.2% 的成绩位列第一,测试集得分 33.3% 位列第二。团队核心采用由智能体直接编写并执行 Python 代码而非生成 JSON 字典的交互范式,搭配基于 AST 构建的安全 Python 解释器以及轻量级多智能体编排和周期性规划机制。
推荐理由:团队通过实测对比了代码动作与传统 JSON 动作的步骤消耗与性能差异,为构建复杂工具调用智能体提供了安全代码执行与规划架构参考。
Hugging Face 正式发布 Transformers Agents 2.0,引入支持基于观察结果持续迭代的 ReactCodeAgent 和 ReactJsonAgent,并在 v4.41.0 版本中上线。
推荐理由:框架通过模块化解耦底层模型与工具调用逻辑,读者可以借鉴其代码智能体设计在开源模型上构建多模态工作流。
Hugging Face 评估了多款开源大语言模型在 LangChain ReAct 架构下担任智能体的表现,结果显示 Mixtral-8x7B 在未经专门微调的情况下超越了 GPT-3.5。测试集整合了 HotpotQA、GSM8K 及 GAIA,重点考察模型在网络搜索与计算器调用上的多步推理能力;而借助工具支持,Mixtral-8x7B 在 GSM8K 零样本测试中的准确率达到了 73%。
推荐理由:文章通过工具调用评测展示了开源模型驱动智能体工作流的可行性,读者可参考其 ReAct 实现与评估方法优化智能体搭建。
OpenAI 宣布推出 GPT Store。当前材料仅包含标题信息,具体功能与发布细节可参见原文链接。
OpenAI 宣布推出 GPTs,支持用户创建结合了自定义指令、扩展知识库以及技能组合的定制版 ChatGPT。用户可以根据特定需求灵活组合各项能力构建专属 AI 助手。
OpenAI 在 DevDay 开发者大会上发布 GPT-4 Turbo,支持 128K 上下文窗口且调用价格更低。本次更新还同步推出了 Assistants API、具备视觉理解能力的 GPT-4 Turbo with Vision 以及 DALL·E 3 API 等多项开发者工具。
推荐理由:OpenAI 在 DevDay 发布支持 128K 上下文且价格更低的 GPT-4 Turbo 与 Assistants API,集中更新了模型与开发者工具。
Hugging Face 推出开源库 Agents.js,允许开发者在浏览器或 Node.js 环境中通过 JavaScript 为大语言模型接入工具。该库开箱即用支持多种多模态工具,允许自由扩展自定义工具和模型,并通过 npm 包 `@huggingface/agents` 分发。官方同时提醒,因运行依赖动态执行模型生成的代码,在不可信环境中建议先通过代码生成接口审查内容后再行评估。
推荐理由:该库为前端和 Node.js 开发者在 JavaScript 环境中调度多模态工具与大语言模型提供了轻量且可扩展的实现方案。
OpenAI 提出视频预训练(VPT)方法,通过海量无标注人类游戏视频与少量承包商标注数据训练神经网络玩《我的世界》。模型直接使用键盘与鼠标等人类原生接口,经微调后可完成通常需要熟练玩家操作 20 分钟以上(约 24,000 次动作)的合成钻石工具任务。该成果展示了从网络视频中学习行为模式并迈向通用计算机操作智能体的路径。
推荐理由:该研究展示了利用海量未标注人类视频与少量操作数据预训练模型的方法,为构建通用的计算机操作智能体提供了可行路径。