跳到正文
原文
Hugging Face·· 1 小时前精选AI 评分76

微软联合 Hugging Face 推出 ThinkingBox 基准:基于数据库终态检验智能体可靠性

The Agent Said It Was Done. The Database Disagreed.

AI 导读

微软与 Hugging Face 联合推出 AI 智能体评测基准与沙盒 ThinkingBox,通过检验任务执行后的后端数据库终态与实际副作用,评估模型在真实业务流程中的有效性与重复可靠性。该基准涵盖 507 个有状态业务工作流并对每个任务独立重复运行 20 次,测试发现约 80% 的任务失败源于工具调用而非推理问题,目前相关环境与数据集已在 Hugging Face 开源。

推荐理由

评测揭示了智能体输出看似成功但实际未正确修改数据库的现象,为检验智能体多次重复执行的可靠性提供了验证方案。

来源:Hugging Face · huggingface.co