Hugging Face·· 2026-04-15AI 评分51
深入剖析 VAKRA 基准:AI 智能体的推理、工具调用与失效模式
Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents
AI 导读
IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。
来源:Hugging Face · huggingface.co