面向 MCP 智能体的来源感知核验方法 ProvenanceGuard:确保来源与事实双重准确
ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。
ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。
IBM Research 推出企业级 Java 跨框架迁移评测基准 ScarfBench,用于评估 AI Agent 在 Spring、Jakarta EE 与 Quarkus 之间迁移后是否能成功构建、部署并保持原有行为。
DiScoFormer 采用 Transformer 架构,无需重新训练即可通过单次前向传播同时估计分布的密度与分值。在 100 维测试中,它相比经调优的核密度估计(KDE)将分值误差降低约 6.5 倍、密度误差降低超过 37 倍。模型还支持在推理阶段利用二者的一致性损失实现即时自适应,可良好泛化至未见过的多模态及非高斯分布。
ServiceNow 等机构提出 MosaicLeaks 基准与 PA-DR 强化学习方法,评估并解决深度研究智能体在多跳检索中通过外部搜索查询累积泄露本地私有信息的“拼图效应”。
BigCode 项目团队发布代码生成评测基准 BigCodeBench,旨在替代任务过于简单的 HumanEval 并减少数据污染与过拟合影响。该基准包含 1,140 个函数级任务,要求大模型调用 139 个第三方库解决实际问题,平均每个任务包含 5.6 个测试用例且分支覆盖率达 99%。
Hugging Face 与爱丁堡大学等合作推出大语言模型幻觉评测排行榜 Hallucinations Leaderboard,通过上下文学习全面评估模型的事实性与忠实度表现。