面向 MCP 智能体的来源感知核验方法 ProvenanceGuard:确保来源与事实双重准确
ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。
ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。
英国人工智能安全研究所(UK AISI)接入 EvalEval 基础设施,通过 Evaluation Cards 平台与统一模式公开前沿大模型的基准评测配置与验证结果。
AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。
研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。
IBM 研究团队通过 ALTK-Evolve 框架测试了八款大语言模型在 AppWorld 上的表现,发现智能体记忆的注入剂量需根据模型能力进行精准校准。
推荐理由:研究揭示了智能体记忆并非越多越好,较弱模型适合核心检索而强模型适合全量注入,为推理阶段上下文分配提供了量化参考。
Hugging Face 组织了 ICML 2026 开源复现挑战赛,1221 名社区成员利用编程 Agent 尝试复现了 2226 篇录用论文,覆盖该届会议总论文量的 34%。
推荐理由:该实验借助编程智能体对两千余篇顶会论文进行逐项复现,展示了学术同行评审在大规模投稿下的盲区与人机协同审计范式。
IBM Research 对比了智能体记忆系统 ALTK-Evolve 与 ACE,展示了通过按需投递经验指南大幅降低推理 Token 消耗的方案。ALTK-Evolve 不直接压缩历史经验,而是通过聚类合并并保留支持计数,在推理时根据模型能力与任务动态检索适量指南。
Real World VoiceEQ 语音评测基准发布,基于超过 100 万次人类独立评分评估 40 多款主流专有和开源语音模型的真实交互水平。该基准涵盖 ASR、TTS、S2S 与语音理解等领域共 15 个维度和 60 多项指标,依托 Kairos 评测平台构建。评测发现语音模型正走向能力专业化,且多数模型在语气、情绪和停顿等副语言感知上仍落后于表达能力。
IBM Research 推出企业级 Java 跨框架迁移评测基准 ScarfBench,用于评估 AI Agent 在 Spring、Jakarta EE 与 Quarkus 之间迁移后是否能成功构建、部署并保持原有行为。
Treble Technologies 与 Hugging Face 联合推出首个开源远场语音识别评测榜单 FFASR Leaderboard,用于系统评估 ASR 模型在真实远场声学环境下的表现。
ServiceNow 等机构提出 MosaicLeaks 基准与 PA-DR 强化学习方法,评估并解决深度研究智能体在多跳检索中通过外部搜索查询累积泄露本地私有信息的“拼图效应”。
IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。
ServiceNow AI 团队推出端到端语音智能体评测框架 EVA,联合评估任务准确性与对话交互体验。框架采用端到端音频模拟架构,首发包含 50 个航空业务场景的测试集,覆盖级联与原生音频等 20 款系统。评测结果显示任务完成度高的智能体往往交互体验更差,且专有名词转写是导致交互中断的主要瓶颈。
推荐理由:该框架将任务准确率与对话交互体验联合度量,为语音智能体的全流程实测提供了可参考的基准方案。
Hugging Face 推出检索嵌入评测基准 RTEB(Retrieval Embedding Benchmark)Beta 版,采用公开与私有数据集混合策略,旨在衡量 embedding 模型的真实检索泛化能力。该基准覆盖 20 种语言及法律、医疗、金融等企业领域,以 NDCG@10 为默认指标,私有数据集评测由 MTEB 团队负责以防刷榜过拟合。
NVIDIA 开源面向日本主权 AI 开发的合成画像数据集 Nemotron-Personas-Japan,采用 CC BY 4.0 协议发布。该数据集基于日本官方人口与劳动统计数据生成,包含 100 万条记录、共 600 万个自然日语人物画像,覆盖 1500 多个职业分类与约 14 亿 token。
SandboxAQ 在 Hugging Face 开源药物研发数据集 SAIR,包含 524 万个蛋白质-配体 3D 复合物结构及实验 IC₅₀ 活性数据,采用 CC BY 4.0 协议。
NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。
推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。
开源评测基准 TimeScope 在 Hugging Face 发布,旨在通过在 1 分钟至 8 小时的基础视频中插入 5 至 10 秒的短视频片段,评估视觉语言模型的长视频理解能力。该基准从局部检索、信息综合和细粒度时序感知三项任务进行评测,测试发现前沿模型在面对真实时序理解时仍表现吃力,性能随视频变长出现明显下滑。
Hugging Face 推出动态评测基准 FutureBench,旨在通过预测尚未发生的真实世界事件来评估 AI 智能体的推理与综合能力。该基准通过抓取实时新闻并结合预测市场 Polymarket 生成具备明确时间周期的预测任务,从机制上杜绝了固定测试集常见的数据污染问题。
Yaak 联合 Hugging Face 的 LeRobot 团队发布开源自动驾驶数据集 Learning to Drive(L2D),专为端到端空间智能与自动驾驶模型训练设计。
推荐理由:数据集结合了驾校教练与学员的双重策略与自然语言指令,为端到端自动驾驶模型提供了大规模真实训练基准。
Hugging Face 与 Adyen 联合推出面向多步推理的数据分析智能体评测基准 DABstep,包含源自真实支付业务场景的 450 多个分析任务。目前主流模型在困难任务上的准确率均未突破 20%,其中 o3-mini 以 16% 领跑,DeepSeek-R1 达到 13% 并在调用成本与表现平衡上表现突出。
Open FinLLM 排行榜正式推出,专为评估大语言模型在真实金融垂直场景下的综合能力而设立。该基准采用零样本评测方法,全面涵盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大任务类别。评测体系结合了 Accuracy、F1 Score、ROUGE 与 MCC 等多维指标,用于客观检验模型处理复杂金融数据的泛化水平。
BenCzechMark 推出捷克语大语言模型综合评测基准与排行榜,用于评估模型在捷克语下的复杂推理、生成及文化知识掌握能力。该基准包含 9 个类别的 50 项任务,其中 90% 为原生非翻译内容,首批排行榜涵盖超过 25 款开源模型。评测覆盖阅读理解、语法纠错、数学推理等维度,采用 Acc、EM、AUROC 与词级困惑度(Ppl)等指标进行公平评估。
Hugging Face 详细公开了开源视频数据集 FineVideo 的构建流程,涵盖从 1.9M 原始视频筛选至 43k 视频(约 3.4k 小时)的多阶段技术细节。
推荐理由:原文完整拆解了从海量视频筛选、多模型标注到结构化解析的管线,对构建多模态视频训练集有直接工程参考价值。
Hugging Face 探讨了利用大语言模型辅助评测方法 LAVE 解决传统 VQA 指标因格式差异导致评分失真的问题,并在合成数据集 Docmatix 上开展零样本评测。实验以 MPLUGDocOwl1.5 为基线并使用 Llama-2-Chat-7b 打分,传统指标 ANLS 仅为 0.002、BLEU 为 0.0032,而 LAVE 得分达 0.58,能更准确评估模型的实际语义泛化能力。
BigCode 项目团队发布代码生成评测基准 BigCodeBench,旨在替代任务过于简单的 HumanEval 并减少数据污染与过拟合影响。该基准包含 1,140 个函数级任务,要求大模型调用 139 个第三方库解决实际问题,平均每个任务包含 5.6 个测试用例且分支覆盖率达 99%。
Meta 与 Hugging Face 推出开源基准 CyberSecEval 2 及排行榜,用于系统评估大语言模型在网络安全领域的风险与能力。评测覆盖不安全代码生成、提示词注入抵御、协助网络攻击合规率、代码解释器滥用以及自动化攻防渗透等维度。最新评测显示模型协助网络攻击的合规率从 52% 降至 28%,但提示词注入和解释器滥用在面对对抗性输入时仍缺乏可靠防护。
推荐理由:该框架从不安全代码生成与提示词注入等维度评估模型风险,帮助开发者在接入代码助手时量化评估潜在安全隐患。
Open Arabic LLM Leaderboard(OALL)正式推出,旨在为全球超 3.8 亿阿拉伯语使用者提供专门的大语言模型评测与对比平台。该榜单整合了 AlGhafa、ACVA 和 AceGPT 等基准数据集,主要采用归一化对数似然准确率指标,依托 lighteval 库在 TII 集群上运行评测。
针对希伯来语形态复杂的语言特性,全新的希伯来语大语言模型开源排行榜(Open Leaderboard for Hebrew LLMs)正式推出。该榜单采用 few-shot 评测模式,涵盖问答(HeQ)、情感分析、Winograd Schema 代词消歧及英希翻译 4 个核心基准任务。
Hugging Face 评测团队与 Dottxt 合作研究发现,大语言模型对提示词格式及示例排列顺序高度敏感,而引入结构化生成可显著降低评测方差并稳定模型排名。在 GSM8K 与 GPQA 测试中,使用 Outlines 正则表达式约束输出不仅使 Mistral-7B 和 Zephyr-7B 的平均得分提高,还消除了少样本设置下的模型胜负倒挂现象。
Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。
Hugging Face 与合作团队推出标准化评测平台 Open Medical-LLM Leaderboard,用于系统评估大语言模型在医疗领域的知识与问答表现。
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。
推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。
加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。
Haize Labs 在 Hugging Face 支持下推出红队对抗基准(Red Teaming Resistance Benchmark)及排行榜,系统评估前沿大语言模型抵御高拟真自然语言攻击的鲁棒性。
Upstage 推出面向韩语大语言模型的公开评测平台 Open Ko-LLM Leaderboard。该平台采用私有测试集以防数据污染,涵盖 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 共 5 项评测基准。
Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。
Patronus 联合 Hugging Face 推出企业场景排行榜 Enterprise Scenarios Leaderboard,用于评估大语言模型在真实企业场景的表现。榜单包含 FinanceBench、法律保密性、创意写作、客服对话、毒性及企业 PII 共 6 项任务。为防止测试集污染,除 FinanceBench 和法律保密性开源外,其余 4 个数据集均闭源且仅提供验证集。
Hugging Face 与爱丁堡大学等合作推出大语言模型幻觉评测排行榜 Hallucinations Leaderboard,通过上下文学习全面评估模型的事实性与忠实度表现。