跳到正文

#Hugging Face

今日 0 条
9月29日周二
  1. Hugging Face43

    面向 MCP 智能体的来源感知核验方法 ProvenanceGuard:确保来源与事实双重准确

    ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。

9月22日周二
9月2日周三
  1. Hugging Face54

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计大语言模型评测基准

    AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

8月19日周三
  1. Hugging Face64

    智能体到底需要多少记忆:ALTK-Evolve 跨模型记忆注入评测

    IBM 研究团队通过 ALTK-Evolve 框架测试了八款大语言模型在 AppWorld 上的表现,发现智能体记忆的注入剂量需根据模型能力进行精准校准。

    推荐理由:研究揭示了智能体记忆并非越多越好,较弱模型适合核心检索而强模型适合全量注入,为推理阶段上下文分配提供了量化参考。

8月13日周四
8月11日周二
7月15日周三
  1. Hugging Face56

    Real World VoiceEQ 评测基准发布,评估语音 AI 的真实人类交互能力

    Real World VoiceEQ 语音评测基准发布,基于超过 100 万次人类独立评分评估 40 多款主流专有和开源语音模型的真实交互水平。该基准涵盖 ASR、TTS、S2S 与语音理解等领域共 15 个维度和 60 多项指标,依托 Kairos 评测平台构建。评测发现语音模型正走向能力专业化,且多数模型在语气、情绪和停顿等副语言感知上仍落后于表达能力。

7月1日周三
6月24日周三
6月19日周五
4月15日周三
  1. Hugging Face51

    深入剖析 VAKRA 基准:AI 智能体的推理、工具调用与失效模式

    IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。

3月24日周二
  1. Hugging Face61

    ServiceNow 推出端到端语音智能体评测框架 EVA

    ServiceNow AI 团队推出端到端语音智能体评测框架 EVA,联合评估任务准确性与对话交互体验。框架采用端到端音频模拟架构,首发包含 50 个航空业务场景的测试集,覆盖级联与原生音频等 20 款系统。评测结果显示任务完成度高的智能体往往交互体验更差,且专有名词转写是导致交互中断的主要瓶颈。

    推荐理由:该框架将任务准确率与对话交互体验联合度量,为语音智能体的全流程实测提供了可参考的基准方案。

10月1日周三
  1. Hugging Face49

    Hugging Face 推出检索评测基准 RTEB:检索评估新标准

    Hugging Face 推出检索嵌入评测基准 RTEB(Retrieval Embedding Benchmark)Beta 版,采用公开与私有数据集混合策略,旨在衡量 embedding 模型的真实检索泛化能力。该基准覆盖 20 种语言及法律、医疗、金融等企业领域,以 NDCG@10 为默认指标,私有数据集评测由 MTEB 团队负责以防刷榜过拟合。

9月26日周五
9月3日周三
8月21日周四
  1. Hugging Face66

    NVIDIA 发布 600 万条多语言推理数据集与 Nemotron Nano 2 9B 模型

    NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。

    推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。

7月23日周三
  1. Hugging Face49

    TimeScope:视频大多模态模型到底能处理多长的视频?

    开源评测基准 TimeScope 在 Hugging Face 发布,旨在通过在 1 分钟至 8 小时的基础视频中插入 5 至 10 秒的短视频片段,评估视觉语言模型的长视频理解能力。该基准从局部检索、信息综合和细粒度时序感知三项任务进行评测,测试发现前沿模型在面对真实时序理解时仍表现吃力,性能随视频变长出现明显下滑。

7月17日周四
3月11日周二
2月4日周二
10月4日周五
  1. Hugging Face47

    Open FinLLM 排行榜正式发布

    Open FinLLM 排行榜正式推出,专为评估大语言模型在真实金融垂直场景下的综合能力而设立。该基准采用零样本评测方法,全面涵盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大任务类别。评测体系结合了 Accuracy、F1 Score、ROUGE 与 MCC 等多维指标,用于客观检验模型处理复杂金融数据的泛化水平。

10月1日周二
  1. Hugging Face34

    BenCzechMark:你的 LLM 能理解捷克语吗?

    BenCzechMark 推出捷克语大语言模型综合评测基准与排行榜,用于评估模型在捷克语下的复杂推理、生成及文化知识掌握能力。该基准包含 9 个类别的 50 项任务,其中 90% 为原生非翻译内容,首批排行榜涵盖超过 25 款开源模型。评测覆盖阅读理解、语法纠错、数学推理等维度,采用 Acc、EM、AUROC 与词级困惑度(Ppl)等指标进行公平评估。

9月23日周一
7月25日周四
  1. Hugging Face34

    LAVE:基于大语言模型在 Docmatix 上的零样本 VQA 评测——我们还需要微调吗?

    Hugging Face 探讨了利用大语言模型辅助评测方法 LAVE 解决传统 VQA 指标因格式差异导致评分失真的问题,并在合成数据集 Docmatix 上开展零样本评测。实验以 MPLUGDocOwl1.5 为基线并使用 Llama-2-Chat-7b 打分,传统指标 ANLS 仅为 0.002、BLEU 为 0.0032,而 LAVE 得分达 0.58,能更准确评估模型的实际语义泛化能力。

6月18日周二
  1. Hugging Face58

    BigCodeBench 代码生成评测基准发布

    BigCode 项目团队发布代码生成评测基准 BigCodeBench,旨在替代任务过于简单的 HumanEval 并减少数据污染与过拟合影响。该基准包含 1,140 个函数级任务,要求大模型调用 139 个第三方库解决实际问题,平均每个任务包含 5.6 个测试用例且分支覆盖率达 99%。

5月24日周五
  1. Hugging Face62

    CyberSecEval 2 发布:大语言模型网络安全风险与能力评估框架上线

    Meta 与 Hugging Face 推出开源基准 CyberSecEval 2 及排行榜,用于系统评估大语言模型在网络安全领域的风险与能力。评测覆盖不安全代码生成、提示词注入抵御、协助网络攻击合规率、代码解释器滥用以及自动化攻防渗透等维度。最新评测显示模型协助网络攻击的合规率从 52% 降至 28%,但提示词注入和解释器滥用在面对对抗性输入时仍缺乏可靠防护。

    推荐理由:该框架从不安全代码生成与提示词注入等维度评估模型风险,帮助开发者在接入代码助手时量化评估潜在安全隐患。

5月14日周二
5月5日周日
4月30日周二
  1. Hugging Face56

    Hugging Face 探索利用结构化生成提升提示词评测一致性

    Hugging Face 评测团队与 Dottxt 合作研究发现,大语言模型对提示词格式及示例排列顺序高度敏感,而引入结构化生成可显著降低评测方差并稳定模型排名。在 GSM8K 与 GPQA 测试中,使用 Outlines 正则表达式约束输出不仅使 Mistral-7B 和 Zephyr-7B 的平均得分提高,还消除了少样本设置下的模型胜负倒挂现象。

4月23日周二
  1. Hugging Face46

    Hugging Face 推出 Open CoT Leaderboard

    Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。

4月19日周五
4月16日周二
  1. Hugging Face68

    Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测

    Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。

    推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。

3月20日周三
  1. Hugging Face73

    Hugging Face 详解 Cosmopedia:如何构建用于大模型预训练的大规模合成数据集

    Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。

    推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。

3月5日周二
  1. Hugging Face45

    ConTextual 发布:测试多模态大模型在富文本场景下的图文联合推理能力

    加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。

2月23日周五
2月20日周二
2月2日周五
  1. Hugging Face49

    NPHardEval 排行榜:通过计算复杂度与动态更新揭示大语言模型推理能力

    Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。

1月31日周三
  1. Hugging Face46

    Patronus 联合 Hugging Face 推出企业场景排行榜 Enterprise Scenarios Leaderboard

    Patronus 联合 Hugging Face 推出企业场景排行榜 Enterprise Scenarios Leaderboard,用于评估大语言模型在真实企业场景的表现。榜单包含 FinanceBench、法律保密性、创意写作、客服对话、毒性及企业 PII 共 6 项任务。为防止测试集污染,除 FinanceBench 和法律保密性开源外,其余 4 个数据集均闭源且仅提供验证集。

1月29日周一