跳到正文

#arXiv

今日 0 条
9月29日周二
  1. Hugging Face43

    面向 MCP 智能体的来源感知核验方法 ProvenanceGuard:确保来源与事实双重准确

    ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。

9月16日周三
  1. Hugging Face69

    ALTK-Evolve 推出 Consistency Analyzer 与一致性准则以提升 Agent 执行稳定性

    IBM Research 在开源框架 ALTK-Evolve 中推出 Consistency Analyzer 与一致性准则机制,用于诊断并解决 AI Agent 多次执行同一任务时结果波动的可靠性问题。

    推荐理由:原文提出通过单次轨迹重采样定位易翻转决策并生成准则,为解决智能体重复执行波动提供了无需重跑环境的诊断方案。

7月1日周三
6月30日周二
  1. Hugging Face42

    DiScoFormer:用单一 Transformer 跨分布估计密度与分值

    DiScoFormer 采用 Transformer 架构,无需重新训练即可通过单次前向传播同时估计分布的密度与分值。在 100 维测试中,它相比经调优的核密度估计(KDE)将分值误差降低约 6.5 倍、密度误差降低超过 37 倍。模型还支持在推理阶段利用二者的一致性损失实现即时自适应,可良好泛化至未见过的多模态及非高斯分布。

6月19日周五
11月19日周三
  1. Hugging Face66

    ServiceNow 发布 Apriel-H1:通过蒸馏打造高效 Mamba 混合推理模型

    ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。

    推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。

8月18日周一
9月23日周一
6月18日周二
  1. Hugging Face58

    BigCodeBench 代码生成评测基准发布

    BigCode 项目团队发布代码生成评测基准 BigCodeBench,旨在替代任务过于简单的 HumanEval 并减少数据污染与过拟合影响。该基准包含 1,140 个函数级任务,要求大模型调用 139 个第三方库解决实际问题,平均每个任务包含 5.6 个测试用例且分支覆盖率达 99%。

1月29日周一
11月17日周四
  1. Hugging Face76

    Hugging Face 与 arXiv 达成合作,论文页面上线机器学习 Demo 体验标签

    Hugging Face 宣布与 arXiv 达成合作,通过 arXivLabs 在 arXiv 论文页面新增 Demo 标签页。用户无需在本地配置环境或运行代码,即可直接在浏览器中试用社区或作者基于 Gradio、Streamlit 构建的开源交互式应用。这一功能提升了学术论文的可复现性与传播度,便于更广泛的人群探索和验证模型效果。

    推荐理由:arXiv 论文页面直接集成 Hugging Face Spaces 演示,方便研究者和开发者无需配置环境即可在线验证模型效果。