跳到正文

#搜索

今日 0 条
12月9日周二
  1. Google DeepMind57

    Google DeepMind 联合 Kaggle 推出 FACTS 事实性评测基准套件

    Google DeepMind 联合 Kaggle 推出 FACTS 事实性评测基准套件,通过参数化知识、网页搜索、多模态及上下文溯源四个维度系统评估大语言模型的事实准确性。评测集共包含 3,513 个公开样本与私有保留测试集,由 Kaggle 托管并维护公共排行榜。首批 15 款主流大模型测试中 Gemini 3 Pro 以 68.8% 综合得分领先,同时所有受测模型总准确率均在 70% 以下。

10月1日周三
  1. Hugging Face49

    Hugging Face 推出检索评测基准 RTEB:检索评估新标准

    Hugging Face 推出检索嵌入评测基准 RTEB(Retrieval Embedding Benchmark)Beta 版,采用公开与私有数据集混合策略,旨在衡量 embedding 模型的真实检索泛化能力。该基准覆盖 20 种语言及法律、医疗、金融等企业领域,以 NDCG@10 为默认指标,私有数据集评测由 MTEB 团队负责以防刷榜过拟合。