Google DeepMind·· 2025-12-09AI 评分57
Google DeepMind 联合 Kaggle 推出 FACTS 事实性评测基准套件
FACTS Benchmark Suite: Systematically evaluating the factuality of large language models
AI 导读
Google DeepMind 联合 Kaggle 推出 FACTS 事实性评测基准套件,通过参数化知识、网页搜索、多模态及上下文溯源四个维度系统评估大语言模型的事实准确性。评测集共包含 3,513 个公开样本与私有保留测试集,由 Kaggle 托管并维护公共排行榜。首批 15 款主流大模型测试中 Gemini 3 Pro 以 68.8% 综合得分领先,同时所有受测模型总准确率均在 70% 以下。
来源:Google DeepMind · deepmind.google