跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 21–26 条 · 共 26 条
12月1日周五
  1. Hugging Face61

    Hugging Face 深度解析 Open LLM Leaderboard 上的 DROP 基准问题并宣布下架

    Hugging Face 宣布从 Open LLM Leaderboard 中暂时下架 DROP 评测基准,因排查发现大部分模型得分异常偏低源于实现缺陷。调查表明,DROP 的文本归一化步骤无法正确匹配紧跟换行符的数字,且使用句点作为停止词导致浮点数被强行截断、长回答模型得分受损。由于重新跑完超 50% 错误样本需要消耗巨额 GPU 时间,官方决定等待评测逻辑修复后再行恢复。

    推荐理由:原文拆解了评测实现细节对分数造成的失真影响,展示了基准测试中停用词与归一化逻辑的设计陷阱。

9月12日周二
  1. Hugging Face61

    Transformers 原生量化方案对比:bitsandbytes 与 auto-gptq 性能基准与选型指南

    Hugging Face 对 Transformers 原生支持的 bitsandbytes 与 auto-gptq 进行了全面基准测试与对比。实测表明 bitsandbytes 无需校准数据集且跨模态兼容性好,适配器微调速度更优;auto-gptq 在文本生成推理速度和权重序列化上优势明显。官方建议可在微调阶段采用 bitsandbytes,合并权重后再通过 GPTQ 量化部署。

    推荐理由:文章提供了实测数据对比 bitsandbytes 与 GPTQ 在推理和微调上的表现,方便开发者选型量化方案。

6月23日周五
  1. Hugging Face68

    Hugging Face 详解 Open LLM Leaderboard 评测机制与 MMLU 分数差异成因

    Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 等模型 MMLU 跑分与论文不一致的原因,指出评测框架的实现细节会导致得分和排名出现显著偏差。

    推荐理由:原文对比了三套主流评测代码的实现细节,读者可以据此理解提示词格式和概率计算方式如何改变基准得分与榜单排名。

6月12日周一
  1. Hugging Face69

    Hugging Face 实测基模型能否像人类一样评估标注数据

    Hugging Face 团队联合 Scale AI 展开实测,对比了 GPT-4 与专业人类标注员在评估开源模型表现时的差异。测试显示 GPT-4 虽能维持模型间的大致相对排名,但存在显著的位置偏置、长度偏好,并倾向于给蒸馏自 OpenAI 风格的模型打高分,甚至将人类示范排在开源模型之后。两者打分相关性在头脑风暴等高熵生成任务中可达 0.60,但在代码等低熵任务中降至 0.33。

    推荐理由:该研究对比了 GPT-4 与专业人类标注员在模型评估上的打分差异,揭示出大模型评测存在位置偏好和长度偏置。

10月19日周三
  1. Hugging Face78

    Hugging Face 推出大规模文本嵌入基准 MTEB

    Hugging Face 推出大规模文本嵌入基准 MTEB,涵盖 8 项任务、56 个数据集以及多达 112 种语言,并同步上线汇总超 2000 项测试结果的公开排行榜。开发者可通过开源库 pip install mteb 评测任意嵌入模型,并将生成的元数据提交至 Hugging Face Hub 排行榜展示。

    推荐理由:原文给出了覆盖56个数据集与112种语言的文本嵌入评测方案,读者可以据此选用统一基准评估模型表现并提交结果。

8月6日周一
  1. OpenAI74

    OpenAI Five 基准测试结果:击败高水平人类 Dota 战队

    OpenAI Five 在三局两胜制的基准比赛中战胜了由 99.95% 分位 Dota 选手组成的人类队伍。对手阵容包括 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾为 Dota 职业选手。整场比赛在现场观众及 10 万名同时在线直播观众面前进行。

    推荐理由:该基准对抗展示了强化学习系统在复杂团队策略游戏中战胜高水平人类选手的实际表现。