Hugging Face 深度解析 Open LLM Leaderboard 上的 DROP 基准问题并宣布下架
Hugging Face 宣布从 Open LLM Leaderboard 中暂时下架 DROP 评测基准,因排查发现大部分模型得分异常偏低源于实现缺陷。调查表明,DROP 的文本归一化步骤无法正确匹配紧跟换行符的数字,且使用句点作为停止词导致浮点数被强行截断、长回答模型得分受损。由于重新跑完超 50% 错误样本需要消耗巨额 GPU 时间,官方决定等待评测逻辑修复后再行恢复。
推荐理由:原文拆解了评测实现细节对分数造成的失真影响,展示了基准测试中停用词与归一化逻辑的设计陷阱。