Hugging Face·· 2025-02-14精选AI 评分69
Hugging Face 引入 Math-Verify 重新评估 Open LLM Leaderboard
Fixing Open LLM Leaderboard with Math-Verify
AI 导读
Hugging Face 宣布在 Open LLM Leaderboard 中引入 Math-Verify 评测器,并重评了此前提交的全部 3,751 个模型。
推荐理由
评测解析缺陷曾导致特定输出格式的模型被严重低估,读者可据此了解数学评测规则变动对开源模型排名的具体影响。
来源:Hugging Face · huggingface.co