跳到正文
原文
Hugging Face·· 2025-02-14精选AI 评分69

Hugging Face 引入 Math-Verify 重新评估 Open LLM Leaderboard

Fixing Open LLM Leaderboard with Math-Verify

AI 导读

Hugging Face 宣布在 Open LLM Leaderboard 中引入 Math-Verify 评测器,并重评了此前提交的全部 3,751 个模型。

推荐理由

评测解析缺陷曾导致特定输出格式的模型被严重低估,读者可据此了解数学评测规则变动对开源模型排名的具体影响。

来源:Hugging Face · huggingface.co