跳到正文
原文
Hugging Face·· 2024-04-23AI 评分46

Hugging Face 推出 Open CoT Leaderboard

Introducing the Open Chain of Thought Leaderboard

AI 导读

Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。

来源:Hugging Face · huggingface.co