Hugging Face·· 2024-04-23AI 评分46
Hugging Face 推出 Open CoT Leaderboard
Introducing the Open Chain of Thought Leaderboard
AI 导读
Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。
来源:Hugging Face · huggingface.co