跳到正文
原文
Hugging Face·· 2024-06-18AI 评分58

BigCodeBench 代码生成评测基准发布

BigCodeBench: The Next Generation of HumanEval

AI 导读

BigCode 项目团队发布代码生成评测基准 BigCodeBench,旨在替代任务过于简单的 HumanEval 并减少数据污染与过拟合影响。该基准包含 1,140 个函数级任务,要求大模型调用 139 个第三方库解决实际问题,平均每个任务包含 5.6 个测试用例且分支覆盖率达 99%。

来源:Hugging Face · huggingface.co