Hugging Face·· 2024-04-16精选AI 评分68
Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测
Introducing the LiveCodeBench Leaderboard - Holistic and Contamination-Free Evaluation of Code LLMs
AI 导读
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由
基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
来源:Hugging Face · huggingface.co