Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
BigCode 联合开源了新一代代码大语言模型 StarCoder2 及代码预训练数据集 The Stack v2,并同步公开所有模型权重、数据集、处理与训练代码。
推荐理由:BigCode开源了代码大语言模型StarCoder2及高质量预训练数据集The Stack v2,覆盖从3B到15B参数规模并公开全部训练细节。
Hugging Face 发布了基于专属代码库训练代码助手 HugCoder 的完整端到端实践教程。内容涵盖从本地仓库提取与过滤代码、基于单张 A100 40GB 运行 QLoRA 与 8 卡 FSDP 全量微调的成本对比,以及利用 PEFT 融合对话与补全两种 LoRA 权重的方法。
推荐理由:教程给出了从私有代码清洗、QLoRA微调到本地IDE部署的完整实现,开发者可直接参考搭建专属编程助手。
Hugging Face 与 ServiceNow 联合发起的 BigCode 项目正式发布 15B 参数的代码大语言模型 StarCoderBase 以及面向 Python 微调的 StarCoder。
推荐理由:原文详细披露了 15B 代码模型的训练数据清洗流程与评测对比,为开发者构建开源代码补全与技术助手提供了可迁移基准。
OpenAI 宣布推出 OpenAI Codex 的改进版本,该 AI 系统能够将自然语言转换为代码。该模型即日起通过 API 开启私测(private beta)。
推荐理由:Codex 将自然语言转化为代码并通过 API 开放私测,为开发者提供了基于自然语言生成代码的直接途径。