BigCode 背后的大规模近似去重实践
Hugging Face 博客系统讲解了 BigScience 与 BigCode 在大语言模型和代码模型训练数据上使用的 MinHash + LSH 文档级近似去重流程,涵盖 shingling 分词、指纹计算、LSH 分桶以及用 union find 或 Spark 做连通分量聚类的实现细节。
推荐理由:原文完整走通 MinHash 与 LSH 的工程细节并给出规模化实测配置,可直接迁移到自有数据集的去重流程。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Hugging Face 博客系统讲解了 BigScience 与 BigCode 在大语言模型和代码模型训练数据上使用的 MinHash + LSH 文档级近似去重流程,涵盖 shingling 分词、指纹计算、LSH 分桶以及用 union find 或 Spark 做连通分量聚类的实现细节。
推荐理由:原文完整走通 MinHash 与 LSH 的工程细节并给出规模化实测配置,可直接迁移到自有数据集的去重流程。
Hugging Face 与 ServiceNow 联合发起的 BigCode 项目正式发布 15B 参数的代码大语言模型 StarCoderBase 以及面向 Python 微调的 StarCoder。
推荐理由:原文详细披露了 15B 代码模型的训练数据清洗流程与评测对比,为开发者构建开源代码补全与技术助手提供了可迁移基准。
OpenAI 发布了 GPT-3 和 Codex 的新版本,新增在现有文本中编辑或插入内容的功能。这项更新让两款模型不再局限于顺向补全现有文本,能够直接对已有内容进行修改和填充。
推荐理由:新版本改变了此前只能顺向补全文本的工作模式,允许开发者直接在现有文本中进行针对性编辑与内容插入。
OpenAI 在其 API 中推出全新的 embeddings 端点,方便开发者处理自然语言和代码任务。该接口可直接用于语义搜索、聚类、主题建模以及文本分类等场景。
推荐理由:官方提供了新的嵌入向量端点,便于开发者直接用于语义搜索、代码理解和分类等任务。
Hugging Face 详细介绍了如何从零预训练 Python 代码生成模型 CodeParrot,并开源了配套的 50GB 清洗后数据集与模型权重。
推荐理由:提供了从数据去重、分词到分布式预训练的完整工程实现,读者可直接复用其流式训练与多卡加速脚本。
OpenAI 宣布推出 OpenAI Codex 的改进版本,该 AI 系统能够将自然语言转换为代码。该模型即日起通过 API 开启私测(private beta)。
推荐理由:Codex 将自然语言转化为代码并通过 API 开放私测,为开发者提供了基于自然语言生成代码的直接途径。