跳到正文
原文
Hugging Face·· 2024-03-20精选AI 评分73

Hugging Face 详解 Cosmopedia:如何构建用于大模型预训练的大规模合成数据集

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 导读

Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。

推荐理由

文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。

来源:Hugging Face · huggingface.co