跳到正文
原文
Hugging Face Blog·· 2024-03-20精选AI 评分62

Hugging Face 发布 Cosmopedia:用 Mixtral 生成 250 亿 token 合成预训练数据

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 导读

Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。

推荐理由

原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。

来源:Hugging Face Blog · huggingface.co