the-pile
开源大模型训练数据集:825GB、22个数据源,驱动GPT-NeoX等主流开源LLM的预训练语料
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源大模型训练数据集:825GB、22个数据源,驱动GPT-NeoX等主流开源LLM的预训练语料
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
"大力出奇迹"不再是一句玩笑话——1750亿参数的大型语言模型,需要与之匹配的庞大高质量训练数据。但OpenAI没有公开GPT-3的训练数据集,学术界和开源社区被挡在了这扇门外。直到2020年8月,一个名为EleutherAI的非营利研究组织,决定自己做一套可以与之比肩的开源数据集——这就是The Pile的诞生背景。
EleutherAI(意为"真理守护者")是一个完全由志愿者运营的AI安全研究组织,核心成员来自全球顶级高校和研究机构。他们没有风投支持,没有商业合同,纯粹靠社区捐赠和志愿者贡献维系项目。但正是这个看似"草根"的团队,先后训练出了GPT-Neo(1.3B/2.7B)、GPT-NeoX(20B)等开源大模型,成为对抗闭源大厂的重要力量。The Pile正是他们为GPT-NeoX(20B参数)量身打造的训练数据集。
The Pile的核心设计理念是多样性与规模并重。它的总原始大小约825GB(去重后有效规模更大),由22个不同的数据子集组合而成,每个子集承担不同类型文本的供给职责。这22个数据源构成了Pile的"数据乐高":
| 数据来源 | 权重 | 特点 |
|---|---|---|
| Pile-CC(Common Crawl清洗版) | 18.11% | 互联网网页,去重处理 |
| PubMed Central | 14.40% | 医学学术论文 |
| Books3 | 12.07% | 盗版书库(后因争议被移除) |
| OpenWebText2 | 10.01% | GPT-3 WebText的开源复现 |
| ArXiv | 8.96% | 数学/物理/计算机预印本 |
| Github | 7.59% | 开源代码 |
| StackExchange | 5.13% | 编程问答社区 |
| FreeLaw | 6.12% | 美国法律文书 |
| USPTO | 3.65% | 美国专利申请 |
| Gutenberg (PG-19) | 2.17% | 经典文学著作 |
| Wikipedia | 1.53% | 英文维基百科 |
| DM Mathematics | 1.24% | DeepMind数学题库 |
| 其他 | ~9% | OpenSubtitles/EuroParl/Ubuntu IRC等 |
每个子集在进入Pile前都经过专门的清洗、去重和质量过滤。比如Github数据用fasttext做了许可证过滤,移除了所有非MIT/Apache/BSD许可证的代码;Wikipedia数据从en.tar.gz原始包中提取JSON格式的文章;书籍数据则从Bibliotik library中获取。
权重分配经过精心设计:学术论文(PubMed/ArXiv)和代码(Github)占比高,保证模型在专业领域的能力;书籍和网页保证通用语言理解;对话数据(Ubuntu IRC/HackerNews)则帮助模型学会连贯的多轮对话能力。
The Pile的代码库非常精炼,核心分为三个模块:
the_pile/datasets.py(约23KB):定义了所有22个数据源的Python类。每个数据源继承自抽象基类Dataset,必须实现name()(名称)、documents()(生成器,逐条产出文本)和clean()(清理本地文件)三个方法。下载逻辑通过download()工具函数处理,支持直接下载、Google Drive和gcloud多种来源,并用SHA256校验确保数据完整性。
the_pile/pile.py(约13KB):将22个数据子集组合为加权采样的完整Pile数据集。核心datasets列表定义了每个子集的名字对象和采样权重,make_clean_split()方法负责将数据切分为训练集/验证集/测试集,并输出Markdown格式的数据集统计表。
the_pile/utils.py(约5.7KB):通用工具层,包括下载器(best_download库封装)、文件哈希校验(SHA256)、tarball解压、stable排序(保证不同机器上的文件顺序一致)等。
安装使用也非常简单:
git clone https://github.com/EleutherAI/the-pile.git
cd the-pile
pip install -e .
或者直接用Python:
from the_pile import ThePile
dataset = ThePile()
但要注意:安装这个包本身只需要几十MB,真正的存储消耗来自下载数据集——完整Pile需要约850GB磁盘空间。数据集本身托管在the-eye.eu(一个非营利存档组织),不托管在GitHub上。
2022年8月,The Pile做了一个令业界震惊的决定——主动从数据集中移除Books3子集。Books3是一个包含数万本未授权电子书的数据库,CMU研究员在研究中发现它被用于多个主流大模型的训练,可能侵犯版权。
这一事件引发了AI学术界对训练数据来源的深刻反思:模型"学到的"知识中,有多少是在未经授权的情况下"偷学"的?EleutherAI的主动删除决定赢得了广泛尊重,但也让The Pile的规模从825GB缩小到约710GB(后经其他数据源补充调整)。
这个争议至今没有定论。一方面,书籍是人类知识的重要载体,完全依赖公开网页训练的模型在文学理解、长篇推理上有明显短板;另一方面,版权问题确实是悬在AI行业头顶的达摩克利斯之剑。The Pile的Books3事件,成为AI数据伦理讨论的重要里程碑。
The Pile最重要的应用,是训练了GPT-NeoX——EleutherAI在2022年发布的200亿参数开源大语言模型。GPT-NeoX在当时是规模最大的完全开源GPT类模型(对比GPT-Neo 2.7B,NeoX大了约7倍),使用Megatron-DeepSpeed框架在数百块A100 GPU上进行训练。
论文《GPT-NeoX-20B: An Open-Source Autoregressive Language Model》详细描述了The Pile在训练中的作用:它不仅提供了高质量的预训练语料,还通过多样化的数据来源让模型在编程、数学、推理等任务上表现出色。GPT-NeoX在多项基准测试中与1750亿参数的GPT-3性能接近甚至超越。
更重要的是,GPT-NeoX的开源(权重+代码+训练细节全公开)让整个社区第一次有机会深入研究200亿参数级别的LLM是如何工作的。这对于推动AI民主化、打破大厂算力垄断具有深远意义。
The Pile并非完美,主要局限性包括:
语言单一:The Pile几乎完全是英文数据(>95%),其他语言占比极低。对于多语言任务,需要与其他数据集(如mC4、OSCAR)配合使用。
时效性有限:数据来源主要是2020年之前的互联网快照和学术论文集,对于需要最新知识的任务(如2023年后的新闻、代码),The Pile无法覆盖。
使用门槛高:虽然代码库本身安装简单,但下载825GB数据集、运行完整数据处理管道,对普通开发者来说仍是较高门槛。EleutherAI后来也意识到了这一点,逐步提供了预处理好的数据下载链接,降低了使用难度。
数据偏见:和所有大规模网络数据一样,The Pile继承了互联网文本中的各类偏见——性别偏见、种族偏见、文化偏见等。在将其用于生产环境时,需要额外的去偏见处理。
The Pile的意义远不止是一个"更大的文本数据集"。它代表了一种新的开源AI路线:不依赖闭源模型和闭源数据,从底层构建可复现的AI研究基础设施。
从The Pile出发,EleutherAI催生了一整个生态:
直到今天,The Pile仍是开源LLM训练数据的事实标准之一,被广泛用于RedPajama(~1.2T tokens)、FineWeb等后续大型开源数据集的构建参照。它的数据集构成、权重设计、去重策略,都成为后来者反复研究和借鉴的经典范式。
如果你在构建自己的语言模型,或者只是想理解大模型训练数据的来源与构造逻辑,The Pile是必经的一站——它既是工具,也是教科书。

图1:EleutherAI 组织标志(The Pile 所属的非营利AI研究组织)