
数据集速览
| 数据集名称 | FineWeb |
| 发布机构 | Hugging Face(HuggingFaceFW) |
| 发布时间 | 2024 年 4 月(技术报告 2024 年 6 月,NeurIPS 2024 数据集与基准赛道) |
| 数据规模 | 约 15 万亿(15T)GPT-2 token,约 44TB 磁盘 |
| 语言 | 英文为主 |
| 许可证 | ODC-By 1.0(Open Data Commons Attribution License) |
| 一句话定位 | 面向 LLM 预训练的、规模最大且完全公开清洗流程的英文网页语料 |
为什么要关注 FineWeb
大模型的预训练数据质量,几乎直接决定了模型的下限。Llama 3、Mixtral 这类顶尖开源模型的预训练语料都是闭源的,外界既拿不到数据,也不知道它们到底是怎么清洗的。这种不透明让开源社区在复现和追赶时始终隔着一层墙。FineWeb 的出发点正是打破这堵墙——它不仅把 15 万亿 token 的数据完整放出来,还把每一步清洗决策都写成文档、开源代码,甚至发布了用于验证的 70 多个消融小模型,让”为什么这么洗”这件事可以被复现、被质疑、被改进。
严格来说,FineWeb 最初只是想完整复刻 RefinedWeb(训练 Falcon 系列模型的数据集)。但 Hugging Face 团队在做复刻的过程中发现,只要在清洗流程里多叠加几道过滤和去重,就能把最终模型的效果推得明显高于 RefinedWeb。项目就此从一个”复刻”升级成了一场完整的、带实证的数据治理研究。
数据规模与来源
FineWeb 的全部数据来自 Common Crawl 的 96 个快照(snapshot),时间跨度从 2013 年夏天一直到 2024 年 4 月。Common Crawl 是一个持续抓取全网网页的开放项目,原始数据量极其庞大,但也充满了样板文本、重复内容、低质量页面和非英文材料,不能直接拿来训练。
经过流水线处理之后,FineWeb 最终沉淀出约 15 万亿 token,占用约 44TB 磁盘空间。这个规模让它成为当时最大的、公开可获取的清洗英文网页语料。相比之下,它常常被拿来对比的几个前辈都要小一个量级:C4 约 1750 亿 token,The Pile 约 3400 亿 token,Dolma 的 Common Crawl 部分约 3 万亿 token。
构建方法:一条被逐段验证的流水线
FineWeb 的处理流程运行在 Hugging Face 自研的 datatrove 库上,大致分为提取、过滤、去重、PII 遮蔽四个阶段,每一步都有消融实验背书。
正文提取是第一步,也是被证明最影响效果的一步。FineWeb 直接解析原始的 WARC 文件(而非预剥离过的 WET 文件),用 Trafilatura 提取网页正文。实验显示,相比其他提取方案,Trafilatura 能更有效地去除导航栏、广告等样板内容,从而在多个基准上带来一致提升。
分层过滤是第二步。基础过滤包括:一份成人/不安全域名的 URL 黑名单、基于 fastText 的语言识别(要求英语概率不小于 0.65)、以及从 MassiveText 借鉴的重复度与质量指标。此外还叠加了超过 50 组自定义的”指标—阈值”规则,全部经过消融实验逐个验证。例如,末尾标点频率过低的文档、重复行占比不小于 0.1 的文档、短行(少于 30 字符)占比不小于 0.67 的文档都会被移除。有意思的是,团队特意把 C4 里”必须保留结尾标点”这条规则砍掉了,理由是它过滤得太狠。
去重是第三步,也是 FineWeb 的一个关键取舍。它不做全局去重,而是在每个快照内部用 MinHash(5-gram、75% 相似度阈值)做近重复去除。理由是:全局去重会优先保留新内容、丢掉更老但往往更高质量的内容,反而造成质量回退。这个决策背后同样是消融实验的结论。
PII 遮蔽是收尾步骤,用正则把邮箱、IP 地址等个人信息抹掉。整套流水线下来,最终模型在相同参数量(1.82B)和相同 token 数下,效果优于 RefinedWeb、C4、Dolma、The Pile、SlimPajama、RedPajama2 等对比语料。
FineWeb-Edu:专挑「教育价值」的子集
除了主数据集,团队还发布了 FineWeb-Edu,一个约 1.3 万亿 token 的教育内容子集。它的筛选方式很有意思:先用 Llama-3-70B-Instruct 生成一批”这段文本是否有教育价值”的标注,再用这批标注训练一个分类器,最后用分类器从全量 FineWeb 里挑出高教育价值的内容。用 FineWeb-Edu 训练的模型,在 MMLU、ARC、OpenBookQA 等知识密集型和推理型基准上,超过了所有其他公开网页语料训练的模型。这从侧面印证了一个越来越被认同的观点:预训练数据的”含金量”比单纯的”量大”更重要。
怎么下载和使用
FineWeb 在 Hugging Face Hub 上完全开放,数据集 ID 为 HuggingFaceFW/fineweb。考虑到 44TB 的体积,团队提供了几个抽样版本方便快速上手:sample-350BT(约 3500 亿 token,388GB)、sample-100BT(约 1000 亿 token,277.4GB)、sample-10BT(约 100 亿 token,27.6GB),三者是逐层嵌套采样的关系。
加载时可以指定单个快照(格式为 CC-MAIN-年份-周数),也可以流式读取。官方推荐用 datatrove 或 datasets 库配合 streaming=True 按需拉取,下载时开启 hf_transfer 能把速度提升一个量级。
许可证与使用限制
FineWeb 采用 ODC-By 1.0 许可证,这是一份宽松的数据许可,允许自由使用、修改和再分发,只要求在使用时注明来源。这份许可让它适合被用于开源模型的预训练。需要注意的一点是,数据集虽然做了 PII 遮蔽和成人域名过滤,但作为互联网抓取的语料,仍可能存在残留的偏见与敏感信息,训练前仍应结合自身场景做额外审查。
横向对比同类语料
如果把公开预训练语料排个队:C4 是 2020 年的”元老”,用启发式规则清洗单个快照,规模最小、方法最朴素;RefinedWeb 是 2023 年 TII 的作品,过滤和去重更精细,公开了约 6000 亿 token;Dolma 是 AI2 为 OLMo 项目做的、约 3 万亿 token 的混合语料,胜在构成多元且全流程开源。FineWeb 则是在”英文网页”这一条线上把规模、质量和透明度同时推到了新高度——15 万亿 token 的体量、逐段验证的流水线、以及完整公开的复现代码,是它区别于前人的核心。
局限与注意事项
FineWeb 也不是没有短板。第一,它聚焦英文网页,多语言能力有限,训练中文或多语言模型不能直接照搬。第二,它刻意不做全局去重,意味着跨快照的重复内容仍然存在,对某些对重复极度敏感的训练场景需要自行再处理。第三,作为网页抓取数据,即便做了过滤,偏见、错误信息和低质量内容的残留依然无法根除,这也是所有网页语料的通病。最后,数据虽然开放,但 44TB 的下载和预处理本身就需要可观的存储与算力成本,中小团队通常只能从抽样版本起步。
参考来源
Hugging Face FineWeb 数据集页(huggingface.co/datasets/HuggingFaceFW/fineweb);FineWeb 技术报告《The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale》(arXiv:2406.17557);Hugging Face 官方博客《FineWeb: Decanting the web for the finest text data at scale》。


