从 2370 亿个网页里捞出 147 亿 token:OpenWebMath 的数学语料炼金术

数据集速览卡

数据集名称OpenWebMath
发布机构Keiran Paster、Marco Dos Santos、Zhangir Azerbayev、Jimmy Ba(多伦多大学等)
发布时间2023 年(论文 arXiv 2310.06786)
规模630 万份文档,147 亿 token
语言英语
许可证ODC-By 1.0
用途定位数学推理能力的大模型预训练/微调语料

背景:开源社区缺一份「数学专用语料」

大语言模型的数学能力,一直是个让人又爱又恨的话题。一方面,数学是衡量模型推理能力最硬的试金石之一;另一方面,通用语料里数学内容的比例极低,模型在通用数据上预训练,数学能力天然偏弱。

Google 的 Minerva 模型最早证明了「用数学专用语料训练能显著提升推理能力」这条路线——它在 PaLM 的基础上,用从 arXiv 和网络精心收集的数学文档继续训练,在定量推理基准上取得了当时的最先进成绩。但问题来了:Minerva 的训练数据是私有的,尤其是其中「数学网页」那部分从未公开。

开源社区能用的数学数据有什么?AMPS(竞赛题)、NaturalProofs(形式证明)、Proof-Pile(arXiv 论文)——它们各有侧重,但都只是「数学的一小部分」。竞赛题太窄,形式证明太冷门,arXiv 论文太正式。互联网上那些「非正式的数学讨论」——论坛问答、教学博客、习题讲解、维基百科的数学条目——这些恰恰是最贴近「人是怎么学数学、讨论数学」的内容,却没有任何一个开源数据集系统地收录过。

OpenWebMath 的使命,就是把这块缺失拼图补上:从整个 Common Crawl 里,把「高质量的非正式数学文本」捞出来,开放给所有人。

数据构成与规模:147 亿 token 的数学精华

OpenWebMath 的规模(官方数字逐字记录):从 Common Crawl 中超过 2000 亿(约 2370 亿)个 HTML 文件里过滤提取,最终得到 630 万份文档,共包含 147 亿 token

这组数字背后的「提纯率」非常惊人:从 2370 亿个网页,到 630 万份文档,过滤掉了超过 99.99% 的内容。这直观地说明了一件事——互联网上真正的「高质量数学内容」其实是极度稀缺的,绝大多数网页要么不含数学,要么质量太低。

数据的来源构成很有代表性。按字符数统计,占比最高的域名包括:

  • stackexchange.com(9.55%)——Stack Exchange 数学问答社区,这是数学讨论的黄金来源。
  • nature.com(3.14%)、wikipedia.org(1.27%)、zbmath.org(1.27%)——权威的学术和百科来源。
  • physicsforums.com(2.38%)、mathoverflow.net(1.02%)——专业论坛。
  • 还有 wordpress.com、github.io、blogspot.com 等大量个人博客和教学站点。

这份来源清单说明,OpenWebMath 收集的正是「论坛 + 教学 + 博客 + 百科」这类非正式的、贴近真实学习场景的数学内容。数据覆盖的领域也不止数学本身,还包括物理、统计、计算机科学等相邻领域。整个数据集横跨了超过 13 万个不同的域名,多样性非常充分。

构建方法:五步流水线把网页「炼」成数学

OpenWebMath 的构建流水线是它的技术精华,官方文档拆成了清晰的五步:

第一步:预过滤 HTML 文档(Prefiltering)。面对 2370 亿个网页,不可能每个都完整处理。先用一个简单的预过滤器快速扫描,直接跳过那些明显不含数学内容的文档,省下大量计算时间。这一步是「粗筛」,把海量数据先砍掉绝大部分。

第二步:文本提取(Text Extraction)。对通过预过滤的 HTML,提取正文文本,重点是提取 LaTeX 数学公式,同时剥离网页的模板代码(导航栏、广告、页脚这些 boilerplate)。这一步对数学数据尤其关键——数学公式在网页里通常以 LaTeX 或 MathML 形式存在,如果提取不干净,公式就会变成乱码,数据就废了。OpenWebMath 特别强调了对 LaTeX 内容的忠实保留,这是它区别于其他网页数据集的独特之处。

第三步:内容分类与过滤(Classification and Filtering)。这一步是三重过滤:用 FastText 语言识别模型只保留英文文档;用 KenLM 模型(在 Proof-Pile 上训练)过滤掉高困惑度的低质量文档;再用自研的 MathScore 模型过滤掉不含数学内容的文档。三道关,分别保证「是英文」「质量高」「有数学」。

第四步:去重(Deduplication)。用 SimHash 算法(配合 text-dedup 库)做近似去重,去掉大量重复转载的内容。

第五步:人工检查(Manual Inspection)。对前几步的结果做人工抽查,移除质量仍然不过关的页面。这一步是「兜底」,用人的判断补算法的漏。

这五步流水线,从粗筛到精筛、从自动到人工,层次分明。它的价值不只是产出了这份数据,更在于整套流程是开源的、可复现的——任何人想在自己的领域(比如化学、生物、法律)做类似的「领域语料提炼」,都可以照着这个流水线改造。

为什么「数学语料」能提升推理能力

OpenWebMath 的价值,建立在一条逐渐被验证的规律上:在数学(以及代码)这类「高逻辑密度」的内容上训练,能显著提升模型的通用推理能力。理解这条规律,才能理解为什么「专挑数学网页」这件事如此重要。

这条规律背后的直觉是:数学文本是「思维过程的最密集载体」。一篇数学推导、一段数学问答,本质上是一串严谨的逻辑链条——每一步推理都有依据,每一步结论都从前一步推出。模型在大量这样的文本上训练,等于在反复学习「如何一步步严格推理」,这种能力是可以迁移到其他需要推理的任务上的。

相比之下,普通网页文本(新闻、闲聊、散文)虽然量大,但逻辑密度低,大多是陈述、描述、观点表达,缺乏「严谨推理」的训练信号。这解释了为什么「在数学语料上训练 14 亿参数的模型,性能超过用 20 倍通用数据训练的模型」——数据质量(逻辑密度)的重要性,可以远超数据数量。

这条规律也是「领域语料」思路的底层逻辑:不只是数学,代码(逻辑严格)、科学论文(论证严谨)都有类似的「推理增强」效果。OpenWebMath 是把这条规律在「网页数学」这个具体领域落地的代表作,它证明了:即使不靠竞赛题、不靠正式论文,仅仅是把互联网上「非正式的数学讨论」提炼出来,就足以显著提升模型的数学推理能力。

与 Minerva 的对比:把私有路线开源化

OpenWebMath 的定位,最直接的参照物是 Google 的 Minerva。

Minerva 是 Google 在 2022 年发布的数学推理模型,在 PaLM 基础上,用「从 arXiv 论文和网络上精心收集的数学文档」继续训练,在 MATH、GSM8K 等数学基准上取得了当时的最先进成绩,展示了「数学专用数据」的巨大威力。但 Minerva 的训练数据是私有的,社区只能看到结果,看不到「那批数学数据到底是什么」。

OpenWebMath 的作者明确把 Minerva 当作对标对象。他们的目标,就是做一个「开源版的 Minerva 数学数据」——把 Minerva 那种「专挑数学内容训练」的路线,用一份公开、可下载、可复现的数据集落地,让整个开源社区都能复制这条成功路径。

两者的关键区别在于数据来源和开放性:Minerva 用的是 arXiv 论文 + 私有收集的网络数学文档;OpenWebMath 专门聚焦「Common Crawl 里的网页数学文本」,并且把完整的数据、清洗流水线全部开源。从论文的实验看,OpenWebMath 这条「网页数学」路线在数学推理上取得了显著效果,证明了「非正式的网页数学」本身就足以支撑起强大的数学能力,而不一定非要依赖论文这种「正式」内容。

下游影响:开源数学模型的语料基石

OpenWebMath 发布后,迅速成为开源数学模型训练的「标配语料」之一,它的下游影响可以从几个方向看到。

最直接的影响是开源数学模型的训练。DeepSeek 的数学系列模型、以及一大批开源数学模型(如 Llemma 之后的各类数学专用模型),在构建训练语料时都把 OpenWebMath 作为核心来源之一。尤其是 DeepSeekMath 的工作,系统性地研究并使用了包括 OpenWebMath 在内的高质量数学网页数据,验证了「数学网页语料」对数学推理能力的关键作用,也进一步推动了 OpenWebMath 的知名度。

另一个影响是方法论上的示范。OpenWebMath 的「五步提炼流水线」(预过滤 → 文本/LaTeX 提取 → 分类过滤 → 去重 → 人工检查)成了一个可复用的模板。后来很多「从 Common Crawl 提炼特定领域数据」的工作,都沿用了类似的多级过滤 + 专用分类器 + 去重的思路。它证明了「领域数据提炼」是一个可以工程化、标准化的流程,而非只能靠大公司的私有数据团队。

还有一个间接影响是对「数据质量 vs 数量」争论的贡献。OpenWebMath 用小得多、但质量高得多的数据,训练出了强于 20 倍通用数据的模型,为「数据质量优先」这个观点提供了有力的实证支持,也影响了后续一批「小而精」领域数据集的构建理念。

LaTeX 提取:数学数据的技术命门

OpenWebMath 构建里最考验技术功力的一步,是 LaTeX 数学公式的提取。这一步做得好不好,直接决定了数据的价值,值得单独展开。

数学公式在网页里有好几种存在形式:有些是纯文本写的(如 x^2 + y^2 = r^2),有些是 LaTeX 代码(如 \frac{a}{b}),有些是 MathML 标签,还有些干脆是图片(这对文本模型是彻底的损失)。如果提取时把这些公式弄乱了——比如把 \sqrt 提取成了乱码、把上下标弄丢了、把分式的分子分母搞混——那么这条数据对数学训练的价值就大打折扣,甚至会产生误导。

OpenWebMath 特别强调了对 LaTeX 内容的忠实保留,这是它区别于普通网页数据集的独特之处。它不仅要提取「文字」,还要确保「公式的 LaTeX 表达是完整、准确的」。这也是为什么它的文本提取这一步需要专门处理——普通的「剥 HTML 标签」式的提取,根本无法胜任数学内容的提取。

这个技术细节的重要性,反映了一个更普遍的规律:领域数据的价值,往往就藏在「领域特有的格式」里。数学数据的价值在 LaTeX 公式里,代码数据的价值在代码结构里,法律数据的价值在条款引用里。做领域数据提炼,如果抓不住这些「领域特有的格式」,提炼出来的数据就是「丢了魂」的通用文本。OpenWebMath 对 LaTeX 的执着,正是抓住了数学数据的「魂」。

下载与使用

OpenWebMath 在 Hugging Face 上的数据集 ID 是 open-web-math/open-web-math,用 datasets 库直接加载:

from datasets import load_dataset
ds = load_dataset("open-web-math/open-web-math")

数据集结构很简单,每条文档包含 text(正文)、url(来源网址)、date(抓取日期)、metadata(提取过程的元信息)。train 划分有 6,315,233 条文档,数据集总大小约 56.7 GB(压缩下载约 16.4 GB)。

使用上,OpenWebMath 既可以作为预训练语料直接混入通用语料里训练(很多数学模型就是这么做的),也可以作为继续预训练(continual pretraining)或微调的数据,专门增强模型的数学能力。它和 DeepSeek 数学系列、以及不少开源数学模型的训练都有渊源。

许可证与商用注意

OpenWebMath 使用 ODC-By 1.0 许可证。这是一个「开放数据共享 + 署名」的许可,允许自由使用、修改和再分发,但要求署名,且使用方需遵守 Common Crawl 的使用条款。总体而言商用友好,比很多「仅供研究」的数据集宽松。

需要留意的是,数据来源是公开网页,原始内容(比如 Stack Exchange 的帖子、个人博客的文章)的版权归原作者,ODC-By 授权的是「这份整理后的数据集」本身。大规模商用训练前,仍建议对数据来源做合规评估,尤其是涉及大量第三方站点内容的情况。

横向对比同类数据集

  • 对比 AMPS / MathPile:AMPS 是竞赛题集(MATH、Khan Academy 等),MathPile 是更大规模的数学语料(数百亿 token)。OpenWebMath 的独特定位是「网页上的非正式数学讨论」,覆盖了论坛、教学、博客这些更贴近真实学习的内容,与竞赛题、论文形成互补。
  • 对比 Proof-Pile:Proof-Pile 是 arXiv 数学论文的语料,正式、学术;OpenWebMath 是非正式的网页数学,两者正好覆盖「正式」和「非正式」两个端。
  • 对比通用网页语料(C4、FineWeb):通用语料里数学内容被严重稀释;OpenWebMath 是「专精」路线,同样规模的 token 里数学信号密度高得多。论文里的实验也证明了这一点:在 OpenWebMath 上训练 14 亿参数的模型,性能超过了用 20 倍以上通用语言数据训练的模型。

局限与争议

OpenWebMath 的局限主要有几点。

第一是只覆盖英语。中文、日文等其他语言的数学网页没有被纳入,非英语场景需要另行处理。

第二是质量过滤仍有残余噪声。虽然有五步流水线,但 630 万份文档里仍难免混入低质量或错误的内容,训练前往往还需要做进一步过滤。

第三是LaTeX 提取的固有难度。数学公式的 LaTeX 提取即使做得再仔细,也难免有损失或错乱,尤其是复杂的、非标准的公式写法。

第四是数据时效性。作为一份从 Common Crawl 某几个抓取批次里提炼出来的静态数据集,它不会自动更新,反映的是抓取时刻的互联网数学内容。

总结与启示

OpenWebMath 的价值,不只是「147 亿 token 的数学数据」本身,更在于它验证了一条重要的方法论:通用互联网里藏着被稀释的高价值领域知识,通过精心设计的过滤流水线,可以把它「提炼」成专精的领域语料。这条「从通用到专精」的提炼路线,为医疗、法律、金融、科学等所有垂直领域的数据构建提供了可复用的范式。

它也再次印证了一个判断:大模型的能力上限,越来越取决于「喂它什么数据」。Minerva 证明了数学语料的价值,但把它锁在私有仓库里;OpenWebMath 把这条路线开源了,让整个社区都能踩在巨人的肩膀上继续往前。这正是开源数据对 AI 进步的真正意义。

参考来源

从 2370 亿个网页里捞出 147 亿 token:OpenWebMath 的数学语料炼金术

主要菜单