关于「大模型为什么进步这么快」,业界一直有两套叙事。一套讲硬件与架构:更大的集群、更好的注意力机制、更优的优化器、更高效的并行策略。另一套讲数据:更干净的语料、更聪明的过滤、更高质量的去重。这两套叙事经常被混在一起讲,因为现实中它们总是同时发生——一个新模型发布,架构和训练数据往往一起变了。
Dwarkesh Patel 和 Jerry Han 想做的事情,就是把这两个变量拆开。他们在 2026 年 9 月 8 日发布的这篇文章,用一个相当笨但相当直接的方法得出了一个引人注目的结论:从 2019 到 2025 年,预训练算力效率的提升里,来自数据的部分是来自模型的 3.24 倍。
速览卡:这位大佬和他说了什么
![]() | 大佬 | Dwarkesh Patel(与 Jerry Han 合著) |
| 身份 | Dwarkesh Podcast 主理人,TIME100 AI 2024 入选者,《The Scaling Era: An Oral History of AI, 2019-2025》合著者;Jerry Han 为共同作者 | |
| 出处 | Substack 长文《Pretraining progress is mostly coming from data》,2026-09-08 — dwarkesh.com | |
| 时间 | 2026 年 9 月 8 日 | |
| 核心观点 | 2019→2025 预训练算力效率提升中,数据贡献 12.0×、模型配方贡献 3.7×,比值 3.24;两者基本独立可叠加(相加模型解释 88% 方差) |
这个结论之所以值得认真读,不是因为数字好看,而是因为它把方法、数据、局限都摊开了——包括哪些地方他们自己也拿不准。下面先还原原文,再拆解方法,最后讲清楚这个结论能推到多远。
他说了什么:逐句还原
文章的核心结论用了一句话概括,数字极其具体:
“We find that from 2019 to 2025, 3.24x more compute efficiency gains have come from data improvements rather than model improvements (12.0x for data and 3.7x for models), at the 1e19 FLOPs compute budget.”
(译文)我们发现,从 2019 到 2025 年,来自数据改进的算力效率提升是模型改进的 3.24 倍(数据 12.0 倍,模型 3.7 倍),在 1e19 FLOPs 的算力预算下。
第二个核心结论关于两者的关系——这一点比倍数更反直觉:
“We find that the gains from data and model improvements are mostly independent and don’t interact (i.e. realizing the gains from some model improvement doesn’t require a specific training datapile, or vice versa). 88% of the variance in the OLMES score can be explained by additive effects of the model and data improvements (using a linear model).”
(译文)我们发现,来自数据和模型改进的收益基本是独立的,彼此不发生交互(也就是说,要实现某个模型改进的收益,并不需要特定的训练数据堆,反之亦然)。OLMES 分数的方差中,有 88% 可以由模型和数据改进的相加效应解释(使用线性模型)。
这句话的技术含义值得单独拎出来:它意味着数据工程和架构改进的收益可以简单地相加,而不需要精巧的配套设计。如果两者高度耦合(比如某种架构只有配某种数据才能发挥),那么实际部署时的策略会复杂得多——你需要知道「什么配什么」。而「可叠加」意味着可以分别投入、分别收获。
第三段话是作者的自谦,也是这篇研究可信度的一部分。他们明确划出了适用范围:
“We investigate this question at a relatively small scale, and for pretraining specifically, from 2019 to 2025.”
(译文)我们在一个相对较小的规模上研究这个问题,且专门针对预训练,时间范围是 2019 到 2025 年。
他们还指出了自己方法的根本约束——数据这条杠杆是有尽头的:
“Most of the corpuses we have investigated are curations (subsets) of the same Common Crawl, rather than expanding the available set of data. This is clearly consumption of a finite stock – there is only so far we can push this lever.”
(译文)我们考察的语料大多是同一份 Common Crawl 的精选(子集),而不是扩展可用数据集本身。这显然是在消耗一个有限的存量——这条杠杆能推多远是有上限的。
最后这句是整篇文章最诚实的地方,也是后面「这个结论对未来意味着什么」的关键:过去六年的数据进步,主要来自「筛得更好」,而不是「找到更多」。筛得更干净的收益是有限的——当所有语料都被严格过滤过之后,继续过滤的边际收益会下降。
方法:一个「笨办法」的严谨之处
这篇研究最值得学的是方法设计。它要解决的问题是:如何把一个总是一起变化的东西拆成两个独立变量?
构造两条时间轴
他们把 2019 到 2025 年切成两条轴:
- 模型轴:每一年的代表性开源模型配方。2019 年是 GPT-2,2025 年是 OLMo-2。中间的改进包括 RoPE 旋转位置编码、RMSNorm + SwiGLU 门控 MLP、归一化位置调整、QK-norm、Z-loss 正则、更干净的初始化、优化器与学习率调度改进等。
- 数据轴:每一年的代表性公开语料。2019 年是 OpenWebText(约 90 亿 token,来自 Reddit 高赞帖链接的网页),2025 年是 UltraFineWeb(更大规模抓取 + 更强抽取 + 去重 + 更严格的质量过滤,部分过滤器用训练好的分类器预测「哪些文档能提升下游表现」)。
然后做了一件关键的事:把每一条模型配方和每一份语料交叉配对,从头训练。在 3.16e18 FLOPs 预算下,这是一个 7×7 的网格,共 49 个组合。这样「架构」和「数据」就被拆成了两个正交的维度。
为什么不能用训练损失比较
这里有个容易被忽视的技术细节。评估模型好不好,最自然的指标是交叉熵损失。但问题在于:在不同数据集上训练的模型,其损失不可直接比较——因为损失是相对于各自的训练分布计算的。在 A 语料上训练、在 A 语料上评测,天然占便宜。
所以他们换成了下游能力评测:OLMES,一个聚合了 10 个相对简单的基准(以多选题问答为主)的评测套件。代价是引入了更多噪声——这就是为什么他们要在每个点跑多个随机种子来估计误差棒。
把差异换算成「算力乘数」
最有巧思的一步是结果表达方式。他们没有直接说「新数据比旧数据好多少分」,而是把分数差异换算成一个算力乘数(compute multiplier):要达到旧配方/旧语料的同等能力,新配方/新语料能省下多少算力。
这个换算让结论变得可以直接用于决策:「如果换一份更好的语料,相当于算力预算翻了几倍」——这比分数差异更接近实验室和管理者真正关心的问题。原文明确定义了它的含义:算力乘数描述的是「在选定性能水平和评测套件下达到同等表现所需的计算量减少倍数,并不是说模型变聪明了 12 倍」。
同一个换算也用于报年度趋势:模型侧的年均算力效率提升 1.24×,数据侧 1.51×,合并观测 1.57×。
为什么他们报出的数字比别人的低
这里有个值得注意的自我披露。他们观测到的年均 1.57× 效率提升,远低于 Anson Ho 等人估计的 3×/年。他们把差异归因于四条:
- 规模依赖:很多改进(如 OLMo-2 的层归一化与 QK-norm、NeoX 的并行注意力 + MLP 块)在更大规模或更长上下文时才显现效果,而他们的实验规模太小。
- 推理侧优化不计入:如 Llama-3 的 GQA(KV 缓存优化)在他们的算力乘数里不体现;分词器改进也没有考察。
- 配方选择的敏感性:他们选的是「有代表性」的配方,不一定是当年「最好」的。
- 评测选择的影响:用 OLMES 这个偏简单任务的套件,如果用编码或解题类基准,结论可能很不一样。
主动列出这些偏差,是这篇研究可信度的重要来源。一篇承认自己可能低估、并说清在哪低估的研究,比一篇只报亮眼数字的研究更值得采信。
核心结论展开:三条可以直接用的判断
判断一:数据是更划算的杠杆
如果 3.24× 这个比值在更大规模上仍然成立,那么对训练小模型的团队来说,数据管线应该被当作第一优先级,排在架构调优之前。原文明确给出了这个实操指向:「一个训练紧凑模型的小实验室,应当把数据管线视作主要杠杆,先于架构微调。」
这个判断的直觉基础不难理解:小模型容量有限,无法像大模型那样「吸收噪声」——它必须靠高质量数据把有限参数用在关键模式上。所以对它们来说,数据的边际价值特别高。
判断二:模型侧的主要贡献其实是「让大训练跑得起来」
这是原文一个容易被忽略但很重要的观察。他们指出,模型侧的改进主要贡献不是「在固定算力下更高效」,而是让更大的训练运行能够存活——稳定性技巧、MoE 路由、稀疏注意力、FlashAttention 这类内核级工具,存在的意义很大程度上是「防止更大的训练崩掉」,而不是在固定算力预算下多榨出性能。
这个区分很有价值。它意味着在评估一项架构改进时,要问清楚它属于哪一类:是「同样算力下能力更强」(效率型),还是「让更大规模成为可能」(使能型)。前者能在小规模实验里被观测到,后者往往在实验里「看不出效果」——因为实验规模根本没到需要它的程度。这也部分解释了为什么他们测到的模型侧提升(3.7×)比数据侧(12.0×)低那么多。
判断三:收益可叠加,意味着两条路可以并行推
88% 的方差可由相加模型解释,说明数据改进和模型改进的收益不需要配套。这对工程决策的直接含义是:不必为了「适配某种数据」而选择特定架构,也不必等到架构定了才开始搞数据——两条线可以独立推进,收益相加。
不过要提醒的是,这个结论建立在一个线性相加模型之上,且实验规模远低于前沿实验室的训练规模。原文自己写得很清楚:这「不是证明架构和数据在其他规模或任务上永远不交互」。把它当作「当前证据支持两者独立」,而不是「已证明两者永远独立」,是更准确的读法。
行业内的讨论与不同声音
补充视角:Anson Ho 等人更早的估计
这篇研究直接对话的对象,是 Anson Ho 等人对预训练软件效率提升的估计(3×/年,95% 置信区间 1.5× 到 64×)。值得注意的是,Patel 和 Han 在脚注里引用了 Ho 本人的一句话:「大部分软件进步可能实际上来自数据质量改进」。这说明「数据比架构更重要」这个判断并非他们首创,而是有更早的线索——他们的贡献是用受控实验把这条线索量化了。
从 3×/年(未区分来源)到 1.24×(模型侧)+ 1.51×(数据侧),这组数字的关系本身就是对「架构叙事被高估」的一个佐证。
质疑一:规模外推的可靠性
最直接的质疑指向外推。他们的实验最高只做到 1e19 FLOPs,而当前前沿模型的训练算力比这高出好几个数量级。在 1e19 规模上观测到的「数据更重要」,能否推到前沿规模?
原文其实给出了一个反向的提示:小模型受益于筛选是因为容量不足无法吸收噪声,而「超大前沿模型被故意训练在超过损失最优的 token 量上(这样推理更便宜),似乎更擅长吸收大规模噪声语料,而不是被严格过滤的小语料」。换句话说,数据筛选的优势可能随规模缩小。这对前沿实验室的含义与对小实验室的含义恰恰相反:小实验室该狠抓数据管线,前沿实验室则可能要把重心转向合成数据——因为自然网页文本是「一个有限的、基本被消耗完的资源」。
质疑二:评测套件的选择效应
OLMES 由 10 个偏简单的多选题任务组成。用这个套件得出的结论,能否代表模型的实际能力?原文自己承认了这一点:「如果我们看其他基准(比如编码或解题专用的),数字会完全不同,那些任务可能会奖励非常不同的数据工程方法。」
这不是小事。「数据更重要」这个结论,很可能只在「知识回忆和基础推理类任务」上成立;在数学、代码这类需要特定推理模式的任务上,数据的作用机制完全不同(可能更依赖合成数据和推理链标注,而非网页过滤)。引用这篇研究时,把适用范围说清楚很重要。
质疑三:这是一次受控实验,不是对真实历史的复现
他们训练的是「代表性配方 × 代表性语料」的组合,而且对大多数配方拟合了统一的学习率指数参数、每个组合只跑一个种子(在 7×7 网格上)。这意味着结果对超参数选择比较敏感——原文也承认「端能力对超参数高度依赖」,且「模型配方的算力乘数实际不确定性可能高于误差棒显示的」。
所以更准确的表述是:这是一次精心控制的消融实验,而不是对六年真实预训练历史的还原。它告诉我们「如果只改数据、其他不变,效率会提升多少」,而不是「历史上一共有多少提升来自数据」。
横向扩展:这个结论背后的知识框架
什么是「算力最优」与 Chinchilla 视角
要理解算力乘数,需要先理解「算力最优训练」这个概念。C = 6ND 是名义算力的记账约定(N 为非嵌入参数量,D 为训练 token 数)。在给定算力预算下,参数规模和 token 数存在一个最优点——训练太少 token 会浪费参数容量,训练太多则收益递减。Chinchilla 的核心贡献就是给出了这个最优点的大致比例。
Patel 和 Han 的方法正是建立在这个框架上:在每个算力预算下,遍历不同参数规模与 token 数,找到各「配方 × 语料」组合的算力最优点,再用「达到同等下游能力所需算力」来定义乘数。这样做的好处是,比较的是「同算力下的能力」而不是「同参数下的能力」,更贴近实际决策。
数据管线里到底有哪些环节
理解了数据管线的工作内容,才能明白「数据贡献 12×」这个数字代表了什么。从 OpenWebText 到 UltraFineWeb,主要的技术演进包括:
- 抓取范围:从「Reddit 高赞帖链接的网页」扩展到更大规模的通用爬取。
- 正文抽取:更准确的 HTML 正文识别,减少导航栏、广告、模板文本的混入。
- 去重:文档级、段落级、句子级的近似去重,避免重复内容稀释训练信号。
- 质量过滤:从基于启发式规则(长度、符号比、停用词比例)进化到基于训练好的分类器预测「该文档是否有助于下游表现」。
- 领域配比与课程:不同来源数据的混合比例,以及训练过程中的数据顺序安排。
这些环节里,分类器质量过滤是近几年最具突破性的一环——它把「什么是有用数据」从一个手写规则问题,变成了一个可以学习的问题。这也解释了为什么数据的效率提升能累积到 12×:它不是单一技巧的功劳,而是整条管线多年的工程积累。
「有限存量」意味着什么
原文那句「这显然是在消耗一个有限的存量」,指向的是整个行业即将面对的结构性问题:Common Crawl 的「好部分」是有限的。当所有实验室都在用相似的过滤方法从同一份库存里挑精选,边际收益必然下降。
这也解释了 2026 年业界对合成数据的高度关注。原文把「合成数据效果如何」列为未来研究方向之一,并给出了一个具体的问题:如果你有一小份高质量语料,用合成数据把它放大,比直接训练多个 epoch 好多少?这个问题目前没有公认答案,但它可能是下一个五年预训练效率提升的主要来源——因为自然数据的筛选红利已经接近见底。
为什么「收益独立」在工程上是个好消息
最后回到那条 88% 的相加模型。在优化问题里,变量之间是否耦合,直接决定了优化策略的复杂度:
- 如果耦合(某种架构必须配某种数据),你需要联合搜索,实验成本是乘积级的,而且很难做消融。
- 如果独立,你可以分别优化再相加,实验成本是加和级的,每个方向都能独立验证。
所以「88% 由相加效应解释」这个数字的意义,不只是描述现状,而是为工程实践开了一条低成本的路:数据团队和架构团队可以各自推进,收益不会互相抵消。这对资源有限的小团队尤其重要——你不必等模型架构确定了才动手搞数据。
总结:怎么引用这个结论才不出错
这篇研究价值很高,但引用时需要带上它的边界条件。给几条实操建议:
可以说:在 2019-2025 年、1e17 至 1e19 FLOPs 规模、以 OLMES 简单多选题任务为评测口径的受控实验中,数据改进带来的算力效率提升(12.0×)是模型配方改进(3.7×)的 3.24 倍,且两者收益基本可叠加。
不宜说:数据和架构的关系已经被证明永远独立;数据一定比架构重要;这个倍数在前沿规模上同样成立。这三条都超出了原文结论的范围。
对做小模型的团队:数据管线优先于架构调优,这个结论对你们的适用性最强。
对做前沿规模的团队:数据筛选的边际收益可能随规模下降,合成数据与新的数据来源可能比进一步过滤更重要。
这项研究最值得学的地方,或许不是那个 3.24 的数字,而是它示范了一种态度:当行业里流传着一个「大概是这样」的经验判断时,用一次可控的实验把它算清楚,并把自己方法的局限一并写出来。在预训练这样成本高昂、实验难以复现的领域,这种做法比结论本身更有长期价值。
参考来源
- Dwarkesh Patel & Jerry Han, “Pretraining progress is mostly coming from data”, 2026-09-08 — dwarkesh.com
- AI Insiders, “Dwarkesh Patel: Data Beat Architecture 3-to-1 in Pretraining Gains” — aiinsiders.net
- Remio, “Dwarkesh Patel Pretraining Study Finds Data Beat Model Improvements” — remio.ai
- Anson Ho et al., 预训练软件效率提升估计(3×/年,95% CI 1.5×–64×),见原文脚注 1




