“我们只有一个互联网”:Ilya 说预训练时代要结束了,Scaling Law 还能撑多久?

这位大佬

Ilya Sutskever大佬Ilya Sutskever
身份OpenAI 联合创始人兼前首席科学家,Safe Superintelligence Inc.(SSI)创始人
出处NeurIPS 2024 Test-of-Time Award 演讲、Dwarkesh Podcast 2025 长访谈(2 万字)、SSI 公开声明
时间2024 年 12 月 13 日(NeurIPS 演讲) / 2025 年 11 月(Dwarkesh 访谈)
核心观点预训练时代终结(pre-training as we know it will unquestionably end),AI 进入\u201c研究时代\u201d,未来属于推理、合成数据、超级智能体

“我们只有一个互联网”:Ilya 说预训练时代要结束了,Scaling Law 还能撑多久?

Ilya 说了什么

2024 年 12 月 13 日,温哥华 NeurIPS 大会。Ilya Sutskever 上台领取十年前那篇论文的 Test-of-Time Award,原本所有人都以为他会讲下一代架构,但这位 OpenAI 联合创始人兼前首席科学家讲了一句话,让整个会场安静下来:

“But pre-training as we know it will unquestionably end. While compute is growing, the data is not growing, because we have but one internet.”

中文翻译过来就是:\u201c但我们所熟知的预训练毫无疑问会终结。算力还在涨,但数据不涨了,因为我们只有一个互联网。\u201d

他在同一篇演讲里还有两句分量更重的话:

“You could say that data is the fossil fuel of AI. It was created somehow, and we are using it, and we have reached peak data, and there will not be more data.”

翻译:\u201c你甚至可以说,数据是 AI 的化石燃料。它被创造出来,我们正在使用它,而我们已达到数据峰值,不会有更多的数据了。\u201d

这意味着,支撑过去十年 Scaling Law 的三大变量(参数、数据、算力)里,\u201c数据\u201d这一条断了。算力还按 5 个月翻一倍的速度在涨,但全球经过去重的高质量人类文本总量约 300 万亿 tokens,按目前的消耗速度,中位数预计 2028 年就会被用完。在数据用完之前,训练算力每翻 10 倍带来的模型性能提升已从过去的 20% 跌到了不足 5%。

一年后(2025 年 11 月 26 日),Ilya 坐回镜头前,与 Dwarkesh Patel 做了一场 1.5 小时、2 万字的长访谈。他把同样的判断推得更远:

“We are moving from the era of scaling to the era of research.”

翻译:\u201c我们正从 Scaling 时代走向研究时代。\u201d

他给出了两个解释:

第一个解释是 RL 让模型目标变得单一、狭隘,反而削弱了全局感知。第二个解释是预训练用了\u201c全部数据\u201d,RL 讲究定向优化,于是\u201c研究者不知不觉从各种评测里获取灵感\u201d,结果训出来的 AI 刷分机器,在真实场景里反而做不好最基础的事。换句话说:\u201c真正钻评测空子的不是模型,是设计基准和 RL 环境的人类研究者。\u201d

两年内,Ilya 给 Scaling Law 唱了两次终曲。但这不是\u201cAI 已死\u201d的悲观论调,而是他对下一阶段研究路径的指引。他明确指出预训练之后的三个方向:\u201cagent、synthetic data、test-time compute\u201d。在 SSI 的实践里,他还提出了第四个方向:让模型学会像人类一样学习。他说,\u201c人类的学习效率比模型高得多。语言、数学、编程——尤其是数学和编程——表明,人类擅长学习的能力,可能并不是因为复杂的进化先验,而是某种更基础、更普遍的能力。\u201d

背景:为什么值得关注

2024 年的 AI 圈有一个不太被明说但人人都在做的假设:只要 GPU 堆得够多、数据喂得够饱,就能造出更强的模型。OpenAI 2020 年的 Chinchilla Scaling Law 把这套公式写得很漂亮——最优参数和数据大约 1:1,按等比放大。这套公式给 OpenAI、Anthropic、Google、Meta 都画了一张路线图:今年买 5 万张卡,明年买 10 万张,后年买 30 万张。每次训练都会更强,每次更强都会带来一波新产品和一波新融资。

Ilya 是在这条路线图上亲手签字的人。AlexNet(2012)、Sequence-to-Sequence(2014)、AlphaGo(2016)、GPT 系列(2018-2023),他的名字贯穿了过去十年最重要的几个 Scaling 成功故事。所以当他说\u201c预训练时代结束\u201d的时候,分量完全不一样。

但真正让这句话有杀伤力的,是 Epoch AI 在 2024 ICML 上公布的一组测算:全球经过去重、校验的公开可用高质量人类文本,总量约 300 万亿 tokens。按当前大模型的消耗速度,中位数预计在 2028 年就全部耗尽。算力每 5 个月翻一倍,电力每年翻一倍,但高质量数据每 8 个月才翻一倍。这个\u201c食材跟不上锅具\u201d的差距,已经把 Scaling Law 的隐性前提——\u201c数据供应永远跟得上算力扩张\u201d——彻底打破了。

更扎心的是来自 Epoch AI、Stanford AI Index 和 a16z 的几组横截面数据:

  • 2022 年 ChatGPT 发布前,互联网新内容里 AI 生成的比例接近零;2025 年初这个数字已超过 51%。换言之,全世界的训练数据正在被 AI 自己生产的低质内容污染。
  • 算力翻 10 倍带来的模型性能提升,从 2022 年的 20% 跌到了 2025 年的不到 5%,投入产出比砍到了 1/4。
  • 微软的 Phi-4、谷歌的 Gemma、Anthropic 的 Claude 3.5 Sonnet、苹果的 Apple Intelligence,几乎所有头部模型的训练都已混入合成数据。Gartner 预测 2024 年 AI 项目中已有约 60% 的数据来自合成,到 2030 年这个比例还会大幅攀升。

这就是 Ilya 喊\u201c数据峰值\u201d的底层逻辑:不是模型训不动了,是数据这一类化石燃料真的快烧完了。下一步要么用合成数据继续烧,要么承认这个烧法不可持续,把研究范式重新切到推理时计算、Agent 和\u201c让模型学会学习\u201d这种新维度上。

核心观点展开:数据峰值到底意味着什么

\u201c数据峰值\u201d(Peak Data)这个词最早在 2024 年 Q4 由 Ilya 在 NeurIPS 公开提出。他给出的解释非常图像化:\u201c数据是 AI 的化石燃料\u201d——化石燃料是被自然过程一次性创造出来的,用完了就没有了。互联网的内容也是人类写作的累积总量:维基百科、新闻、博客、论文、Reddit 评论、GitHub 代码。这些构成了大模型训练数据的绝大部分,但增量越来越慢:

  • 新增高质量文本(专业书籍、学术论文)每 8 个月翻一倍;
  • 训练算力每 5 个月翻一倍;
  • 电力供应每年翻一倍;
  • 活跃训练数据中心的数量每 6 个月翻一倍。

这就是 Epoch AI 反复强调的\u201c数据墙\u201d:Scaling Law 的隐性前提——\u201c数据无限供给\u201d——从 2024 年开始第一次变得不成立。

第二个关键论点是\u201c数据是 AI 的化石燃料\u201d。化石燃料燃烧后会变成二氧化碳污染大气,AI 数据被用尽后会变成\u201cAI 自己的排泄物污染训练池\u201d。牛津、剑桥、帝国理工和多伦多大学的联合研究在 2024 年登上 Nature 封面,用数学证明和模拟实验展示了\u201c模型坍缩\u201d(Model Collapse)的过程——研究者拿一张关于欧洲中世纪教堂塔楼的维基百科文本开始输入 MINI-OPT-125m 模型,第一代输出还能谈论教堂建筑,第五代就偏向了语言翻译,到了第九代,模型开始滔滔不绝地介绍不存在的\u201c黑尾长耳大野野兔\u201d。这是一个三阶段退化机制的必然产物——方差消亡、错误级联、最终熵死。

第三个关键论点是\u201c范式转移:从预训练 Scaling 到推理时 Scaling\u201d。Ilya 在 NeurIPS 演讲末尾留了三个未来方向:agents、synthetic data、test-time compute。一年后他在 Dwarkesh 访谈里进一步说:\u201c从 2012 到 2020 是\u2018研究的时代\u2019,从 2020 到 2025 是\u2018Scaling 的时代\u2019。但现在算力已经很大了,电脑已经非常非常强了,从某种意义上说,我们又回到了\u2018研究的时代\u2019。\u201dScaling 时代的一个后果,是 scaling 把屋子里的空气都吸干了,大家就都开始做同一件事。于是,我们来到了这么一个世界:公司数量远远多于点子数量,而且是远远多于。\u201d

最后一个关键论点是\u201c让模型学会像人类一样学习\u201d。这是 Ilya 在 2025 年底提出的新方向——不是单纯的 RL,而是把人类的\u201c情绪价值函数\u201d内化进模型。科学家曾发现,一个因为脑损伤失去情绪能力的人,智力没变、语言没变、逻辑没变,却变得极其不会做决定——连穿袜子都要想半天。情绪并不是\u201c多余的噪音\u201d,而是决策系统的一部分。Ilya 由此推断:人类与生俱来的情绪,可能在帮助人类成为\u201c在世界中能正常运作的智能体\u201d这件事上发挥着关键作用。如果模型能内置一个类似的稳定价值感受器,它就能像人类青少年那样在十小时练车后就能开车,而不是像今天的大模型在两个 bug 之间来回\u201c跳房子\u201d。

行业内的讨论与不同声音

Ilya 的判断在业内引起了连锁反应,但绝非所有人都同意。

反对派最显眼的是 Yann LeCun。他一如既往地毒舌,认为\u201c大语言模型无论如何 Scaling 都没办法触达真正的 AGI\u201d。LeCun 的论点比 Ilya 更激进:他不只是说预训练死了,而是说整个 LLM 路线死了。但 LeCun 自己搞的世界模型路线在工程上一直被质疑——Meta 投入巨资但进展缓慢,2026 年的 V-JEPA 2 仍处于研究演示阶段。LeCun 的判断方向没错(LLM 不是 AGI),但路径替代方案还不够成熟。

温和的反对派是 Sam Sam Altman。他在公开场合含蓄承认,\u201c单纯靠更多 GPU 已经换不回同比例的智能跃迁\u201d,但他强调 Sam Altman 强调 OpenAI 的路线没有错,只是大家需要更多的\u201c产品反馈\u201d来优化 RL。Altman 的策略被业内调侃为\u201c不要承认 Scaling Law 死了\u201d——OpenAI 2025 年的支出预期已经高达数千亿美元,承认 Scaling Law 死亡会让资本市场对整个 AI 投入的合理性产生质疑。

乐观派是 Gemini 团队。Gemini 3 的发布被 Oriol Vinyals 称为\u201c我们见过最大的一次提升\u201d,明确表示\u201c看不到任何墙\u201d。黄仁勋在 2025 年底提出了更系统的理论框架:不是只有一个 Scaling Law,而是三个维度同时在起作用——预训练 Scaling、后训练 Scaling、推理时 Scaling(也叫 Test-Time Compute)。传统的 Scaling 是把资源投在预训练阶段,让模型在训练时变得更强;后训练 Scaling 做了 RLHF、DPO 等路线优化;而推理时 Scaling 则是让模型在回答问题的时候花更多时间\u201c思考\u201d,比如 OpenAI 的 o1/o3 系列就是这条路线。

从基础设施的角度看,AI21 实验室 2026 年 4 月发布的 Maestro 框架和英伟达的 Nemotron-3-Super-120B-A12B 混合模型都印证了 Ilya 的判断。前者在 SWE-bench 上用结构化测试时计算策略追上了 Claude 4.5 Opus 和 Gemini 3 Pro;后者用 Mamba + MoE + 多 Token 预测的组合,把 120B 总参数下的实际计算量压缩到了 12B 稠密模型的水平,但原生支持百万级上下文。这两件事都在说同一件事:\u201c我们不能再比参数规模了,比的是\u2018组合效率\u2019。\u201d

中国 AI 圈的反应则更冷静。新加坡国立大学校长青年教授尤洋 2026 年初在知乎发表的长文《智能增长的瓶颈》指出,过去十年 AI 大模型的技术本质,是把电力能源通过计算过程转化为可复用的智能。他提出了三个关键共识:

  • 预训练是智能的主要来源;
  • Next-Token Prediction 是一个极其成功的 Loss 设计,它最大化减少了人为干预;
  • Transformer 的胜出,是因为 Transformer 也是一台并行计算机。

Transformer 并非\u201c更像人脑\u201d,而是更像 GPU——高度并行、计算密集、通信可控。尤洋的判断与 Ilya 不谋而合:\u201c当前遇到的并不是\u2018算力不够\u2019,而是\u2018我们现在的范式无法充分利用持续增长的算力\u2019。\u201d

横向扩展:Scaling Law 的前世今生

把时间线拉长来看,Scaling Law 不是一个永恒定律,而是一段历史。这段历史可以分为三段。

第一段是\u201c研究的时代\u201d(2012-2020)。AlexNet 只用了 2 张 GPU 训出 ImageNet 冠军。Transformer 的实验规模大多在 8-64 张 GPU 之间。ResNet 也是如此。那个阶段的\u201c范式\u201d是\u201c想法比算力稀缺\u201d,瓶颈是研究人员的洞察力和实验设计能力。

第二段是\u201cScaling 的时代\u201d(2020-2025)。OpenAI 的 GPT-3 把 Scaling Law 正式写成了论文——参数、数据、算力按等比放大,性能就按幂律提升。从 GPT-3 到 GPT-4,从 GPT-4 到 GPT-4o,每一次训练规模翻倍都带来肉眼可见的能力跃迁。这个阶段的\u201c范式\u201d是\u201c算力比想法稀缺\u201d,瓶颈是 GPU 数量、电力、数据中心规模和资本。

第三段是\u201c研究时代的回归\u201d(2025-)。Ilya 的判断是:算力已经大到不再稀缺,瓶颈再次回到\u201c想法\u201d本身。但这次的”研究时代”与第一段不一样:第一段的瓶颈是\u201c想法\u201d的产出(人脑不够用),第三段的瓶颈是\u201c想法\u201d的工程化(怎么把想法变成能用的产品)。

从更长的视角看,Scaling Law 的出现和消失都不是孤立事件。物理学里的摩尔定律也经历了类似的阶段:1965 年到 2000 年是\u201c摩尔定律时代\u201d,每个芯片的晶体管数量每两年翻一倍;2000 年到 2015 年是\u201c多核与并行\u201d的时代,CPU 频率撞墙,靠多核和并行计算继续提升性能;2015 年以后是\u201c异构计算\u201d的时代,GPU、TPU、NPU 百花齐放,每一次都靠\u201c新维度\u201d扩展算力天花板。Scaling Law 之于 AI,正如摩尔定律之于芯片——不是\u201c死了\u201d,而是\u201c从单一维度扩展转向多维度扩展\u201d。

这也解释了为什么 SSI 坚持\u201c纯粹研究\u201d的策略。Ilya 在 Dwarkesh 访谈里算过一笔账:OpenAI 一年在研究实验上的投入约 50-60 亿美元,但真正用于纯研究的资源扣掉推理服务、产品工程、销售等开销后并不高。SSI 30 亿美元的资金绝大部分用于研究,因此可用于实验的算力并不少。换句话说,SSI 不是\u201c没有算力\u201d,而是把算力\u201c全部押在\u201d研究上。

总结:研究者该怎么读 Ilya 的判断

回到 2024 年 12 月 NeurIPS 的那一刻,Ilya 讲完\u201c我们只有一个互联网\u201d的时候,他说了一句更重的话:\u201c在某个节点上,预训练总归会把数据用光的,数据显然是有限的。\u201d这不是悲观,而是清醒。

对 AI 工程师来说,这个判断有三层含义:

  • 短期(1-2 年):如果你的产品还依赖\u201c大力出奇迹\u201d的预训练 Scaling,那大概率会撞上投资回报率的天花板。数据增长跟不上算力增长,模型能力提升的成本会越来越高。Llama 4、Gemini 3、GPT-5 之后,每一代模型的能力提升可能不再是线性的。
  • 中期(2-5 年):推理时计算(test-time compute)、Agent 系统、合成数据将成为新的增长极。OpenAI 的 o1/o3 系列、Anthropic 的 Claude Code、DeepMind 的 AlphaEvolve 都是这条路的早期形态。这些\u201c新维度\u201d不是预训练的替代品,而是预训练的延伸——让模型在训练完之后还能继续\u201c思考\u201d。
  • 长期(5-10 年):让模型学会像人类一样学习。Ilya 在访谈里说,\u201c如果你真的解决了这个问题,那它就是一个具备类人学习能力的智能体,同时还能把多个\u2018个体大脑\u2019合并在一起。这种能力人类不具备。它就完全是另一种存在了。\u201dSSI 在做的就是这个方向——不是为了打败 OpenAI,而是为了找到一种能让模型自主学习的算法。

对于普通开发者、,AI 研究者、,产品经理来说,Ilya 的判断更像是一面镜子:过去十年你以为是\u201cAI 越来越聪明\u201d,其实更多是\u201cAI 看到的资料越来越多\u201d。当资料用完了,谁在研究算法,谁在搞合成数据,谁在训练推理能力,谁就能跑到下一棒。

所以,回到最初的问题:\u201c我们只有一个互联网\u201d意味着 Scaling Law 死了吗?

Ilya 的回答是:不是 Scaling Law 死了,而是 Scaling 的\u201c食材\u201d变质了。当数据用完,研究者必须重新切菜、洗菜、配菜、炒菜。这比过去十年的\u201c直接买现成的半成品加热\u201d要麻烦得多,但也是 AI 真正进入下一阶段的开始。

参考来源

主要菜单