
2026 年,机器人领域迎来一个被多位研究者集体称为「GPT 时刻」的发布。Generalist AI 推出的 GEN-1.5 机器人基座模型,展示了一种此前只在理论上被讨论的能力:广谱的一次性上下文学习(one-shot in-context learning)——机器人看到一次演示,就能把动作泛化到新的场景里。这件事在机器人研究社区引发了罕见的集体兴奋,而 NVIDIA 的机器人负责人 Jim Fan 给出的拆解,可能是其中最有信息量的一份。他没有停留在「厉害」的感叹上,而是钻进训练数据里,解释清楚了这个能力到底是怎么「凭空」冒出来的。
速览卡:这位大佬和他说了什么
| 项目 | 内容 |
|---|---|
| 大佬 | Jim Fan |
| 身份 | NVIDIA AI 总监、杰出科学家,GR00T 系列机器人模型的推动者 |
| 出处 | X(Twitter)@DrJimFan,2026 年(针对 GEN-1.5 发布的评论与拆解) |
| 时间 | 2026 年(GEN-1.5 发布后) |
| 核心观点 | GEN-1.5 的涌现能力来自训练数据里两类天然结构:对称重复动作提供的「上下文样本」,以及纠错动作提供的「失败—恢复」弧线 |
Jim Fan 说了什么
GEN-1.5 发布后,Jim Fan 没有跟风喊「牛」,而是给出了一个具体的技术判断。他指出了背后两个关键因素,解释为什么这个模型会「自然涌现」出一次性学习的能力:
第一,训练数据中天然存在的对称、重复的动作模式。比如组装家具时反复拧螺丝——第一颗螺丝对第二颗来说,天然就是一个「上下文学习样本」。第二,数据中人类犯错后的恢复动作——比如把掉在地上的东西捡起来继续干——构成了一条完整的「失败—恢复—继续」弧线,让模型在测试时能自然表现出纠错能力。
他还点出了一个更隐蔽、但更关键的细节,关于数据采集方式:
Generalist AI 使用的 UMI 数据采集方法——让人直接戴上机器人夹爪去操作——保留了人类的「物理直觉」,而传统通过 VR 设备进行的遥操作,会显著损失这种直觉。
不过,作为一贯冷静的科学家,他在同一条推文的评论里也泼了一盆理性的冷水:
这个演示还是太简单了,不能据此下任何结论。
这五句话,构成了一个非常「Jim Fan 式」的拆解:先给机制,再点要害,最后守住科学的边界。
背景:机器人为什么卡在「一次性学习」上
要理解 Jim Fan 这段拆解的分量,得先搞清楚「一次性学习」为什么是机器人领域的圣杯。
在机器人历史上,让一个机器人学会一个技能,传统上需要大量的示范数据,而且学到的技能很难迁移——换个环境、换个物体,可能就得重新来。这个「泛化」难题,是机器人迟迟无法像 LLM 那样「scale up」的核心原因之一。相比之下,大语言模型在 GPT-3 之后展示了一种惊人的能力:给它几个示例(few-shot),它就能「举一反三」。这就是所谓的 in-context learning(上下文学习)。
机器人研究者梦寐以求的,就是把 LLM 的这种「广谱上下文学习」搬到物理世界——让机器人看到一个动作,就能复制到新场景里。Generalist AI 的联合创始人 Pete Florence 在 X 上坦言,这是他从研究机器人基座模型起就定下的「最清晰的目标」:
自从我开始研究机器人基座模型,广谱的一次性上下文学习就是我心中最清晰的目标。现在我看到近十年的想象在现实世界中成真了。
Florence 还回忆了他和 Andy Zeng 在研究生时代讨论过的一个「Ctrl-C / Ctrl-V」式的设想:看到一个动作,让机器人复制它——但当时发现这极其困难,因为「你要粘贴进去的世界,永远和你复制出来的那个世界不一样」。这正是机器人一次性学习的本质难点:物理世界的场景千变万化,没有两个完全相同的「上下文」。
而 GEN-1.5 展示的,正是这个「不同世界之间复制动作」的能力。卡内基梅隆大学的机器人研究者 Chris Paxton 甚至直接说,这「可能是真正的 GPT 时刻」:
操作学习的圣杯,毫无疑问就是一次性学习。
核心观点展开:能力为什么会「自然涌现」
Jim Fan 拆解的独到之处,在于他没有把 GEN-1.5 的成功归因于某种神秘的新架构,而是归因于训练数据里那些「你平时不会注意、却极其重要」的结构。
第一类结构:对称重复动作 = 免费的上下文学习样本。这可能是 Jim Fan 这段拆解里最漂亮的一个洞察。在真实的操作数据里,有大量「重复」的动作——组装家具时拧第二颗、第三颗、第四颗螺丝,每一次动作都和前一次高度相似。对模型来说,这些「看起来一样」的重复动作,天然构成了一组组的上下文学习样本:第一颗螺丝是「示例」,第二颗螺丝是「模仿」。模型在训练中不知不觉就学会了「看一次、照着做」。这解释了为什么一次性学习能力不是被刻意设计出来的,而是从数据里「长」出来的——它和 LLM 里 few-shot 能力的来源,在机制上是同构的。
第二类结构:纠错动作 = 失败—恢复的完整弧线。另一个被大多数人忽略的数据特征,是人类在操作过程中的「纠错」:东西掉了,捡起来继续;拧歪了,退回来重拧。这些动作在传统的数据清洗里,往往被当成「噪声」删掉,或者在建模时被当成「不完美示范」而嫌弃。但 Jim Fan 指出,恰恰是这些纠错动作,给模型提供了「失败—恢复—继续」的完整轨迹,让模型学会了「出错之后如何纠正」。这解释了为什么 GEN-1.5 在测试时能表现出自主纠错的能力——因为它在训练数据里见过了海量的「错了怎么办」。
第三类细节:UMI 数据采集保留了物理直觉。这是 Jim Fan 点出的另一个容易忽视的关键。Generalist AI 用的是 UMI(Universal Manipulation Interface)采集方式——让人直接穿戴机器人夹爪去操作,采集到的数据「以人为主、机器人不在环」。这种方式的好处是:人手的物理直觉(力度、姿态、对物体重量的预判)被原原本本地保留了下来。相比之下,传统的 VR 遥操作,操作者手里拿的是手柄,隔着屏幕看机器人,大量的物理反馈信息(比如触觉、重量感)在这个过程中丢失了。Jim Fan 的判断是:正是这种「直觉保留」的数据质量,才让模型学到了真正可泛化的操作策略,而不是只会「复读」固定轨迹。
把这三类洞察合起来,Jim Fan 实际上是在说:GEN-1.5 的「GPT 时刻」不是一次算法的胜利,而是一次「数据工程 + 数据质量」的胜利。这和他一贯强调的「物理 AI 要规模化,关键在于数据和数据引擎」的立场完全一致。
行业内的讨论与不同声音
GEN-1.5 的发布在机器人社区激起的反应,值得完整记录下来,因为它本身就是一次难得的「共识形成」现场。
支持方的声音很有代表性。东北大学的具身智能研究者 Jimmy Yang 说:「作为一个具身 AI 研究者,这对这个领域来说是一个真正特殊的时刻。」Pete Florence 更是把这次发布上升到「近十年想象成真」的高度。这些反应之所以罕见,是因为机器人领域的「突破」通常伴随着大量附加条件和限制,而这次展示的「广谱一次性学习」直指领域最核心的痛点,且看起来是「自然涌现」的。
但理性的冷水同样存在,而且恰恰来自最懂行的人。Jim Fan 在评论里那句「演示还是太简单了,不能据此下任何结论」,是一个非常重要的信号。他的意思是:GEN-1.5 展示的还只是「演示级」的能力,距离「在真实、非结构化、高噪声环境里稳定泛化」还有很长的路。一次性学习在「受控演示」里成立,和在「真实工厂、真实家庭」里成立,是两个完全不同量级的挑战。这和他三天前在巴黎的另一段发言形成了呼应——他反复强调,物理 AI 现在「还在很早的阶段」。
这场讨论的另一个暗线,是「数据方法」和「模型架构」之争。Jim Fan 把能力归因于「数据里的对称结构 + 采集方式」,这实际上是在说:很多时候,领域的瓶颈不在模型,而在数据。这个判断如果成立,意味着机器人领域的竞争焦点,会从「谁的模型更强」转向「谁的数据引擎更猛」——而这正是 Jim Fan 一直在布道的方向。
横向扩展:世界行动模型、物理 AI 与「数据引擎」
Jim Fan 对 GEN-1.5 的解读,可以放进他那套关于「物理 AI」的完整框架里理解。
就在同一时期(2026 年 7 月),Jim Fan 在巴黎的 RAISE Week 上提出了他著名的「三个数字、三项策略」。三个数字回答「为什么是现在」:全球因岗位空缺造成的损失约相当于 GDP 的 1.5%(超过一万亿美元,他称之为「一门今天为零、前方一万亿的生意」);一台宇树 G1 人形机器人在沃尔玛标价 4 万美元(二十年前本田 ASIMO 成本约 200 万美元,价格暴跌 98%);NVIDIA 开源的 GR00T 模型与物理 AI 数据集下载量突破 1000 万次。
三项策略回答「怎么建」。其中和 GEN-1.5 最相关的,是他对「数据」的强调——两条数据引擎:一条是「以人为中心的自我数据」(egocentric human data),把传感器穿戴在人身上、让机器人暂时退出数据采集闭环,他称之为「新的 FSD」——像全自动驾驶那样,以车队规模采集第一人称视角的人类数据。这和他称赞 UMI 采集方式「保留了物理直觉」,是同一套逻辑的一体两面。另一条是「仿真数据」,用越来越快、越来越逼真的神经世界模型(如 Cosmos)作为新的模拟器。
还有一条值得单独说:Jim Fan 提出的下一代建模范式——「世界行动模型」(World Action Model),即物理 AI 直接生成像素、从海量视频中学习物理、预测下一帧画面。这和 LeCun 的世界模型主张高度同频,但 Jim Fan 更强调「行动」——模型不仅要理解世界,还要能在世界里行动。GEN-1.5 的「一次性学习」,本质上是「世界行动模型」这条路上的一个里程碑样本。
他还说过一句很有意思的话,点破了物理 AI 和 LLM 的关系:「LLM 的那帮人玩得挺开心,所以我们要去借点他们的玩具。」——指的就是把 LLM 领域的最新 Agent 技术(上下文学习、测试时训练、自我纠错)搬到机器人上。GEN-1.5 的「GPT 时刻」,正是「借玩具」借出了效果。
从「一次性学习」到「测试时训练」:Jim Fan 的机器人学习观
Jim Fan 对 GEN-1.5 的拆解,其实只是他那套更完整的「机器人学习」思想的一个切片。要真正理解他为什么能一眼看出「对称重复动作 = 上下文样本」这个机制,得看他同期在做的另一件事——RoboTTT。
2026 年 7 月 15 日,Jim Fan 在 X 上公布了一个叫 RoboTTT 的机器人策略,一个很有意思的技术方向:把机器人模型的上下文,从 128 个时间步一路扩展到 8000 个时间步,而且推理成本恒定不变。做法是「测试时训练」(test-time training,简称 TTT)——在主模型内部,藏一个很小的「核心模型」,每来一个传感器读数,就对这个小核心做一次梯度步,把历史不断压缩进这个小核心的权重里。因为隐藏状态的大小是固定的,机器人就能用极小的开销,处理任意长的经验,而且部署之后还能持续学习下去。
这套东西和 GEN-1.5 的关系,在于它指向了同一个方向:机器人要真正「聪明」起来,靠的不是「训练时记住了多少」,而是「部署之后还能不能继续学」。RoboTTT 展示的是「从人类视频里做一次性上下文学习」,以及「在部署中自我改进、在剧集中途从自己的错误里恢复」——这和 Jim Fan 在 GEN-1.5 拆解里强调的「失败—恢复—继续弧线」,几乎是同一件事的两个侧面。
他还给出了一个具体的量:从 128 到 8000 时间步的「上下文缩放曲线」显示,闭环性能在稳步爬坡、没有任何饱和的迹象,而且 8K 上下文的预训练,比 1K 要强 62%。这个数字背后的含义是:机器人的「上下文窗口」越大,它能记住、能利用的经验就越长,能处理的「长程任务」就越复杂——这和 LLM 里的长上下文竞争,逻辑完全一致。
把 RoboTTT 和 GEN-1.5 拆解放在一起,Jim Fan 的「机器人学习观」就清晰了:机器人智能的瓶颈,正在从「模型架构」转向「数据」和「持续学习」。数据决定模型能学到什么(对称结构、纠错弧线),持续学习决定模型部署后能走多远(测试时训练)。这也是他反复强调「数据引擎」的根本原因。
为什么物理 AI 是「零万亿生意」:一次能力之外的大局判断
Jim Fan 之所以对 GEN-1.5 这样的进展如此敏感,是因为他有一个更大的大局判断——物理 AI 是一个「今天为零、前方一万亿」的生意。理解这个判断,才能真正理解他为什么把机器人的每一次能力突破都看得那么重。
他的论证是宏观的:全球正在老龄化,而很多岗位找不到足够的人来做。他把「岗位空缺造成的损失」估算为全球 GDP 的 1.5%——超过一万亿美元。所以他用了一个很妙的表述:「我们正处在一门零万亿美元的生意里——今天是零,前方就是一万亿。」这句话的意思是,物理 AI 目前的市场规模几乎可以忽略不计,但它的天花板高得惊人。
支撑这个判断的,是一个价格曲线。二十年前,本田的 ASIMO 单台成本约 200 万美元;而今天,一台宇树 G1 人形机器人在沃尔玛标价 4 万美元——相当于一辆普通家用车。二十年间,人形机器人的入门价格下降了 98%。Jim Fan 的判断是,4 万美元大约是「人形机器人有史以来的最高价」,从此只会继续下探,直到逼近原材料的物理成本极限。
第三个数字是生态的临界点:NVIDIA 开源的 GR00T 模型和物理 AI 数据集,下载量突破了 1000 万次。这个数字的意义在于,它标志着一个「社区」正在形成——不再是某一家公司在单打独斗,而是整个开发者生态在共同构建物理 AI。当下载量到这个量级,说明「工具」已经足够成熟、足够好用,能吸引大规模的人进来。
所以,当 GEN-1.5 展示出「一次性学习」这种能力时,Jim Fan 看到的不是一个 demo,而是「那个一万亿美元的生意」往前迈了一步。这也是为什么他既兴奋(「GPT 时刻」)又冷静(「演示还太简单」)——因为他清楚,从「演示级的一次性学习」到「万亿生意的落地」,中间还隔着很长的路。
总结与启示
Jim Fan 对 GEN-1.5 的拆解,最值得学习的不是「他说了什么结论」,而是「他怎么拆」——他不满足于「这个模型很强」,而是追问「这个能力是怎么从数据里长出来的」。这种「钻进数据里找机制」的视角,是区分「看热闹」和「看门道」的分水岭。
几个具体的启示:其一,涌现能力往往有迹可循。一次性学习看起来很「神」,但 Jim Fan 告诉我们,它可能只是训练数据里「对称重复 + 纠错弧线」这两类结构的自然结果。追根溯源,比迷信玄学更有用。其二,数据的「质量」和「采集方式」可能是比模型架构更被低估的变量。UMI 保留物理直觉这件事,提醒我们:很多时候模型的上限,在数据采集的那一刻就已经被决定了。其三,保持科学理性。Jim Fan 那句「演示太简单,不能下结论」,是技术圈稀缺的品质——在一群人欢呼时,懂行的人负责说「等等,我们还没到那一步」。
如果 GEN-1.5 真的是机器人的「GPT 时刻」,那么它真正的意义不在于这一款模型,而在于它证明了一条路是通的:只要数据和方法对了,机器人也能像 LLM 那样,涌现出「看一次就会」的泛化能力。而这条路能走多远,Jim Fan 已经用「世界行动模型 + 数据引擎」给出了他的答案。
参考来源
- KuCoin News《Generalist AI Launches GEN-1.5, Seen as the GPT-3 Moment for Robotics》(含 Jim Fan 原推拆解)
- Humanoid.guide《Jim Fan in Three Minutes》(Nebius Robotour Paris,三个数字三项策略)
- Humanoid.guide《Machina 2026》
- Tech & Business《NVIDIA researcher Jim Fan unveils RoboTTT robot policy with 8,000-timestep context and test-time training》

