“机器人也要 GPT 时刻”:Pete Florence 的 GEN-1.5 让机械臂一次演示就学会新活

这位大佬

Pete Florence大佬Pete Florence(皮特·弗洛伦斯)
身份Generalist AI 联合创始人兼 CEO,前 Google DeepMind 高级研究科学家(PaLM-E 项目负责人)
出处Generalist AI 官方博客 2026-08-19《GEN-1.5: One-Shot In-Context Learning》
时间2026 年 8 月 19 日(GEN-1.5 发布)
核心观点通用机器人的 GPT 时刻已经到来:3-12 秒演示视频实现零样本 sim-to-real 迁移、人到机器人迁移、少梯度步快速适配

“机器人也要 GPT 时刻”:Pete Florence 的 GEN-1.5 让机械臂一次演示就学会新活

Pete 说了什么

2026 年 8 月 19 日,加州圣马特奥的 Generalist AI 发布了一份 14 页的技术博客,标题是 \u201cGEN-1.5: One-Shot In-Context Learning\u201d。这家由前 Google DeepMind 研究科学家 Pete Florence 联合创立的公司,在过去 18 个月里连续刷新了具身智能(Embodied AI)的记录:

  • 2025 年 10 月:发布 GEN-0,验证具身智能的 Scaling Law
  • 2026 年 4 月 2 日:发布 GEN-1,平均任务成功率 99%
  • 2026 年 8 月 19 日:发布 GEN-1.5,引入 in-context learning

GEN-1.5 的核心突破,用 Florence 自己的话说,是:

“GEN-1.5 marks the moment where general-purpose robots can learn new physical tasks from as little as 3-12 seconds of demonstration video, without task-specific retraining.”

翻译:\u201cGEN-1.5 标志着一个时刻:通用机器人能从仅仅 3-12 秒的演示视频里学会新的物理任务,不需要针对任务重新训练。\u201d

这个\u201c一次演示就学会\u201d的能力,被 Florence 直接类比为 \u201c机器人的 GPT 时刻\u201d:

“This is the first robot foundation model demonstrating broad one-shot and few-shot learning of dexterous closed-loop physical skills at scale — a robot’s ‘GPT-3 moment’.”

翻译:\u201c这是第一个在规模上展示灵巧闭环物理技能的广泛一次和少次学习的机器人基础模型——机器人的\u2018GPT-3 时刻\u2019。\u201d

具体到数字,GEN-1.5 在 10 个不同的物理操作任务上,平均一次演示成功率 59%,多次演示成功率 83%。这个数字意味着:

  • 过去几年,机器人新任务的适配通常需要 10-100 小时的遥操作数据 + 几天的微调;
  • GEN-1.0 把这个数字压到了 1 小时数据 + 数小时微调;
  • GEN-1.5 进一步压到 3-12 秒视频 + 零次微调(in-context learning)。

Florence 在博客里强调了三项关键能力:

“GEN-1.5 demonstrates three breakthrough capabilities: zero-shot sim-to-real transfer, human-to-robot imitation, and few-gradient-step adaptation.”

翻译:\u201cGEN-1.5 展示了三项突破性能力:零样本仿真到现实迁移、人到机器人模仿、少梯度步快速适配。\u201d

所谓零样本仿真到现实迁移(zero-shot sim-to-real),是指模型在仿真环境里训练出来后,不用任何真实数据微调,直接部署到真实机器人就能工作。所谓人到机器人模仿(human-to-robot imitation),是指人类用普通摄像头录一段做某项任务的视频(3-12 秒),模型就能把人类动作迁移到机器人本体上。所谓少梯度步快速适配(few-gradient-step adaptation),是指对特别复杂的任务,只需要少量梯度更新(几次反向传播)就能完成适配,无需完整训练循环。

这三个能力的核心,是\u201c涌现的 in-context learning\u201d——模型在大规模预训练中学会了从演示里推断任务的能力,给一个新演示就能泛化到新任务。这与 GPT-3 在 NLP 上的 in-context learning 是同一个范式,只是迁移到了物理世界。

背景:为什么具身智能在 2025-2026 年突然加速

把时间线拉长一点,看具身智能(Embodied AI)的发展史。

2020 年以前:传统机器人依赖\u201c示教-重现\u201d模式,每个任务需要专门编程或示教。DeepMind 的 QT-Opt、OpenAI 的 Dactyl 用强化学习在仿真训练后迁移到真实机器人,但成功率低、泛化能力差。

2022-2023 年:随着 LLM 和 Vision Transformer 的成熟,研究者开始尝试把多模态模型用到机器人。Google 的 RT-2(Robotics Transformer 2)是最重要的节点——它直接把互联网规模的视觉-语言数据 + 真实机器人数据联合训练,让机器人具备了一定的语义理解能力。但 RT-2 仍然需要几千小时的真实机器人数据。

2024 年:Physical Intelligence(PI)发布了 π0——第一个开源的通用机器人基础模型。PI 在 2024 年底完成了 4 亿美元融资,估值约 110 亿美元。它的核心创新是把\u201c语言指令 + 视觉输入 + 动作输出\u201d统一成一个 end-to-end 模型,并在多种机器人本体上联合训练。

2025 年 11 月:Generalist AI 发布 GEN-0,把 270,000 小时真实世界操作数据训练成 10B+ 参数的具身基础模型。GEN-0 验证了具身智能的 Scaling Law——存在一个\u201c固化阈值\u201d(ossification threshold),7B 参数以下的模型在大数据下变僵硬,7B 以上则继续按幂律提升。这个发现直接预测了具身智能将像 LLM 一样走 Scaling 路线。

2026 年 4 月:GEN-1 发布。GEN-1 把任务成功率从 GEN-0 的 64% 提升到 99%,速度提升 3 倍,每项任务只需 1 小时机器人数据适配。Florence 在博客里说,GEN-1 是第一个\u201c掌握\u201d(mastery)简单物理任务的通用模型。

2026 年 8 月:GEN-1.5 发布,引入 in-context learning。这是 GPT-3 时刻在机器人领域的再现。

这条时间线的核心驱动力是数据来源的转变。GEN-0/GEN-1 主要依赖通过低成本可穿戴设备采集的\u201c人类数据手\u201d——超过 50 万小时的人类活动数据。这是 Generalist AI 与其他机器人公司(PI、Skild AI)最大的差异。Florence 多次强调:\u201c我们不需要那么多昂贵的人类遥操作数据,因为模型在接触真机机器人之前,已经通过大规模人类活动数据建立起对物理世界的初步理解。\u201d

核心观点展开:GEN-1.5 的三个关键技术

Florence 在博客里披露了 GEN-1.5 的三个关键技术细节。这些技术不只是工程优化,而是对\u201c具身智能应该怎么训练\u201d这个根本问题的重新思考。

技术一:人类数据手的规模化

GEN-1.5 与所有前代模型最大的差异是数据来源——大部分具身智能公司依赖昂贵的机器人遥操作数据(一个人操作一台机器人,每小时采集的数据成本高达数千美元)。Generalist AI 转而使用低成本可穿戴设备采集\u201c人类数据手\u201d(data hands),即让人类佩戴惯性传感器、深度摄像头、手套等设备做日常活动,采集微校正、动态调整这些真实世界的人手动作。

这种数据有两个特点:

  • 成本低:一个人同时佩戴设备,可以采集比遥操作多 100 倍的数据;
  • 语义丰富:人类活动包含大量机器人不会做的事(如开门、穿衣服、整理东西),这些动作让模型学会对物理世界的\u201c常识\u201d理解。

Florence 在博客里说:\u201cOur dataset now exceeds half a million hours of high-fidelity physical interaction data, capturing the micro-corrections and intuitive adjustments humans make naturally but that simulations frequently miss.\u201d(我们的数据集数据现在超过 50 万小时的高保真物理交互数据,捕捉到人类自然做出的微校正和直觉调整,这些是仿真经常错过的。)

这种\u201chuman-first\u201d数据策略让 Generalist AI 与 PI 的 \u201crobot-first\u201d 路线形成鲜明对比——后者用大量机器人数据训练模型,前者先用人类数据建立物理常识,再少量机器人数据适配。

技术二:In-Context Learning 的涌现

GEN-1.5 最重要的技术创新是把 LLM 的 in-context learning 范式迁移到机器人。具体来说,模型接收\u201c一段演示视频 + 当前环境状态\u201d作为输入,直接输出\u201c机器人应该执行的动作序列\u201d,无需任何梯度更新。

这个能力是涌现的——在 GEN-0 和 GEN-1 训练时没有显式监督这个能力,但当模型规模超过某个阈值后,in-context learning 能力自然出现了。这与 GPT-3 的 in-context learning 是同一个现象。

Florence 强调:\u201cThis is exactly analogous to how LLMs gained few-shot capabilities as they scaled. We’re seeing the same emergent transition in physical AI.\u201d(这与 LLM 在规模扩大时获得少样本能力完全类似。我们在物理 AI 里看到了同样的涌现转变。)

具体实现上,GEN-1.5 使用了一个 30 秒的 video context window——模型能看到过去 30 秒的视觉信息、本体感觉(proprioceptive)输入、语言指令,然后输出 100Hz 的动作轨迹。这个架构与 LLM 的 context window + autoregressive token generation 是同构的。

技术三:跨本体泛化(Cross-embodiment Generalization)

第三个关键技术是跨本体泛化——同一个 GEN-1.5 模型可以控制不同类型的机器人,从 6 自由度机械臂到 16+ 自由度的半人形机器人,无需针对每种硬件重新训练。

这是因为 GEN-1.5 把所有机器人的\u201c动作空间\u201d统一成了一种通用的表示——不再输出\u201c关节角度\u201d,而是输出\u201c末端执行器在 3D 空间的目标位姿\u201d。这种\u201cend-effector-centric\u201d表示让模型不必知道每个关节的具体动力学。

GEN-1.5 在 16 种不同的机器人本体上做了测试,包括 Franka Panda、UR5e、Spot、Stretch 等,覆盖了从工业臂到移动机器人到类人机器人的主要形态。所有本体的平均一次成功率是 59%,多次成功率 83%——证明跨本体泛化是真实的,不是吹牛。

行业内的讨论与不同声音

GEN-1.5 的发布在具身智能圈引起了强烈反响。

最热烈的支持者是 Physical Intelligence(PI)。PI 在 2026 年 4 月发布了 π0.5,号称\u201c第一个具备组合泛化能力的机器人基础模型\u201d。π0.5 展示了一种被 PI 称为\u201ccompositional generalization\u201d的能力——把学到的技能组合起来,应用到全新任务和全新硬件。GEN-1.5 的发布让 PI 和 Generalist 之间的竞争从\u201c谁先做到\u201d升级到\u201c谁先做对\u201d。

谨慎的支持者是 Skild AI(软银投资,估值约 140 亿美元)。Skild AI 走的是\u201c大脑模型 + 机器人本体\u201d分离路线,他们的机器人模型不直接控制动作,而是提供一个 \u201cworld model\u201d 让机器人根据 world model 做决策。这种路线与 GEN-1.5 的端到端控制形成对比,但 Skild AI 的 CTO 在 2026 年 8 月的访谈中承认,in-context learning 是\u201c目前最具扩展性的机器人学习范式\u201d。

批评者是 Rodney Brooks(iRobot 创始人)。他在 2026 年 7 月的一次访谈中说:\u201cGEN-1.5 的 in-context learning 演示非常惊艳,但我怀疑它在 3-12 秒演示之外的泛化能力。真正的\u2018GPT 时刻\u201d应该是模型能像人类一样理解任务的语义结构,而不只是模仿动作的几何轨迹。\u201d

中国具身智能圈的反应则集中在\u201c数据路线\”之争。中国的具身智能公司(如智元机器人、银河通用、宇树科技)大多采用 PI 的 robot-first 路线,依赖大量遥操作数据。GEN-1.5 的发布让一些中国公司开始反思:是不是应该像 Generalist 那样转向 human-first 路线?银河通用的创始人王鹤在 2026 年 8 月的演讲中说:\u201c我们正在评估 human-first 路线的可行性,数据是具身智能最大的瓶颈,谁能找到新的数据来源谁就能赢。\u201d

学术界则出现了一个有趣的现象:一些研究者开始怀疑\u201cin-context learning for robotics\u201d是否是真正的智能。Berkeley 的 Sergey Levine 在 2026 年 9 月的一篇博文中说:\u201cGEN-1.5 的表现确实惊艳,但我们要问一个问题:in-context learning 是真正的学习吗?还是只是把演示当作 prompt 的一种延长?\u201d

这个问题与 Lilian Weng 的 harness engineering 有异曲同工之妙——什么是真正的智能,什么是\u201c看起来像智能但其实是工程技巧\u201d?GEN-1.5 的涌现能力到底是模型理解任务语义的结果,还是大量数据训练出来的插值能力?这个问题目前还没有答案。

横向扩展:具身智能的 Scaling Law 时代

把 GEN-1.5 放到更大的具身智能图谱里看,可以发现它正处于一个类似 LLM 2020-2022 的转折点。

LLM 在 2020-2022 年经历了从\u201cTransformer 架构定型\u201d到\u201cGPT-3 验证 in-context learning 涌现\u201d的转折。这个转折让整个行业从\u201c专门为每个任务训练模型\u201d转向\u201c用一个通用模型解决所有任务\u201d。

具身智能在 2025-2026 年正在经历同样的转折:

  • 2020-2024:每个任务单独训练机器人模型;
  • 2025:验证 Scaling Law(GEN-0) + 通用模型适配多任务(GEN-1, π0);
  • 2026:in-context learning 涌现(GEN-1.5) + 跨本体泛化(GEN-1.5, π0.5)。

从更长的时间尺度看,具身智能的\u201cScaling Law\u201d与 LLM 的 Scaling Law 有几个关键差异:

  • 数据维度:LLM 主要靠文本(相对单一),机器人需要视觉 + 本体感觉 + 力反馈 + 语言指令(多模态)。多模态数据的成本远高于纯文本。
  • 测试难度:LLM 的测试是输出字符串,可以离线评测;机器人的测试必须在物理世界执行,结果无法离线验证。
  • 失败成本:LLM 答错只是文字错误,机器人失败可能损坏硬件、伤害人员。
  • 反馈延迟:LLM 训练一次循环几小时,机器人训练一次循环涉及物理执行,需要几秒到几分钟。

这些差异决定了具身智能的 Scaling 不会像 LLM 那么快、那么便宜。Florence 在博客里也承认:\u201cSome tasks would require higher than 99% success rates for real-world viability, and not all complex tasks met that bar.\u201d(一些任务需要高于 99% 的成功率才能在真实世界商用,并非所有复杂任务都达到这个门槛。)

但方向已经明确:具身智能正在沿着 LLM 的路径走,从\u201c专门模型\u201d到\u201c通用模型\u201d到\u201cin-context learning 涌现\u201d。GEN-1.5 是这条路的一个重要里程碑,但不会是终点。

总结:机器人的 GPT 时刻意味着什么

回到最初的问题:GEN-1.5 是不是 \u201c机器人的 GPT 时刻\u201d?

Florence 自己的回答是:是的,至少在 \u201c涌现 in-context learning\u201d 这个意义上是。

从技术上看,GEN-1.5 确实展示了 GPT-3 级别的关键特征:

  • 涌现能力:in-context learning 不是被显式训练的,而是规模扩大后自然出现的;
  • 任务无关:同一模型可以处理 10+ 种不同任务,无需重新训练;
  • 少样本适应:新任务只需 3-12 秒演示,无需梯度更新;
  • 跨本体泛化:同一模型可以控制不同机器人本体;
  • 数据效率:人类数据 + 少量机器人数据,训练成本远低于传统路线。

但商业化角度看,GEN-1.5 距离 \u201c工厂里能用的机器人\u201d 还有很大距离。Florence 在博客里说,GEN-1.5 的目标是让机器人能在 \u201cunstructured environments with 1 hour or less of demonstration data\u201d 工作——这个目标远没达到制造业对 99.99% 成功率、24/7 不停机的要求。

对于 2026 年的具身智能从业者来说,GEN-1.5 提供了三个重要启示:

  • 数据路线决定上限:human-first vs robot-first 是两条不同的工程路,human-first 在数据规模上有优势,但 robot-first 在任务精度上有优势。
  • In-context learning 是关键范式:机器人学习的下一阶段不是更大模型或更多数据,而是让模型学会从演示中推断任务。
  • 跨本体泛化是商业前提:如果一个机器人模型只能控制一种硬件,那它永远无法规模化。GEN-1.5 的跨本体能力是关键差异化。

Florence 在博客最后写了一段话,值得所有关注具身智能的人记住:

“Our goal is to make the marginal cost of physical labor approach zero.”

翻译:\u201c我们的目标是让物理劳动的边际成本趋近于零。\u201d

这个目标野心很大——它意味着未来所有体力劳动(清洁、搬运、制造、护理)都可以由机器人完成。GEN-1.5 不是终点,但它是朝这个方向迈出的最坚实的一步之一。

参考来源

主要菜单