Humanoid & Embodied AI · 基础模型 (VLA) 创业公司

Google DeepMind Robotics

Google DeepMind · Carolina Parada(Google DeepMind Robotics 负责人,VP & Head of Robotics)等

VLA模型 / 机器人基础模型

产品线10

语言规划

  1. 2022

    SayCan / PaLM-SayCan

    LLM 做高层规划、机器人做低层执行的早期范式

Robotics Transformer

  1. 2022

    RT-1

    35M 参数 Transformer 控制模型,700+ 指令成功率 97%

  2. 2023

    RT-2

    首次提出 VLA 范式,未见场景成功率 32%→62%

  3. 2024

    AutoRT / SARA-RT / RT-Trajectory

    机器人宪法安全过滤,7 个月调度 52 台机器人

具身多模态模型

  1. 2023

    PaLM-E

    5620 亿参数具身多模态语言模型,RT-2 骨干之一

自我提升智能体

  1. 2023

    RoboCat

    自我提升循环,未见任务成功率 36%→74%

跨本体数据集与模型

  1. 2023

    Open X-Embodiment / RT-X

    33 家机构、22 种本体、100 万条真实轨迹

Gemini Robotics

  1. 2025

    Gemini Robotics / Gemini Robotics-ER

    基于 Gemini 2.0 的 VLA 与具身推理模型

  2. 2025

    Gemini Robotics On-Device

    首个可离线运行的端上 VLA,配套 SDK

  3. 2026

    Gemini Robotics 1.5 / ER 1.6

    行动前思考、跨本体迁移,ER 1.6 新增仪表读数

项目与产品时间线 14 个节点

  1. 2022
    1. 04 研究

      SayCan 发布

      将大语言模型与机器人可供性判断结合,为 Everyday Robots 规划可执行子任务序列。

    2. 12 研究

      RT-1 发布

      35M 参数 Transformer 控制模型,基于 13 台机器人 17 个月真机数据,700+ 指令成功率 97%。

  2. 2023
    1. 02 机构

      Everyday Robots 关停

      Alphabet 裁员中关闭该 Moonshot 项目,部分技术与团队并入 Google 机器人研究主线。

    2. 04-20 机构

      Google DeepMind 成立

      Google Brain 与 DeepMind 合并,由 Demis Hassabis 出任 CEO,机器人研究统一建制。

    3. 06-20 研究

      RoboCat 发布

      基于 Gato 架构的自我提升通用操作智能体,未见任务成功率从 36% 提升到 74%。

    4. 07-28 研究

      RT-2 发布

      首个明确提出 VLA 范式的模型,未见场景成功率从 RT-1 的 32% 提升到 62%。

    5. 10-03 研究

      Open X-Embodiment 与 RT-X

      联合 33 个实验室、22 种本体、超 100 万条真机轨迹,RT-1-X 平均成功率高出专用方法 50%。

  3. 2024
    1. 01 研究

      AutoRT 等机器人研究三连发

      AutoRT 用「机器人宪法」安全过滤,7 个月内调度最多 20 台机器人自主收集 77,000+ 会话。

    2. 12-19 机构

      与 Apptronik 达成战略合作

      共同基于 Gemini 系列模型开发下一代人形机器人 Apollo。

  4. 2025
    1. 03-12 研究

      Gemini Robotics 与 ER 发布

      基于 Gemini 2.0 的 VLA 与具身推理模型,泛化基准较同类 SOTA 平均提升超 2 倍。

    2. 06-24 研究

      Gemini Robotics On-Device 发布

      首个可完全离线运行的端上 VLA 模型,配套 SDK 支持 50-100 条演示快速微调。

    3. 09-25 研究

      Gemini Robotics 1.5 与 ER 1.5

      首次具备「行动前思考」与跨本体迁移能力,ER 1.5 经 AI Studio 向开发者开放。

  5. 2026
    1. 01-05 机构

      与 Boston Dynamics 达成 AI 合作

      Gemini Robotics 将集成到新一代 Atlas 与 Spot,现代计划部署超 25,000 台 Atlas。

    2. 04-14 研究

      Gemini Robotics-ER 1.6 发布

      强化空间与多视角推理,新增仪表读数能力,源自与 Boston Dynamics 的 Spot 巡检合作。

方向: VLA模型 / 机器人基础模型 核心人物: Carolina Parada(Google DeepMind Robotics 负责人,VP & Head of Robotics)等 机构: Google DeepMind 简介: Google DeepMind Robotics 是在 Carolina Parada 领导下的机器人基础模型团队,前身融合了 Google Brain 机器人团队、Everyday Robots 技术遗产与 DeepMind 控制研究。团队开创了 RT-1/RT-2 系列 Robotics Transformer 与 Vision-Language-Action(VLA)模型范式,并将其发展为基于 Gemini 的通用具身智能模型家族(Gemini Robotics / Gemini Robotics-ER),目标是"解决物理世界中的 AGI"。团队与 Apptronik(人形机器人 Apollo)、Boston Dynamics(Atlas、Spot)等硬件厂商深度合作,推动模型跨本体(cross-embodiment)部署。

Carolina Parada 此前在 Google Speech/Assistant 团队工作 7 年,随后在 Nvidia 负责自动驾驶摄像头感知团队 2 年,现任 Google DeepMind Robotics 负责人;来源:research.google 简介CES speaker profileHumanoids Daily 专访

关键成就

  • 学术引用量:团队奠基性论文的引用量在具身智能/机器人学习领域名列前茅——SayCan("Do As I Can, Not As I Say: Grounding Language in Robotic Affordances")被引用 2,347 次;RT-2("Vision-Language-Action Models Transfer Web Knowledge to Robotic Control")被引用 1,777 次(其中 119 篇为"高影响力"引用);Open X-Embodiment 被引用 647 次;RT-1 被引用 500+ 次(以上均为 Semantic Scholar 于 2026 年 7 月检索到的数据,来源:RT-2 Semantic Scholar 页面Open X-Embodiment Semantic Scholar 页面SayCan Semantic Scholar 页面RT-1 引用统计(SciSpace 汇总))。
  • VLA 范式确立者:RT-2 论文首次提出并推广了 "Vision-Language-Action (VLA)" 这一术语与建模范式,此后成为业界描述具身智能模型的标准分类,直接影响了 OpenVLA、π0(Physical Intelligence)等后续大量开源与商业 VLA 工作的命名与技术路线。
  • 最大规模开源跨本体数据集:Open X-Embodiment 联合 21-33 个学术机构,汇聚超过 100 万条真实机器人轨迹、22 种机器人本体,是迄今公开的最大规模机器人学习数据集之一,其 GitHub 仓库持续被学界复用(来源:Open X-Embodiment 项目页GitHub)。
  • 核心硬件伙伴融资规模:人形机器人合作伙伴 Apptronik(Gemini Robotics 的主要落地载体之一)截至 2026 年 2 月 Series A 系列融资累计超过 9.35 亿美元(含 Google 参投的 5.2 亿美元 A-X 扩展轮,投后估值约 50 亿美元),公司总融资接近 10 亿美元(来源:Apptronik 官方新闻稿CNBC 报道)。
  • 产业化部署规模意向:2026 年 1 月与 Boston Dynamics 达成 AI 合作后,双方共同伙伴现代汽车集团宣布计划在旗下工厂部署超过 25,000 台搭载 Gemini Robotics 技术的 Atlas 人形机器人,是目前已知规模最大的人形机器人量产部署计划之一。
  • 主流科技媒体头条覆盖:2025 年 3 月 Gemini Robotics 发布当天即获 TechCrunch("Google DeepMind unveils new AI models for controlling robots")、MIT Technology Review("Gemini Robotics uses Google's top language model to make robots more useful")等主流科技媒体头条报道,此后 2025-2026 年每次重大版本发布(On-Device、1.5、ER 1.6)均被 TechCrunch、MarkTechPost 等持续跟踪报道(来源见时间线各条目链接)。

时间线(2021-2026)

2021-10 — Stacking our way to more general robots(RGB-Stacking 基准)

  • DeepMind(尚未与 Google Brain 合并前)在 CoRL 2021 发表 RGB-Stacking,一个基于视觉的机械臂堆叠基准:机器人需在 20 秒内把红色物体堆到蓝色物体上,绿色物体作为干扰项。研究结合模拟与真实数据来解决"泛化到新物体"的开放问题,并开源了模拟环境与真实机器人环境设计图。这是团队早期强化学习驱动的通用操作研究代表作,是后续 RT 系列的技术前奏之一。
  • 链接: Stacking our way to more general robots — Google DeepMind

2022-04 — SayCan: Grounding Language in Robotic Affordances

  • Google(Robotics at Google + Everyday Robots + DeepMind 前身团队)发布 SayCan,将大语言模型(最初为 FLAN)与机器人"可供性"(affordance)判断结合,让语言模型为真实世界的 Everyday Robots 机器人规划可执行的子任务序列。这是"LLM 做高层规划 + 机器人做低层执行"范式的代表性早期工作,为后续 RT-2 的语义推理能力埋下基础。
  • 链接: SayCan: Grounding Language in Robotic Affordances(项目页)PaLM-SayCan 官方站点
  • 图片: SayCan 项目页分享图:机器人与语言模型对话规划示意

2022-08 — PaLM-SayCan 升级

  • Google 将 SayCan 底层语言模型升级为 5400 亿参数的 PaLM,规划成功率从 FLAN-SayCan 的 70% 提升到 84%,执行成功率从 61% 提升到 74%,并新增抽屉操作、思维链提示、多语言指令等能力,让 Everyday Robots 的助理机器人可在真实办公室环境中响应自然语言请求。
  • 链接: Google's PaLM-SayCan: The First of the Next Generation of RobotsInfoQ 报道

2022-12 — RT-1: Robotics Transformer for Real-World Control at Scale

  • Google Research 团队(含 Everyday Robots、Google Brain 机器人组,后并入 Google DeepMind)发布 RT-1,一个仅 35M 参数、以 3Hz 运行的高容量 Transformer 控制模型,融合 FiLM-conditioned EfficientNet、TokenLearner 与 Transformer。基于 13 台机器人在办公室厨房环境中 17 个月收集的真实数据训练,700+ 训练指令下成功率达 97%,并在新任务、干扰物、新背景上分别比此前最佳基线提升 25%、36%、18%。这是"Robotics Transformer"系列的开端。
  • 链接: arXiv:2212.06817Google AI Blog 原文
  • 图片: RT-1 架构与数据吸收示意图

2023-02 — Everyday Robots 关停,技术与团队并入机器人研究主线

2023-03 — PaLM-E: An Embodied Multimodal Language Model

  • Google 与柏林工业大学联合发表 PaLM-E,一个 5620 亿参数的具身多模态语言模型,将视觉、连续状态估计与文本编码交织输入,端到端训练用于机器人操作规划、视觉问答和图像描述等多任务。PaLM-E 后来成为 RT-2 的两个骨干网络之一(另一个是 PaLI-X)。
  • 链接: arXiv:2303.03378项目页 PDF
  • 图片: PaLM-E 项目页头图:具身多模态语言模型示意

2023-04-20 — Announcing Google DeepMind(Google Brain 与 DeepMind 合并)

  • Alphabet 宣布将 Google Research 的 Brain 团队与 DeepMind 合并为统一的 "Google DeepMind",由 Demis Hassabis 出任 CEO,Google Brain 副总裁 Zoubin Ghahramani 等组成联合领导层。此次合并是"Google DeepMind Robotics"这一团队名称与建制得以形成的组织节点,此后机器人研究统一在 Google DeepMind 旗下推进。
  • 链接: Announcing Google DeepMind — Google DeepMindTechCrunch 报道

2023-06-20 — RoboCat: A Self-Improving Robotic Agent

  • 基于多模态模型 Gato 架构,DeepMind 发布 RoboCat:一个可操作多种机械臂、通过"收集演示→微调出专精子代理→子代理自我练习生成新数据→并入训练集→重新训练"五步循环实现自我提升的通用操作智能体。仅需 100-1000 次演示即可适应新任务或新机械臂;相比初版,最终版本在未见任务上的成功率从 36% 提升到 74%。
  • 链接: arXiv:2306.11706RoboCat: A self-improving robotic agent — Google DeepMind
  • 图片: RoboCat 机械臂操作

2023-07-28 — RT-2: New Model Translates Vision and Language into Action

  • Google DeepMind 发布 RT-2(Robotic Transformer 2),首个明确提出 "Vision-Language-Action (VLA)" 范式的模型:将 PaLI-X / PaLM-E 等视觉语言模型作为骨干,把机器人动作离散化为类文本 token,与网络级视觉语言数据联合微调(co-fine-tune)。RT-2 在未见场景成功率上从 RT-1 的 32% 提升到 62%,并展示了"用石头当锤子""为疲惫的人选能量饮料"等需要网络知识迁移的涌现推理能力,还引入思维链(chain-of-thought)实现多步语义推理。
  • 链接: DeepMind 官方论文 PDFRT-2: New model translates vision and language into action — Google DeepMindThe Keyword 报道
  • 图片: RT-2 机械臂拾取玩具恐龙VLM 到 VLA 转化示意 GIF

2023-09 — Q-Transformer: Scalable Offline RL via Autoregressive Q-Functions

  • Google DeepMind 团队(Yevgen Chebotar、Sergey Levine 等)在 CoRL 2023 发表 Q-Transformer,用 Transformer 表示可扩展的 Q 函数,把每个动作维度离散化为单独 token 进行离线时序差分训练,可同时利用人类演示与自主收集数据,在大规模真实机器人操作任务上超过此前的离线 RL 与模仿学习方法。
  • 链接: arXiv:2309.10150PMLR 会议版本

2023-10-03 — Open X-Embodiment 数据集 与 RT-X 模型

  • Google DeepMind 联合全球 33 个学术实验室,汇聚 22 种机器人本体、超过 100 万条真实机器人轨迹、500+ 技能、150,000+ 任务,构建了当时最大的开源机器人数据集 Open X-Embodiment,并发布基于 RT-1/RT-2 训练的跨本体模型 RT-1-X、RT-2-X。RT-1-X 在 5 个不同高校实验室测试中平均成功率比各实验室专用方法高 50%;RT-2-X 在涌现技能评测上比 RT-2 提升 3 倍。
  • 链接: arXiv:2310.08864Scaling up learning across many different robot types — Google DeepMind项目页/模型下载GitHub
  • 图片: 多种机械臂完成不同任务的示例网格

2024-01 — AutoRT、SARA-RT、RT-Trajectory:机器人研究三连发

  • Google DeepMind 同时公布三项机器人研究:AutoRT 用视觉语言模型做场景理解、大语言模型生成任务提议,配合"机器人宪法"(Robot Constitution,受阿西莫夫三定律启发)与"LLM 立法者"做安全过滤,在 7 个月内于多栋办公楼调度最多 20 台机器人同时作业(累计 52 台机器人),收集 77,000+ 会话、6,650 个独特任务,是已知首个允许 LLM 控制的机器人在真实世界中自主巡游、自主提出目标并采取行动的系统。同期发布的 SARA-RT 与 RT-Trajectory 分别聚焦模型加速与轨迹条件控制。
  • 链接: arXiv:2401.12963(AutoRT)Shaping the future of advanced robotics — Google DeepMind
  • 图片: AutoRT 机器人在办公楼环境中自主巡游采集数据

2024-09 — ALOHA Unleashed 与 DemoStart:机器人灵巧性新进展

  • Google DeepMind 发布两套灵巧操作系统:ALOHA Unleashed 在双臂遥操作平台 ALOHA 2 上使用扩散模型(类似 Imagen 的生成方式)模仿学习机器人动作,学会系鞋带、挂衣服、修理另一台机器人、插齿轮、清洁厨房等复杂双臂任务;DemoStart 则用强化学习在仿真中让多指灵巧手掌握复杂行为(如立方体重定向、插座插入),仿真训练后在真实世界复杂任务成功率达 97%。
  • 链接: Our latest advances in robot dexterity — Google DeepMind

2024-12-19 — Apptronik 宣布与 Google DeepMind Robotics 战略合作

  • 人形机器人公司 Apptronik 宣布与 Google DeepMind 机器人团队达成战略合作协议,共同基于 Gemini 系列模型开发下一代人形机器人 Apollo,为此后 Gemini Robotics 家族在人形机器人本体上的落地铺路。
  • 链接: Apptronik Partners with Google DeepMind Robotics

2025-03-12 — Gemini Robotics 与 Gemini Robotics-ER 发布

  • Google DeepMind 推出基于 Gemini 2.0 的两款机器人模型:Gemini Robotics(新增"物理动作"作为输出模态的高级 VLA 模型,主打通用性、交互性、灵巧性三大能力,在综合泛化基准上比同类 SOTA VLA 模型平均提升超过 2 倍)与 Gemini Robotics-ER(具备增强空间理解能力的具身推理 VLM,可执行感知、状态估计、规划、代码生成全流程,端到端成功率是 Gemini 2.0 的 2-3 倍)。同时发布 ASIMOV 安全评测数据集,并宣布与 Apptronik 合作人形机器人 Apollo,向 Agile Robots、Agility Robots、Boston Dynamics、Enchanted Tools 等可信测试者开放 Gemini Robotics-ER。作者与主导人为 Carolina Parada。
  • 链接: arXiv:2503.20020(技术报告)Gemini Robotics brings AI into the physical world — Google DeepMindMIT Technology Review 报道
  • 图片: Gemini Robotics 头图:机械臂用积木拼出 world 字样Gemini Robotics-ER 具身推理能力拼图(2D检测/指向/多视角对应/3D检测)

2025-06-24 — Gemini Robotics On-Device 发布

  • Google DeepMind 推出首个可完全离线运行的端上(on-device)VLA 模型 Gemini Robotics On-Device,专为双臂机器人设计,具备强通用灵巧性与低延迟推理能力;同时发布 Gemini Robotics SDK,支持开发者在 MuJoCo 仿真中评测并以 50-100 条演示快速微调模型。该模型主要基于 ALOHA 双臂平台训练,并成功适配到 Franka FR3 双臂机器人与 Apptronik 人形机器人 Apollo。
  • 链接: Gemini Robotics On-Device brings AI to local robotic devices — Google DeepMindTechCrunch 报道
  • 图片: Gemini Robotics On-Device 宣传图,含 ALOHA、Franka、Apollo 机器人

2025-09-25 — Gemini Robotics 1.5 与 Gemini Robotics-ER 1.5:把 AI Agent 带入物理世界

  • Google DeepMind 推出两款协同工作的"具身智能体"模型:Gemini Robotics-ER 1.5(高层"大脑",具备 SOTA 空间理解能力,可原生调用 Google 搜索等工具、做多步规划与进度/成功检测)与 Gemini Robotics 1.5(VLA 执行模型,首次具备"行动前思考"能力,会用自然语言展示推理过程,并展现出跨本体学习能力——在 ALOHA 2 上学到的技能可直接迁移到 Apptronik 人形机器人 Apollo 及双臂 Franka 机器人)。同时发布升级版 ASIMOV 安全基准 v2。Gemini Robotics-ER 1.5 当天起通过 Google AI Studio 向开发者开放。
  • 链接: Gemini Robotics 1.5 brings AI agents into the physical world — Google DeepMindarXiv:2510.03342(技术报告论文版)官方技术报告 PDF
  • 图片: Gemini Robotics 1.5 三联图:机械臂持胶带、抓取葡萄、Apollo人形机器人

2026-01-05 — Boston Dynamics 与 Google DeepMind 达成 AI 合作

  • CES 2026 期间,Boston Dynamics 与 Google DeepMind 宣布建立新的 AI 合作关系,计划将 Gemini Robotics 系列基础模型集成到 Boston Dynamics 新一代人形机器人 Atlas 以及四足机器人 Spot 上。Boston Dynamics 2026 年 Atlas 全部产能优先供给现代汽车集团(Hyundai,Boston Dynamics 大股东)的机器人园区(RMAC)与 Google DeepMind,2027 年前不对外部客户交付;现代计划在旗下工厂部署超过 25,000 台 Atlas。
  • 链接: Boston Dynamics & Google DeepMind Form New AI PartnershipTechCrunch 报道
  • 图片: Atlas 人形机器人在实验室中站立

2026-04-14 — Gemini Robotics-ER 1.6 发布

  • Google DeepMind 发布具身推理模型的重大升级 Gemini Robotics-ER 1.6,强化空间推理与多视角理解,新增"仪表读数"(instrument reading)能力——机器人可读取压力表、视液镜等复杂仪器指针与刻度,这项能力是与 Boston Dynamics 紧密合作(应用于其四足机器人 Spot 的设施巡检场景)中发掘的。该模型在指向(pointing)、计数、成功检测等空间/物理推理基准上显著超越 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash,是团队迄今最安全的机器人模型。当天起通过 Gemini API 与 Google AI Studio 向开发者开放。
  • 链接: Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced embodied reasoning — Google DeepMindGoogle Blog 官方公告MarkTechPost 报道
  • 图片: Gemini Robotics-ER 1.6 宣传图:汽车空调歧管压力表组的俯视诊断视图

2026-06-30 — Apptronik 发布 Robot Park 与 Apollo 2,深化与 Google DeepMind 的数据合作

  • Apptronik 在美国德州奥斯汀开放扩建后的旗舰数据采集与训练基地 "Robot Park"(约 9 万平方英尺),并发布人形机器人平台新一代版本 Apollo 2(含双足与轮式底盘两种构型)。Robot Park 采集的高质量数据将持续用于训练 Google DeepMind 的 Gemini Robotics 基础模型,形成"硬件采集数据 → 模型训练 → 部署回机器人"的闭环,是双方 2024 年底合作关系的落地深化。
  • 链接: Welcome to Robot Park: Apollo Goes to Work — ApptronikForbes 报道GlobeNewswire 官方新闻稿
← 返回人形机器人