Google DeepMind Robotics
Google DeepMind · Carolina Parada(Google DeepMind Robotics 负责人,VP & Head of Robotics)等













1 / 14 产品线10
语言规划
- 2022
SayCan / PaLM-SayCan
LLM 做高层规划、机器人做低层执行的早期范式
Robotics Transformer
- 2022
RT-1
35M 参数 Transformer 控制模型,700+ 指令成功率 97%
- 2023
RT-2
首次提出 VLA 范式,未见场景成功率 32%→62%
- 2024
AutoRT / SARA-RT / RT-Trajectory
机器人宪法安全过滤,7 个月调度 52 台机器人
具身多模态模型
- 2023
PaLM-E
5620 亿参数具身多模态语言模型,RT-2 骨干之一
自我提升智能体
- 2023
RoboCat
自我提升循环,未见任务成功率 36%→74%
跨本体数据集与模型
- 2023
Open X-Embodiment / RT-X
33 家机构、22 种本体、100 万条真实轨迹
Gemini Robotics
- 2025
Gemini Robotics / Gemini Robotics-ER
基于 Gemini 2.0 的 VLA 与具身推理模型
- 2025
Gemini Robotics On-Device
首个可离线运行的端上 VLA,配套 SDK
- 2026
Gemini Robotics 1.5 / ER 1.6
行动前思考、跨本体迁移,ER 1.6 新增仪表读数
项目与产品时间线 14 个节点
- 2022
-
SayCan 发布
将大语言模型与机器人可供性判断结合,为 Everyday Robots 规划可执行子任务序列。
-
RT-1 发布
35M 参数 Transformer 控制模型,基于 13 台机器人 17 个月真机数据,700+ 指令成功率 97%。
-
- 2023
-
Everyday Robots 关停
Alphabet 裁员中关闭该 Moonshot 项目,部分技术与团队并入 Google 机器人研究主线。
-
Google DeepMind 成立
Google Brain 与 DeepMind 合并,由 Demis Hassabis 出任 CEO,机器人研究统一建制。
-
RoboCat 发布
基于 Gato 架构的自我提升通用操作智能体,未见任务成功率从 36% 提升到 74%。
-
RT-2 发布
首个明确提出 VLA 范式的模型,未见场景成功率从 RT-1 的 32% 提升到 62%。
-
Open X-Embodiment 与 RT-X
联合 33 个实验室、22 种本体、超 100 万条真机轨迹,RT-1-X 平均成功率高出专用方法 50%。
-
- 2024
-
AutoRT 等机器人研究三连发
AutoRT 用「机器人宪法」安全过滤,7 个月内调度最多 20 台机器人自主收集 77,000+ 会话。
-
与 Apptronik 达成战略合作
共同基于 Gemini 系列模型开发下一代人形机器人 Apollo。
-
- 2025
-
Gemini Robotics 与 ER 发布
基于 Gemini 2.0 的 VLA 与具身推理模型,泛化基准较同类 SOTA 平均提升超 2 倍。
-
Gemini Robotics On-Device 发布
首个可完全离线运行的端上 VLA 模型,配套 SDK 支持 50-100 条演示快速微调。
-
Gemini Robotics 1.5 与 ER 1.5
首次具备「行动前思考」与跨本体迁移能力,ER 1.5 经 AI Studio 向开发者开放。
-
- 2026
-
与 Boston Dynamics 达成 AI 合作
Gemini Robotics 将集成到新一代 Atlas 与 Spot,现代计划部署超 25,000 台 Atlas。
-
Gemini Robotics-ER 1.6 发布
强化空间与多视角推理,新增仪表读数能力,源自与 Boston Dynamics 的 Spot 巡检合作。
-
方向: VLA模型 / 机器人基础模型 核心人物: Carolina Parada(Google DeepMind Robotics 负责人,VP & Head of Robotics)等 机构: Google DeepMind 简介: Google DeepMind Robotics 是在 Carolina Parada 领导下的机器人基础模型团队,前身融合了 Google Brain 机器人团队、Everyday Robots 技术遗产与 DeepMind 控制研究。团队开创了 RT-1/RT-2 系列 Robotics Transformer 与 Vision-Language-Action(VLA)模型范式,并将其发展为基于 Gemini 的通用具身智能模型家族(Gemini Robotics / Gemini Robotics-ER),目标是"解决物理世界中的 AGI"。团队与 Apptronik(人形机器人 Apollo)、Boston Dynamics(Atlas、Spot)等硬件厂商深度合作,推动模型跨本体(cross-embodiment)部署。
Carolina Parada 此前在 Google Speech/Assistant 团队工作 7 年,随后在 Nvidia 负责自动驾驶摄像头感知团队 2 年,现任 Google DeepMind Robotics 负责人;来源:research.google 简介、CES speaker profile、Humanoids Daily 专访。
关键成就
- 学术引用量:团队奠基性论文的引用量在具身智能/机器人学习领域名列前茅——SayCan("Do As I Can, Not As I Say: Grounding Language in Robotic Affordances")被引用 2,347 次;RT-2("Vision-Language-Action Models Transfer Web Knowledge to Robotic Control")被引用 1,777 次(其中 119 篇为"高影响力"引用);Open X-Embodiment 被引用 647 次;RT-1 被引用 500+ 次(以上均为 Semantic Scholar 于 2026 年 7 月检索到的数据,来源:RT-2 Semantic Scholar 页面、Open X-Embodiment Semantic Scholar 页面、SayCan Semantic Scholar 页面、RT-1 引用统计(SciSpace 汇总))。
- VLA 范式确立者:RT-2 论文首次提出并推广了 "Vision-Language-Action (VLA)" 这一术语与建模范式,此后成为业界描述具身智能模型的标准分类,直接影响了 OpenVLA、π0(Physical Intelligence)等后续大量开源与商业 VLA 工作的命名与技术路线。
- 最大规模开源跨本体数据集:Open X-Embodiment 联合 21-33 个学术机构,汇聚超过 100 万条真实机器人轨迹、22 种机器人本体,是迄今公开的最大规模机器人学习数据集之一,其 GitHub 仓库持续被学界复用(来源:Open X-Embodiment 项目页、GitHub)。
- 核心硬件伙伴融资规模:人形机器人合作伙伴 Apptronik(Gemini Robotics 的主要落地载体之一)截至 2026 年 2 月 Series A 系列融资累计超过 9.35 亿美元(含 Google 参投的 5.2 亿美元 A-X 扩展轮,投后估值约 50 亿美元),公司总融资接近 10 亿美元(来源:Apptronik 官方新闻稿、CNBC 报道)。
- 产业化部署规模意向:2026 年 1 月与 Boston Dynamics 达成 AI 合作后,双方共同伙伴现代汽车集团宣布计划在旗下工厂部署超过 25,000 台搭载 Gemini Robotics 技术的 Atlas 人形机器人,是目前已知规模最大的人形机器人量产部署计划之一。
- 主流科技媒体头条覆盖:2025 年 3 月 Gemini Robotics 发布当天即获 TechCrunch("Google DeepMind unveils new AI models for controlling robots")、MIT Technology Review("Gemini Robotics uses Google's top language model to make robots more useful")等主流科技媒体头条报道,此后 2025-2026 年每次重大版本发布(On-Device、1.5、ER 1.6)均被 TechCrunch、MarkTechPost 等持续跟踪报道(来源见时间线各条目链接)。
时间线(2021-2026)
2021-10 — Stacking our way to more general robots(RGB-Stacking 基准)
- DeepMind(尚未与 Google Brain 合并前)在 CoRL 2021 发表 RGB-Stacking,一个基于视觉的机械臂堆叠基准:机器人需在 20 秒内把红色物体堆到蓝色物体上,绿色物体作为干扰项。研究结合模拟与真实数据来解决"泛化到新物体"的开放问题,并开源了模拟环境与真实机器人环境设计图。这是团队早期强化学习驱动的通用操作研究代表作,是后续 RT 系列的技术前奏之一。
- 链接: Stacking our way to more general robots — Google DeepMind
2022-04 — SayCan: Grounding Language in Robotic Affordances
- Google(Robotics at Google + Everyday Robots + DeepMind 前身团队)发布 SayCan,将大语言模型(最初为 FLAN)与机器人"可供性"(affordance)判断结合,让语言模型为真实世界的 Everyday Robots 机器人规划可执行的子任务序列。这是"LLM 做高层规划 + 机器人做低层执行"范式的代表性早期工作,为后续 RT-2 的语义推理能力埋下基础。
- 链接: SayCan: Grounding Language in Robotic Affordances(项目页) | PaLM-SayCan 官方站点
- 图片:

2022-08 — PaLM-SayCan 升级
- Google 将 SayCan 底层语言模型升级为 5400 亿参数的 PaLM,规划成功率从 FLAN-SayCan 的 70% 提升到 84%,执行成功率从 61% 提升到 74%,并新增抽屉操作、思维链提示、多语言指令等能力,让 Everyday Robots 的助理机器人可在真实办公室环境中响应自然语言请求。
- 链接: Google's PaLM-SayCan: The First of the Next Generation of Robots | InfoQ 报道
2022-12 — RT-1: Robotics Transformer for Real-World Control at Scale
- Google Research 团队(含 Everyday Robots、Google Brain 机器人组,后并入 Google DeepMind)发布 RT-1,一个仅 35M 参数、以 3Hz 运行的高容量 Transformer 控制模型,融合 FiLM-conditioned EfficientNet、TokenLearner 与 Transformer。基于 13 台机器人在办公室厨房环境中 17 个月收集的真实数据训练,700+ 训练指令下成功率达 97%,并在新任务、干扰物、新背景上分别比此前最佳基线提升 25%、36%、18%。这是"Robotics Transformer"系列的开端。
- 链接: arXiv:2212.06817 | Google AI Blog 原文
- 图片:

2023-02 — Everyday Robots 关停,技术与团队并入机器人研究主线
- Alphabet 在 2023 年初大规模裁员(约 12,000 人)中关闭了旗下 Moonshot 项目 Everyday Robots(源自 Alphabet X)。Everyday Robots 曾训练超过 100 台单臂轮式机器人在办公室完成清理桌面、垃圾分类、开门等任务,但始终未能实现商业化。据报道其部分技术与团队成员随后并入 Google(DeepMind)机器人研究工作。
- 链接: Alphabet closes Everyday Robots among layoffs — The Robot Report | Everyday Robots — A Google X Moonshot(项目页)
2023-03 — PaLM-E: An Embodied Multimodal Language Model
- Google 与柏林工业大学联合发表 PaLM-E,一个 5620 亿参数的具身多模态语言模型,将视觉、连续状态估计与文本编码交织输入,端到端训练用于机器人操作规划、视觉问答和图像描述等多任务。PaLM-E 后来成为 RT-2 的两个骨干网络之一(另一个是 PaLI-X)。
- 链接: arXiv:2303.03378 | 项目页 PDF
- 图片:

2023-04-20 — Announcing Google DeepMind(Google Brain 与 DeepMind 合并)
- Alphabet 宣布将 Google Research 的 Brain 团队与 DeepMind 合并为统一的 "Google DeepMind",由 Demis Hassabis 出任 CEO,Google Brain 副总裁 Zoubin Ghahramani 等组成联合领导层。此次合并是"Google DeepMind Robotics"这一团队名称与建制得以形成的组织节点,此后机器人研究统一在 Google DeepMind 旗下推进。
- 链接: Announcing Google DeepMind — Google DeepMind | TechCrunch 报道
2023-06-20 — RoboCat: A Self-Improving Robotic Agent
- 基于多模态模型 Gato 架构,DeepMind 发布 RoboCat:一个可操作多种机械臂、通过"收集演示→微调出专精子代理→子代理自我练习生成新数据→并入训练集→重新训练"五步循环实现自我提升的通用操作智能体。仅需 100-1000 次演示即可适应新任务或新机械臂;相比初版,最终版本在未见任务上的成功率从 36% 提升到 74%。
- 链接: arXiv:2306.11706 | RoboCat: A self-improving robotic agent — Google DeepMind
- 图片:

2023-07-28 — RT-2: New Model Translates Vision and Language into Action
- Google DeepMind 发布 RT-2(Robotic Transformer 2),首个明确提出 "Vision-Language-Action (VLA)" 范式的模型:将 PaLI-X / PaLM-E 等视觉语言模型作为骨干,把机器人动作离散化为类文本 token,与网络级视觉语言数据联合微调(co-fine-tune)。RT-2 在未见场景成功率上从 RT-1 的 32% 提升到 62%,并展示了"用石头当锤子""为疲惫的人选能量饮料"等需要网络知识迁移的涌现推理能力,还引入思维链(chain-of-thought)实现多步语义推理。
- 链接: DeepMind 官方论文 PDF | RT-2: New model translates vision and language into action — Google DeepMind | The Keyword 报道
- 图片:
| 
2023-09 — Q-Transformer: Scalable Offline RL via Autoregressive Q-Functions
- Google DeepMind 团队(Yevgen Chebotar、Sergey Levine 等)在 CoRL 2023 发表 Q-Transformer,用 Transformer 表示可扩展的 Q 函数,把每个动作维度离散化为单独 token 进行离线时序差分训练,可同时利用人类演示与自主收集数据,在大规模真实机器人操作任务上超过此前的离线 RL 与模仿学习方法。
- 链接: arXiv:2309.10150 | PMLR 会议版本
2023-10-03 — Open X-Embodiment 数据集 与 RT-X 模型
- Google DeepMind 联合全球 33 个学术实验室,汇聚 22 种机器人本体、超过 100 万条真实机器人轨迹、500+ 技能、150,000+ 任务,构建了当时最大的开源机器人数据集 Open X-Embodiment,并发布基于 RT-1/RT-2 训练的跨本体模型 RT-1-X、RT-2-X。RT-1-X 在 5 个不同高校实验室测试中平均成功率比各实验室专用方法高 50%;RT-2-X 在涌现技能评测上比 RT-2 提升 3 倍。
- 链接: arXiv:2310.08864 | Scaling up learning across many different robot types — Google DeepMind | 项目页/模型下载 | GitHub
- 图片:

2024-01 — AutoRT、SARA-RT、RT-Trajectory:机器人研究三连发
- Google DeepMind 同时公布三项机器人研究:AutoRT 用视觉语言模型做场景理解、大语言模型生成任务提议,配合"机器人宪法"(Robot Constitution,受阿西莫夫三定律启发)与"LLM 立法者"做安全过滤,在 7 个月内于多栋办公楼调度最多 20 台机器人同时作业(累计 52 台机器人),收集 77,000+ 会话、6,650 个独特任务,是已知首个允许 LLM 控制的机器人在真实世界中自主巡游、自主提出目标并采取行动的系统。同期发布的 SARA-RT 与 RT-Trajectory 分别聚焦模型加速与轨迹条件控制。
- 链接: arXiv:2401.12963(AutoRT) | Shaping the future of advanced robotics — Google DeepMind
- 图片:

2024-09 — ALOHA Unleashed 与 DemoStart:机器人灵巧性新进展
- Google DeepMind 发布两套灵巧操作系统:ALOHA Unleashed 在双臂遥操作平台 ALOHA 2 上使用扩散模型(类似 Imagen 的生成方式)模仿学习机器人动作,学会系鞋带、挂衣服、修理另一台机器人、插齿轮、清洁厨房等复杂双臂任务;DemoStart 则用强化学习在仿真中让多指灵巧手掌握复杂行为(如立方体重定向、插座插入),仿真训练后在真实世界复杂任务成功率达 97%。
- 链接: Our latest advances in robot dexterity — Google DeepMind
2024-12-19 — Apptronik 宣布与 Google DeepMind Robotics 战略合作
- 人形机器人公司 Apptronik 宣布与 Google DeepMind 机器人团队达成战略合作协议,共同基于 Gemini 系列模型开发下一代人形机器人 Apollo,为此后 Gemini Robotics 家族在人形机器人本体上的落地铺路。
- 链接: Apptronik Partners with Google DeepMind Robotics
2025-03-12 — Gemini Robotics 与 Gemini Robotics-ER 发布
- Google DeepMind 推出基于 Gemini 2.0 的两款机器人模型:Gemini Robotics(新增"物理动作"作为输出模态的高级 VLA 模型,主打通用性、交互性、灵巧性三大能力,在综合泛化基准上比同类 SOTA VLA 模型平均提升超过 2 倍)与 Gemini Robotics-ER(具备增强空间理解能力的具身推理 VLM,可执行感知、状态估计、规划、代码生成全流程,端到端成功率是 Gemini 2.0 的 2-3 倍)。同时发布 ASIMOV 安全评测数据集,并宣布与 Apptronik 合作人形机器人 Apollo,向 Agile Robots、Agility Robots、Boston Dynamics、Enchanted Tools 等可信测试者开放 Gemini Robotics-ER。作者与主导人为 Carolina Parada。
- 链接: arXiv:2503.20020(技术报告) | Gemini Robotics brings AI into the physical world — Google DeepMind | MIT Technology Review 报道
- 图片:
| 
2025-06-24 — Gemini Robotics On-Device 发布
- Google DeepMind 推出首个可完全离线运行的端上(on-device)VLA 模型 Gemini Robotics On-Device,专为双臂机器人设计,具备强通用灵巧性与低延迟推理能力;同时发布 Gemini Robotics SDK,支持开发者在 MuJoCo 仿真中评测并以 50-100 条演示快速微调模型。该模型主要基于 ALOHA 双臂平台训练,并成功适配到 Franka FR3 双臂机器人与 Apptronik 人形机器人 Apollo。
- 链接: Gemini Robotics On-Device brings AI to local robotic devices — Google DeepMind | TechCrunch 报道
- 图片:

2025-09-25 — Gemini Robotics 1.5 与 Gemini Robotics-ER 1.5:把 AI Agent 带入物理世界
- Google DeepMind 推出两款协同工作的"具身智能体"模型:Gemini Robotics-ER 1.5(高层"大脑",具备 SOTA 空间理解能力,可原生调用 Google 搜索等工具、做多步规划与进度/成功检测)与 Gemini Robotics 1.5(VLA 执行模型,首次具备"行动前思考"能力,会用自然语言展示推理过程,并展现出跨本体学习能力——在 ALOHA 2 上学到的技能可直接迁移到 Apptronik 人形机器人 Apollo 及双臂 Franka 机器人)。同时发布升级版 ASIMOV 安全基准 v2。Gemini Robotics-ER 1.5 当天起通过 Google AI Studio 向开发者开放。
- 链接: Gemini Robotics 1.5 brings AI agents into the physical world — Google DeepMind | arXiv:2510.03342(技术报告论文版) | 官方技术报告 PDF
- 图片:

2026-01-05 — Boston Dynamics 与 Google DeepMind 达成 AI 合作
- CES 2026 期间,Boston Dynamics 与 Google DeepMind 宣布建立新的 AI 合作关系,计划将 Gemini Robotics 系列基础模型集成到 Boston Dynamics 新一代人形机器人 Atlas 以及四足机器人 Spot 上。Boston Dynamics 2026 年 Atlas 全部产能优先供给现代汽车集团(Hyundai,Boston Dynamics 大股东)的机器人园区(RMAC)与 Google DeepMind,2027 年前不对外部客户交付;现代计划在旗下工厂部署超过 25,000 台 Atlas。
- 链接: Boston Dynamics & Google DeepMind Form New AI Partnership | TechCrunch 报道
- 图片:

2026-04-14 — Gemini Robotics-ER 1.6 发布
- Google DeepMind 发布具身推理模型的重大升级 Gemini Robotics-ER 1.6,强化空间推理与多视角理解,新增"仪表读数"(instrument reading)能力——机器人可读取压力表、视液镜等复杂仪器指针与刻度,这项能力是与 Boston Dynamics 紧密合作(应用于其四足机器人 Spot 的设施巡检场景)中发掘的。该模型在指向(pointing)、计数、成功检测等空间/物理推理基准上显著超越 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash,是团队迄今最安全的机器人模型。当天起通过 Gemini API 与 Google AI Studio 向开发者开放。
- 链接: Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced embodied reasoning — Google DeepMind | Google Blog 官方公告 | MarkTechPost 报道
- 图片:

2026-06-30 — Apptronik 发布 Robot Park 与 Apollo 2,深化与 Google DeepMind 的数据合作
- Apptronik 在美国德州奥斯汀开放扩建后的旗舰数据采集与训练基地 "Robot Park"(约 9 万平方英尺),并发布人形机器人平台新一代版本 Apollo 2(含双足与轮式底盘两种构型)。Robot Park 采集的高质量数据将持续用于训练 Google DeepMind 的 Gemini Robotics 基础模型,形成"硬件采集数据 → 模型训练 → 部署回机器人"的闭环,是双方 2024 年底合作关系的落地深化。
- 链接: Welcome to Robot Park: Apollo Goes to Work — Apptronik | Forbes 报道 | GlobeNewswire 官方新闻稿