Foundation Models in Robotics: Applications, Challenges, and the Future
机器人中的基础模型——应用、挑战与未来
Roya Firoozi、Mac Schwager 等 15 人 · Stanford / Princeton / UT Austin / Google DeepMind / 上海交大 · IJRR 44(5) · 2025
项目与产品时间线 3 个节点
- 2023
-
arXiv 首版发布
15 位来自 Stanford、Princeton、UT Austin、Google DeepMind 等机构的作者联合发布 arXiv:2312.07843。
-
- 2024
-
IJRR 在线发表
经同行评审后在《International Journal of Robotics Research》在线首发。
-
- 2025
-
正式刊出
收入 IJRR 第 44 卷第 5 期,页码 701–739,成为该领域标准引用综述。
-
文章脉络8
- 01
CLIP / SAM / DINOv2
综述中作为开放词表感知与 3D 场景表征的底座反复出现。
- 02
PaLM-E
具身多模态语言模型的代表,把机器人传感器数据直接注入语言模型。
- 03
RT-1 / RT-2 / RT-X
「机器人 Transformer」一节的主线,示范了动作离散化与跨本体数据聚合。
- 04
SayCan / Inner Monologue
LLM 做高层任务规划、用价值函数做可行性打分的范式。
- 05
Code as Policies / VoxPoser
以代码和 3D 价值图作为语言到动作的中间表示。
- 06
R3M / VIP / LIV
语言-图像目标条件的价值与表征学习,用于奖励塑形和策略预训练。
- 07
ViNT / LM-Nav
开放词表导航侧的基础模型代表工作。
- 08
四层组织框架
感知 / 决策与规划 / 动作生成 / 具身智能与仿真器,构成全文骨架。
Foundation Models in Robotics: Applications, Challenges, and the Future|Roya Firoozi、Johnathan Tucker、Stephen Tian、Anirudha Majumdar、Jiankai Sun、Weiyu Liu、Yuke Zhu、Shuran Song、Ashish Kapoor、Karol Hausman、Brian Ichter、Danny Driess、Jiajun Wu、卢策吾(Cewu Lu)、Mac Schwager · Stanford / Princeton / UT Austin / Google DeepMind / 上海交通大学等 · International Journal of Robotics Research (IJRR) 44(5): 701–739 · 2025 · 原文
这篇综述在回答什么问题
传统机器人学习模型往往针对单一任务、在小规模数据上训练,换个物体、换个场景就要重训。而在互联网规模数据上预训练的基础模型(foundation model)展现出很强的泛化性,甚至能对训练集中未出现的问题给出零样本解。这篇综述要回答的核心问题是:这种泛化能力究竟能在多大程度上迁移进机器人的自主性栈(autonomy stack),从感知一路贯通到决策与控制?它不是一篇「模型清单」,而是一次对边界的勘定——哪些环节已经被基础模型实质性改写,哪些环节只是被「套壳」使用,哪些环节因为物理交互的特殊性而根本无法照搬语言与视觉领域的配方。作为发表在机器人学顶刊 IJRR 上的长篇综述,它也是目前中英文文献中被当作「领域标准引用」的那一篇。
分类框架
全文用两个正交维度组织材料。第一个维度是论文与机器人的关系,作者明确把文献分成三类:
- 背景类:本身与机器人无关、但理解后续内容所必需的基础模型工作,如大语言模型、Vision Transformer、视觉-语言模型、具身多模态语言模型、视觉生成模型。
- 机器人类:把基础模型即插即用地接入机器人系统、对基础模型做机器人领域微调、或者从头训练机器人专用基础模型的工作。
- 机器人邻接类:来自计算机视觉、具身 AI 等相邻领域,尚未落到真机、但有清晰迁移路径的方法。
第二个维度是按自主性栈的功能分层:感知(开放词表检测与分割、3D 场景与物体表征、可供性 affordance、预测模型)、决策与规划(语言条件的模仿学习、语言辅助强化学习、LLM 任务规划、上下文学习决策)、动作生成(机器人 Transformer、开放词表导航与操作)、以及具身智能(通用智能体与仿真器)。两个维度交叉,构成了全文的检索表。这套划分的实用价值在于:它让「某项能力究竟是被基础模型改写了,还是只是换了个接口」这个判断变得可操作——感知层多数属于前者,控制层多数仍属于后者。
关键结论
- 感知层收益最直接:开放词表检测、分割与 3D 表征几乎可以直接复用视觉基础模型,是当前落地最成熟、风险最低的一环。
- 决策层依赖「接地」而非模型规模:LLM 提供常识推理与代码生成能力,但必须通过可供性函数、价值函数或代码接口接地(grounding)到真实机器人能力上,SayCan、Code as Policies、VoxPoser 都是不同的接地方案。
- 控制层是真正的瓶颈:RT 系列证明了跨本体数据聚合的价值,但机器人动作数据的规模比语言、图像小若干个数量级,端到端动作生成尚未出现真正的「涌现」。
- 「用现成模型」与「造机器人专用模型」是一个未决的战略选择:作者把这一条单独列为开放问题,认为两条路线各自的适用边界还没有实证答案。
- 具身智能与仿真器被并入同一章讨论:作者认为通用具身智能体的进展在很大程度上被仿真器的保真度与可扩展性所决定,仿真不是配角而是数据基础设施。
它指出的开放问题
- 数据稀缺:如何获得互联网规模的机器人数据——自监督训练、合成数据生成、利用人类视频与自由玩耍数据、用 VLM 做数据增广,都是被列出的候选路径。
- 实时性:大模型推理延迟高,与机器人闭环控制所需的毫秒级频率之间存在数量级的鸿沟。
- 多模态表征的局限:现有模型难以融合力、触觉、本体感受等异质传感信号。
- 不确定性量化:语言歧义、LLM 幻觉带来的实例级不确定性,以及闭环部署引起的分布漂移,都缺乏可校准的度量。
- 安全评估:部署前的严格测试、运行时监控与分布外检测尚无标准方法。
- 可变性与可复现性:机器人环境、平台、任务差异极大,基准与复现标准亟待建立。
为什么值得读
这是一份「venue 权威 + 作者阵容权威」双满分的综述:IJRR 是机器人学历史最悠久的顶刊,作者名单里 Yuke Zhu、Shuran Song、Karol Hausman、Brian Ichter、Danny Driess、Jiajun Wu、卢策吾、Mac Schwager 几乎覆盖了 2022–2024 年推动机器人基础模型的主要课题组。它的价值不在于新颖,而在于校准坐标系——当你面对每周几十篇 VLA 新论文时,这篇综述给出的四层分栈和三类文献划分能让你迅速判断一篇新工作到底在改进哪一环。建议与后面两篇配合阅读:本篇给全局,VLA 综述给动作表示的细粒度,人形综述给物理本体的约束。需要留意的是,它的文献覆盖截止在 2024 年上半年,π0、OpenVLA、GR00T 等 2024 年下半年之后的模型不在其中,但它提出的分栈框架和六条挑战至今没有过时——今天绝大多数新工作,仍然是在这六条挑战中的某一条上做局部推进。