Humanoid & Embodied AI · 综述论文 综述 · 论文

A Survey on Vision-Language-Action Models for Embodied AI

具身智能视觉-语言-动作模型综述

Yueen Ma / Irwin King(通讯)· 香港中文大学 · 华为诺亚方舟实验室 · IEEE TNNLS · 2026

VLA具身操作机器人基础模型
Humanoid & Embodied AI

项目与产品时间线 6 个节点

  1. 2022
    1. 04 研究

      SayCan 打开语言驱动机器人

      用 LLM 拆任务、用可供性函数打分,确立「高层规划器 + 低层技能」的分层范式。

  2. 2023
    1. 07 研究

      RT-2 造出 VLA 这个词

      互联网 VQA 数据与机器人数据共同微调,让大模型的语义知识迁移进动作空间。

  3. 2024
    1. 05 研究

      本综述预印本上线

      arXiv:2405.14093 v1,首篇专门面向具身智能 VLA 的系统综述。

    2. 10 研究

      π0 与流匹配路线

      连续动作生成路线成熟,VLA 从离散 token 化动作扩展到扩散/流匹配的 action expert。

  4. 2025
    1. 03 产品

      GR00T N1 与人形基础模型

      双系统架构把慢思考的 VLM 与快执行的扩散策略解耦,人形机器人开始有专用基础模型。

  5. 2026
    1. 04 publication

      正式刊于 IEEE TNNLS

      历经 v1 到 v8 的持续修订后通过同行评审发表(DOI: 10.1109/TNNLS.2025.3650584),并配套维护 Awesome-VLA 资源库。

文章脉络8

  1. 01

    RT-2 / RT-X / RT-H

    Google DeepMind · 2023–2024

    RT-2 首次提出 VLA 这个术语,用互联网 VQA 数据与机器人数据共同微调;RT-X 在 Open X-Embodiment 上重训;RT-H 插入「语言动作」中间层实现跨任务数据共享。

  2. 02

    OpenVLA / OpenVLA-OFT / TraceVLA

    开源大 VLA · 2024–2025

    RT-2-X 的开源对应物,进一步探索 LoRA 微调与量化;OFT 优化微调配方,TraceVLA 引入视觉轨迹提示增强时空感知。

  3. 03

    π0(pi-zero)

    Physical Intelligence · flow matching · 2024

    用流匹配架构把 VLM 改造成 VLA,靠 MoE 式的 action expert 继承互联网知识同时输出连续动作。

  4. 04

    GR00T N1

    NVIDIA · 双系统架构 · 2025

    面向人形机器人的机器人基础模型:System 2(VLM)以 10 Hz 处理图像与指令,System 1(扩散模块)以 120 Hz 实时闭环出电机指令。

  5. 05

    SayCan / PaLM-E / Code as Policies

    高层任务规划器 · 2022–2023

    综述把任务规划器分为单体式(端到端、3D 视觉、接地式)与模块式(语言型、代码型),这几项是各类的代表。

  6. 06

    Diffusion Policy / TinyVLA / CogACT / DexVLA

    扩散式控制策略 · 2023–2025

    扩散在动作解码上的一条独立主线,DexVLA 用具身课程学习逐步训练扩散 action expert 并做子步推理。

  7. 07

    WorldVLA / UniVLA / Genie Envisioner

    VLA × 世界模型 · 2025

    把多模态量化成共享词表下的离散 token,让动作、文本、图像统一在自回归范式里生成,VLA 因此同时是世界模型。

  8. 08

    LAPA

    隐动作无监督预训练 · 2024

    首个基于 latent action 的 VLA 无监督预训练方法,用 VQ-VAE 从互联网无标注视频里抽帧间隐动作,再用少量真机数据映射到真实动作。

A Survey on Vision-Language-Action Models for Embodied AI|Yueen Ma、Zixing Song、Yuzheng Zhuang、Jianye Hao、Irwin King(通讯)· 香港中文大学 / 布里斯托大学 / 华为诺亚方舟实验室 · IEEE Transactions on Neural Networks and Learning Systems, 2026, vol.37, no.7, pp.3031–3051 · 原文

这篇综述在回答什么问题

VLA 这个词是 RT-2 在 2023 年造出来的,此后两年里相关工作以指数速度堆积,但「什么算 VLA、它由哪些部件构成、这些部件之间是什么关系」一直没有被系统回答过。这篇综述是第一篇专门面向具身智能 VLA 的系统梳理,核心主张是:VLA 不是一类模型,而是一整条从表征学习到长程任务规划的技术栈。作者据此提出三条研究线——组件、低层控制策略、高层任务规划器——并强调相比早期深度强化学习方法,VLA 在复杂环境中的通用性、灵巧性与泛化能力都有质变,因而不只适用于工厂这类受控环境,也能进入家庭日常任务。

分类框架

三条主线各自还有细分,这是全文最有价值的部分:

  • 第一条线:VLA 的组件。涵盖强化学习、预训练视觉表征(PVR)、视频表征、动力学学习(前向与逆向)世界模型(进一步分为 LLM 诱导的世界模型与视觉世界模型)、推理,以及 policy steering(策略引导)。这一节回答的是「造一个 VLA 需要哪些零件,每个零件的强弱在哪」。
  • 第二条线:低层控制策略。按架构与动作表示切了九类:非 Transformer 策略、Transformer 策略、支持多模态指令的策略、带 3D 视觉的策略、扩散式策略、扩散 + 3D 视觉、面向运动规划的策略、基于点表示动作的策略,以及 Large VLA(LVLA)。作者明确区分了 LVLA(RT-2 原义下的大模型 VLA)与更宽泛的 generalized VLA,这个区分在后续文献里被反复引用。
  • 第三条线:高层任务规划器。分为单体式(monolithic)——端到端、带 3D 视觉的端到端、接地式(grounded)——和模块式(modular)——语言型与代码型两类。前者需要训练但一体化,后者通常免训练但不是即插即用。
  • 资源层:真机机器人数据集与基准、仿真器与仿真数据集(Gibson、iGibson、SAPIEN、AI2-THOR、VirtualHome、TDW、RLBench、Meta-World、CALVIN、Franka Kitchen、Habitat、ALFRED、DMC、Genesis 等,逐项标注场景数、物理引擎、任务类型、观测模态、动作类型与配套机器人)、自动化数据采集、人类数据集、任务规划基准,以及具身问答(EQA)基准。

关键结论

  • 动作表示方式决定了训练目标:离散 token 化动作走自回归、连续动作走扩散或流匹配、点表示动作走另一套路径——综述指出架构差异(FiLM、cross-attention、concatenation)在小模型上明显,但模型放大后拼接式融合就能追平 cross-attention,工程上更简单。
  • 量化是 VLA 与世界模型合流的钥匙:把图像、文本、动作统一量化到共享词表后,同一个自回归模型既能出动作也能生成图像,于是 WorldVLAUniVLA 这类工作让 VLA 本身就成为世界模型;NORA-1.5 用奖励引导的后训练把两者统一,Genie Envisioner 则把世界模型与 VLA 装进同一个视频生成框架。这条判断把具身操作和世界模型两个板块真正连了起来。
  • 双系统架构是人形机器人的现实解GR00T N1 的 System 2(VLM,10 Hz)与 System 1(扩散模块,120 Hz)分频运行,直面了「大模型推理慢、闭环控制要快」的根本矛盾。
  • 无监督预训练开始摆脱真机数据依赖LAPA 用 VQ-VAE 从互联网无标注视频中抽取帧间 latent action,先预训练 VLA 预测隐动作,最后只用少量真机数据把隐动作映射到实际动作——这是绕开机器人数据稀缺的一条重要路线。
  • 数据稀缺的根源是三重的:设备与环境搭建成本高、遥操作采集耗时;不同机器人的传感器、控制模式、夹爪类型互不兼容;6D 物体位姿的精确记录与场景复现至今困难。这也是 Open X-Embodiment 这类跨本体数据集意义重大的原因。

它指出的开放问题

  • 安全优先:机器人直接作用于物理世界,需要安全护栏、风险评估框架与人机交互协议;RLHF 与「不执行即评估(evaluation without execution)」能显著降低风险,而决策过程的可解释性是错误诊断的前提。
  • 基准与指标:覆盖广泛技能、物体、本体与环境的综合基准仍然缺失;单一成功率不足以细粒度诊断问题,需要更细的度量。
  • 泛化能力仍远不及 LLM:机器人基础模型(RFM)受限于本体、环境与任务的多样性,尽管已有显著进展,其泛化水平与 NLP 中的 LLM 仍不在一个量级。
  • 长程任务的框架冗余:分层框架当前最实用,但会增加系统复杂度与失效点;单体式规划器与 LVLA 架构相近,同时跑两个大模型存在冗余;模块式规划器虽免训练却不是即插即用——语言型可能生成控制策略无法执行的子任务,代码型需要人工把模块预先包成 API。作者认为端到端把长程任务直接翻译成底层控制信号的统一框架值得探索。
  • 实时性与容量的取舍:推理跟不上环境变化时模型会反复输出过期动作,LVLA 与任务规划器尤其受此困扰。
  • 多模态融合的边界:ImageBind、LanguageBind 把各模态对齐到图像或语言嵌入空间,但「只靠嵌入是否足够」仍有争议;音频、触觉、视线(gaze)已被证明对特定具身任务有用(人类视线往往指向环境中最显著的位置),但每加一个模态都会带来额外的设计复杂度。
  • 应用面窄:当前 VLA 集中于家庭与工业场景,而虚拟助手、自动驾驶、农业机器人尚未被充分覆盖;灵巧手、无人机、四足与人形机器人可能需要各自专用的 VLA;医疗(手术机器人、护理机器人)对安全与隐私要求更高,可能需要人在回路(HITL)控制与联邦学习等新技术。

为什么值得读

这是 VLA 方向被引最广且已通过同行评审的综述:2024 年 5 月首版上线后持续修订到 2026 年 5 月的 v8,最终刊于 IEEE TNNLS(OpenAlex 记录 15 次引用、FWCI 29.9,即约为同领域同期论文平均水平的 30 倍)。通讯作者 Irwin King 是港中大计算机系教授、IEEE Fellow;郝建业(Jianye Hao) 是华为诺亚方舟实验室决策与推理方向负责人、天津大学教授,在强化学习与决策智能上有长期积累——不是临时组队的综述班子。

放在这个板块里,它承担的是方法论纵切面:IJRR 2025 的机器人基础模型综述回答「基础模型如何进入机器人学」,T-Mech 2026 的人形运动与操作综述回答「人形这个本体怎么动」,而这一篇回答「视觉-语言-动作这条路上有哪些技术选项、各自的强弱边界在哪」。第 V 章的数据集/仿真器对照表可以直接当工具书查,第 VI 章的九项挑战则是判断某个新 VLA 工作是否真有价值的一份检查清单。作者另维护配套资源库 Awesome-VLA 做持续更新,但综述正文本身是定稿的、经过评审的版本。

原文链接

← 返回人形机器人