Humanoid & Embodied AI · 基础模型 (VLA) 综述 · 论文

学术开源VLA:Octo & OpenVLA

UC Berkeley(RAIL实验室)/ Stanford University(同时有 Carnegie Mellon University、Google DeepMind、Toyota Research Institute、Physi

VLA模型 / 机器人基础模型(学术开源)

项目与产品时间线 7 个节点

  1. 2024
    1. 05 研究

      Octo 论文发布

      基于 80 万条 Open X-Embodiment 轨迹预训练的 Transformer 扩散策略,含 27M 与 93M 两个版本。

    2. 05 研究

      Octo v1.5 权重发布

      改进视觉-语言 token 交叉注意力,用 GPT-3.5 增强语言指令,权重发布于 rail-berkeley。

    3. 06 研究

      OpenVLA 论文发布

      7B 开源 VLA,在 97 万条真机轨迹上训练,绝对成功率超 55B 的 RT-2-X 达 16.5%。

    4. 07 研究

      Octo 在 RSS 2024 正式发表

      于荷兰代尔夫特举行的 RSS 2024 大会发表。

    5. 08 研究

      CrossFormer 发布

      Octo 的跨具身扩展,90 万条轨迹、30 种本体,被 CoRL 2024 接收为 Oral(前 4%)。

    6. 11 研究

      OpenVLA 入围 CoRL 2024 杰出论文

      在慕尼黑举行的 CoRL 2024 接收,并入围杰出论文奖六个决选名单之一。

  2. 2025
    1. 02 研究

      OpenVLA-OFT 发布

      并行解码+动作分块微调配方,LIBERO 平均成功率 76.5%→97.1%,吞吐量提升 26 倍。

文章脉络5

  1. 01

    Octo: An Open-Source Generalist Robot Policy

    arXiv 2405.12213 / RSS 2024

    80 万条 OXE 轨迹预训练的 Transformer 扩散策略

  2. 02

    Octo v1.5

    GitHub Release, 2024-05

    改进视觉-语言交叉注意力并做指令数据增强

  3. 03

    OpenVLA: An Open-Source Vision-Language-Action Model

    arXiv 2406.09246 / CoRL 2024

    7B 开源 VLA,入围 CoRL 2024 杰出论文决选

  4. 04

    CrossFormer

    arXiv 2408.11812 / CoRL 2024 Oral

    Octo 的跨具身扩展,同一权重控制 30 种本体

  5. 05

    OpenVLA-OFT

    arXiv 2502.19645 / RSS 2025

    LIBERO 76.5%→97.1%,吞吐量提升 26 倍

方向: VLA模型 / 机器人基础模型(学术开源) 核心人物:

  • Octo(UC Berkeley主导,"Octo Model Team"共同一作): Dibya Ghosh、Homer Walke、Karl Pertsch、Kevin Black、Oier Mees(并列一作,按字母序);核心通讯/资深作者 Sergey Levine(UC Berkeley)、Chelsea Finn(Stanford)
  • OpenVLA(Stanford主导,三方并列一作): Moo Jin Kim、Karl Pertsch、Siddharth Karamcheti;资深作者 Sergey Levine(UC Berkeley)、Percy Liang(Stanford)、Chelsea Finn(Stanford)
  • OpenVLA-OFT(后续工作): Moo Jin Kim、Chelsea Finn、Percy Liang(Stanford)
  • CrossFormer(Octo后续工作): Ria Doshi、Homer Walke、Oier Mees、Sudeep Dasari、Sergey Levine(UC Berkeley / CMU)
  • 两个项目团队高度重叠,Karl Pertsch、Sergey Levine、Chelsea Finn、Dorsa Sadigh、Ted Xiao、Pannag Sanketi、Quan Vuong 同时出现在Octo与OpenVLA的作者名单中

机构: UC Berkeley(RAIL实验室)/ Stanford University(同时有 Carnegie Mellon University、Google DeepMind、Toyota Research Institute、Physical Intelligence、MIT 等合作机构参与)

简介: Octo(2024年5月)与OpenVLA(2024年6月)是学术界最早、影响力最大的两个完全开源的机器人基础模型,均基于Open X-Embodiment跨机构机器人数据集训练,为后续大量开源VLA研究奠定了代码库、模型权重与评测基准。两者作者高度重叠,共同代表了UC Berkeley(RAIL实验室)与Stanford在"开放机器人基础模型"路线上的持续投入,并分别孵化出CrossFormer(Octo的跨具身扩展)与OpenVLA-OFT(OpenVLA的高效微调方案)等后续工作。

关键成就

  • 双开源基座地位:Octo与OpenVLA是2024年最早发布的两个完全开源的机器人基础模型,均基于Open X-Embodiment数据集训练,已成为后续大量VLA研究(π0、RDT-1B、SpatialVLA、TraceVLA等)的标准对比基线与代码起点。
  • 学术引用规模:经Semantic Scholar核实(2026-07-19查询),OpenVLA论文被引用1,028次(其中174次被标记为"高影响力引用"),Octo论文被引用716次(同为"高影响力引用");Google Scholar口径下Octo论文引用数约为1,481次,两篇论文均跻身VLA/机器人基础模型领域被引最多的开源工作之列。
  • 开源社区热度:GitHub上openvla/openvla约6.2k星、728 fork;octo-models/octo约1.7k星、270 fork、19 watcher;均采用MIT协议开放代码与权重。
  • 权重下载规模:HuggingFace上openvla/openvla-7b权重近30天下载量超过152万次,并衍生出21个adapter模型与17个微调(finetune)模型,是VLA领域下载量最高的开源权重之一。
  • 学术荣誉:OpenVLA入围CoRL 2024 Outstanding Paper Award六个决选名单之一;CrossFormer(Octo团队后续工作)被CoRL 2024接收为Oral Presentation(录用论文中前4%)。
  • 衍生生态:两个项目分别孵化出CrossFormer(跨具身扩展,2024-08,支持30种机器人本体)与OpenVLA-OFT(高效微调方案,2025-02),后者将LIBERO基准平均成功率从76.5%提升到97.1%、推理吞吐量提升26倍,成为后续π0、RDT-1B等工作的常见对比对象。

时间线(2023-2026)

2024-05 — Octo论文发布:《Octo: An Open-Source Generalist Robot Policy》

  • UC Berkeley、Stanford、CMU、Google DeepMind联合团队在arXiv发布Octo,一个基于80万条Open X-Embodiment轨迹(25个数据集混合)预训练的transformer扩散策略,提供Octo-Small(27M参数)与Octo-Base(93M参数)两个版本。
  • Octo支持语言指令与目标图像两种任务指定方式,可在消费级GPU上几小时内微调到新的传感器/动作空间;论文在9个真实机器人平台上评测,零样本表现优于RT-1-X,微调后平均比次优基线高52%。
  • v1版本提交于2024年5月20日,v2修订于2024年5月26日。
  • 链接: arXiv:2405.12213
  • 链接: 项目主页 octo-models.github.io
  • 链接: GitHub octo-models/octo
  • 图片: Octo模型架构
  • 图片: Octo训练数据混合

2024-05 — Octo v1.5权重发布

  • GitHub发布Octo v1.5版本(2024年5月24日),改进了视觉-语言token的交叉注意力机制、用GPT-3.5对语言指令做数据增强改写,并修复了扩散头dropout、注意力mask等若干bug。
  • 预训练权重(octo-small-1.5 / octo-base-1.5)发布在HuggingFace的rail-berkeley组织下。
  • 链接: GitHub Release v1.5
  • 链接: HuggingFace rail-berkeley

2024-06 — OpenVLA论文发布:《OpenVLA: An Open-Source Vision-Language-Action Model》

  • Stanford、UC Berkeley、Toyota Research Institute、Google DeepMind、Physical Intelligence、MIT联合团队发布OpenVLA,一个7B参数的开源VLA,基于Prismatic-7B VLM(融合DINOv2+SigLIP视觉编码器与LLaMA-2语言模型骨干),在97万条Open X-Embodiment真实机器人轨迹上训练。
  • 在64块A100 GPU上训练15天;在29个任务、多种机器人本体上,以7倍更少参数量的优势,绝对成功率超过55B参数的闭源模型RT-2-X达16.5%,微调后超过Diffusion Policy 20.4%。论文同时验证了LoRA等参数高效微调方法可在消费级GPU上微调OpenVLA且不损失性能。
  • v1版本提交于2024年6月13日,后于2024年9月4-5日修订至v3。
  • 链接: arXiv:2406.09246
  • 链接: 项目主页 openvla.github.io
  • 链接: GitHub openvla/openvla
  • 图片: OpenVLA模型结构
  • 图片: OpenVLA与RT-2-X/Octo在多机器人平台上的对比结果

2024-07 — Octo在RSS 2024正式发表

  • Octo论文在Robotics: Science and Systems (RSS) 2024大会(2024年7月15-19日,荷兰代尔夫特Delft)正式发表,是当年机器人学习领域的重要开源基础模型工作之一。
  • 链接: RSS 2024 论文页
  • 链接: RSS Proceedings PDF

2024-08 — CrossFormer发布:Octo团队的跨具身扩展

  • UC Berkeley RAIL实验室(Ria Doshi、Homer Walke、Oier Mees、Sudeep Dasari、Sergey Levine)在Octo代码库基础上发布CrossFormer,将策略扩展到90万条轨迹、30种不同机器人本体(含单臂/双臂操作、轮式导航、四旋翼飞行器、四足机器人),无需手动对齐动作空间即可用同一套网络权重控制差异极大的机器人。
  • 该工作被CoRL 2024接收为Oral Presentation(前4%),是Octo路线在"跨具身通用策略"方向的直接延伸。
  • 链接: arXiv:2408.11812
  • 链接: 项目主页 crossformer-model.github.io
  • 链接: GitHub rail-berkeley/crossformer
  • 图片: CrossFormer架构示意

2024-11 — OpenVLA在CoRL 2024发表,入围Outstanding Paper Award

  • OpenVLA论文被机器人学习顶会CoRL 2024(2024年11月6-9日,德国慕尼黑)接收,并入围当届Outstanding Paper Award六个决选名单之一,是学术界对其开源VLA工作的高度认可。
  • 链接: OpenReview: OpenVLA (CoRL 2024)
  • 链接: CoRL 2024官网

2025-02 — OpenVLA-OFT发布:面向速度与成功率的优化微调方案

  • Stanford团队(Moo Jin Kim、Chelsea Finn、Percy Liang)发布论文《Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success》,系统研究VLA微调的设计选择,提出结合并行解码、动作分块(action chunking)、连续动作表示与L1回归目标的"优化微调(OFT)"配方。
  • 以OpenVLA为基座实例化的OpenVLA-OFT在LIBERO仿真基准上将平均成功率从76.5%提升到97.1%,动作生成吞吐量提升26倍;加入FiLM语言条件化的OpenVLA-OFT+版本在双臂ALOHA机器人上的高频灵巧操作任务中,绝对成功率超过π0、RDT-1B等微调VLA,以及从零训练的ACT、Diffusion Policy达最多15个百分点。
  • 论文2025年2月27日提交,被RSS 2025正式接收。
  • 链接: arXiv:2502.19645
  • 链接: 项目主页 openvla-oft.github.io
  • 链接: GitHub moojink/openvla-oft
  • 图片: OpenVLA-OFT在LIBERO基准上的任务成功率对比
  • 图片: OpenVLA-OFT在ALOHA机器人上的表现

2026-07 — 社区影响力现状快照

  • Octo(GitHub octo-models/octo):约1.7k星、270 fork、19 watcher,MIT协议,代码库自2024年发布后持续被后续工作(如CrossFormer)复用为基础架构。
  • OpenVLA(GitHub openvla/openvla):约6.2k星、728 fork,MIT协议;HuggingFace上openvla/openvla-7b权重近30天下载量超过152万次,社区在此基础上已产生21个adapter模型与17个微调(finetune)衍生模型,广泛用于LIBERO、SimplerEnv等仿真评测与真实机器人研究中的基线对比。
  • OpenVLA已成为VLA领域事实上的标准开源基线之一,被后续大量论文(π0、RDT-1B、OpenVLA-OFT、SpatialVLA、TraceVLA等)作为对比对象引用。
  • 链接: GitHub octo-models/octo
  • 链接: GitHub openvla/openvla
  • 链接: HuggingFace openvla/openvla-7b
← 返回人形机器人