NVIDIA GEAR Lab
NVIDIA(GEAR = Generalist Embodied Agent Research,隶属 NVIDIA Research) · Linxi "Jim" Fan(Distinguished Scientist / Directo










1 / 11 产品线10
开放式智能体研究
- 2022
MineDojo
NeurIPS 2022 数据集赛道杰出论文奖
- 2022
VIMA
多模态提示驱动的通用机器人操控
- 2023
Voyager
首个 GPT-4 驱动的终身学习具身智能体
仿真与数据管线
- 2023
Eureka
LLM 自动设计奖励,83% 任务超人类专家
- 2023
MimicGen / DexMimicGen
200 条示教自动扩增至 5 万条轨迹
GR00T 基础模型
- 2025
Isaac GR00T N1
首个开放可定制的人形机器人基础模型,双系统架构
- 2025
Isaac GR00T N1.5 / N1.6
语言跟随 46.6%→93.3%;N1.6 扩展双臂与移动操作
- 2026
Isaac GR00T N1.7 / Reference Humanoid
3B 开放商用 VLA;联合 Unitree 推参考人形机器人
世界模型与合成数据
- 2025
DreamGen / GR00T-Dreams
神经轨迹合成,11 小时生成 78 万条数据
- 2026
EgoScale
2 万小时第一视角视频,首次发现灵巧度 Scaling Law
项目与产品时间线 14 个节点
- 2022
-
MineDojo 提出
基于 Minecraft 的开放式具身智能体框架,获 NeurIPS 2022 数据集赛道杰出论文奖。
-
VIMA 提出
以图文交织多模态提示统一机器人操控任务,用单一 Transformer 自回归输出电机动作。
-
- 2023
-
Voyager 发布
首个基于 GPT-4 的 Minecraft 终身学习智能体,解锁科技树速度比此前方法快 15.3 倍。
-
Eureka 发布
用 GPT-4 自动编写 RL 奖励函数,在 83% 任务上超越人类专家手写奖励、平均提升 52%。
-
- 2024
-
Project GR00T 发布
GTC 2024 宣布人形机器人通用基础模型计划,1X、Figure、Unitree 等 9 家厂商成为首批伙伴。
-
- 2025
-
Isaac GR00T N1 发布
首个开放可定制的人形机器人基础模型,采用系统1/系统2双架构,GTC 现场演示 1X 与傅利叶 GR-1。
-
DreamGen / GR00T-Dreams
用视频世界模型 11 小时生成 78 万条合成轨迹,相当于 6500 小时人类示教,N1 性能提升 40%。
-
Isaac GR00T N1.5 发布
引入 FLARE 联合训练,GR-1 语言跟随成功率从 46.6% 提升到 93.3%,任务成功率达 83.0%。
-
Newton 物理引擎捐赠 Linux 基金会
NVIDIA、Google DeepMind、Disney Research 联合开发的开源物理引擎正式贡献给社区。
-
Isaac GR00T N1.6 发布
VLM 换为 Cosmos-2B,DiT 增至 32 层,新增双臂 YAM、AGIBot Genie-1 等数千小时遥操作数据。
-
- 2026
-
EgoScale 发表
在 20,854 小时第一视角人类视频上预训练,首次发现人类数据规模的对数线性 Scaling Law。
-
GR00T N1.7 早期访问与 N2 预告
GTC 2026 开放商业授权,AGIBOT、LG 电子、NEURA 等采用;预告基于 DreamZero 的 GR00T N2。
-
Isaac GR00T N1.7 正式发布
30 亿参数、Action Cascade 双系统架构,基于 EgoScale 2 万+ 小时人类视频预训练。
-
Isaac GR00T 参考人形机器人
联合 Unitree 推出开源参考设计,H2 Plus 底盘 + 双 Sharpa 灵巧手,全身 75 自由度。
-
方向: VLA模型 / 机器人基础模型(Vision-Language-Action Foundation Models for Humanoid Robots) 核心人物: Linxi "Jim" Fan(Distinguished Scientist / Director of AI, Co-Lead of Project GR00T & GEAR)、Yuke Zhu(Prof., Co-Lead GEAR)、Ajay Mandlekar、Dieter Fox、Jan Kautz、Scott Reed 等 机构: NVIDIA(GEAR = Generalist Embodied Agent Research,隶属 NVIDIA Research) 简介: GEAR Lab 由 Jim Fan 与 Yuke Zhu 共同领导,是 NVIDIA Research 内专注"虚拟与现实世界通用具身智能体基础模型"的研究团队,前身研究可追溯至 Jim Fan 在 MineDojo、VIMA、Voyager、Eureka 等开放式智能体/机器人学习项目上的工作。2024 年起,该团队成为 NVIDIA "Project GR00T"人形机器人基础模型计划的核心研发单位,主导了 Isaac GR00T N 系列 VLA 模型(N1 → N1.5 → N1.6 → N1.7)及 DreamGen/GR00T-Dreams、EgoScale 等配套的世界模型与人类视频预训练研究。
关键成就
- 开源社区影响力:GR00T 官方代码仓库 NVIDIA/Isaac-GR00T 在 GitHub 上已获得约 7.5k+ Stars、1.3k Forks、77 Watchers(经直接查询 GitHub 仓库页确认,截至2026年7月),是人形机器人 VLA 领域星标数最高的开源项目之一。
- 模型生态采用:GR00T N1 论文(arXiv:2503.14734)在 Hugging Face 论文页上已被 44 个模型仓库与 15 个数据集直接引用/构建("Models citing this paper" / "Datasets citing this paper"),其继任模型 nvidia/GR00T-N1.7-3B 上线后下载量已超过 3.7 万次。
- 顶级科技媒体持续追踪报道:TechCrunch 连续三年跟踪报道该项目关键节点——2024年3月《Nvidia enlists humanoid robotics' biggest names for new AI platform, GR00T》、2025年3月《Nvidia debuts Groot N1, a foundation model for humanoid robotics》、2026年1月《Nvidia wants to be the Android of generalist robotics》;每次 GTC 发布也均有 NVIDIA Newsroom 官方新闻稿与 Developer Blog 深度技术解读同步发出。
- 硬件厂商合作规模持续扩大:2024年3月 Project GR00T 启动时即与 1X Technologies、Agility Robotics、Apptronik、Boston Dynamics、Figure AI、Fourier Intelligence、Sanctuary AI、Unitree Robotics、XPENG Robotics 等9家全球头部人形机器人公司达成平台合作;2025年3月 GTC 上 Fourier GR-1、1X 机器人登台实机演示 GR00T N1 后训练效果;到2026年进一步扩展至 AGIBOT、Humanoid、LG Electronics、NEURA Robotics、Noble Machines 等商业化客户,并与 Unitree 联合开发开源人形机器人参考设计(Isaac GR00T Reference Humanoid Robot),Ai2、ETH Zurich、Stanford、UC San Diego 等学术机构也成为首批采用方。
- 团队既往研究获顶级奖项与主流关注,为 GR00T 积累行业影响力:GEAR 核心团队前身工作 MineDojo 获 NeurIPS 2022 Datasets and Benchmarks Track Outstanding Paper Award;Voyager(2023)获《WIRED》《Forbes》《TechCrunch》等主流科技媒体广泛报道,是团队在 2024 年后主导 GR00T 项目的重要行业信誉基础。
时间线(2021-2026)
2022-06 — MineDojo:互联网知识驱动的开放式具身智能体
- Jim Fan 等提出 MineDojo,一个基于 Minecraft 构建的开放式具身智能体研究框架,聚合互联网规模的 Minecraft 视频、Wiki 与论坛文本作为知识库,用于训练通用智能体。该论文获得 NeurIPS 2022 Datasets and Benchmarks Track Outstanding Paper Award,是 Jim Fan 团队通往"通用具身智能体"研究路线的早期奠基工作。
- 链接: MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge (arXiv:2206.08853)
- 链接: NVIDIA Seattle Robotics Lab 项目页
2022-10 — VIMA:多模态提示驱动的通用机器人操控
- Yunfan Jiang、Jim Fan 等提出 VIMA,将机器人操控任务统一表述为"图文交织的多模态提示",用一个 Transformer 智能体自回归输出电机动作,涵盖模仿学习、语言指令跟随、视觉目标达成等多种任务范式。该项目至今仍在 GEAR 官网 Projects 列表中展示,是 GR00T 系列"语言+视觉驱动动作"设计思路的重要前身。
- 链接: VIMA: General Robot Manipulation with Multimodal Prompts (arXiv:2210.03094)
- 链接: VIMA 项目主页
- 图片:

2023-05 — Voyager:首个终身学习的 LLM 具身智能体
- Guanzhi Wang、Yuke Zhu、Jim Fan 等发布 Voyager,是首个基于 GPT-4 的 Minecraft 终身学习智能体,通过自动课程、可增长的技能库与迭代式代码生成,在无人工干预下持续探索并积累技能,解锁科技树速度比此前方法快 15.3 倍。
- 链接: Voyager: An Open-Ended Embodied Agent with Large Language Models (arXiv:2305.16291)
- 链接: Voyager 项目主页
- 图片:

2023-10 — Eureka:LLM 自动设计机器人奖励函数
- Jim Fan 团队发布 Eureka,利用 GPT-4 结合 GPU 加速物理仿真自动编写强化学习奖励函数代码,在 29 个任务、10 种机器人构成的基准测试中,Eureka 生成的奖励在 83% 的任务上超越人类专家手写奖励,平均提升 52%。该工作被视为"LLM+仿真"路线在机器人灵巧操作上的代表性突破,直接影响了后续 GR00T 训练数据管线的设计理念。
- 链接: Eureka: Human-Level Reward Design via Coding Large Language Models (arXiv:2310.12931)
- 链接: NVIDIA Blog: Eureka! NVIDIA Research Breakthrough Puts New Spin on Robot Learning
- 图片:

2023-10 — MimicGen:可扩展的机器人示教数据生成系统
- Ajay Mandlekar、Jim Fan、Yuke Zhu、Dieter Fox 等在 CoRL 2023 发表 MimicGen,能够从少于 200 条人类示教中自动生成超过 5 万条跨任务、跨仿真环境甚至真实世界的机器人轨迹数据,为后续 GR00T 系列的数据规模化奠定方法基础(其继任版本 DexMimicGen 进一步扩展至双臂灵巧手场景)。
- 链接: MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations
- 链接: NVIDIA Seattle Robotics Lab 项目页
2024-03 — GTC 2024:Project GR00T 与 Jetson Thor 发布
- 2024年3月18日,NVIDIA 在 GTC 大会上正式宣布 "Project GR00T"(Generalist Robot 00 Technology),一个面向人形机器人的通用基础模型计划,机器人可通过理解自然语言与观察人类动作来快速习得协调、灵巧操作等技能。同时发布基于 Blackwell 架构的 Jetson Thor 机器人计算平台(800 TFLOPS FP8 算力),并升级 Isaac 机器人平台的生成式 AI 基础模型与仿真工具链。1X、Agility Robotics、Apptronik、Boston Dynamics、Figure AI、Fourier Intelligence、Sanctuary AI、Unitree、XPENG Robotics 等人形机器人公司成为早期合作伙伴。
- 链接: NVIDIA Announces Project GR00T Foundation Model for Humanoid Robots and Major Isaac Robotics Platform Update
- 图片:

2025-03 — GTC 2025:Isaac GR00T N1 发布,双系统架构,Newton 物理引擎
- 2025年3月18日,NVIDIA 正式发布 Isaac GR00T N1——"世界首个开放、可完全定制的人形机器人通用推理与技能基础模型"。模型采用受人类认知启发的"系统1/系统2"双架构:System 2(视觉语言模型)负责环境理解与任务规划,System 1(基于人类示教与 Omniverse 合成数据训练的扩散/动作模型)将规划转化为连续精确的机器人动作。Jensen Huang 在 GTC 主题演讲中现场演示了基于 GR00T N1 后训练的 1X 人形机器人自主整理家务,以及 Fourier GR-1 机器人执行抓取-传递-交接的协作任务。同期,NVIDIA、Google DeepMind、Disney Research 联合宣布开发开源物理引擎 Newton;Agility Robotics、Boston Dynamics、Mentee Robotics、NEURA Robotics 等获得 GR00T N1 早期访问权限。
- 链接: 论文 GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv:2503.14734)
- 链接: NVIDIA Newsroom 官方新闻稿
- 链接: GitHub: NVIDIA/Isaac-GR00T
- 链接: 1X 与 NVIDIA 的 AI 训练合作
- 图片:

2025-05 — DreamGen / GR00T-Dreams:用视频世界模型生成合成机器人数据
- GEAR Lab 发布 DreamGen(又称 GR00T-Dreams),一个四阶段流水线:微调图生视频世界模型(基于 Cosmos-Predict2)以学习目标机器人本体动力学,再用初始帧+语言指令生成"神经轨迹"(neural trajectories),并通过逆动力学/潜在动作模型提取伪动作用于策略训练。该方法首次实现零样本行为泛化与零样本环境泛化:仅用单一环境的抓取-放置示教数据,让人形机器人在 10 个新环境中学会 22 种新行为;11 小时内生成了相当于 6500 小时人类示教(约9个月连续采集)的 78 万条合成轨迹,并将 GR00T N1 性能提升 40%。
- 链接: 论文 DreamGen (arXiv:2505.12705)
- 链接: GEAR 项目页 DreamGen
- 链接: GitHub: NVIDIA/GR00T-Dreams
2025-06 — Isaac GR00T N1.5:语言跟随与泛化能力大幅提升
- 2025年6月11日发布 GR00T N1.5,在架构上冻结 VLM 并简化视觉-语言适配器,VLM 升级为基于 Eagle 2.5 调优的版本(GR-1 grounding IoU 从 Qwen2.5VL 的 35.5 提升到 40.4),并引入 FLARE(Future LAtent Representation Alignment)联合训练目标,使模型可从人类视频中学习。真实 GR-1 机器人上的语言跟随成功率从 N1 的 46.6% 提升到 93.3%,整体任务成功率从 43.3% 提升到 83.0%;在 Unitree G1 上后训练 1000 条示教后,成功率从 44.0% 提升到 98.8%。训练使用 1000 张 H100 GPU,25万步。
- 链接: GEAR 官方博客 GR00T N1.5
- 链接: Hugging Face 模型卡 nvidia/GR00T-N1.5-3B
- 图片:

2025-09 — Newton 物理引擎捐赠给 Linux Foundation
- 2025年9月29日,Linux Foundation 宣布 NVIDIA、Google DeepMind 与 Disney Research 将联合开发的下一代开源物理引擎 Newton(基于 NVIDIA Warp 与 OpenUSD 构建,兼容 MuJoCo)正式贡献给开源社区,作为机器人仿真与 Sim-to-Real 训练的基础设施标准化的重要一步。
- 链接: Linux Foundation 官方公告
- 链接: NVIDIA Developer Blog: Announcing Newton
- 图片:

2025-12 — Isaac GR00T N1.6:双臂灵巧操作与移动操作能力扩展
- 2025年12月15日发布 GR00T N1.6,基础 VLM 升级为内部 NVIDIA Cosmos-2B 变体(支持任意分辨率原生输入),DiT 层数从 16 层增至 32 层,动作空间改为"相对动作块"预测。预训练数据新增双臂 YAM 机械臂、AGIBot Genie-1、仿真 Galaxea R1 Pro(BEHAVIOR 套件)及 Unitree G1 全身移动操作的数千小时遥操作数据,在真实机器人上实验验证了长程推理、灵巧操作与多任务能力,并引入 DAgger 与 RTC(Real-Time Chunking)等训练/推理技巧提升动作平滑度与鲁棒性。
- 链接: GEAR 官方博客 GR00T N1.6
- 链接: Hugging Face 模型卡 nvidia/GR00T-N1.6-3B
- 链接: NVIDIA Developer Blog: Building Generalist Humanoid Capabilities with GR00T N1.6
- 图片:

2026-02 — EgoScale:大规模人类第一视角视频解锁灵巧操作的 Scaling Law
- 2026年2月19日发表 EgoScale,在超过 20,854 小时的人类第一视角带动作标注视频(规模是此前工作的20倍以上)上预训练 VLA 模型,首次发现"人类数据规模 vs 验证损失"的对数线性 Scaling Law,且该损失与真实机器人下游表现强相关。结合少量对齐的人机协同中训练数据,在 22 自由度灵巧手上相较无预训练基线平均成功率提升 54%,并可迁移到低自由度手部,证明大规模人类视频可作为跨本体、可复用的运动先验——为 GR00T N1.7 的 EgoScale 预训练方案提供了核心研究支撑。
- 链接: 论文 EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data (arXiv:2602.16710)
- 链接: GEAR 项目页 EgoScale
- 图片:

2026-03 — GTC 2026:GR00T N1.7 商业化早期访问 + GR00T N2/DreamZero 预告
- 2026年3月16日 GTC 大会上,NVIDIA 宣布 GR00T N1.7 进入早期访问阶段并开放商业授权,可用于物料搬运、包装、质检等产线部署,AGIBOT、Humanoid、LG Electronics、NEURA Robotics、Noble Machines 等企业开始采用 GR00T N 系列模型加速人形机器人产业化。Jensen Huang 在主题演讲中还首次预告了下一代基础模型 GR00T N2(基于 DreamZero 研究的"世界-动作模型"新架构),该模型通过视频扩散骨干直接"想象"未来画面再提取动作,在新任务/新环境上的成功率是主流 VLA 模型的两倍以上,计划年内推出;同期发布 Isaac Lab 3.0(基于 Newton 1.0 + PhysX)与 Cosmos 3 世界基础模型。
- 链接: NVIDIA Newsroom: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World
- 链接: DreamZero 项目页
- 链接: Hugging Face 模型 nvidia/GR00T-N1.7-3B
- 图片:

2026-04 — Isaac GR00T N1.7 正式发布:EgoScale 预训练 + 开放推理 VLA
- 2026年4月17日,NVIDIA 在 Hugging Face 正式发布 GR00T N1.7 技术博客,确认其为 30 亿参数、采用"Action Cascade"双系统架构(System 2 = Cosmos-Reason2-2B 视觉语言骨干负责任务分解与多步推理;System 1 = 32 层扩散 Transformer 负责实时电机控制)的开放商业授权 VLA 模型。基于 EgoScale 的 2 万+ 小时人类第一视角视频预训练,实现了"灵巧度 Scaling Law"(人类数据从1000小时增至2万小时使平均任务完成率提升超过一倍),并在 Unitree G1、双臂 YAM、AGIBot Genie 1 等平台上验证了移动操作、桌面操作与双臂灵巧操作能力。
- 链接: Hugging Face Blog: NVIDIA Isaac GR00T N1.7: Open Reasoning VLA Model for Humanoid Robots
- 链接: GitHub: NVIDIA/Isaac-GR00T (N1.7)
2026-05 — GTC Taipei:Isaac GR00T 参考人形机器人(联合 Unitree)
- 2026年5月31日,NVIDIA 在 GTC Taipei(Computex 2026 同期)宣布 NVIDIA Isaac GR00T Reference Humanoid Robot,是首款基于 Jetson Thor 与 Isaac GR00T 开放开发平台的开源人形机器人参考设计。"身体"为 Unitree H2 Plus 底盘(近6英尺高、150磅、31自由度)搭配双 Sharpa Wave 触觉五指灵巧手(22自由度,全身共75自由度);"大脑"为 Jetson AGX Thor T5000(Blackwell GPU,2070 FP4 TFLOPS)及 Isaac GR00T 全栈软件(Isaac Teleop、GR00T 开放基础模型、Isaac Sim/Lab、Isaac ROS)。Ai2、ETH Zurich、Stanford Robotics Center、UC San Diego 高级机器人与控制实验室等顶尖研究机构将率先使用该参考设计,预计2026年底通过 Unitree 上市;同一平台也将支持 Unitree G1。
- 链接: NVIDIA Newsroom: NVIDIA Announces NVIDIA Isaac GR00T Reference Humanoid Robot for Academic Research
- 图片:
