Humanoid Locomotion and Manipulation: Current Progress and Challenges in Control, Planning, and Learning
人形机器人的行走与操作——控制、规划与学习的进展和挑战
Zhaoyuan Gu、Ye Zhao 等 18 人 · Georgia Tech / Stanford / CMU / SFU / TUM / CNRS 等 · IEEE/ASME Trans. Mechatronics · 2026
项目与产品时间线 2 个节点
- 2025
-
arXiv 首版
18 位作者联合发布 arXiv:2501.02116,覆盖模型控制、学习、触觉、基础模型四条线。
-
v2 修订
扩充学习方法与基础模型章节,补充 2024 年底至 2025 年初的人形工作。
-
文章脉络8
- 01
多接触规划(Multi-contact planning)
分搜索式、优化式、学习式三条路线,核心难点是接触序列的组合爆炸。
- 02
模型预测控制(MPC)
从简化模型、全身模型到混合精度模型,权衡模型保真度与实时求解速度。
- 03
全身控制(Whole-body Control)
闭式解法与优化解法(分层 QP)并存,扩展到 loco-manipulation 的任务优先级设计。
- 04
线性倒立摆与质心动力学模型
三十年来双足行走控制的基础抽象,仍是实时 MPC 的主力模型。
- 05
接触隐式(contact-implicit)规划与控制
免去人工指定接触序列,但计算复杂度与实时性仍是瓶颈。
- 06
H2O / OmniH2O 等人类动作重定向
从人体动作捕捉与遥操作数据学习人形全身技能的代表路线。
- 07
全身触觉感知(whole-body tactile)
分手部、足部、全身三层,被作者点名为最被低估的关键模态。
- 08
人形基础模型(如 GR00T 方向)
讨论把 LLM/VLM 接入人形,以及直接为人形训练端到端 VLA 的可能性。
Humanoid Locomotion and Manipulation: Current Progress and Challenges in Control, Planning, and Learning|Zhaoyuan Gu、Junheng Li、Wenlan Shen、Wenhao Yu、Zhaoming Xie、Stephen McCrory、Xianyi Cheng、Abdulaziz Shamsah、Robert Griffin、C. Karen Liu、Abderrahmane Kheddar、Xue Bin Peng、Yuke Zhu、Guanya Shi、Quan Nguyen、Gordon Cheng、Huijun Gao、Ye Zhao · Georgia Tech / Stanford / CMU / SFU / USC / TUM / CNRS / IHMC / Google DeepMind / 哈工大 · IEEE/ASME Transactions on Mechatronics · 2026 · 原文
这篇综述在回答什么问题
人形机器人被寄望于执行「人类级」技能,而这类技能的本质是行走与操作的统一(humanoid loco-manipulation, HLM):搬箱子时要边走边扛,开门时要用身体顶住门框。但过去三十年,双足行走的研究(模型驱动的控制与规划)和机器人操作的研究(近年以学习为主)几乎是两条独立发展的技术脉络。这篇综述要回答的正是:当这两条脉络必须在同一具身体上会合时,各自的方法论还剩下多少有效性? 作者的立场很克制——他们不认为学习方法会替代模型方法,而是逐章论证两者在鲁棒性、计算效率、通用性、可泛化性四个维度上各有胜负,最终指向融合。
分类框架
全文十章,主干是「模型驱动 vs 学习驱动」两大范式,外加触觉感知与基础模型两条横切线索:
- 背景层:把问题域拆为双足行走(bipedal locomotion)、导航、全身操作(whole-body manipulation)与 loco-manipulation 四类任务。
- 触觉感知:按手部、足部、全身三个身体区域组织,单列一章,是本综述区别于其他人形综述的特色。
- 多接触规划:搜索式、优化式、学习式三条路线并列。
- 模型预测控制(MPC):按模型保真度分层——简化模型(如线性倒立摆、质心动力学)、全身模型、混合精度模型,再讨论非线性 MPC 的加速与环境/物体交互建模。
- 全身控制(WBC):闭式解与优化解(分层二次规划)两类,延伸到动态任务与 loco-manipulation 的数值稳定性问题。
- 学习方法:从零开始的强化学习、模仿学习(机器人数据与人类数据两个来源)、混合方法、表征与技能组合、基准与数据稀缺。
- 基础模型:把已有 LLM/VLM 接入人形,与为人形直接构建基础模型,两条路径分开评估。
值得注意的是章节顺序本身也是一种主张:感知(触觉)→ 接触规划 → 预测控制 → 反应式全身控制 → 学习 → 基础模型,恰好对应作者反复强调的「预测-反应控制层级(predictive-reactive control hierarchy)」,即长时程的接触与运动规划在上,毫秒级的全身力矩分配在下,学习方法则可以插入其中任意一层。
关键结论
- 「模型驱动」与「学习驱动」的界线并不清晰:作者明确指出,依赖精确动力学模型做 sim-to-real 的强化学习,本质上也可视为一种模型驱动方法——只是模型被藏在仿真器里。
- 两者是互补而非替代关系:模型方法在可解释性、安全约束、样本效率上占优;学习方法在鲁棒性与技能多样性上占优,组合使用往往优于任一单独路线。
- loco-manipulation 的本质是全身接触调度:不能沿用「腿走路、手干活」的分工,必须把整具身体当作一个接触资源池来做全身接触调度(whole-body contact scheduling)。
- 触觉是被严重低估的模态:接触密集型交互离不开触觉反馈,但全身触觉的硬件与算法都还很初级。
- 硬件仍在拖后腿:当前人形的运输成本(cost of transport, COT)普遍高于 0.7,而人类约为 0.2,能效差距直接限制了续航与任务时长。
它指出的开放问题
- 多接触规划:搜索、优化与学习尚未真正融合;接触隐式(contact-implicit)规划的计算复杂度居高不下,实时性与接触无关的鲁棒策略都还缺。
- loco-manipulation:导航与全身控制的耦合、真实世界全谱不确定性的处理,以及从点接触模型扩展到面接触(patch contact)。
- 触觉:动态接触推理、实时自适应,以及把全身触觉同时接入行走与操作的规划回路。
- 学习:数据稀缺、sim-to-real 差距,以及 loco-manipulation 专用基准的缺失。
- 基础模型:为人形训练端到端的视觉-语言-动作模型仍处于起步阶段。
- 硬件:能效、柔顺与力透明的机构设计、全身传感的集成。
为什么值得读
人形方向的综述很多,但绝大多数由单一背景的团队写成——要么只懂控制,要么只懂学习。这一篇的十八位作者刻意做了跨阵营配置:Ye Zhao、Quan Nguyen、Abderrahmane Kheddar、Gordon Cheng 代表经典多接触规划与全身控制,C. Karen Liu、Xue Bin Peng 代表物理仿真与角色动画驱动的运动学习,Yuke Zhu、Guanya Shi、Wenhao Yu 代表机器人学习与 sim-to-real。因此它是少数能把 ZMP 时代的控制理论和 2024 年后的人形 RL/模仿学习放在同一张表里横向对比的文献。如果你要判断某个人形创业公司的技术路线是否自洽,这篇提供的四维对比(鲁棒性、计算效率、通用性、可泛化性)是很好用的评估尺。另一个不常被提及的读法:把第 III 章的触觉部分和第 VIII 章的基础模型部分对照着读,可以清楚看到人形与桌面机械臂的根本差异——桌面操作可以靠视觉闭环凑合,而人形一旦全身与环境发生多点接触,缺少触觉的视觉-语言-动作模型就会失去最关键的反馈信号。这也解释了为什么作者把「全身触觉」而不是「更大的模型」列为最紧迫的缺口。