枢纽

人形机器人的行走 + 操作:一份 Control / Planning / Learning 全景地图

Zhaoyuan Gu, Junheng Li, Wenlan Shen, Wenhao Yu, Zhaoming Xie 等(Georgia Tech + USC + TUM + Google DeepMind + Stanford + CMU + NVIDIA + HIT 等 16 家机构,Ye Zhao / Huijun Gao 通讯)。arXiv:2501.02116v2 (2025)。 arXiv 链接 · 综述(30 年跨度)· locomotionmanipulationloco-manipulationmodel-basedlearning-basedfoundation modelstactile sensing

🧠 一句话心智模型:30 年来,人形机器人一直在两条平行轨道上跑——「模型派」(MPC / WBC,精确但脆)「学习派」(RL / IL,鲁棒但吃数据)。这篇综述告诉你它们在 loco-manipulation(边走边操作)这个交叉点上终于相遇,而 Foundation Models + 触觉感知 是新加入的两个变量,缺一不可。

🎯 为什么重要:locomotion 和 manipulation 一直是「两家人」

传统的 humanoid 研究里,下半身归控制组(保持平衡、走稳),上半身归操作组(抓东西、拧盖子)。早期框架甚至直接「锁住上半身」来简化成纯双足行走问题,或反过来「锁住双脚」做桌面操作。两者井水不犯河水。

但真正有用的人形机器人——搬箱子爬楼梯、推小车、开门、和人一起抬桌子——必须 同时 用腿和手。论文把这种「移动中操作」叫做 loco-manipulation,并把它定义为整个人形机器人领域当前的关键前沿:

核心矛盾 / Gap:locomotion 和 manipulation 各自都已经能打(model-based 30 年成熟,learning 这十年爆发),但 一旦合体,问题不是 1+1=2,而是 1+1<1——因为「腿-手协同」意味着 每个接触点既影响平衡又影响任务,自由度暴涨、接触模式组合爆炸、sim-to-real gap 也叠加上来。把两者融在一起 才是当前真正的瓶颈。

更狠的是,论文还专门把 触觉感知(tactile sensing) 单列一章(Sec. III),指出这是 loco-manipulation 一直被忽视的「第三种传感器」——视觉看不见被遮挡的接触面,本体感觉估不准接触分布,只有触觉能直接告诉你「碰得多重、滑没滑、抓哪了」

💡 全文地图:三大范式 + 触觉 + 基础模型

整篇综述(Fig. 2)其实就是一张大图谱:以「loco-manipulation」为中心,向外辐射出 两条主线 + 两个支撑模块。下面这张图是我对全文结构的直觉化重构:

Loco-manipulation 边走边操作 · 全身接触 论文的核心交叉点 ① Model-based(30 年) Contact Planning (Sec. IV) search / optimization / CITO MPC (Sec. V) LIPM / SRBM / Centroidal / WBD Whole-Body Control (Sec. VI) ② Learning-based(20 年) RL from scratch (Sec. VII-A) PPO / SAC · sim-to-real Imitation Learning (Sec. VII-B/C) teleop / mocap / 人体视频 Versatile Skills (Sec. VII-E) ③ Tactile Sensing (Sec. III) 手部(DIGIT / GelSight / BioTac) 足底(GRF / 地形识别) 全身皮肤(Punyo / iCub / REEM-C) 被忽视的「第三感」 ④ Foundation Models (Sec. VIII) LLM / VLM 做任务规划 SayCan / OmniH2O / HYPERmotion VLA 端到端(RT-2 / π0 / GR00T N1) 「通用化」的新希望 实线 = 直接支撑 loco-manipulation;Sec. IX 给出 model vs learning 的 head-to-head 对比
图 1:全文 taxonomy 的直觉重构。四个象限对应论文的四大块(Sec. III-VI 为 model 侧,Sec. VII-VIII 为 learning 侧),中心是 loco-manipulation 这个交叉点。

有意思的是,论文专门点出一个非显然的观点(Sec. I):sim-to-real RL 本质上也是一种「model-based」方法——因为它的训练依赖于 simulator 里的动力学模型;而且 model-based 与 learning-based 不冲突,常常互补,组合使用比单独任何一个都强。这是后面 hybrid 方法(Sec. VII-D)的理论基础。

🛠️ 三大范式怎么比?

论文 Sec. IX-A 给出了一张非常诚实的对比表(Table VI),我把它转成中文直觉版。注意 VLA 的「generalizability」是唯一拿到 high 的——但代价是 motion accuracy 几乎是最低的。

维度Model-based(MPC / WBC)RLIL(模仿学习)VLA(基础模型)
多模态传感融合低(建模繁琐)非常高
鲁棒性非常高低(分布一偏就崩)非常低
运动精度非常高非常低
实时可行低(推理慢)
versatility(技能广度)
generalizability(OOD)

再看已达成能力(Table VI 下半部分):

技能Model-basedRLIL
纯 locomotion非常高(MIT humanoid 跑跳 / 敏捷 MPC [6,30])非常高(Cassie 100m dash / 人形 parkour [37,40])中(Diffusion Policy 走 [283])
Loco-manipulation(手+脚接触)(Hector 动态搬物 / 多接触 locomotion [2,218])中(带载行走 [41,281])低(HumanPlus 系鞋带 [268])
Whole-body multi-contact中(HRP-2 起立 [140])(接触式 shadowing [419])
🔮 综合洞察(Sec. IX-A 的 takeaway)没有任何一个范式能通吃
· 需要精度、可解释、可证明稳定 → Model-based(仍是工业部署的保底)。
· 需要鲁棒、能处理「未知扰动」(比如摔倒恢复)→ RL
· 需要多技能、从演示快速学习 → IL
· 需要跨任务/跨环境泛化、与人类语义交互 → VLA(潜力最大,但现阶段 loco-manip 还跑不通)。
所以 hybrid(Sec. VII-D)才是现实路线:model-based 给 reference,learning 去 tracking/augment,FM 在顶层做规划。

📊 关键观察与代表方法

论文横跨 30 年,引用了 400+ 篇文献。下表挑出在 loco-manipulation 叙事中反复出现、具有里程碑意义的机器人 / 方法(每一项都可在 PDF 中核对):

代表系统 / 方法范式在综述中的角色
HRP-4 / HRP-2(Kawada / AIST 系列)Model-based(WBC + multi-contact)Fig.1(a):边走边擦木板、和人一起推重物;multi-contact planning 的经典载体 [1, 79, 140]
Atlas(Boston Dynamics)Model-based(MPC + WBC)DARPA Robotics Challenge 旗舰;weighted-QP WBC 的代表 [130, 234, 260]
MIT HumanoidModel-based + QDD 硬件75% 质量集中在躯干;SRBM-MPC 实现 空翻等 acrobatic 行为 [6, 179]
Hector / Digit / Apollo / H1 / Figure 02 / Optimus混合(model-based + 学习)Fig.1 工业化 humanoid 第一梯队;电池 2-4 小时;代表当下「能搬箱子」的产品形态 [2, 423, 424]
Cassie(Agility Robotics)RL(sim-to-real)双足 RL 控制的旗舰平台;100m dash / 跳跃等敏捷运动 [37, 38]
HumanPlus / OmniH2OIL(teleoperation + 模仿)从人类遥操数据学到自主技能;HumanPlus 学系鞋带,OmniH2O 用 GPT-4 选技能 [267, 268]
Punyo-1 / iCub / REEM-C全身触觉Sec. III-C:用整条手臂/躯干抱大物体;全身人工皮肤实现 contact-aware compliance [71, 125, 133]
GR00T N1 / Helix / π0 / RT-2 / OpenVLAFoundation Model / VLASec. VIII:RFM 的最新尝试;π0 用 diffusion head 做 50Hz 双臂控制;现阶段 humanoid loco-manip 还主要在仿真里 [377, 385, 387, 406]
📌 几个值得记住的硬数字(都来自 PDF 正文):
· 人行走的 Cost of Transport ≈ 0.2,今天的人形机器人 >0.7——能效还差 3-4 倍(Sec. II-A)。
· ReLU-QP(GPU 加速 QP 求解器)把高维 balancing 任务的 MPC 频率从 206 Hz 提到 2600 Hz(Sec. V-D)。
· 学习类 contact planner(Lin et al.)在 < 0.1 秒 内预测 centroidal dynamics + 接触序列,比传统优化快 300×(Sec. IV-C)。
· LLaMA 训练用了 992 块 A100-80B,烧了 34 天——指出 humanoid FM 的训练成本痛点(Sec. VIII-C)。
· 现阶段 humanoid battery:Apollo 4 小时、Unitree G1 2 小时,实验室里大多还要拖电线(Sec. IX-B)。

🌐 全景趋势

被动行走 / quasi-static(1990s-2000s) 动态行走 + WBC + MPC(2000s-2010s, model-based 黄金期) RL / IL 进入 locomotion & 桌面 manipulation(2015s-2020s) Loco-manipulation 融合 + 触觉(2023+,当下前沿)⭐ Foundation Model humanoid(VLA / 通用智能体,2025+)

这篇综述的价值在于它把上面这条时间线同时投影到 model-based 和 learning-based 两条轨道上,并明确指出:当下的 frontier 既不在单纯走得更稳,也不在单纯抓得更准,而在 「leg + arm + tactile + FM」四件事同时跑 的 loco-manipulation。作者在结论里预言:未来十年,硬件成本下降 + FM 落地,会催生真正能进入家庭和工厂的人形机器人。

❓ 常见误区

Model-based 是不是已经被 learning 淘汰了?

绝对不是。论文的核心立场之一就是「model-based 是基石,learning 是补充」。Table VI 里 model-based 在 motion accuracy 和 real-time feasibility 上仍然是最强的;所有工业部署的 humanoid(Atlas、HRP、Apollo)底层都是 MPC + WBC。learning 主要补的是鲁棒性(RL)和泛化性(FM)。作者在 Sec. I 明确写:「model-based control 和 sim-to-real RL 不冲突,反而互补」。

为什么触觉突然变得重要?以前不都是视觉 + 本体感觉就够了吗?

因为在 loco-manipulation 里,接触是「分布式的、动态的、被遮挡的」——视觉看不见脚底和地面之间、手心和物体之间到底怎么接触;本体感觉只能间接估,估不准 GRF 和接触分布。论文 Sec. III 论证:只有触觉能提供直接的、未遮挡的接触信息,特别是在推重物、抓易滑物体、whole-body 抱大物体这些 contact-rich 任务中。这也是 Punyo-1、iCub 全身皮肤被高亮的原因。

最难还没解决的开放问题是什么?

论文在 Sec. IV-D / VII-G / VIII-C 反复提到三个未解难题:
1. Contact-Implicit Planning(CIP)的实时化:把接触模式、接触力、轨迹同时优化(CITO)还做不到 humanoid 在线实时,组合爆炸太严重。
2. Loco-manipulation 的 benchmark 缺失:现有 HumanoidBench / Mimicking-Bench 只覆盖一小部分技能,sim-to-real 价值存疑(Sec. VII-G)。
3. Humanoid Foundation Model 的输入输出设计:高 DoF + 不稳定动力学 + 力反馈,VLA 怎么定义 token 还没共识;现在 humanoid VLA 基本只在仿真里跑(Sec. VIII-B)。