人形机器人的行走 + 操作:一份 Control / Planning / Learning 全景地图
🎯 为什么重要:locomotion 和 manipulation 一直是「两家人」
传统的 humanoid 研究里,下半身归控制组(保持平衡、走稳),上半身归操作组(抓东西、拧盖子)。早期框架甚至直接「锁住上半身」来简化成纯双足行走问题,或反过来「锁住双脚」做桌面操作。两者井水不犯河水。
但真正有用的人形机器人——搬箱子爬楼梯、推小车、开门、和人一起抬桌子——必须 同时 用腿和手。论文把这种「移动中操作」叫做 loco-manipulation,并把它定义为整个人形机器人领域当前的关键前沿:
更狠的是,论文还专门把 触觉感知(tactile sensing) 单列一章(Sec. III),指出这是 loco-manipulation 一直被忽视的「第三种传感器」——视觉看不见被遮挡的接触面,本体感觉估不准接触分布,只有触觉能直接告诉你「碰得多重、滑没滑、抓哪了」。
💡 全文地图:三大范式 + 触觉 + 基础模型
整篇综述(Fig. 2)其实就是一张大图谱:以「loco-manipulation」为中心,向外辐射出 两条主线 + 两个支撑模块。下面这张图是我对全文结构的直觉化重构:
有意思的是,论文专门点出一个非显然的观点(Sec. I):sim-to-real RL 本质上也是一种「model-based」方法——因为它的训练依赖于 simulator 里的动力学模型;而且 model-based 与 learning-based 不冲突,常常互补,组合使用比单独任何一个都强。这是后面 hybrid 方法(Sec. VII-D)的理论基础。
🛠️ 三大范式怎么比?
论文 Sec. IX-A 给出了一张非常诚实的对比表(Table VI),我把它转成中文直觉版。注意 VLA 的「generalizability」是唯一拿到 high 的——但代价是 motion accuracy 几乎是最低的。
| 维度 | Model-based(MPC / WBC) | RL | IL(模仿学习) | VLA(基础模型) |
|---|---|---|---|---|
| 多模态传感融合 | 低(建模繁琐) | 中 | 高 | 非常高 |
| 鲁棒性 | 高 | 非常高 | 低(分布一偏就崩) | 非常低 |
| 运动精度 | 非常高 | 中 | 中 | 非常低 |
| 实时可行 | 高 | 高 | 高 | 低(推理慢) |
| versatility(技能广度) | 高 | 中 | 高 | 高 |
| generalizability(OOD) | 中 | 低 | 低 | 高 |
再看已达成能力(Table VI 下半部分):
| 技能 | Model-based | RL | IL |
|---|---|---|---|
| 纯 locomotion | 非常高(MIT humanoid 跑跳 / 敏捷 MPC [6,30]) | 非常高(Cassie 100m dash / 人形 parkour [37,40]) | 中(Diffusion Policy 走 [283]) |
| Loco-manipulation(手+脚接触) | 高(Hector 动态搬物 / 多接触 locomotion [2,218]) | 中(带载行走 [41,281]) | 低(HumanPlus 系鞋带 [268]) |
| Whole-body multi-contact | 中(HRP-2 起立 [140]) | 高(接触式 shadowing [419]) | — |
· 需要精度、可解释、可证明稳定 → Model-based(仍是工业部署的保底)。
· 需要鲁棒、能处理「未知扰动」(比如摔倒恢复)→ RL。
· 需要多技能、从演示快速学习 → IL。
· 需要跨任务/跨环境泛化、与人类语义交互 → VLA(潜力最大,但现阶段 loco-manip 还跑不通)。
所以 hybrid(Sec. VII-D)才是现实路线:model-based 给 reference,learning 去 tracking/augment,FM 在顶层做规划。
📊 关键观察与代表方法
论文横跨 30 年,引用了 400+ 篇文献。下表挑出在 loco-manipulation 叙事中反复出现、具有里程碑意义的机器人 / 方法(每一项都可在 PDF 中核对):
| 代表系统 / 方法 | 范式 | 在综述中的角色 |
|---|---|---|
| HRP-4 / HRP-2(Kawada / AIST 系列) | Model-based(WBC + multi-contact) | Fig.1(a):边走边擦木板、和人一起推重物;multi-contact planning 的经典载体 [1, 79, 140] |
| Atlas(Boston Dynamics) | Model-based(MPC + WBC) | DARPA Robotics Challenge 旗舰;weighted-QP WBC 的代表 [130, 234, 260] |
| MIT Humanoid | Model-based + QDD 硬件 | 75% 质量集中在躯干;SRBM-MPC 实现 空翻等 acrobatic 行为 [6, 179] |
| Hector / Digit / Apollo / H1 / Figure 02 / Optimus | 混合(model-based + 学习) | Fig.1 工业化 humanoid 第一梯队;电池 2-4 小时;代表当下「能搬箱子」的产品形态 [2, 423, 424] |
| Cassie(Agility Robotics) | RL(sim-to-real) | 双足 RL 控制的旗舰平台;100m dash / 跳跃等敏捷运动 [37, 38] |
| HumanPlus / OmniH2O | IL(teleoperation + 模仿) | 从人类遥操数据学到自主技能;HumanPlus 学系鞋带,OmniH2O 用 GPT-4 选技能 [267, 268] |
| Punyo-1 / iCub / REEM-C | 全身触觉 | Sec. III-C:用整条手臂/躯干抱大物体;全身人工皮肤实现 contact-aware compliance [71, 125, 133] |
| GR00T N1 / Helix / π0 / RT-2 / OpenVLA | Foundation Model / VLA | Sec. VIII:RFM 的最新尝试;π0 用 diffusion head 做 50Hz 双臂控制;现阶段 humanoid loco-manip 还主要在仿真里 [377, 385, 387, 406] |
· 人行走的 Cost of Transport ≈ 0.2,今天的人形机器人 >0.7——能效还差 3-4 倍(Sec. II-A)。
· ReLU-QP(GPU 加速 QP 求解器)把高维 balancing 任务的 MPC 频率从 206 Hz 提到 2600 Hz(Sec. V-D)。
· 学习类 contact planner(Lin et al.)在 < 0.1 秒 内预测 centroidal dynamics + 接触序列,比传统优化快 300×(Sec. IV-C)。
· LLaMA 训练用了 992 块 A100-80B,烧了 34 天——指出 humanoid FM 的训练成本痛点(Sec. VIII-C)。
· 现阶段 humanoid battery:Apollo 4 小时、Unitree G1 2 小时,实验室里大多还要拖电线(Sec. IX-B)。
🌐 全景趋势
这篇综述的价值在于它把上面这条时间线同时投影到 model-based 和 learning-based 两条轨道上,并明确指出:当下的 frontier 既不在单纯走得更稳,也不在单纯抓得更准,而在 「leg + arm + tactile + FM」四件事同时跑 的 loco-manipulation。作者在结论里预言:未来十年,硬件成本下降 + FM 落地,会催生真正能进入家庭和工厂的人形机器人。
❓ 常见误区
Model-based 是不是已经被 learning 淘汰了?
绝对不是。论文的核心立场之一就是「model-based 是基石,learning 是补充」。Table VI 里 model-based 在 motion accuracy 和 real-time feasibility 上仍然是最强的;所有工业部署的 humanoid(Atlas、HRP、Apollo)底层都是 MPC + WBC。learning 主要补的是鲁棒性(RL)和泛化性(FM)。作者在 Sec. I 明确写:「model-based control 和 sim-to-real RL 不冲突,反而互补」。
为什么触觉突然变得重要?以前不都是视觉 + 本体感觉就够了吗?
因为在 loco-manipulation 里,接触是「分布式的、动态的、被遮挡的」——视觉看不见脚底和地面之间、手心和物体之间到底怎么接触;本体感觉只能间接估,估不准 GRF 和接触分布。论文 Sec. III 论证:只有触觉能提供直接的、未遮挡的接触信息,特别是在推重物、抓易滑物体、whole-body 抱大物体这些 contact-rich 任务中。这也是 Punyo-1、iCub 全身皮肤被高亮的原因。
最难还没解决的开放问题是什么?
论文在 Sec. IV-D / VII-G / VIII-C 反复提到三个未解难题:
1. Contact-Implicit Planning(CIP)的实时化:把接触模式、接触力、轨迹同时优化(CITO)还做不到 humanoid 在线实时,组合爆炸太严重。
2. Loco-manipulation 的 benchmark 缺失:现有 HumanoidBench / Mimicking-Bench 只覆盖一小部分技能,sim-to-real 价值存疑(Sec. VII-G)。
3. Humanoid Foundation Model 的输入输出设计:高 DoF + 不稳定动力学 + 力反馈,VLA 怎么定义 token 还没共识;现在 humanoid VLA 基本只在仿真里跑(Sec. VIII-B)。