IMU 全身遥操:给人形机器人穿一件「动作捕捉服」
🎯 为什么重要:人形机器人「数据采集」的关键拼图
2024–2026 年人形机器人最大瓶颈之一是缺乏人类演示数据——而采集这种数据最自然的方式,就是让操作员「身临其境」地驱动机器人(teleop)。但现有的全身遥操方案都有麻烦:
💡 核心思想:四模块实时流水线 + 零修改 sim2real
系统的精髓是:不做动力学,只做运动学。把人骨骼角度"翻译"成机器人关节角度,靠硬件本身的低层伺服去稳定。这让它天然物理无关(physics-agnostic),所以仿真和真机可以共用同一份代码。
🛠️ 四个模块各自在做什么
| 模块 | 做什么 | 为什么必要 |
|---|---|---|
| ① 运动学映射 | 把人体骨架关节映射到 G1 的 kinematic tree 上;结构不同处(如人髋 vs G1 三自由度髋)用几何投影算等效角度 | 人和机器人 link 长度、自由度、关节范围都不一样,直接 1:1 映射会立刻撞限位 |
| ② 关节限位强制 | 硬限位 + 略内缩的软限位;映射后先 clip 再下发 | 防止高速大幅动作下执行器饱和、减少磨损 |
| ③ EMA 滤波 | 每关节一个指数滑动平均器,时间常数在去噪 vs 响应之间折中 | IMU 原始估计含高频噪声,不滤会变成关节快速大幅振荡,破坏平衡 |
| ④ 帧内同步 | 上肢/下肢/躯干在同一步 retargeting 内同步算完,紧贴控制周期,无缓冲/批处理 | 保证 CoM 轨迹与操作员姿态一致;避免不同身体部位时间错位 |
关键在于:整条流水线都是「运动学」——只关心关节角,不关心重力、惯量、接触。动力学交给 G1 自带的低层伺服去管。既然和物理无关,仿真和真机的代码当然可以共用,不需要域随机化、不需要重调参。这是本文设计哲学的最大杠杆点。
📊 关键结果:真机可复现的动作类型
| 类别 | 具体动作 | 结果 |
|---|---|---|
| 移动 | 前后走、原地踏步 | 稳定,无明显延迟 |
| 姿态切换 | 从椅子坐下 / 站起 | 真机复现成功 |
| 朝向变化 | 原地转弯、横向重心转移 | 稳定 |
| 表达性手势 | 鞠躬、挥手、双臂协调 | 同步复现 |
| 复合动作 | 边走边做手势 | 稳定(最具挑战) |
1. "无感知延迟"——操作员动作和机器人执行在视觉上同步。
2. 整段动作中机器人保持平衡,没有额外的稳定控制器——只靠 G1 板载关节伺服。
3. sim2sim 验证后再 sim2real:同份代码两次跑通,无 retuning。
🌐 在领域中的位置
本文在「表达力 vs 工程成本」上找了一个新折中点:放弃 RL 全身控制器的鲁棒性,换得「即插即用、可解释、确定性」。它是数据采集管线而非终端产品——论文 §7.3 明确指出下一步是把遥操数据喂给模仿学习,bootstrap 出神经全身控制器(即 ExBody / OmniH2O 路线)。关联线索:teleop / 具身数据采集。
❓ 常见误区
这比 OmniH2O / ExBody 强吗?
不在一个维度上比。OmniH2O 等 RL 方法的鲁棒性更强(能在扰动下保持平衡),但训练成本极高。本文是「轻量、可立刻部署」的替代方案——论文 §7.2 明确说它适用于安全关键、需可解释的场景,而不是和 RL 方法比极限鲁棒性。
「无感知延迟」有具体数字吗?
论文是定性描述,没有给延迟毫秒数。EMA 滤波器会引入「小幅、运动速度相关的相位滞后」(§7.3),论文建议未来用 Kalman 滤波进一步减小。这意味着高动态动作下其实会有可察觉的滞后。
机器人不会摔倒吗?
会,在「快速转向、大幅快速摆臂」等高动态场景下平衡会变差。论文 §7.3 自己承认——目前的稳定完全靠 G1 板载低层关节伺服,没有上层 WBC / MPC step planner。这是该方案最大的未解决问题。
为什么不让 G1 直接学操作员动作?
本文路线回避了 sim2real gap,正是为了避免「学」带来的不稳定性。但作者明确说下一步要把遥操数据收集起来做模仿学习——也就是说,这条路最终还是为「学」服务的,只是把学的时机推迟了。