枢纽
机器人Unitree G1
上真机
实时
输入模态proprioception,motion_capture

IMU 全身遥操:给人形机器人穿一件「动作捕捉服」

Hamza Ahmed Durrani, Suleman Khan(WeGo Robotics)。arXiv:2605.12347,2026 年 5 月。 teleophumanoidIMU 动捕sim2real

🧠 一句话心智模型:让人穿上一套 IMU 动捕服做什么动作,旁边的 Unitree G1 人形机器人就实时、同步、零延迟地跟着做——不训练任何神经网络,纯运动学映射,仿真调通就直接上真机,零改动。

🎯 为什么重要:人形机器人「数据采集」的关键拼图

2024–2026 年人形机器人最大瓶颈之一是缺乏人类演示数据——而采集这种数据最自然的方式,就是让操作员「身临其境」地驱动机器人(teleop)。但现有的全身遥操方案都有麻烦:

核心痛点:RL 训练的全身控制器(OmniH2O 等)要训练数据、要 sim2real 域随机化、要奖励工程;离线 retargeting 又做不到实时;光学动捕又受场地约束。能不能有一条「不用学、能实时、能直接上真机」的中间路线?
脚本化回放 预录动作 → 逐帧播放 ✓ 稳定 ✗ 不能交互 ✗ 表达力差 RL 全身控制 OmniH2O / ExBody ✓ 鲁棒 ✗ 需大量训练 ✗ sim2real 调参 纯运动学 retarget ✅ 本文:IMU→映射→控制 ✓ 实时 ✓ 无需训练 ✓ sim2real 零改
图 1:三条人形遥操路线对比(论文 §2)。本文选了第三条——「不学,只映射」。

💡 核心思想:四模块实时流水线 + 零修改 sim2real

系统的精髓是:不做动力学,只做运动学。把人骨骼角度"翻译"成机器人关节角度,靠硬件本身的低层伺服去稳定。这让它天然物理无关(physics-agnostic),所以仿真和真机可以共用同一份代码。

Virdyn IMU 动捕服 ① 运动学映射 骨架 → G1 关节树 几何投影 ② 关节限位 硬限位 + 软限位 clip 到安全范围 ③ EMA 平滑 指数滑动平均 去高频抖动 ④ 同步派发 上下身/躯干同拍 同控制周期下发 → MuJoCo 仿真 验证 → 真机 G1 零改动部署
图 2:四模块同步运行在 G1 控制回路中,每帧传感器数据在同一控制周期里映射、平滑、下发。同一份代码先跑 MuJoCo(sim2sim),再上真机(sim2real)。

🛠️ 四个模块各自在做什么

模块做什么为什么必要
① 运动学映射把人体骨架关节映射到 G1 的 kinematic tree 上;结构不同处(如人髋 vs G1 三自由度髋)用几何投影算等效角度人和机器人 link 长度、自由度、关节范围都不一样,直接 1:1 映射会立刻撞限位
② 关节限位强制硬限位 + 略内缩的软限位;映射后先 clip 再下发防止高速大幅动作下执行器饱和、减少磨损
③ EMA 滤波每关节一个指数滑动平均器,时间常数在去噪 vs 响应之间折中IMU 原始估计含高频噪声,不滤会变成关节快速大幅振荡,破坏平衡
④ 帧内同步上肢/下肢/躯干在同一步 retargeting 内同步算完,紧贴控制周期,无缓冲/批处理保证 CoM 轨迹与操作员姿态一致;避免不同身体部位时间错位
🔮 直觉:为什么「零修改 sim2real」能成立?
关键在于:整条流水线都是「运动学」——只关心关节角,不关心重力、惯量、接触。动力学交给 G1 自带的低层伺服去管。既然和物理无关,仿真和真机的代码当然可以共用,不需要域随机化、不需要重调参。这是本文设计哲学的最大杠杆点

📊 关键结果:真机可复现的动作类型

类别具体动作结果
移动前后走、原地踏步稳定,无明显延迟
姿态切换从椅子坐下 / 站起真机复现成功
朝向变化原地转弯、横向重心转移稳定
表达性手势鞠躬、挥手、双臂协调同步复现
复合动作边走边做手势稳定(最具挑战)
关键定性结论(论文以定性验证为主,未给数值延迟表):
1. "无感知延迟"——操作员动作和机器人执行在视觉上同步。
2. 整段动作中机器人保持平衡,没有额外的稳定控制器——只靠 G1 板载关节伺服。
3. sim2sim 验证后再 sim2real:同份代码两次跑通,无 retuning。

🌐 在领域中的位置

光学动捕 → 离线 retarget OmniH2O / ExBody(学习版 WBC) IMU + 纯运动学 retarget(本文)⭐ 数据采集 → 模仿学习 / VLA 训练

本文在「表达力 vs 工程成本」上找了一个新折中点:放弃 RL 全身控制器的鲁棒性,换得「即插即用、可解释、确定性」。它是数据采集管线而非终端产品——论文 §7.3 明确指出下一步是把遥操数据喂给模仿学习,bootstrap 出神经全身控制器(即 ExBody / OmniH2O 路线)。关联线索:teleop / 具身数据采集。

❓ 常见误区

这比 OmniH2O / ExBody 强吗?

不在一个维度上比。OmniH2O 等 RL 方法的鲁棒性更强(能在扰动下保持平衡),但训练成本极高。本文是「轻量、可立刻部署」的替代方案——论文 §7.2 明确说它适用于安全关键、需可解释的场景,而不是和 RL 方法比极限鲁棒性。

「无感知延迟」有具体数字吗?

论文是定性描述,没有给延迟毫秒数。EMA 滤波器会引入「小幅、运动速度相关的相位滞后」(§7.3),论文建议未来用 Kalman 滤波进一步减小。这意味着高动态动作下其实会有可察觉的滞后。

机器人不会摔倒吗?

会,在「快速转向、大幅快速摆臂」等高动态场景下平衡会变差。论文 §7.3 自己承认——目前的稳定完全靠 G1 板载低层关节伺服,没有上层 WBC / MPC step planner。这是该方案最大的未解决问题。

为什么不让 G1 直接学操作员动作?

本文路线回避了 sim2real gap,正是为了避免「学」带来的不稳定性。但作者明确说下一步要把遥操数据收集起来做模仿学习——也就是说,这条路最终还是为「学」服务的,只是把学的时机推迟了。