HOMIE:同构外骨骼驾驶舱,一个人开动一整台人形机器人
🎯 为什么重要:人形遥操作的「分裂困境」
2024 年起人形机器人成了显学,但要训练它做实际任务,缺不了一条「低成本、单操作员、全身 + 高精度」的数据采集管线。论文开篇就点出现有方案的分裂:
① RL 训练的 locomotion policy——能适应环境,但没有实时遥操接口;
② 主流遥操作(VR / 单相机视觉)——能控上身,但忽略移动对操作空间的巨大影响。结果是要么「能走不能抓」,要么「能抓不能走」。再加上现有方案依赖逆运动学(IK)和MoCap 数据——IK 是迭代近似,精度差、奇异点频出;MoCap 贵且数据收集慢。
HOMIE 的破局思路是「相互视角迭代」:让 RL 训练里植入上身遥操接口,让遥操系统接管 locomotion 模块——这样两边不再互相拖累。再加上「同构 + 直接关节匹配」绕开 IK,精度/速度直接翻倍。
💡 核心思想:驾驶舱三件套 = 踏板 + 外骨骼 + 手套
关键创新是「同构(isomorphic)」——外骨骼的关节配置和被控机械臂一一对应。这意味着操作员关节角 直接复制到机器人身上,不需要任何 IK 求解。论文 §II 详细对比了 11 种遥操系统,HOMIE 是唯一同时满足:有 loco-manipulation、全身遥操、不依赖 MoCap、cost 仅 $500。
🛠️ RL 训练框架的三个核心 trick
只有硬件不够,policy 得支持「上身姿态任意变化时下半身还能稳定」。论文给了三个互相耦合的训练技术,缺一不可:
| 技术 | 心智 | 为什么必要 |
|---|---|---|
| ① 上身姿态课程 | 训练时不断采样上身关节范围,从 0 逐步扩到全范围;用动作比 $\rho_a$ 控制难度,达标后 +0.05 | 直接全范围训会崩——课程让 policy 先学好基础站立,再逐步适应越来越离谱的上身姿态 |
| ② 高度跟踪 reward | 引入 $r_{\text{knee}}$:实际身高 < 目标时鼓励屈膝,反之鼓励伸膝 | 让机器人能蹲到任意指定高度——这是 HOMIE 把工作空间从「只能站」扩到「能低能高」的关键 |
| ③ 对称性利用 | 从 sim 取到 transition 后,镜像翻转得到额外样本;policy 也强制对称输出 | 人形机器人的左右对称是「免费先验」——既增广数据又约束动作空间,收敛更快 |
VR 方案的链路是:VR 估位姿 → IK 解关节角 → 控机器人。两步都有损:VR 在切向方向估不准,IK 是迭代近似还经常碰到奇异点。HOMIE 直接把外骨骼的关节读数送给机器人关节——读数 = 命令,零误差、零延迟。论文实测:外骨骼方案 arm 输出频率 263 Hz / hand 293 Hz,而 VR 方案(OpenTelevision)只有 60/60 Hz,AnyTeleop 视觉方案 125/111 Hz。精度上则把任务完成时间砍到 VR 的一半。
训练基于 Isaac Gym + PPO,部署时 π_loco 直接跑在 Unitree G1 的 Jetson Orin 上。部署阶段还设计了一个自主策略 π_auto:用遥操采到的数据(50 episodes / 任务,10 Hz,RGB + robot state)训一个端到端的视觉运动策略(基于 Seer 自回归 Transformer + MAE 预训练 ViT),让机器人脱开操作员自主完成任务。
📊 结果:硬件快一倍,任务能从蹲到举
| 维度 | 数字 |
|---|---|
| 硬件总成本 | $500(对比 DexCap $4k、Mobile-ALOHA $32k、OpenTelevision $4k) |
| 遥操输出频率 | Arm 263 Hz / Hand 293 Hz(无 GPU/SoC,对比 VR 60/60 Hz) |
| Wi-Fi 通信延迟 | 16 ms(128 字节/包,带 checksum 校验) |
| 任务完成时间 | 桌面四任务(Pick&Place / Scan Barcode / Hand Over / Open Oven)近 VR 一半 |
| 用户上手 | 5 名新手 tester(不同身高/体重/性别),5 次试错后逼近专家速度 |
| 鲁棒性任务 | 推 60 kg 坐在椅子上的人(≈ 机器人两倍重)、双机器人协作递苹果、开烤箱、抱花盒等 |
| 自主策略(IL) | Squat Pick 成功率 73.3%;Pick & Place 成功率 80.0%(各 50 episodes,Seer Transformer) |
| 跨平台 | Unitree G1 + Fourier GR-1,仿真侧迁移到 GRUtopia(Isaac Sim) |
🌐 在领域中的位置
HOMIE 站在 HumanPlus(2024) / OmniH2O(2024) / OpenTelevision(2024) 这条「单操作员全身遥操」主线上。它的差异化很清晰:精度 + 频率 + 成本三者同时拉满——这恰好是后续人形 VLA 训练数据最看重的三个指标。关联:HumanPlus(前身,纯视觉路线)。
❓ 常见误区
既然都「同构」了,是不是只能用于一种机器人?
不是。论文明确设计了可拆手套 + 可适配外骨骼,验证了用同一套硬件控制 Inspire(12关节)、LEAP(16)、Shadow(20)、Schunk(20)等多款灵巧手。机器人本体也跨 Unitree G1 和 Fourier GR-1。「同构」指的是外骨骼和它当前控制的那台机器人同构,换机器人时调整外骨骼配置即可。
RL 训练依赖 MoCap 数据吗?
明确不依赖。论文把这点列为对比维度("No Mocap" 列),HOMIE 是少数全部打勾的系统之一。HumanPlus / OmniH2O 等都依赖 retargeted MoCap 数据作 motion prior,HOMIE 通过「上身姿态课程 + 高度跟踪 reward + 对称性」三件套直接训出无 motion prior 的鲁棒 policy。
$500 真的够吗?
论文 Table I 给的硬件成本对比里,HOMIE = $0.5k。这指的是外骨骼 + 手套 + 踏板这套驾驶舱本身的物料成本(用高精度旋转电位器、霍尔传感器而非伺服)。机器人本体(Unitree G1)另算,不算在 $500 里。但即便如此,这个价位远低于 MoCap 设备和主流遥操方案。