枢纽
机器人full-size humanoid + dexterous hands
数据集自采数据
上真机
实时
输入模态低成本同构 exoskeleton cockpit + 踏板 + 力反馈

HOMIE:同构外骨骼驾驶舱,一个人开动一整台人形机器人

Qingwei Ben, Feiyu Jia, Jia Zeng, Junting Dong, Dahua Lin, Jiangmiao Pang(上海 AI Lab + 香港中文大学多媒体实验室)。arXiv:2502.13013, 2025。 硬件只要 $500,完全开源。action_genhumanoidteleop

🧠 一句话心智模型:想用人形机器人采数据教它做事,得先能「一个人实时遥控它」。HOMIE 的答案是一台「驾驶舱」:脚踩踏板走路,手穿同构外骨骼直接控制机械臂关节,戴霍尔传感手套控制灵巧手——同构意味着不用逆运动学(IK),关节角度直接读直接发,精度和速度都是 VR/视觉方案比不了的。

🎯 为什么重要:人形遥操作的「分裂困境」

2024 年起人形机器人成了显学,但要训练它做实际任务,缺不了一条「低成本、单操作员、全身 + 高精度」的数据采集管线。论文开篇就点出现有方案的分裂:

核心矛盾(lose-lose):
RL 训练的 locomotion policy——能适应环境,但没有实时遥操接口;
主流遥操作(VR / 单相机视觉)——能控上身,但忽略移动对操作空间的巨大影响。结果是要么「能走不能抓」,要么「能抓不能走」。再加上现有方案依赖逆运动学(IK)MoCap 数据——IK 是迭代近似,精度差、奇异点频出;MoCap 贵且数据收集慢。

HOMIE 的破局思路是「相互视角迭代」:让 RL 训练里植入上身遥操接口,让遥操系统接管 locomotion 模块——这样两边不再互相拖累。再加上「同构 + 直接关节匹配」绕开 IK,精度/速度直接翻倍。

💡 核心思想:驾驶舱三件套 = 踏板 + 外骨骼 + 手套

操作员 (单人) 🦶 踏板 [vx, ωyaw, height] 🦾 同构外骨骼 关节角直接读 无 IK / 无视觉 🧤 霍尔传感手套 15 DoF × 2(比主流灵巧手还多) 不用伺服,可拆 📡 Wi-Fi 单包 128 字节,延迟 ≈ 16 ms → 同时给 π_loco(腿) + 直接设关节角(臂/手) Unitree G1 / Fourier GR-1 走路+蹲+ 任意上身姿态
图 1:HOMIE 的驾驶舱——单人控制全身。脚管「走+蹲」,外骨骼管手臂,手套管灵巧手,三者并行不冲突。

关键创新是「同构(isomorphic)」——外骨骼的关节配置和被控机械臂一一对应。这意味着操作员关节角 直接复制到机器人身上,不需要任何 IK 求解。论文 §II 详细对比了 11 种遥操系统,HOMIE 是唯一同时满足:有 loco-manipulation、全身遥操、不依赖 MoCap、cost 仅 $500。

🛠️ RL 训练框架的三个核心 trick

只有硬件不够,policy 得支持「上身姿态任意变化时下半身还能稳定」。论文给了三个互相耦合的训练技术,缺一不可:

技术心智为什么必要
① 上身姿态课程训练时不断采样上身关节范围,从 0 逐步扩到全范围;用动作比 $\rho_a$ 控制难度,达标后 +0.05直接全范围训会崩——课程让 policy 先学好基础站立,再逐步适应越来越离谱的上身姿态
② 高度跟踪 reward引入 $r_{\text{knee}}$:实际身高 < 目标时鼓励屈膝,反之鼓励伸膝让机器人能蹲到任意指定高度——这是 HOMIE 把工作空间从「只能站」扩到「能低能高」的关键
③ 对称性利用从 sim 取到 transition 后,镜像翻转得到额外样本;policy 也强制对称输出人形机器人的左右对称是「免费先验」——既增广数据又约束动作空间,收敛更快
🔮 直觉:为什么是「同构外骨骼」而不是 VR?
VR 方案的链路是:VR 估位姿 → IK 解关节角 → 控机器人。两步都有损:VR 在切向方向估不准,IK 是迭代近似还经常碰到奇异点。HOMIE 直接把外骨骼的关节读数送给机器人关节——读数 = 命令,零误差、零延迟。论文实测:外骨骼方案 arm 输出频率 263 Hz / hand 293 Hz,而 VR 方案(OpenTelevision)只有 60/60 Hz,AnyTeleop 视觉方案 125/111 Hz。精度上则把任务完成时间砍到 VR 的一半。

训练基于 Isaac Gym + PPO,部署时 π_loco 直接跑在 Unitree G1 的 Jetson Orin 上。部署阶段还设计了一个自主策略 π_auto:用遥操采到的数据(50 episodes / 任务,10 Hz,RGB + robot state)训一个端到端的视觉运动策略(基于 Seer 自回归 Transformer + MAE 预训练 ViT),让机器人脱开操作员自主完成任务。

📊 结果:硬件快一倍,任务能从蹲到举

维度数字
硬件总成本$500(对比 DexCap $4k、Mobile-ALOHA $32k、OpenTelevision $4k)
遥操输出频率Arm 263 Hz / Hand 293 Hz(无 GPU/SoC,对比 VR 60/60 Hz)
Wi-Fi 通信延迟16 ms(128 字节/包,带 checksum 校验)
任务完成时间桌面四任务(Pick&Place / Scan Barcode / Hand Over / Open Oven)近 VR 一半
用户上手5 名新手 tester(不同身高/体重/性别),5 次试错后逼近专家速度
鲁棒性任务60 kg 坐在椅子上的人(≈ 机器人两倍重)、双机器人协作递苹果、开烤箱、抱花盒等
自主策略(IL)Squat Pick 成功率 73.3%;Pick & Place 成功率 80.0%(各 50 episodes,Seer Transformer)
跨平台Unitree G1 + Fourier GR-1,仿真侧迁移到 GRUtopia(Isaac Sim)
关键洞察:HOMIE 不是「又一个遥操硬件」,而是把硬件 + RL + IL 串成一个数据飞轮——同构外骨骼保证数据质量高(关节级精确、高频率),π_loco 保证机器人能蹲能走(工作空间大),π_auto 用高质量数据训练出能自主完成 70%+ 的策略。硬件精度 → 数据精度 → IL 性能这条链路,是它真正贡献的方法论。

🌐 在领域中的位置

MoCap 全身遥操(贵、受限场地) HumanPlus / OmniH2O(单 RGB 相机,普及但精度差) HOMIE(同构外骨骼 + 霍尔手套 + 踏板,$500)⭐ 人形数据飞轮 → VLA 大模型时代

HOMIE 站在 HumanPlus(2024) / OmniH2O(2024) / OpenTelevision(2024) 这条「单操作员全身遥操」主线上。它的差异化很清晰:精度 + 频率 + 成本三者同时拉满——这恰好是后续人形 VLA 训练数据最看重的三个指标。关联:HumanPlus(前身,纯视觉路线)。

❓ 常见误区

既然都「同构」了,是不是只能用于一种机器人?

不是。论文明确设计了可拆手套 + 可适配外骨骼,验证了用同一套硬件控制 Inspire(12关节)、LEAP(16)、Shadow(20)、Schunk(20)等多款灵巧手。机器人本体也跨 Unitree G1 和 Fourier GR-1。「同构」指的是外骨骼和它当前控制的那台机器人同构,换机器人时调整外骨骼配置即可。

RL 训练依赖 MoCap 数据吗?

明确不依赖。论文把这点列为对比维度("No Mocap" 列),HOMIE 是少数全部打勾的系统之一。HumanPlus / OmniH2O 等都依赖 retargeted MoCap 数据作 motion prior,HOMIE 通过「上身姿态课程 + 高度跟踪 reward + 对称性」三件套直接训出无 motion prior 的鲁棒 policy。

$500 真的够吗?

论文 Table I 给的硬件成本对比里,HOMIE = $0.5k。这指的是外骨骼 + 手套 + 踏板这套驾驶舱本身的物料成本(用高精度旋转电位器、霍尔传感器而非伺服)。机器人本体(Unitree G1)另算,不算在 $500 里。但即便如此,这个价位远低于 MoCap 设备和主流遥操方案。