枢纽
机器人Unitree G1 (full-body, dexterous)
上真机
实时
输入模态VR / 头+手追踪 + MoE 闭环误差修正

CLONE:用「MoE + LiDAR 闭环」解开人形遥操作的两道死结

Yixuan Li, Yutang Lin, Jieming Cui 等(BIT + BIGAI + PKU + Unitree)。arXiv:2506.08931v2(2025 年 8 月)。 项目页 · teleopMoEclosed-loop

🧠 一句话心智模型:人形遥操作两大死结——上身下身拆开控制(不协调)、开环无位置反馈(一路走一路漂)。CLONE 的解药只有两味:① MoE 让一个网络同时装下「走/蹲/跳/挥手」各种冲突的技能(每个 expert 专一门手艺),② LiDAR 测距实时算出机器人和操作者的全局位姿差,把差值喂回策略——漂多大补多大。输入只需一台 Apple Vision Pro 的头+双手追踪。

🎯 为什么重要:遥操作是「数据采集母机」,但它一直走不远

2024 年起,人形机器人学界形成共识:要训练能干活的 VLA,必须有大规模高质量遥操作数据。但现有遥操作有两大老毛病:

核心痛点
上身/下身解耦——为了稳,多数系统让下身走「速度命令」、上身走「动捕追踪」,两条子策略互不知情。结果「边走边弯腰捡东西」这种需要全身协调的动作根本做不出来。
开环 = 一路累积漂移——人形是双足 + 非完整约束,脚-地接触复杂,没法像轮式机器人靠轮速计做里程计。没有闭环反馈,每步几厘米的误差十分钟漂成几米,操作者完全失去空间感。

CLONE 直接对准这两个痛点。论文 Fig.2 那张总览图就是它的全部哲学:

操作者 Apple Vision Pro 头 (3D) + 双腕 (6D) 仅需 3 个 tracking 点 稀疏控制信号 头位置 p̂_head 双手 6D pose CLONE 策略(MoE) 走 expert 蹲 expert 跳 expert 挥 expert Router 选 top-k 29 DoF 整体输出 Unitree G1 下身:AMP 自然步态 上身:紧追头/手目标 闭环:LiDAR 里程计 FAST-LIO2:误差 (p - p̂) 反馈
图 1:CLONE 的全部哲学。左→右是正向控制(稀疏信号→MoE→机器人),底部黄色虚线是闭环反馈——LiDAR 里程计把机器人实际位置送回策略,与操作者目标做差,主动消除累积漂移。

💡 核心思想:MoE 让「冲突目标」不再打架,闭环让「漂移」不再累积

CLONE 用 teacher-student 蒸馏(沿用 OmniH2O 框架):teacher 看特权信息(完整机器人状态 + 环境),student 只看真实可观测信息。关键在 student 用了 MoE,而且加了 闭环误差项。整体管线(论文 Fig.3):

(a) CLONED 数据集 AMASS 149 段 + 14 段 Xsens MoCap + 6D 手腕增广 (SLERP 平滑) 运动编辑扩多样性 补全蹲/跳/转 (b) Teacher 训练 特权观测 o_tea MLP + AMP discriminator (c) Student:MoE 蒸馏 观测:25 帧历史 + 头/手 + LiDAR 误差 (p - p̂) L 层 × N experts,top-k 路由 DAgger 在线蒸馏 (d) 部署 VR Input LiDAR Odom PD 1000Hz 闭环误差纠正机制(核心创新) 机器人 LiDAR(FAST-LIO2) + 操作者 AVP 里程计 → 各算全局 p, p̂ → 策略吃 (p - p̂) → 主动消除漂移 训练时:用 SDE 噪声模型 dP = ṗ·dt + (‖ṗ‖/c_vel + c_min) dW 注入 LiDAR 误差,让策略对噪声鲁棒 下身无显式参考 → 用 AMP 对抗奖励约束「自然步态」(学 AMASS 的风格分布)
图 2:CLONE 训练 + 部署管线。Teacher 看特权信息,蒸馏成 MoE Student;部署时用 LiDAR 里程计做闭环纠正。下身靠 AMP 学自然步态。

🛠️ 三个关键设计

设计心智为什么必要
① MoE Student 策略 L 层、每层 N 个 expert FFN,router 输出 top-k 权重,$f=\sum_i w_i E_i(\cdot)$;加 balancing loss 防止「塌缩到一两个 expert」 走/蹲/跳对下身动态要求互相冲突(膝盖弯曲方向、髋力矩极值都不同)。单个 MLP 会被迫折中,MoE 让每种动作有专属参数子集
② LiDAR 闭环 + SDE 噪声训练 机器人装 LiDAR 跑 FAST-LIO2、操作者用 AVP 自带里程计,各算全局 p 与 p̂,策略观测 $(p - \hat p)$;训练时用速度相关 Wiener 噪声 $dP = \dot p\,dt + (\|\dot p\|/c_{\text{vel}} + c_{\min})\,dW$ 注入仿真 双足非完整约束,无轮速计;不闭环 → 几分钟漂出几米。SDE 噪声模型反映真实「走得越快 LiDAR 误差越大」的特性,避免策略对完美 p 过拟合
③ CLONED 数据集 + AMP 下身 AMASS 149 段 + 14 段 Xsens MoCap + SLERP 平滑的 6D 手腕增广;下身不追踪具体姿态,用 AMP 对抗奖励约束「自然像 AMASS」 原始 AMASS 缺手腕朝向(这是灵巧操作关键);下身若也用参考追踪会和上身命令打架——AMP 把「走起来像人」当软约束即可
🔮 直觉:为什么是 MoE,而不是更大的 MLP?
论文 §2 直接给答案:「monolithic MLP 处理冲突目标时被迫折中」。MoE 的妙处是路由器学到的不是「动作分类」,而是「应该激活哪组肌肉记忆」。蹲下时膝盖和髋的协调模式跟走路完全不同——一个 expert 专攻一个模式,等于把一个策略拆成了多个 specialist + 一个调度器。balancing loss 保证所有 expert 都被用上,避免退化成只用一两个。

📊 结果:直行平均误差 5.1cm(3-8.9m 无累积漂移),全身协调解锁

测试数字(原文溯源)
直行全局追踪3m / 6m / 8.9m 三档平均误差 5.1 cm,最远 8.9m 处最大偏差 12.0 cm(Fig.4)
统计显著性3m vs 6m (t=0.165, p=0.871),6m vs 8.9m (t=0.048, p=0.963)——距离远近对精度无显著影响(无累积漂移)
曲径追踪10m 路径含两个 90° 转弯,平均误差 20 cm(最大 27 cm),平均旋转漂移
长程导航15m+ 复合路径(前行/转弯/侧步/返回),机器人最终回到起点附近,无显著漂移
全身技能挥手、蹲下、起立、跳跃——全部能实时遥操(Fig.5)
下蹲覆盖头部高度 1.2m(站)到 0.6m(深蹲),0.1m 步进测 7 档(Fig.7)

仿真消融(CLONED 数据集,所有方法 SR=100%,Tab.1):

方法Empkpe ↓Er-mpkpeEvelEhand-rot
CLONE(MLP 替代 MoE)113.9735.55245.114.73
CLONE*(OmniH2O 数据替代 CLONED)102.2041.07309.654.61
CLONE(完整版)87.8433.30227.173.61
关键洞察:Tab.1 说明 MoE 和 CLONED 数据集都不可或缺——去掉 MoE 用 MLP,全局位置误差(Empkpe)涨 30%;换回 OmniH2O 数据集,速度误差(Evel)涨 36%。Fig.7 进一步揭示 CLONE 在「局部姿态忠实度」(R-MPKPE、速度、手朝向)始终优于 baseline,尤其在深蹲(0.6m)时差距拉大——这正是 MoE 的价值:难姿势有专门 expert 处理。

🌐 在领域中的位置

传统 MoCap 遥操(动捕服 + 追踪) OmniH2O / H2O / iDP3(VR 头显 + 解耦上下身) CLONE(MoE 协调 + LiDAR 闭环)⭐ 长程自主遥操 + 数据集采集

CLONE 在 T07 人形遥操栈 中标志「从短时演示 → 长程遥操」的转折:它是第一个明确把「累积漂移」作为头号问题、并给出闭环解的人形遥操工作。它与 BFMXHugWBC 同属「为 VLA 时代准备数据母机」这一波——后者关心跨机器人/跨任务,CLONE 关心长时程精度

❓ 常见误区

闭环纠正是不是就是「PID 把机器人拉回目标位置」?

不是。CLONE 不在控制层做位置环,而是把 (p - p̂) 作为观测送进策略网络,让 RL 自己学会「看到偏差时下身该怎么迈步、上身该怎么补偿」。这是学习式闭环,比 PID 柔性得多——能处理跳跃、蹲下这种 PID 会抖动的场景。

只追踪头和双手,足够吗?

论文承认这是它的局限(§7):「极简输入虽然直观,但在某些场景下限制了细粒度的稳定性控制」。比如跳跃时下半身平衡就没法直接干预,只能靠策略自己学。但优点是硬件门槛极低——一台 Apple Vision Pro 即可,比动捕服 + 多 VR 手柄实用得多。

MoE 不会让推理变慢吗?

不会显著。top-k 路由意味着每步只有 k 个 expert 实际计算(不是全部 N 个),加上 router 本身是个小 MLP。论文未给出具体开销数字,但 top-k=2 时实际计算量仅为 router + 2 个 expert FFN(远低于跑完全部 N 个);收益是全身协调精度大幅提升。

LiDAR 里程计在快速运动时不可靠怎么办?

这正是训练时 SDE 噪声模型的用途:$dP = \dot p\,dt + (\|\dot p\|/c_{\text{vel}} + c_{\min})\,dW$ 显式告诉策略「动得越快、LiDAR 越噪」。部署时如果 LiDAR 真的漂了,策略已经见过类似的扰动,不会立刻翻车。这是「在仿真里模拟传感器缺陷」的经典 sim-to-real 技巧。

CLONED 数据集能开源吗?

论文 §3.4 描述了内容(AMASS 149 段 + 14 段 Xsens + SLERP 手腕增广),项目页 humanoid-clone.github.io 应该会放。它是少数专门为机器人遥操而非动画/图形学整理的人体 MoCap 数据集——补全了蹲/跳/转换这些 AMASS 缺失的动作。