CLONE:用「MoE + LiDAR 闭环」解开人形遥操作的两道死结
🎯 为什么重要:遥操作是「数据采集母机」,但它一直走不远
2024 年起,人形机器人学界形成共识:要训练能干活的 VLA,必须有大规模高质量遥操作数据。但现有遥操作有两大老毛病:
① 上身/下身解耦——为了稳,多数系统让下身走「速度命令」、上身走「动捕追踪」,两条子策略互不知情。结果「边走边弯腰捡东西」这种需要全身协调的动作根本做不出来。
② 开环 = 一路累积漂移——人形是双足 + 非完整约束,脚-地接触复杂,没法像轮式机器人靠轮速计做里程计。没有闭环反馈,每步几厘米的误差十分钟漂成几米,操作者完全失去空间感。
CLONE 直接对准这两个痛点。论文 Fig.2 那张总览图就是它的全部哲学:
💡 核心思想:MoE 让「冲突目标」不再打架,闭环让「漂移」不再累积
CLONE 用 teacher-student 蒸馏(沿用 OmniH2O 框架):teacher 看特权信息(完整机器人状态 + 环境),student 只看真实可观测信息。关键在 student 用了 MoE,而且加了 闭环误差项。整体管线(论文 Fig.3):
🛠️ 三个关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① MoE Student 策略 | L 层、每层 N 个 expert FFN,router 输出 top-k 权重,$f=\sum_i w_i E_i(\cdot)$;加 balancing loss 防止「塌缩到一两个 expert」 | 走/蹲/跳对下身动态要求互相冲突(膝盖弯曲方向、髋力矩极值都不同)。单个 MLP 会被迫折中,MoE 让每种动作有专属参数子集 |
| ② LiDAR 闭环 + SDE 噪声训练 | 机器人装 LiDAR 跑 FAST-LIO2、操作者用 AVP 自带里程计,各算全局 p 与 p̂,策略观测 $(p - \hat p)$;训练时用速度相关 Wiener 噪声 $dP = \dot p\,dt + (\|\dot p\|/c_{\text{vel}} + c_{\min})\,dW$ 注入仿真 | 双足非完整约束,无轮速计;不闭环 → 几分钟漂出几米。SDE 噪声模型反映真实「走得越快 LiDAR 误差越大」的特性,避免策略对完美 p 过拟合 |
| ③ CLONED 数据集 + AMP 下身 | AMASS 149 段 + 14 段 Xsens MoCap + SLERP 平滑的 6D 手腕增广;下身不追踪具体姿态,用 AMP 对抗奖励约束「自然像 AMASS」 | 原始 AMASS 缺手腕朝向(这是灵巧操作关键);下身若也用参考追踪会和上身命令打架——AMP 把「走起来像人」当软约束即可 |
论文 §2 直接给答案:「monolithic MLP 处理冲突目标时被迫折中」。MoE 的妙处是路由器学到的不是「动作分类」,而是「应该激活哪组肌肉记忆」。蹲下时膝盖和髋的协调模式跟走路完全不同——一个 expert 专攻一个模式,等于把一个策略拆成了多个 specialist + 一个调度器。balancing loss 保证所有 expert 都被用上,避免退化成只用一两个。
📊 结果:直行平均误差 5.1cm(3-8.9m 无累积漂移),全身协调解锁
| 测试 | 数字(原文溯源) |
|---|---|
| 直行全局追踪 | 3m / 6m / 8.9m 三档平均误差 5.1 cm,最远 8.9m 处最大偏差 12.0 cm(Fig.4) |
| 统计显著性 | 3m vs 6m (t=0.165, p=0.871),6m vs 8.9m (t=0.048, p=0.963)——距离远近对精度无显著影响(无累积漂移) |
| 曲径追踪 | 10m 路径含两个 90° 转弯,平均误差 20 cm(最大 27 cm),平均旋转漂移 2° |
| 长程导航 | 15m+ 复合路径(前行/转弯/侧步/返回),机器人最终回到起点附近,无显著漂移 |
| 全身技能 | 挥手、蹲下、起立、跳跃——全部能实时遥操(Fig.5) |
| 下蹲覆盖 | 头部高度 1.2m(站)到 0.6m(深蹲),0.1m 步进测 7 档(Fig.7) |
仿真消融(CLONED 数据集,所有方法 SR=100%,Tab.1):
| 方法 | Empkpe ↓ | Er-mpkpe ↓ | Evel ↓ | Ehand-rot ↓ |
|---|---|---|---|---|
| CLONE†(MLP 替代 MoE) | 113.97 | 35.55 | 245.11 | 4.73 |
| CLONE*(OmniH2O 数据替代 CLONED) | 102.20 | 41.07 | 309.65 | 4.61 |
| CLONE(完整版) | 87.84 | 33.30 | 227.17 | 3.61 |
🌐 在领域中的位置
CLONE 在 T07 人形遥操栈 中标志「从短时演示 → 长程遥操」的转折:它是第一个明确把「累积漂移」作为头号问题、并给出闭环解的人形遥操工作。它与 BFM、XHugWBC 同属「为 VLA 时代准备数据母机」这一波——后者关心跨机器人/跨任务,CLONE 关心长时程精度。
❓ 常见误区
闭环纠正是不是就是「PID 把机器人拉回目标位置」?
不是。CLONE 不在控制层做位置环,而是把 (p - p̂) 作为观测送进策略网络,让 RL 自己学会「看到偏差时下身该怎么迈步、上身该怎么补偿」。这是学习式闭环,比 PID 柔性得多——能处理跳跃、蹲下这种 PID 会抖动的场景。
只追踪头和双手,足够吗?
论文承认这是它的局限(§7):「极简输入虽然直观,但在某些场景下限制了细粒度的稳定性控制」。比如跳跃时下半身平衡就没法直接干预,只能靠策略自己学。但优点是硬件门槛极低——一台 Apple Vision Pro 即可,比动捕服 + 多 VR 手柄实用得多。
MoE 不会让推理变慢吗?
不会显著。top-k 路由意味着每步只有 k 个 expert 实际计算(不是全部 N 个),加上 router 本身是个小 MLP。论文未给出具体开销数字,但 top-k=2 时实际计算量仅为 router + 2 个 expert FFN(远低于跑完全部 N 个);收益是全身协调精度大幅提升。
LiDAR 里程计在快速运动时不可靠怎么办?
这正是训练时 SDE 噪声模型的用途:$dP = \dot p\,dt + (\|\dot p\|/c_{\text{vel}} + c_{\min})\,dW$ 显式告诉策略「动得越快、LiDAR 越噪」。部署时如果 LiDAR 真的漂了,策略已经见过类似的扰动,不会立刻翻车。这是「在仿真里模拟传感器缺陷」的经典 sim-to-real 技巧。
CLONED 数据集能开源吗?
论文 §3.4 描述了内容(AMASS 149 段 + 14 段 Xsens + SLERP 手腕增广),项目页 humanoid-clone.github.io 应该会放。它是少数专门为机器人遥操而非动画/图形学整理的人体 MoCap 数据集——补全了蹲/跳/转换这些 AMASS 缺失的动作。