Mobile ALOHA:把 ALOHA 装上轮子,让双手 + 移动底盘一起「学动作」
🎯 为什么重要:移动操作卡在「数据采集」和「长程协调」两座大山
"模仿学习 + 双手机械臂"已经在桌面上大杀四方(ACT、Diffusion Policy)。但要让它走进厨房、客厅、电梯,必须解决两件事:
💡 核心思想:物理 tethering 实现「双手 + 双脚」全身遥操作
关键工程洞察:操作员的两只手已经被 ALOHA leader 臂占用了,怎么再控制底盘?答案出乎意料地简单——把操作员的腰通过一根带子连到底盘上,让他「走」着开底盘。底盘轮子扭矩关闭后摩擦很低(滚动阻力 13N),人可以轻松 backdrive(倒推)。
🛠️ 三个让"双手 + 底盘"真正能一起学的关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 16维动作 + 行动 chunking | 14维手臂目标关节位置 + 2维底盘线/角速度直接拼成 $\mathbb{R}^{16}$;用 ACT/Diffusion Policy 的 action chunking 一次预测未来 k 步 | 底盘有延迟、手臂几乎没有;chunking 让策略"提前看到"未来若干步,对两个延迟不同的子系统统一调度(手臂执行前 k−d 步、底盘执行后 k−d 步) |
| ② 与静态 ALOHA 数据 co-training | 把 825 段桌面 ALOHA 演示和 50 段 Mobile ALOHA 演示等概率混 batch;静态数据没有底盘就把底盘 action zero-pad 成 [0,0] | 50 段示范对 transformer/diffusion 来说太少,会过拟合。静态数据虽然任务不同、相机背景不同,但"如何抓、如何接近"的运动先验可迁移 |
| ③ 全身遥操作硬件 | $7k 的 AgileX Tracer + 现成的 ALOHA,整机 $32k;自带 1.26kWh 电池 + 一台消费级笔记本(3070 Ti) | 电池既是电源也是配重抗倾覆;整机成本≈一台 Franka Panda 单臂,让实验室能大规模采数 |
静态 ALOHA 数据里底盘动作永远是 [0,0],看起来"信息量是零"。但模型从中学到的不是"怎么走",而是"怎么抓"——视觉特征、接近轨迹、手-物接触的先验。50 段移动数据负责教"怎么走 + 怎么边走边抓",825 段静态数据负责教"怎么抓得稳"。这种分而治之的隐式分解让小数据 regime 下也不崩。
📊 结果:7 个任务平均 +34%,瓶颈子任务提升高达 +95%
| 任务(50 demos) | Co-train 成功率 | 无 co-train | 提升 |
|---|---|---|---|
| Wipe Wine(擦酒) | 95% | 50% | +45% |
| Use Cabinet(放锅入柜) | 85% | 85% | 0% |
| Rinse Pan(涮锅) | 80% | 0% | +80% |
| Call Elevator(叫电梯) | 95% | 0% | +95% |
| Push Chairs(推椅子) | 80% | 0%(第5把) | +80%(OOD 椅子) |
| Cook Shrimp(炒虾,仅 20 demos) | 40% | 20% | +20% |
| High Five(击掌,仅 20 demos) | 85% | 85% | 0% |
| 维度 | 数字 |
|---|---|
| 整机成本 | $32k(含电池与机载计算) |
| 底盘速度 | 1.42 m/s(≈ 人步行),最高 1.6 m/s |
| 电池续航 | 12 小时(1620 Wh) |
| 用户学习曲线 | 5 次试验后从 46s → 28s(Wipe Wine −39%)、75s → 36s(Use Cabinet −52%) |
| co-training 兼容性 | ACT / Diffusion Policy / VINN+chunking 都能直接用 |
🌐 在领域中的位置
Mobile ALOHA 是"低成本全身遥操作 + 模仿学习"路线的分水岭:它证明 50 段人类演示 + 已有静态数据 co-training,就能让一台 $32k 的双臂移动机器人完成 75 秒的长程任务。它把"模仿学习能不能走出桌面"这个问题从"是否可能"变成了"什么时候规模化"。后续人形遥操作(人形机器人全身跟随)继承了"主-从 puppeteering + 行为克隆"的核心范式。
❓ 常见误区
Mobile ALOHA 是 RL 吗?
不是。它是纯模仿学习(行为克隆 BC)——ACT / Diffusion Policy / VINN,没有任何 reward、没有试错。论文明确把"机器人能否自主改进行为"列为 future work。
$32k 这么便宜是不是性能也差?
不差。整机参数:14+2=16 自由度、75kg 自重、单臂负载 750g(双臂合计 1.5kg,能拎 1.4kg 的锅)、底盘最高速 1.6 m/s、12 小时续航、臂端重复定位 1mm。论文同时强调它的"可维修 + 全开源",普通实验室能完整复现。
co-training 的 825 段静态数据是不是污染了 mobile 任务?
没有,反而是正迁移。论文 §7 还比较了 co-train vs pre-train:pre-train(先在静态数据上训 10K 步再 fine-tune)效果反而更差(40% vs 95%),因为网络会"忘掉"静态经验。co-train 让两类数据持续混入 batch,是更稳的方式。
底盘的延迟怎么办?
论文用 action chunking 巧妙绕开:手臂延迟小、底盘延迟大,所以每个 chunk(长度 k)执行时"手臂执行前 k−d 步,底盘执行后 k−d 步"——人为错开 d 步,相当于给底盘"提前发车"的缓冲,最终两只手和底盘能对齐到同一时间相位。