枢纽
机器人轮式移动基座 + 双臂(whole-body teleop)
数据集Mobile ALOHA 自采(+ 共训练静态 ALOHA 数据)
上真机
实时
输入模态同构 leader-follower(双臂 + 移动底盘)

Mobile ALOHA:把 ALOHA 装上轮子,让双手 + 移动底盘一起「学动作」

Zipeng Fu, Tony Z. Zhao, Chelsea Finn(Stanford University)。arXiv:2401.02117, 2024 年 1 月。 项目页 · 软硬件全开源 · teleopmobile manipulationimitation

🧠 一句话心智模型:把 ALOHA 那套「双手 + 主从 puppeteering」的低成本遥操作setup,绑到一台轮式底盘上,让人用「双手抓 leader 臂 + 脚踩着走」的方式同时操纵双手和底盘;然后用 ACT / Diffusion Policy 直接做行为克隆。秘诀在于:把已有的桌面静态 ALOHA 数据拿来co-training——把"已经会抓东西"的先验白送给"还在学边走边抓"的策略。

🎯 为什么重要:移动操作卡在「数据采集」和「长程协调」两座大山

"模仿学习 + 双手机械臂"已经在桌面上大杀四方(ACT、Diffusion Policy)。但要让它走进厨房、客厅、电梯,必须解决两件事:

核心矛盾:现实任务需要 "底盘 + 双手"全身上下协同。比如「把锅放进橱柜」——走到橱柜前、双手抓住两扇门把手、底盘边退边开门、再双手抓锅抬进去。这种任务 "手不动"或"底盘不动"都做不了。但市面上的双臂移动机器人 PR2、TIAGo 都要 20 万美元以上,普通实验室买不起、更别提数据采集了。
商业双臂移动机器人 PR2 / TIAGo · $200k+ 价格 · 需额外遥操作硬件 · 单臂 / 力反馈踏板 ❌ 实验室难以规模化 静态 ALOHA 桌面双臂 puppeteering · 低成本 ~$20k · 双手灵巧、易修 · 但底盘不动 ⚠️ 只能做桌面任务 Mobile ALOHA ✅ ALOHA + 轮式底盘 · $32k 整机 · 全身遥操作(同控) · 50 demos 即可学 移动 + 双手 + 全身协调
图 1:Mobile ALOHA 在「成本 / 可遥操作 / 可移动」三个维度上找到了甜点。

💡 核心思想:物理 tethering 实现「双手 + 双脚」全身遥操作

关键工程洞察:操作员的两只手已经被 ALOHA leader 臂占用了,怎么再控制底盘?答案出乎意料地简单——把操作员的腰通过一根带子连到底盘上,让他「走」着开底盘。底盘轮子扭矩关闭后摩擦很低(滚动阻力 13N),人可以轻松 backdrive(倒推)。

操作员 双手抓 leader 臂 L 臂 R 臂 腰-底盘 tethering AgileX Tracer 底盘 backdrive 走 follower L follower R 📷 3× webcam(2 腕 + 1 前向)
图 2:全身遥操作示意图。操作员的双手 puppeteer 两个 follower 臂;双脚走路倒推底盘;底盘速度 + 14维手臂关节位置一起记录成 16维 action;3 个 RGB 摄像头作为视觉观察。

🛠️ 三个让"双手 + 底盘"真正能一起学的关键设计

设计心智为什么必要
① 16维动作 + 行动 chunking14维手臂目标关节位置 + 2维底盘线/角速度直接拼成 $\mathbb{R}^{16}$;用 ACT/Diffusion Policy 的 action chunking 一次预测未来 k 步底盘有延迟、手臂几乎没有;chunking 让策略"提前看到"未来若干步,对两个延迟不同的子系统统一调度(手臂执行前 k−d 步、底盘执行后 k−d 步)
② 与静态 ALOHA 数据 co-training把 825 段桌面 ALOHA 演示和 50 段 Mobile ALOHA 演示等概率混 batch;静态数据没有底盘就把底盘 action zero-pad 成 [0,0]50 段示范对 transformer/diffusion 来说太少,会过拟合。静态数据虽然任务不同、相机背景不同,但"如何抓、如何接近"的运动先验可迁移
③ 全身遥操作硬件$7k 的 AgileX Tracer + 现成的 ALOHA,整机 $32k;自带 1.26kWh 电池 + 一台消费级笔记本(3070 Ti)电池既是电源也是配重抗倾覆;整机成本≈一台 Franka Panda 单臂,让实验室能大规模采数
🔮 直觉:为什么 co-training 这么"出乎意料地"有效?
静态 ALOHA 数据里底盘动作永远是 [0,0],看起来"信息量是零"。但模型从中学到的不是"怎么走",而是"怎么抓"——视觉特征、接近轨迹、手-物接触的先验。50 段移动数据负责教"怎么走 + 怎么边走边抓",825 段静态数据负责教"怎么抓得稳"。这种分而治之的隐式分解让小数据 regime 下也不崩。

📊 结果:7 个任务平均 +34%,瓶颈子任务提升高达 +95%

任务(50 demos)Co-train 成功率无 co-train提升
Wipe Wine(擦酒)95%50%+45%
Use Cabinet(放锅入柜)85%85%0%
Rinse Pan(涮锅)80%0%+80%
Call Elevator(叫电梯)95%0%+95%
Push Chairs(推椅子)80%0%(第5把)+80%(OOD 椅子)
Cook Shrimp(炒虾,仅 20 demos)40%20%+20%
High Five(击掌,仅 20 demos)85%85%0%
维度数字
整机成本$32k(含电池与机载计算)
底盘速度1.42 m/s(≈ 人步行),最高 1.6 m/s
电池续航12 小时(1620 Wh)
用户学习曲线5 次试验后从 46s → 28s(Wipe Wine −39%)、75s → 36s(Use Cabinet −52%)
co-training 兼容性ACT / Diffusion Policy / VINN+chunking 都能直接用
关键洞察:提升最猛(+80% / +95%)的子任务恰恰是"按按钮 / 开水龙头"这类厘米级精度的精细动作。这说明 co-training 的真正价值不是"教新东西",而是把视觉-运动先验做扎实,让底盘带来的累积误差能被纠正回来

🌐 在领域中的位置

静态 ALOHA(2023)桌面双臂 Mobile ALOHA(2024)移动双臂 ⭐ HumanPlus / ACE / Bunny-VisionPro(人形全身遥操作) π0 / OpenVLA(VLA 大一统)

Mobile ALOHA 是"低成本全身遥操作 + 模仿学习"路线的分水岭:它证明 50 段人类演示 + 已有静态数据 co-training,就能让一台 $32k 的双臂移动机器人完成 75 秒的长程任务。它把"模仿学习能不能走出桌面"这个问题从"是否可能"变成了"什么时候规模化"。后续人形遥操作(人形机器人全身跟随)继承了"主-从 puppeteering + 行为克隆"的核心范式。

❓ 常见误区

Mobile ALOHA 是 RL 吗?

不是。它是纯模仿学习(行为克隆 BC)——ACT / Diffusion Policy / VINN,没有任何 reward、没有试错。论文明确把"机器人能否自主改进行为"列为 future work。

$32k 这么便宜是不是性能也差?

不差。整机参数:14+2=16 自由度、75kg 自重、单臂负载 750g(双臂合计 1.5kg,能拎 1.4kg 的锅)、底盘最高速 1.6 m/s、12 小时续航、臂端重复定位 1mm。论文同时强调它的"可维修 + 全开源",普通实验室能完整复现。

co-training 的 825 段静态数据是不是污染了 mobile 任务?

没有,反而是正迁移。论文 §7 还比较了 co-train vs pre-train:pre-train(先在静态数据上训 10K 步再 fine-tune)效果反而更差(40% vs 95%),因为网络会"忘掉"静态经验。co-train 让两类数据持续混入 batch,是更稳的方式。

底盘的延迟怎么办?

论文用 action chunking 巧妙绕开:手臂延迟小、底盘延迟大,所以每个 chunk(长度 k)执行时"手臂执行前 k−d 步,底盘执行后 k−d 步"——人为错开 d 步,相当于给底盘"提前发车"的缓冲,最终两只手和底盘能对齐到同一时间相位