EgoMimic:戴副智能眼镜「被动录视频」,机器人就能跟着学
🎯 为什么重要:机器人数据的「被动扩展」关卡
CV 和 NLP 之所以能做出大模型,是因为它们有互联网规模的数据——而这些数据不是专门为训练采集的(被动数据)。机器人学卡在哪?每个 demo 都得人坐在机器人前主动采,慢且贵(RT-1 用了 17 个月 + 13 台机器人)。
破局点:人手的 ego 视频——戴着智能眼镜做饭、叠衣服、装东西的时候顺手就录了——是天然的被动、可互联网化的数据源。但人手数据和机器人数据在运动学、外观、相机上差异巨大,怎么「混在一起训」是难题。
EgoMimic 的核心论点是:不要把人手视频当「辅助信号」单独处理(如 MimicPlay 的「人手规划 + 机器人底层」分层架构),而要把人和机器人当作同一种 embodied 数据平等共训。这一改,性能、泛化、scaling 全都上一个台阶。
💡 核心思想:全栈设计,把人和机器人「对齐」到可共训
让人手数据和机器人数据「共训」听上去简单,做起来处处是坑。EgoMimic 是个 full-stack 工作——从硬件、数据对齐、到网络结构,四层都设计了:
硬件设计的灵魂:为了缩小人-机的「相机 gap」,机器人的主视觉传感器故意也用 Project Aria 眼镜(装在躯干顶部、和人眼位置类似)。这样 ego 图像的 FOV、曝光、动态范围天然一致。机器人则用两个 6-DoF ViperX 300 臂倒装——轻、便宜(除臂外 BOM <$1000)、运动学接近人手。
🛠️ 三层对齐 + 共训架构:把「跨本体」变成「同本体」
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 坐标系统一 | 用 Aria 的 SLAM 把每帧的手/末端轨迹变换到「当前观察相机系」下,构造动作 chunk $a_{t:t+h}$ | 人戴眼镜走动时相机系在变,机器人相机系固定——不统一就没法用同一套 action 监督 |
| ② 动作分布归一 | 对人和机器人各自做 Gaussian normalization(零均值单位方差),再喂给网络 | 人手工作空间和机器人不一样(尤其 y 方向左右),分布对不齐会让网络学到「两套表征」,人数据加进来反而帮倒忙 |
| ③ 外观遮罩 | SAM 把人手和机械臂都抠掉涂黑,再叠一条红线表示末端方向 | 人手 vs 机械臂视觉差异巨大;遮住本体只留场景+方向指示,强迫策略关注「任务几何」而非本体外观 |
| ④ 共训架构(ACT) | 共享视觉编码 + Transformer;pose 头同时监督人和机器人,joint 头只监督机器人 | pose 头是「跨本体桥梁」——通过它,人手数据 supervise 的视觉表征也帮到机器人分支。两个头只差一层 linear,强迫表征融合 |
MimicPlay 的做法是:用人手视频训一个高层 planner,再用机器人数据训一个低层 policy,planner 给 policy 提供目标。问题:低层 policy 没法直接从大规模人手数据中获益,瓶颈卡在低层。EgoMimic 的做法是让人手数据直接监督同一个网络(通过 pose 头)——人手数据的规模红利直接灌进策略表征。论文实测:未见场景下,EgoMimic 拿 63 分,MimicPlay 只拿 4 分。
📊 结果:Bowl 任务 +228%,1 小时人手 ≫ 1 小时机器人
| 维度 | 数字(PDF 溯源) |
|---|---|
| 任务 | 3 个真机长 horizon:Continuous Object-in-Bowl、Laundry 叠 T 恤、Groceries 装袋(§IV-A) |
| 主结果(score) | Bowl 128 vs ACT 39(+228%);Laundry 114 vs 82;Groceries 110 vs 82(Tab.III) |
| 成功率 | Laundry 88% vs ACT 55%;Groceries 30% vs 22%;Open Bag 70% vs 54% |
| vs MimicPlay | Bowl 128 vs 71;Laundry 114 vs 78;Groceries 110 vs 53 |
| 消除架构差异 | EgoMimic (0% human) 68 分仍 > ACT 39 分;说明架构改进 + 人数据双重贡献(Tab.III) |
| 泛化:未见衣服颜色 | EgoMimic 85% SR vs ACT 25%(Fig.7a) |
| 泛化:完全未见场景 | EgoMimic 63 分(零额外机器人数据) vs MimicPlay 4 分(Fig.7b) |
| scaling 关键 | 2h 机器人 + 1h 人手 = 128 分 > 3h 机器人(ACT)的 74 分。1h 人手数据 ≈ 1400 demos,1h 机器人 ≈ 135 demos(10× 效率) |
| 消融(Bowl, Tab.IV) | 完整 128;去掉红线 112;去掉红线+遮罩 95;去掉动作归一 79(-38%);去人手数据 68(-47%) |
🌐 在领域中的位置
EgoMimic 是「机器人数据被动扩展」路线的标志性工作。它的论点——把人手视频当作另一种 embodiment 平等共训(而非辅助规划)——为后续「戴智能眼镜采数据」的范式打下了地基。随着 Project Aria 等设备的普及,这条路线被认为是通向「互联网规模机器人数据」的现实路径。关联:ACT/ALOHA(共训基座)、Diffusion Policy。
❓ 常见误区
它是不是就是「拿人手视频预训练视觉编码器」?
不是。预训练视觉表征(如 R3M、VIP)只用人视频学视觉,动作还是机器人自己学。EgoMimic 把人手 3D 轨迹作为 action 监督直接灌进策略——人手数据同时教「看」和「动」。这是它和 R3M 类工作的本质区别。
为什么要做 SAM 遮罩?把人手遮了不就丢信息了吗?
遮的是「本体外观」(人手 vs 机械臂),但红线方向指示保留了末端朝向。这么做是为了强迫网络学「场景 → 该往哪动」的几何关系,而不是「这只好手/这只机械臂」长什么样。消融显示去掉红线(保留遮罩)掉 16 分(128→112),再去掉遮罩再掉 17 分(112→95)——视觉对齐确实有用。
「1 小时人手 ≫ 1 小时机器人」是真的吗?
是真的,且原因直接:1 小时人手采 1400 条 demo,1 小时机器人只采 135 条(差 10×,因为人动作快、不用 reset)。在人手数据上训到的 Bowl 任务分数(128)显著高于等量机器人数据(74)。这就是「被动+可扩展」数据源的红利。
它和「cross-embodiment」(RT-X)是什么关系?
理念一致——把不同本体当作 transfer learning 问题。RT-X 跨的是不同机器人,EgoMimic 跨的是人 ↔ 机器人。论文明确说:「人数据应当被视为 transfer learning 中的另一种 embodiment」。可以认为它是 cross-embodiment 在「人机」方向上的极端案例。