枢纽
机器人bimanual manipulator
上真机
实时
输入模态vision,proprioception

EgoMimic:戴副智能眼镜「被动录视频」,机器人就能跟着学

Simar Kareer, Dhruv Patel, Ryan Punamiya 等(Georgia Tech + Stanford)。arXiv:2410.24221, 2024。 项目页 · 开源 · imitation数据扩展

🧠 一句话心智模型:模仿学习最贵的是「遥操作采数据」——一小时只能采 135 条。EgoMimic 说:你别老老实实坐机器人前面采了,戴副 Project Aria 智能眼镜,像平时一样用手干活,眼镜会录下 ego 视频和 3D 手部轨迹。把这种「被动数据」和机器人数据当成同一种 embodied 数据共训,一小时人手数据顶好几小时机器人数据。

🎯 为什么重要:机器人数据的「被动扩展」关卡

CV 和 NLP 之所以能做出大模型,是因为它们有互联网规模的数据——而这些数据不是专门为训练采集的(被动数据)。机器人学卡在哪?每个 demo 都得人坐在机器人前主动采,慢且贵(RT-1 用了 17 个月 + 13 台机器人)。

核心矛盾:要泛化就要海量数据;但机器人遥操作数据采集无法被动扩展
破局点:人手的 ego 视频——戴着智能眼镜做饭、叠衣服、装东西的时候顺手就录了——是天然的被动、可互联网化的数据源。但人手数据和机器人数据在运动学、外观、相机上差异巨大,怎么「混在一起训」是难题。

EgoMimic 的核心论点是:不要把人手视频当「辅助信号」单独处理(如 MimicPlay 的「人手规划 + 机器人底层」分层架构),而要把人和机器人当作同一种 embodied 数据平等共训。这一改,性能、泛化、scaling 全都上一个台阶。

💡 核心思想:全栈设计,把人和机器人「对齐」到可共训

让人手数据和机器人数据「共训」听上去简单,做起来处处是坑。EgoMimic 是个 full-stack 工作——从硬件、数据对齐、到网络结构,四层都设计了:

人手数据 Project Aria 眼镜 ego RGB + 3D 手 被动、可扩展 机器人数据 ViperX 300 S 双臂 (除臂外 BOM <$1000) Aria 作相机 主动遥操作 三层对齐 ① 坐标系统一 SLAM 转相机系 ② 动作分布归一 Gaussian normalization ③ 外观遮罩 SAM 抠手/机器人 叠红色线表朝向 共训 ACT 共享视觉编码器 共享 Transformer pose 头:人+机 joint 头:仅机 "平等共训" 不分主从 统一策略 Bowl +228% 未见颜色 85% SR
图 2:EgoMimic 的 full-stack pipeline。人手数据(被动)+ 机器人数据(主动),经三层对齐后注入共训 ACT,输出一个统一策略。关键是做分层、做辅助——平等共训。

硬件设计的灵魂:为了缩小人-机的「相机 gap」,机器人的主视觉传感器故意也用 Project Aria 眼镜(装在躯干顶部、和人眼位置类似)。这样 ego 图像的 FOV、曝光、动态范围天然一致。机器人则用两个 6-DoF ViperX 300 臂倒装——轻、便宜(除臂外 BOM <$1000)、运动学接近人手。

🛠️ 三层对齐 + 共训架构:把「跨本体」变成「同本体」

设计心智为什么必要
① 坐标系统一用 Aria 的 SLAM 把每帧的手/末端轨迹变换到「当前观察相机系」下,构造动作 chunk $a_{t:t+h}$人戴眼镜走动时相机系在变,机器人相机系固定——不统一就没法用同一套 action 监督
② 动作分布归一对人和机器人各自做 Gaussian normalization(零均值单位方差),再喂给网络人手工作空间和机器人不一样(尤其 y 方向左右),分布对不齐会让网络学到「两套表征」,人数据加进来反而帮倒忙
③ 外观遮罩SAM 把人手和机械臂都抠掉涂黑,再叠一条红线表示末端方向人手 vs 机械臂视觉差异巨大;遮住本体只留场景+方向指示,强迫策略关注「任务几何」而非本体外观
④ 共训架构(ACT)共享视觉编码 + Transformer;pose 头同时监督人和机器人,joint 头只监督机器人pose 头是「跨本体桥梁」——通过它,人手数据 supervise 的视觉表征也帮到机器人分支。两个头只差一层 linear,强迫表征融合
🔮 直觉:为什么「平等共训」比「分层(MimicPlay)」好?
MimicPlay 的做法是:用人手视频训一个高层 planner,再用机器人数据训一个低层 policy,planner 给 policy 提供目标。问题:低层 policy 没法直接从大规模人手数据中获益,瓶颈卡在低层。EgoMimic 的做法是让人手数据直接监督同一个网络(通过 pose 头)——人手数据的规模红利直接灌进策略表征。论文实测:未见场景下,EgoMimic 拿 63 分,MimicPlay 只拿 4 分。

📊 结果:Bowl 任务 +228%,1 小时人手 ≫ 1 小时机器人

维度数字(PDF 溯源)
任务3 个真机长 horizon:Continuous Object-in-Bowl、Laundry 叠 T 恤、Groceries 装袋(§IV-A)
主结果(score)Bowl 128 vs ACT 39(+228%);Laundry 114 vs 82;Groceries 110 vs 82(Tab.III)
成功率Laundry 88% vs ACT 55%;Groceries 30% vs 22%;Open Bag 70% vs 54%
vs MimicPlayBowl 128 vs 71;Laundry 114 vs 78;Groceries 110 vs 53
消除架构差异EgoMimic (0% human) 68 分仍 > ACT 39 分;说明架构改进 + 人数据双重贡献(Tab.III)
泛化:未见衣服颜色EgoMimic 85% SR vs ACT 25%(Fig.7a)
泛化:完全未见场景EgoMimic 63 分(零额外机器人数据) vs MimicPlay 4 分(Fig.7b)
scaling 关键2h 机器人 + 1h 人手 = 128 分 > 3h 机器人(ACT)的 74 分。1h 人手数据 ≈ 1400 demos,1h 机器人 ≈ 135 demos(10× 效率)
消融(Bowl, Tab.IV)完整 128;去掉红线 112;去掉红线+遮罩 95;去掉动作归一 79(-38%);去人手数据 68(-47%)
关键洞察:去人手数据(-47%)和去动作归一(-38%)是最大的两块掉分——前者证明人手数据是真有效,后者证明「对齐」是让人手数据生效的前提。两层合在一起才解释了 EgoMimic 的成功:不是「加数据」就行,是「对齐了才能用上跨本体数据」。

🌐 在领域中的位置

VR/ALOHA 遥操作(主动采,慢) MimicPlay(人手做高层规划,分层) EgoMimic(ego 视频+手追踪,平等共训)⭐ XR 眼镜 + 互联网级被动数据 / VLA

EgoMimic 是「机器人数据被动扩展」路线的标志性工作。它的论点——把人手视频当作另一种 embodiment 平等共训(而非辅助规划)——为后续「戴智能眼镜采数据」的范式打下了地基。随着 Project Aria 等设备的普及,这条路线被认为是通向「互联网规模机器人数据」的现实路径。关联:ACT/ALOHA(共训基座)、Diffusion Policy

❓ 常见误区

它是不是就是「拿人手视频预训练视觉编码器」?

不是。预训练视觉表征(如 R3M、VIP)只用人视频学视觉,动作还是机器人自己学。EgoMimic 把人手 3D 轨迹作为 action 监督直接灌进策略——人手数据同时教「看」和「动」。这是它和 R3M 类工作的本质区别。

为什么要做 SAM 遮罩?把人手遮了不就丢信息了吗?

遮的是「本体外观」(人手 vs 机械臂),但红线方向指示保留了末端朝向。这么做是为了强迫网络学「场景 → 该往哪动」的几何关系,而不是「这只好手/这只机械臂」长什么样。消融显示去掉红线(保留遮罩)掉 16 分(128→112),再去掉遮罩再掉 17 分(112→95)——视觉对齐确实有用。

「1 小时人手 ≫ 1 小时机器人」是真的吗?

是真的,且原因直接:1 小时人手采 1400 条 demo,1 小时机器人只采 135 条(差 10×,因为人动作快、不用 reset)。在人手数据上训到的 Bowl 任务分数(128)显著高于等量机器人数据(74)。这就是「被动+可扩展」数据源的红利。

它和「cross-embodiment」(RT-X)是什么关系?

理念一致——把不同本体当作 transfer learning 问题。RT-X 跨的是不同机器人,EgoMimic 跨的是人 ↔ 机器人。论文明确说:「人数据应当被视为 transfer learning 中的另一种 embodiment」。可以认为它是 cross-embodiment 在「人机」方向上的极端案例。