R3M:从「人类第一人称视频」学一个机器人通用的视觉编码器
🎯 为什么重要:机器人的「ImageNet 时刻」
CV/NLP 早就不从零训练了——大家都下载一个 ImageNet/BERT 预训练模型,再小样本微调。但机器人一直困在「tabula rasa」(白板)范式:每个新任务从零训一个端到端网络,需要海量同域数据。
R3M 的转向:既然「机器人数据」稀缺,那就用「人类活动视频」。Ego4D 是 Meta 采集的第一人称视频,覆盖全球 70+ 地点、从做饭到组装家具的各种任务。虽然躯体不同(人是肉手,机器人是夹爪),但「场景的视觉结构 + 物体交互语义」是共通的。
这个「用人类视频给机器人做预训练」的思路,在 2022 年是个小赌注——R3M 用实验证明了它可行。两年后,它成了 RT-2 / π0 / Octo 这类 VLA 模型的基本前提:大规模人类/互联网视频就是机器人的「预训练语料」。
💡 核心思想:好表示 = 时序 + 语义 + 紧凑
R3M 对「什么才算好的机器人视觉表示」给了三条规定,每条对应一个训练目标:
三个目标对应三种「好表示」的特性,论文消融证明缺一不可——尤其是语言对齐,去掉后效果掉得最狠(53.2% vs 62.4%)。
🛠️ 怎么用:冻结 R3M + 简单 BC = 少样本学新任务
| 步骤 | 心智 | 关键细节 |
|---|---|---|
| ① 下载 R3M 权重 | 提供 ResNet-18 / 34 / 50 三种规模 | 开箱即用,不微调;作为「机器人的 ImageNet」 |
| ② 拼接状态 | 状态 = 视觉嵌入 ⊕ 本体感觉 [z_t, p_t] | z_t 来自冻结 R3M;p_t 是关节位置/速度 |
| ③ 训练 BC 策略 | 2 层 MLP + 输入 BatchNorm,监督:||a_t − π([z_t, p_t])||² | 训练 20000 步,每 1000 步评测,取最佳 |
| ④ 在线评测 | 3 个 seed × 多视角 × 多数据量 | 12 任务、9 视角、3 数据规模(5/10/25 或 25/50/100 demo) |
低数据 regime(20 demo)下,微调整个视觉编码器 = 过拟合——网络会把编码器扭到只认识这 20 个 demo 的样子。冻结 R3M = 强制它用「从人类视频学到的通用先验」看世界,让 BC 只学「从通用感知到动作」这层映射。这也是为什么 L1 稀疏有用——降有效维度,缓解 state drift。
📊 结果:仿真 +10%,真机翻倍
| 评测 | 设置 | 关键数字 |
|---|---|---|
| 仿真总体 | 12 任务 × 9 视角 × 3 数据量 | R3M ~62%;vs 从零训 +20%;vs CLIP/MoCo +10% |
| 数据 vs 算法(Franka Kitchen) | 同 Ego4D 数据 | R3M 53.1%;MoCo-Ego4D 42.0%;MVP(更多数据/算力)27.0% |
| 数据 vs 算法(Adroit) | 同 Ego4D 数据 | R3M 65.0%;MoCo-Ego4D 54.9%;MVP 51.4% |
| 消融:去语言对齐 | Table 1 | 62.4% → 53.2%(最大跌幅,语言最关键) |
| 消融:去 L1 稀疏 | Table 1 | 62.4% → 59.4%(L1 在 Kitchen/MetaWorld 有用,但去掉后 Adroit 反而略涨) |
| 消融:去数据增广 | Table 1 | 62.4% → 60.4% |
| 真机(Franka 在公寓,20 demo/任务) | 5 个家务任务 | R3M 平均 56%;CLIP 平均 24%(接近翻倍) |
| 真机任务 | R3M | CLIP |
|---|---|---|
| 关抽屉 | 80% | 70% |
| 把口罩放进抽屉 | 30% | 10% |
| 把生菜放进锅 | 60% | 0% |
| 把杯子推到目标 | 70% | 40% |
| 折毛巾 | 40% | 0% |
| 平均 | 56% | 24% |
另一个值得注意:即使去掉了语言对齐(R3M-Lang),R3M 仍超过 CLIP/MoCo——光靠「Ego4D 视频 + 时间对比」就已经赢了,语言只是锦上添花。
🌐 在领域中的位置
R3M 是「用人类视频给机器人做视觉预训练」这条路线的奠基作之一。它和同期的 Voltron(语言+视频)、MVP(MAE 自监督)一起,把「机器人感知模块从零训」的范式打破了。虽然两年后 VLA(RT-2、π0)把视觉和策略一起塞进 Transformer、不再需要单独的「视觉前端」,但 R3M 留下的洞察仍然有效:(1) 第一人称视频是天然的机器人语料;(2) 时序对比 > 单帧对比;(3) 语言对齐带来语义先验。
❓ 常见误区
人类视频和机器人形态差这么多,预训练能管用?
能。R3M 学的不是「怎么动手」,而是「视觉场景里什么重要」——物体位置、关系、动作语义。这些和躯体无关。论文用 MoCo-Ego4D(同数据、不同算法)做对照:R3M 比 MoCo-Ego4D 高 10%,说明学到的视觉先验能跨躯体迁移。
R3M 是 VLA 吗?
不是。R3M 只是视觉前端,输出 2048 维特征向量;策略还是单独训的 BC MLP。VLA(RT-2、π0)是把视觉、语言、动作一起塞进一个大 Transformer 端到端训。R3M 是「分层派」的产物——视觉/策略各管各的。它对应的是 2022 年的主流设计,今天看来已经过时,但其核心 insight「人类视频是好语料」被 VLA 完全继承。
为什么语言对齐最重要?
消融里去掉语言掉 9%,去掉 L1 只掉 3%。作者的解释:语言对齐强迫表示编码「苹果、盘子、抽屉」这种物体语义,而 imitation learning 的任务大多和物体识别强相关。这也预示了后来的 VLA —— 语言是视觉表示的最强监督信号之一。
它能用于 RL 吗?
论文明确说没测。IL(behavior cloning)和 RL 对表示的需求可能不同——RL 还要支持 value function 的稳定性、exploration 的可分性等。这是论文列出的主要局限。后续工作(如 CPI、Voltron-RL)补了这部分实验。