枢纽
机器人Franka Emika Panda
数据集Ego4D
上真机
实时
输入模态vision

R3M:从「人类第一人称视频」学一个机器人通用的视觉编码器

Suraj Nair, Aravind Rajeswaran, Vikash Kumar, Chelsea Finn, Abhinav Gupta(Stanford + Meta AI)。CoRL 2022。 项目页 · 全开源 · foundation_models视觉预训练 × 机器人

🧠 一句话心智模型:CV 有 ImageNet、NLP 有 BERT,机器人有什么?没数据。但 YouTube 有海量「人做饭、人折衣服、人开抽屉」的第一人称视频——R3M 把 Ego4D(3500 小时)当成「机器人的 ImageNet」,用「时间对比 + 语言对齐 + L1 稀疏」三个目标预训练一个 ResNet,冻结后插到任何机器人策略前面,下游 20 个 demo 就能学新任务。

🎯 为什么重要:机器人的「ImageNet 时刻」

CV/NLP 早就不从零训练了——大家都下载一个 ImageNet/BERT 预训练模型,再小样本微调。但机器人一直困在「tabula rasa」(白板)范式:每个新任务从零训一个端到端网络,需要海量同域数据。

核心问题:为什么机器人没有「ImageNet」?因为机器人数据本身稀缺——采集成本高,已有数据集(RoboNet、Bridge 等)任务少、环境单一。
R3M 的转向:既然「机器人数据」稀缺,那就用「人类活动视频」。Ego4D 是 Meta 采集的第一人称视频,覆盖全球 70+ 地点、从做饭到组装家具的各种任务。虽然躯体不同(人是肉手,机器人是夹爪),但「场景的视觉结构 + 物体交互语义」是共通的。

这个「用人类视频给机器人做预训练」的思路,在 2022 年是个小赌注——R3M 用实验证明了它可行。两年后,它成了 RT-2 / π0 / Octo 这类 VLA 模型的基本前提:大规模人类/互联网视频就是机器人的「预训练语料」。

💡 核心思想:好表示 = 时序 + 语义 + 紧凑

R3M 对「什么才算好的机器人视觉表示」给了三条规定,每条对应一个训练目标:

Ego4D 第一人称视频 3500 小时,70+ 地点 配语言描述 三元组采样 [I_i, I_j>i, I_k>j] ResNet-50 F_φ 视觉编码器 输出 2048 维 ① 时间对比损失 L_tcn 时间近的帧嵌入更近,远的/不同视频的更远 → 捕捉时序动力学 ② 视频-语言对齐 L_language G_θ(I_0, I_i, l) 给「起止帧+语言」打分 → 捕捉语义相关性(苹果、盘子…) ③ L1 / L2 稀疏正则 惩罚嵌入的 L1/L2 范数 紧凑,缓解 imitation 的 state drift 总损失 L = λ₁ L_tcn + λ₂ L_language + λ₃ ||F_φ(I)||_1 + λ₄ ||F_φ(I)||_2 冻结后:z_t = F_φ(I_t) 直接拼到机器人策略 π 输入
图 1:R3M 训练目标。Ego4D 视频帧 → ResNet-50 → 三个目标联合训练。冻结后作为机器人策略的视觉前端。

三个目标对应三种「好表示」的特性,论文消融证明缺一不可——尤其是语言对齐,去掉后效果掉得最狠(53.2% vs 62.4%)。

🛠️ 怎么用:冻结 R3M + 简单 BC = 少样本学新任务

步骤心智关键细节
① 下载 R3M 权重提供 ResNet-18 / 34 / 50 三种规模开箱即用,不微调;作为「机器人的 ImageNet」
② 拼接状态状态 = 视觉嵌入 ⊕ 本体感觉 [z_t, p_t]z_t 来自冻结 R3M;p_t 是关节位置/速度
③ 训练 BC 策略2 层 MLP + 输入 BatchNorm,监督:||a_t − π([z_t, p_t])||²训练 20000 步,每 1000 步评测,取最佳
④ 在线评测3 个 seed × 多视角 × 多数据量12 任务、9 视角、3 数据规模(5/10/25 或 25/50/100 demo)
🔮 直觉:为什么「冻结」反而比「微调」好?
低数据 regime(20 demo)下,微调整个视觉编码器 = 过拟合——网络会把编码器扭到只认识这 20 个 demo 的样子。冻结 R3M = 强制它用「从人类视频学到的通用先验」看世界,让 BC 只学「从通用感知到动作」这层映射。这也是为什么 L1 稀疏有用——降有效维度,缓解 state drift。

📊 结果:仿真 +10%,真机翻倍

评测设置关键数字
仿真总体12 任务 × 9 视角 × 3 数据量R3M ~62%;vs 从零训 +20%;vs CLIP/MoCo +10%
数据 vs 算法(Franka Kitchen)同 Ego4D 数据R3M 53.1%;MoCo-Ego4D 42.0%;MVP(更多数据/算力)27.0%
数据 vs 算法(Adroit)同 Ego4D 数据R3M 65.0%;MoCo-Ego4D 54.9%;MVP 51.4%
消融:去语言对齐Table 162.4% → 53.2%(最大跌幅,语言最关键)
消融:去 L1 稀疏Table 162.4% → 59.4%(L1 在 Kitchen/MetaWorld 有用,但去掉后 Adroit 反而略涨)
消融:去数据增广Table 162.4% → 60.4%
真机(Franka 在公寓,20 demo/任务)5 个家务任务R3M 平均 56%;CLIP 平均 24%(接近翻倍)
真机任务R3MCLIP
关抽屉80%70%
把口罩放进抽屉30%10%
把生菜放进锅60%0%
把杯子推到目标70%40%
折毛巾40%0%
平均56%24%
关键洞察:在「把生菜放进锅」「折毛巾」这种需要精细视觉的任务上,CLIP 直接 0%——CLIP 学到的是「这是生菜」的分类语义,但策略需要的是「生菜在桌上的哪个位置、形状如何」的几何感知。R3M 因为有时间对比 + L1 稀疏,更「贴近控制」。
另一个值得注意:即使去掉了语言对齐(R3M-Lang),R3M 仍超过 CLIP/MoCo——光靠「Ego4D 视频 + 时间对比」就已经赢了,语言只是锦上添花。

🌐 在领域中的位置

从零训练(端到端 RL/IL) ImageNet/MoCo/CLIP 特征(静态图像) R3M(人类第一人称视频预训练)⭐ Voltron / MVP(更大数据 + 文本) Octo / RT-2 / π0(VLA 端到端)

R3M 是「用人类视频给机器人做视觉预训练」这条路线的奠基作之一。它和同期的 Voltron(语言+视频)、MVP(MAE 自监督)一起,把「机器人感知模块从零训」的范式打破了。虽然两年后 VLA(RT-2、π0)把视觉和策略一起塞进 Transformer、不再需要单独的「视觉前端」,但 R3M 留下的洞察仍然有效:(1) 第一人称视频是天然的机器人语料;(2) 时序对比 > 单帧对比;(3) 语言对齐带来语义先验。

❓ 常见误区

人类视频和机器人形态差这么多,预训练能管用?

能。R3M 学的不是「怎么动手」,而是「视觉场景里什么重要」——物体位置、关系、动作语义。这些和躯体无关。论文用 MoCo-Ego4D(同数据、不同算法)做对照:R3M 比 MoCo-Ego4D 高 10%,说明学到的视觉先验能跨躯体迁移

R3M 是 VLA 吗?

不是。R3M 只是视觉前端,输出 2048 维特征向量;策略还是单独训的 BC MLP。VLA(RT-2、π0)是把视觉、语言、动作一起塞进一个大 Transformer 端到端训。R3M 是「分层派」的产物——视觉/策略各管各的。它对应的是 2022 年的主流设计,今天看来已经过时,但其核心 insight「人类视频是好语料」被 VLA 完全继承。

为什么语言对齐最重要?

消融里去掉语言掉 9%,去掉 L1 只掉 3%。作者的解释:语言对齐强迫表示编码「苹果、盘子、抽屉」这种物体语义,而 imitation learning 的任务大多和物体识别强相关。这也预示了后来的 VLA —— 语言是视觉表示的最强监督信号之一

它能用于 RL 吗?

论文明确说没测。IL(behavior cloning)和 RL 对表示的需求可能不同——RL 还要支持 value function 的稳定性、exploration 的可分性等。这是论文列出的主要局限。后续工作(如 CPI、Voltron-RL)补了这部分实验。