VC-1:给 Embodied AI 找一个「人工视觉皮层」——还没有
🎯 为什么重要:第一个「全谱系」的 PVR 体检
「视觉预训练表征(PVR)能不能给机器人用」是个老问题。但之前的工作各说各话——R3M 在 Franka 上说有效,MVP 在桌面上说有效,但用的是不同的算法、不同的数据、不同的下游评测。结果就是:没人知道哪个 PVR 真的强。
破局:本文建立 CORTEXBENCH——17 个任务,覆盖移动 / 导航 / 桌面操作 / 灵巧操作 / 移动操作,5 种本体(机械臂、灵巧手、人形/四足、移动机器人),从平坦平面到照片级真实扫描,从 few-shot IL 到大规模 RL。第一次让「视觉皮层」有了一个客观考场。
💡 核心方法:MAE 在「ego 视频 + ImageNet」上做扩展律实验
本文不是提出新算法——他们明确说「本文不提出新技术」(Abstract)。他们用现有的 MAE(Masked Auto-Encoding),在精心组合的数据集上做扩展律研究,再 open-source 出最大的模型 VC-1。
🛠️ 四个关键发现(数字都来自原文 Tab.2/Tab.4/Tab.5)
| 发现 | 具体证据 | 含义 |
|---|---|---|
| ① 「人工视觉皮层」还不存在 | 17 任务里,没有任何 PVR 通吃:R3M 赢 Adroit/MetaWorld/DMControl;MVP (ViT-L) 赢 TriFinger/ImageNav/Mobile Pick;CLIP 赢 ObjectNav(Tab.2) | 不同任务对「视觉特征」的需求不一样;预训练目标和数据决定了它在哪类任务上强 |
| ② 扩展律「平均有效,个案不保证」 | ViT-B→ViT-L、Ego4D→Ego4D+MNI 平均分都涨;但Mobile Pick 的最优是只训 Ego4D+M(不包含导航/ImageNet),ImageNav 最优是 Ego4D+N(§5.2) | 推翻了「数据越多越多样就越好」的朴素推论——数据「相关性」比「数量」更重要 |
| ③ VC-1 = 当前最强「平均」PVR | 平均 68.7%,比 MVP(ViT-L) +1.2、R3M +10.7、CLIP +11.7、随机 fine-tune +19.6(Tab.4 row 11) | 平均最优 ≠ 任意任务最优;但作为「新任务的起点」最稳 |
| ④ 适配 VC-1 后能在所有任务追平 SOTA | MAE 适配在 few-shot IL 任务上大涨(MetaWorld 88.8→96.0、TriFinger 71.7→80.6);E2E 在大规模 RL 任务上涨(ImageNav 70.3→81.6、Mobile Pick 63.2→74.0)(Tab.5) | 「通用预训练 + 任务适配」是当前最实际的范式 |
E2E fine-tune 把 307M 参数的 ViT-L 在 ≤50K 帧的专家数据上整个重训——过拟合(Adroit 59.3→15.9、DMControl 66.9→6.7)。而 MAE 适配是用同样数据做无监督续训(不接任务 loss),相当于把 backbone 的特征分布「拉近到下游域」,再冻结训策略——既能补 domain gap,又不被小数据带偏。这个对比是本文最实操的发现:小数据用 SSL 适配,大数据才用 E2E。
📊 关键数字(PDF 溯源)
| 维度 | 数字 |
|---|---|
| Benchmark | CORTEXBENCH:7 个 benchmark 类,17 个任务(Adroit / MetaWorld / DMControl 5 任务 / TriFinger / ObjectNav / ImageNav / Mobile Pick)(§4, Tab.1) |
| 预训练数据 | 7 源 ego 视频(4000+ 小时)+ ImageNet;最大组合 Ego4D+MNI = 5.6M 帧(Tab.3) |
| VC-1 配置 | ViT-L (307M) + MAE;10000+ GPU 小时;开源 |
| VC-1 平均成功率 | 68.7%(Tab.4 row 11);平均排名 2.4(最低=最好) |
| vs CLIP | VC-1 在每一个 benchmark 上都赢 CLIP,尽管训练数据小 70×(§5.3) |
| 硬件真机 | Franka few-shot IL:VC-1 70.0% vs MVP 55.0%(+15);MAE 适配后 85.0%(Tab.5) |
| TriFinger Push-Cube(真机) | VC-1 45.8% vs MVP 31.9%(+13.9)(Tab.5) |
| 适配后 vs best prior | VC-1(适配)在所有 CORTEXBENCH 任务上 competitive or superior(§6) |
🌐 在领域中的位置
VC-1 是具身 AI 视觉预训练的「清流」——它不喊 SOTA,而是诚实地用最大规模评测说「我们还没到」。它的负面结论(没有通用 PVR)影响了后续路线选择:社区开始转向「视觉+语言+动作」联合的 VLA 范式(RT-2、OpenVLA、π0),而不是继续追求纯视觉 PVR。关联:Q-Transformer、VC-1 同期 foundation_models 路线。
❓ 常见误区
VC-1 是个新算法吗?为什么 abstract 说「presents no new techniques」?
不是新算法。MAE 是 He et al. 2021 的工作,ViT 是 Dosovitskiy 2020 的,数据集也都是已有的(Ego4D、ImageNet 等)。本文的贡献是「评测 + 扩展律研究 + 开源模型」——把现有零件组合起来,跑 10000+ GPU 小时的系统实验,给出可信结论。这种「不提出新算法但有重大影响」的实证研究在科学上极其重要。
「平均最强」但「不通用」,那 VC-1 有什么用?
有两个明确价值:(1) 作为新任务的默认起点——遇到新的 EAI 任务,先用 VC-1 frozen 试,往往就是最强 baseline;(2) 开源后供社区 fine-tune——很多后续工作直接拿 VC-1 做视觉 backbone。论文明确把它定位为「starting point」而不是终点。
它和 R3M / MVP 这些被比较的 PVR 是什么关系?
它们是评测对象。R3M 用时间对比 + video-language + L1 稀疏,ResNet-50 骨干,在操作任务上强;MVP 用 MAE 在 4.5M ego 帧上训,ViT 骨干,在导航 + TriFinger 上强;CLIP 用 400M 图文对监督,在 ObjectNav 上强。VC-1 把这些放同一考场上,证明「不同任务的王者不同」——这正是它最大的发现。
既然 VC-1 平均最强,为什么后续 VLA 不直接用 VC-1?
因为本文的「负面结论」指出:纯视觉 PVR 不够。后续 VLA(RT-2、OpenVLA、π0)走的是「视觉 + 语言 + 动作」端到端联合训练的路,把视觉表征、语言理解、动作生成绑在一起学——这是对 VC-1「没有通用视觉皮层」结论的直接回应。VC-1 的失败(在通用意义上)反而推动了 VLA 路线的兴起。