枢纽
数据集CortexBench
上真机
实时
输入模态vision

VC-1:给 Embodied AI 找一个「人工视觉皮层」——还没有

Arjun Majumdar, Karmesh Yadav, Sergio Arnaud 等(Meta AI + Georgia Tech + UPenn + Stanford + UC Berkeley)。arXiv:2303.18240, 2023。 项目页 · 开源模型(10000+ GPU 小时)· foundation_models视觉预训练

🧠 一句话心智模型:CV 里有 ImageNet 预训练,NLP 里有 BERT——机器人视觉的「通用预训练表征」到底有没有?这篇论文做了一次最全的体检:拉了 17 个任务(CORTEXBENCH),把当时所有 PVR(R3M/MVP/CLIP/VIP)放一起测。结论很冷静:「人工视觉皮层」还不存在——没有任何一个模型能通吃所有任务。但他们训出的 VC-1(MAE + 5.6M 帧 ego 视频 + ViT-L)平均分最高适配后能在所有任务上比肩或超过专门 SOTA。

🎯 为什么重要:第一个「全谱系」的 PVR 体检

「视觉预训练表征(PVR)能不能给机器人用」是个老问题。但之前的工作各说各话——R3M 在 Franka 上说有效,MVP 在桌面上说有效,但用的是不同的算法、不同的数据、不同的下游评测。结果就是:没人知道哪个 PVR 真的强

核心矛盾:要做通用 PVR,先得有「跨任务、跨场景、跨本体」的评测。不然每篇论文都在自己挑的几个任务上「自称 SOTA」,社区没法判断进展。
破局:本文建立 CORTEXBENCH——17 个任务,覆盖移动 / 导航 / 桌面操作 / 灵巧操作 / 移动操作,5 种本体(机械臂、灵巧手、人形/四足、移动机器人),从平坦平面到照片级真实扫描,从 few-shot IL 到大规模 RL。第一次让「视觉皮层」有了一个客观考场。
CORTEXBENCH 17 任务 · 7 类 benchmark Locomotion DMControl (5 任务) Navigation ImageNav / ObjectNav Dexterous Adroit Manipulation TriFinger Mobile Manip Habitat 2.0 Pick Tabletop MetaWorld (Sawyer)
图 1:CORTEXBENCH 把机器人学最主流的几大任务类型(locomotion / navigation / 桌面操作 / 灵巧操作 / 移动操作)整合到一个统一评测里——这是「人工视觉皮层」第一次有客观考场。

💡 核心方法:MAE 在「ego 视频 + ImageNet」上做扩展律实验

本文不是提出新算法——他们明确说「本文不提出新技术」(Abstract)。他们用现有的 MAE(Masked Auto-Encoding),在精心组合的数据集上做扩展律研究,再 open-source 出最大的模型 VC-1。

7 个数据源 Ego4D + 100DOH + SS-v2 + Epic Kitchens (操作) + RealEstate10K + OpenHouse24 (导航) + ImageNet 4000+ 小时 ego 视频 5 个数据组合 最大 5.6M 帧 MAE 预训练 Mask 75% patches 重建像素 ViT-B (86M) / ViT-L (307M) 10000+ GPU 小时 VC-1 ViT-L Ego4D+MNI 5.6M 帧 平均 68.7% (best) 下游适配 E2E fine-tune (导航/移动操作) MAE 续训 (小样本 IL) → 任务 SOTA
图 2:VC-1 的训练 + 适配流程。核心是「MAE 在组合的 ego 数据上预训练」+「下游两种适配方式」。本文真正贡献的不是算法,而是系统评测开放模型

🛠️ 四个关键发现(数字都来自原文 Tab.2/Tab.4/Tab.5)

发现具体证据含义
① 「人工视觉皮层」还不存在17 任务里,没有任何 PVR 通吃:R3M 赢 Adroit/MetaWorld/DMControl;MVP (ViT-L) 赢 TriFinger/ImageNav/Mobile Pick;CLIP 赢 ObjectNav(Tab.2)不同任务对「视觉特征」的需求不一样;预训练目标和数据决定了它在哪类任务上强
② 扩展律「平均有效,个案不保证」ViT-B→ViT-L、Ego4D→Ego4D+MNI 平均分都涨;但Mobile Pick 的最优是只训 Ego4D+M(不包含导航/ImageNet),ImageNav 最优是 Ego4D+N(§5.2)推翻了「数据越多越多样就越好」的朴素推论——数据「相关性」比「数量」更重要
③ VC-1 = 当前最强「平均」PVR平均 68.7%,比 MVP(ViT-L) +1.2、R3M +10.7、CLIP +11.7、随机 fine-tune +19.6(Tab.4 row 11)平均最优 ≠ 任意任务最优;但作为「新任务的起点」最稳
④ 适配 VC-1 后能在所有任务追平 SOTAMAE 适配在 few-shot IL 任务上大涨(MetaWorld 88.8→96.0、TriFinger 71.7→80.6);E2E 在大规模 RL 任务上涨(ImageNav 70.3→81.6、Mobile Pick 63.2→74.0)(Tab.5)「通用预训练 + 任务适配」是当前最实际的范式
🔮 直觉:为什么 E2E 在小样本 IL 上反而掉分,MAE 适配却涨?
E2E fine-tune 把 307M 参数的 ViT-L 在 ≤50K 帧的专家数据上整个重训——过拟合(Adroit 59.3→15.9、DMControl 66.9→6.7)。而 MAE 适配是用同样数据做无监督续训(不接任务 loss),相当于把 backbone 的特征分布「拉近到下游域」,再冻结训策略——既能补 domain gap,又不被小数据带偏。这个对比是本文最实操的发现:小数据用 SSL 适配,大数据才用 E2E

📊 关键数字(PDF 溯源)

维度数字
BenchmarkCORTEXBENCH:7 个 benchmark 类,17 个任务(Adroit / MetaWorld / DMControl 5 任务 / TriFinger / ObjectNav / ImageNav / Mobile Pick)(§4, Tab.1)
预训练数据7 源 ego 视频(4000+ 小时)+ ImageNet;最大组合 Ego4D+MNI = 5.6M 帧(Tab.3)
VC-1 配置ViT-L (307M) + MAE;10000+ GPU 小时;开源
VC-1 平均成功率68.7%(Tab.4 row 11);平均排名 2.4(最低=最好)
vs CLIPVC-1 在每一个 benchmark 上都赢 CLIP,尽管训练数据小 70×(§5.3)
硬件真机Franka few-shot IL:VC-1 70.0% vs MVP 55.0%(+15);MAE 适配后 85.0%(Tab.5)
TriFinger Push-Cube(真机)VC-1 45.8% vs MVP 31.9%(+13.9)(Tab.5)
适配后 vs best priorVC-1(适配)在所有 CORTEXBENCH 任务上 competitive or superior(§6)
关键洞察:本文最值得记的不是某个 SOTA 数字,而是三个「祛魅」结论:(1) 没有「人工视觉皮层」——通吃 PVR 不存在;(2) 扩展律不是万能——数据相关性 > 数据量;(3) 「通用预训练 + 任务适配」是当前最实际的工程范式。这三条对后续 robot 学习研究的影响比任何单点 SOTA 都大。

🌐 在领域中的位置

ImageNet 监督预训练(CV 老范式) CLIP / R3M / MVP / VIP(各 PVR 自称 SOTA,但各测各的) VC-1 + CORTEXBENCH(统一评测 + 平均最强 PVR)⭐ VLA / 通用具身基础模型(VC-1 反而说明:纯视觉 PVR 不够,要语言+动作)

VC-1 是具身 AI 视觉预训练的「清流」——它不喊 SOTA,而是诚实地用最大规模评测说「我们还没到」。它的负面结论(没有通用 PVR)影响了后续路线选择:社区开始转向「视觉+语言+动作」联合的 VLA 范式(RT-2、OpenVLA、π0),而不是继续追求纯视觉 PVR。关联:Q-TransformerVC-1 同期 foundation_models 路线。

❓ 常见误区

VC-1 是个新算法吗?为什么 abstract 说「presents no new techniques」?

不是新算法。MAE 是 He et al. 2021 的工作,ViT 是 Dosovitskiy 2020 的,数据集也都是已有的(Ego4D、ImageNet 等)。本文的贡献是「评测 + 扩展律研究 + 开源模型」——把现有零件组合起来,跑 10000+ GPU 小时的系统实验,给出可信结论。这种「不提出新算法但有重大影响」的实证研究在科学上极其重要。

「平均最强」但「不通用」,那 VC-1 有什么用?

有两个明确价值:(1) 作为新任务的默认起点——遇到新的 EAI 任务,先用 VC-1 frozen 试,往往就是最强 baseline;(2) 开源后供社区 fine-tune——很多后续工作直接拿 VC-1 做视觉 backbone。论文明确把它定位为「starting point」而不是终点。

它和 R3M / MVP 这些被比较的 PVR 是什么关系?

它们是评测对象。R3M 用时间对比 + video-language + L1 稀疏,ResNet-50 骨干,在操作任务上强;MVP 用 MAE 在 4.5M ego 帧上训,ViT 骨干,在导航 + TriFinger 上强;CLIP 用 400M 图文对监督,在 ObjectNav 上强。VC-1 把这些放同一考场上,证明「不同任务的王者不同」——这正是它最大的发现。 既然 VC-1 平均最强,为什么后续 VLA 不直接用 VC-1?

因为本文的「负面结论」指出:纯视觉 PVR 不够。后续 VLA(RT-2、OpenVLA、π0)走的是「视觉 + 语言 + 动作」端到端联合训练的路,把视觉表征、语言理解、动作生成绑在一起学——这是对 VC-1「没有通用视觉皮层」结论的直接回应。VC-1 的失败(在通用意义上)反而推动了 VLA 路线的兴起。