里程碑
机器人WidowX/Franka
数据集OpenX (970k trajectories)
上真机
实时
输入模态vision,language

OpenVLA:把 Google 藏起来的 VLA,开源做到 1/8 大还更强

Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti 等(Stanford + UC Berkeley + TRI + Google DeepMind + Physical Intelligence + MIT)。arXiv:2406.09246,2024 年 6 月。 项目页 · 全开源(权重 + 数据 + 代码)· VLAfoundation_models线索 T02

🧠 一句话心智模型:RT-2 系列(55B、闭源、只 Google 自己用)让全世界知道 VLA 路线可行,但大家用不上。OpenVLA 干了两件事:① 把 VLA 从 55B 缩到 7B,让你能在一块 RTX 4090 上跑;② 全开源——权重、训练代码、数据混合配方、微调 notebook 一把梭。结果:参数少约 7×,在 29 个任务上还反超 RT-2-X 16.5%。这是 VLA「飞入寻常百姓家」的拐点。

🎯 为什么重要:闭源 VLA 把整个领域卡住了

RT-2 / RT-2-X 证明了 VLA 是机器人基础模型的方向。但它有两个致命问题:

闭源 VLA 的两大壁垒
不可访问:模型权重不公开、架构细节含糊、数据混合配方保密——其他实验室无法复现、无法改进
无法微调:只有 Google 自己的 TPU 上能跑,外部研究者拿到自己的 Franka 机器人也无法快速适配。社区不能贡献 → 进展被 Google 节奏锁死。

对比 NLP / CV:Llama 之类的开源 LLM 让全世界都能微调、改进、做下游应用,生态才滚起来。OpenVLA 要做的就是给机器人界一个 VLA 版的 Llama

核心叩问:能不能用更小的开源骨干(Llama 2 7B)+ 更精心准备的数据 + 更好的视觉编码,做出一个 7B 参数、消费级 GPU 可跑、还更强的 VLA?

💡 核心思想:用"双视觉编码器 + 优质数据 + 精简骨干"打赢 55B

OpenVLA 的架构看似朴素,但每个组件都经过了精心选择。关键洞察:不是参数越大越好,而是"视觉特征质量 + 数据多样性"决定上限

输入图像 224 × 224 语言指令 "put eggplant in bowl" SigLIP 高层语义 DINOv2 低层空间 通道拼接 MLP Projector 视觉特征 → 语言嵌入空间 Llama 2 (7B) 语言模型主干 "What should the robot do to {task}?" → 输出 7 个动作 token 256 bin × 7 维 Action De-Tokenizer 7 个 token → Δx, Δy, Δz, Δroll, Δpitch, Δyaw, Δgrip 用 1%-99% 分位数定 bin 边界(比 RT-2 的 min-max 更鲁棒)
图 1:OpenVLA 架构。三个核心组件:① 双视觉编码器(SigLIP + DINOv2)② MLP 投影 ③ Llama 2 7B 主干。结构简单,但每个组件都有讲究。

🛠️ 让 7B 打赢 55B 的 5 个"反直觉"设计决定

OpenVLA 团队做了大量小规模消融(在 BridgeData V2 上),发现很多"VLM 经验"在 VLA 上不成立。这些反直觉的发现是论文最有价值的部分:

设计VLM 上的常识VLA 上的真相
① 双视觉编码器
(SigLIP + DINOv2)
通常一个 SigLIP/CLIP 就够DINOv2 提供低层空间细节对精确控制关键。LLaVA 比 IDEFICS-1 +35%(5 个多物体语言定位任务平均);加上 DINOv2 的 Prismatic 再 +10%(单/多物体各类任务平均)
② 视觉编码器要解冻冻结视觉编码器更稳,保留预训练特征VLA 必须微调视觉编码器——预训练特征不够精细到能做机器人级别的空间判断
③ 训练 27 个 epochLLM/VLM 最多 1-2 epoch 怕过拟合VLA 需要反复看数据,性能持续涨到 action token accuracy 超过 95% 才停
④ 224×224 就够VLM 上更高分辨率更好VLA 上 384×384 没提升,但训练慢 3 倍。224 是性价比最优
⑤ 1%-99% 分位数定 binRT-2 用 min-max 边界用分位数忽略离群动作,避免 bin 被极端值拉宽、有效精度下降
🔮 直觉:为什么"双视觉编码器"是关键?
SigLIP 像"懂概念的语义眼"——能认出"这是茄子、那是碗",但看不出茄子确切位置和形状细节。DINOv2 像"几何眼"——空间结构敏感,但不知道物体叫什么。两者拼接(通道维 concat)= 既有语义识别又有空间精度,正好是机器人抓取需要的。论文消融显示:去掉 DINOv2 后性能下降约 5%(影响不如数据多样性大)。

此外,OpenVLA 还把"高效微调"做成了 VLA 的标配

高效适配技术效果
LoRA(低秩适配)只训练 1.4% 参数,消费级 GPU 就能微调 7B VLA
量化(quantization)模型显存从 16.8GB 压到 7.0GB(int4,约 42%),性能不掉。可装进更小 GPU
开源代码库FSDP + FlashAttention + AMP,从单 GPU 微调到多节点训练无缝切换

📊 结果:7B 打赢 55B,全面领先闭源模型

训练细节:970k 轨迹(来自 OpenX),64 块 A100 训 14 天 = 21,500 A100-hours,batch size 2048。推理:15GB 显存(bfloat16),RTX 4090 上 ~6 Hz。

评估RT-1-X (35M)Octo (93M)RT-2-X (55B, 闭源)OpenVLA (7B)
BridgeData V2(WidowX,17 任务 × 10 trial)挣扎挣扎整体最强,反超 RT-2-X
Google Robot(12 任务 × 5 trial)持平 RT-2-X
29 任务总平均基线+16.5% 绝对成功率提升

数据高效微调上,OpenVLA 也是默认最优选择(Franka 7 任务,10-150 演示):

方法单指令窄任务多指令宽任务视觉鲁棒性总评
Diffusion Policy(from scratch)窄任务优势
Octo 微调中等
OpenVLA 微调总平均最高,唯一在所有任务 ≥ 50%
对比维度数字
vs RT-2-X (55B)+16.5% 绝对成功率,7× 更少参数
vs Diffusion Policy(多指令任务)+20.4%
LoRA 微调显存消费级 GPU 可跑(无需 A100)
推理速度~6 Hz on RTX 4090,15GB 显存
训练规模64×A100 × 14 天 = 21,500 A100-hours
关键洞察:OpenVLA 证明 VLA 的天花板不是"参数够不够大",而是"视觉特征质量 + 数据多样性 + 训练细节"。一个 7B 模型,用对的组件、对的数据、对的训练长度,就能反超 8 倍大的闭源模型。这让 VLA 研究从"只有大厂能玩"变成"任何实验室都能玩"。

🌐 在领域中的位置

RT-2 / RT-2-X(55B,闭源,VLA 范式确立) Octo(开源 generalist,但非 VLM 骨干) OpenVLA(7B 开源 VLA,反超闭源 55B)⭐ π0 / RDT-1B(更大规模 + diffusion action head)

OpenVLA 是VLA 民主化的里程碑。它的开源让全世界实验室都能在 VLA 上做研究——改进架构、试新数据、做下游适配。后续大量工作(包括 CogACT、π0 等)直接基于 OpenVLA 改造。关联线索:T06 基础模型谱系

❓ 常见误区

OpenVLA 比 RT-2-X 更小又更强,是不是说 Google 路线错了?

不是。OpenVLA 站在 RT-2-X 肩膀上:用了 OpenX 数据集(RT-X 项目成果)、继承了 RT-2 的"动作即 token"范式、还在 Google DeepMind 的合作下完成。OpenVLA 的进步来自更精心的数据清洗 + 双视觉编码器 + 更多训练 epoch,不是否定 RT-2-X,而是"在正确范式上做工程优化"。

为什么 OpenVLA 比 Diffusion Policy 强?是不是 Diffusion Policy 过时了?

不是——两者优势不同。Diffusion Policy 在窄任务、单指令、需要精细动作(如精确倒水)上仍然更强。OpenVLA 在多任务、多指令、需要语言理解和泛化上更强。论文明确说:Diffusion Policy 轨迹更平滑、精细,OpenVLA 可以借鉴它的 action chunking 和时序平滑。

7B 还是不小,能在树莓派上跑吗?

不能直接跑。但量化后(int4)显存压到约 7GB(bfloat16 为 16.8GB),配合 LoRA 微调可以在消费级 GPU(如 RTX 4090 / RTX 3090)上跑 6 Hz。论文还提供了远程推理服务方案——机器人本地只需要薄客户端,模型在 GPU 服务器上跑。完全边缘部署仍是开放问题。

为什么用 Llama 2 而不是更新的 Llama 3?

论文发表于 2024 年 6 月,那时的 Prismatic-7B VLM 基于 Llama 2。后续工作(如 OpenVLA-OFT 等)已经在用更新的 LLM 骨干。OpenVLA 的核心贡献是开源 VLA 范式,骨干可以随时升级。