OpenVLA:把 Google 藏起来的 VLA,开源做到 1/8 大还更强
🎯 为什么重要:闭源 VLA 把整个领域卡住了
RT-2 / RT-2-X 证明了 VLA 是机器人基础模型的方向。但它有两个致命问题:
① 不可访问:模型权重不公开、架构细节含糊、数据混合配方保密——其他实验室无法复现、无法改进。
② 无法微调:只有 Google 自己的 TPU 上能跑,外部研究者拿到自己的 Franka 机器人也无法快速适配。社区不能贡献 → 进展被 Google 节奏锁死。
对比 NLP / CV:Llama 之类的开源 LLM 让全世界都能微调、改进、做下游应用,生态才滚起来。OpenVLA 要做的就是给机器人界一个 VLA 版的 Llama。
💡 核心思想:用"双视觉编码器 + 优质数据 + 精简骨干"打赢 55B
OpenVLA 的架构看似朴素,但每个组件都经过了精心选择。关键洞察:不是参数越大越好,而是"视觉特征质量 + 数据多样性"决定上限。
🛠️ 让 7B 打赢 55B 的 5 个"反直觉"设计决定
OpenVLA 团队做了大量小规模消融(在 BridgeData V2 上),发现很多"VLM 经验"在 VLA 上不成立。这些反直觉的发现是论文最有价值的部分:
| 设计 | VLM 上的常识 | VLA 上的真相 |
|---|---|---|
| ① 双视觉编码器 (SigLIP + DINOv2) | 通常一个 SigLIP/CLIP 就够 | DINOv2 提供低层空间细节对精确控制关键。LLaVA 比 IDEFICS-1 +35%(5 个多物体语言定位任务平均);加上 DINOv2 的 Prismatic 再 +10%(单/多物体各类任务平均) |
| ② 视觉编码器要解冻 | 冻结视觉编码器更稳,保留预训练特征 | VLA 必须微调视觉编码器——预训练特征不够精细到能做机器人级别的空间判断 |
| ③ 训练 27 个 epoch | LLM/VLM 最多 1-2 epoch 怕过拟合 | VLA 需要反复看数据,性能持续涨到 action token accuracy 超过 95% 才停 |
| ④ 224×224 就够 | VLM 上更高分辨率更好 | VLA 上 384×384 没提升,但训练慢 3 倍。224 是性价比最优 |
| ⑤ 1%-99% 分位数定 bin | RT-2 用 min-max 边界 | 用分位数忽略离群动作,避免 bin 被极端值拉宽、有效精度下降 |
SigLIP 像"懂概念的语义眼"——能认出"这是茄子、那是碗",但看不出茄子确切位置和形状细节。DINOv2 像"几何眼"——空间结构敏感,但不知道物体叫什么。两者拼接(通道维 concat)= 既有语义识别又有空间精度,正好是机器人抓取需要的。论文消融显示:去掉 DINOv2 后性能下降约 5%(影响不如数据多样性大)。
此外,OpenVLA 还把"高效微调"做成了 VLA 的标配:
| 高效适配技术 | 效果 |
|---|---|
| LoRA(低秩适配) | 只训练 1.4% 参数,消费级 GPU 就能微调 7B VLA |
| 量化(quantization) | 模型显存从 16.8GB 压到 7.0GB(int4,约 42%),性能不掉。可装进更小 GPU |
| 开源代码库 | FSDP + FlashAttention + AMP,从单 GPU 微调到多节点训练无缝切换 |
📊 结果:7B 打赢 55B,全面领先闭源模型
训练细节:970k 轨迹(来自 OpenX),64 块 A100 训 14 天 = 21,500 A100-hours,batch size 2048。推理:15GB 显存(bfloat16),RTX 4090 上 ~6 Hz。
| 评估 | RT-1-X (35M) | Octo (93M) | RT-2-X (55B, 闭源) | OpenVLA (7B) |
|---|---|---|---|---|
| BridgeData V2(WidowX,17 任务 × 10 trial) | 挣扎 | 挣扎 | 强 | 整体最强,反超 RT-2-X |
| Google Robot(12 任务 × 5 trial) | — | — | 强 | 持平 RT-2-X |
| 29 任务总平均 | 基线 | +16.5% 绝对成功率提升 | ||
在数据高效微调上,OpenVLA 也是默认最优选择(Franka 7 任务,10-150 演示):
| 方法 | 单指令窄任务 | 多指令宽任务 | 视觉鲁棒性 | 总评 |
|---|---|---|---|---|
| Diffusion Policy(from scratch) | 强 | 弱 | — | 窄任务优势 |
| Octo 微调 | 中 | 中 | 中 | 中等 |
| OpenVLA 微调 | 中 | 强 | 强 | 总平均最高,唯一在所有任务 ≥ 50% |
| 对比维度 | 数字 |
|---|---|
| vs RT-2-X (55B) | +16.5% 绝对成功率,7× 更少参数 |
| vs Diffusion Policy(多指令任务) | +20.4% |
| LoRA 微调显存 | 消费级 GPU 可跑(无需 A100) |
| 推理速度 | ~6 Hz on RTX 4090,15GB 显存 |
| 训练规模 | 64×A100 × 14 天 = 21,500 A100-hours |
🌐 在领域中的位置
OpenVLA 是VLA 民主化的里程碑。它的开源让全世界实验室都能在 VLA 上做研究——改进架构、试新数据、做下游适配。后续大量工作(包括 CogACT、π0 等)直接基于 OpenVLA 改造。关联线索:T06 基础模型谱系。
❓ 常见误区
OpenVLA 比 RT-2-X 更小又更强,是不是说 Google 路线错了?
不是。OpenVLA 站在 RT-2-X 肩膀上:用了 OpenX 数据集(RT-X 项目成果)、继承了 RT-2 的"动作即 token"范式、还在 Google DeepMind 的合作下完成。OpenVLA 的进步来自更精心的数据清洗 + 双视觉编码器 + 更多训练 epoch,不是否定 RT-2-X,而是"在正确范式上做工程优化"。
为什么 OpenVLA 比 Diffusion Policy 强?是不是 Diffusion Policy 过时了?
不是——两者优势不同。Diffusion Policy 在窄任务、单指令、需要精细动作(如精确倒水)上仍然更强。OpenVLA 在多任务、多指令、需要语言理解和泛化上更强。论文明确说:Diffusion Policy 轨迹更平滑、精细,OpenVLA 可以借鉴它的 action chunking 和时序平滑。
7B 还是不小,能在树莓派上跑吗?
不能直接跑。但量化后(int4)显存压到约 7GB(bfloat16 为 16.8GB),配合 LoRA 微调可以在消费级 GPU(如 RTX 4090 / RTX 3090)上跑 6 Hz。论文还提供了远程推理服务方案——机器人本地只需要薄客户端,模型在 GPU 服务器上跑。完全边缘部署仍是开放问题。
为什么用 Llama 2 而不是更新的 Llama 3?
论文发表于 2024 年 6 月,那时的 Prismatic-7B VLM 基于 Llama 2。后续工作(如 OpenVLA-OFT 等)已经在用更新的 LLM 骨干。OpenVLA 的核心贡献是开源 VLA 范式,骨干可以随时升级。