枢纽
输入模态vision,language

VLA 综述:把「具身大模型」这三年的所有论文塞进一张图

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King(港中文 CUHK + 华为诺亚 + Bristol)。IEEE TNNLS 2025 / arXiv:2405.14093(v8 2026-05,持续更新)。
Awesome-VLA 仓库 · foundation modelssurveyVLA 入门地图

🧠 一句话心智模型:这是第一篇系统梳理「视觉-语言-动作(VLA)模型」的综述。
它把所有看起来各异的具身大模型(RT-1/2、PaLM-E、OpenVLA、π0、SayCan…)装进一个三层框架:① 单组件(视觉/世界模型/推理)② 低层控制策略 ③ 高层任务规划。读完它,你就能拿到整张 VLA 演进地图——这是 KB 知识脉络的根目录

🎯 为什么重要:VLA 是「具身 AGI」的入场券

「具身 AI 是 AGI 的基石」——这是这篇综述的开篇判断。因为只有它真的控制物理实体在世界里做事,其他 AI(对话、画图)都只在数字空间里转。而 VLA 模型是这条路上目前最有共识的范式:

论文的广义定义:VLA = 任何能吃多模态(视觉 + 语言)输入、吐出机器人动作、完成具身任务的模型。
原始「VLA」词是 RT-2 提出的(VLM 蒸馏出动作)。为避免概念狭义化,综述把基于大 LLM/VLM 的叫 LVLA(Large VLA),把更广义的(含传统 RL、BC)统称 VLA。

综述主要价值有三:

价值具体
① 一张图理清概念关系Fig.2 用 Venn 图把「具身 AI / 控制策略 / 任务规划 / VLA(含 LVLA)」的层级包含关系讲清楚(CV/NLP/RL 作为基础学科喂入)——这是初学者最容易混乱的地方
② 一棵 taxonomy 树导航论文Fig.3 把 VLA 拆成 3 大类(组件 9 + 控制 9 + 规划 5,共 23 个叶子小类),每篇论文挂一个叶子节点——这是「找相关工作」的索引
③ 资源全汇总Table V/VI/VII 列了所有数据集、模拟器、benchmark,加上 challenges & future directions——这是「找选题」的索引

💡 核心思想:VLA 的三层分类法

VLA(综述定义) ① VLA 组件 §III-A(单模块研究) ② 控制策略 §III-B(看图说话→出动作) ③ 任务规划器 §IV(长程任务分解) 子类: RL · PVR · 视频表征 动力学 · 世界模型 LLM 诱导 · 视觉 · 推理 Policy Steering 子类: 非 Transformer · Transformer 多模态指令 · 3D 视觉 Diffusion · 3D+Diffusion 运动规划 · 点动作 · LVLA 子类: Monolithic(端到端) - End-to-End - 3D Vision - Grounded Modular(语言/代码) CLIP / R3M / VC-1 Dreamer / Genie / ECoT RT-1 / RT-2 / Octo OpenVLA / π0 / Diffusion Policy SayCan / PaLM-E / CaP ProgPrompt / Inner Monologue 通用架构(Fig.1):视觉编码器 + 语言编码器 → 预训练 LLM → 动作预测头 三种动作预测范式:端到端 / 强化学习辅助 / 世界模型驱动
图 1:综述的核心 taxonomy。把整个 VLA 领域拆成 3 大类(组件 9 + 控制 9 + 规划 5,共 23 个叶子小类),每篇论文都能挂到某个叶子节点上。最下方是论文给出的「通用 VLA 架构」抽象。
🔮 直觉:为什么是「3 大类」而不是 100 类?
论文借用了机器人系统的层次结构:高层「想」→ 中层「动」→ 低层「执行」。
- 组件研究 = 强化某个「零件」(更好的视觉编码器、更好的世界模型)
- 控制策略 = 中层「看图说话→动作」的端到端映射
- 任务规划器 = 高层把「打扫房间」拆成「捡玩具→放桌上→...」
这套层次结构和经典 hierarchical RL 一致,所以它既能装新论文(π0、GR00T),也能装老工作(DQN、DeepMimic)

🛠️ 综述里最实用的 4 张「对照表」

内容怎么用
Table I(PVR 对照)10 种预训练视觉表征(CLIP / R3M / MVP / VIP / VC-1 / Voltron / RPT / DINOv2 / I-JEPA / Theia),列出网络、损失、机器人任务选视觉 encoder 时查这张——告诉你每个 PVR 适合什么任务
Table III(控制策略)几十个控制策略模型按类别分类:动作类型(连续/离散/SE(2)/SE(3)/点)+ 训练目标(BC / DDPM / RL / flow matching)选策略架构时查这张——告诉你 RT 系、OpenVLA、π0 各属哪一档
Table IV(任务规划器)15+ 任务规划器:用的 VLM、用的低层策略、架构类型(concat / xattn)、是否需要训练对比 SayCan / PaLM-E / Inner Monologue / ProgPrompt 的差异
Table V/VI/VII(资源)所有具身数据集 + 模拟器 + EQA benchmark 的横向对比选数据集/模拟器/benchmark 时查这三张

论文 §III-B 还总结了 4 种动作表达范式及对应训练目标(另有 point-based 点动作见 §III-B8),对理解 VLA 输出空间非常关键:

动作类型表达典型任务训练目标
连续末端执行器位姿(连续向量)精细操作$\mathcal{L}_{\text{Cont}} = \sum_t \text{MSE}(a_t, \hat{a}_t)$
离散分桶(bins)RT-1 等$\mathcal{L}_{\text{Disc}} = \sum_t \text{CE}(a_t, \hat{a}_t)$
SE(2)只预测 pick / place 两个位姿桌面操作(CLIPort)$\mathcal{L}_{\text{SE(2)}} = \text{CE}(a_{\text{pick}}, \hat{a}_{\text{pick}}) + \text{CE}(a_{\text{place}}, \hat{a}_{\text{place}})$
Diffusion扩散生成的动作序列Diffusion Policy / π0$\mathcal{L}_{\text{DDPM}} = \text{MSE}(\epsilon^k, \epsilon_\theta(a_t^k, k))$

📊 综述的核心「输出」:9 大挑战 + 资源地图

综述不是实验论文,没有「关键结果」传统意义。它的核心输出是对领域现状的诊断。综述 §VI 列出了 9 个开放挑战:

挑战综述判断
① Safety(安全)需 risk assessment + HITL + RLHF + 可解释性;医疗等高安全场景需特殊设计
② Datasets & Benchmarks现有 benchmark 覆盖窄;除 success rate 外需细粒度指标(如 EAI 的 input-output 形式化)
③ Foundation Models & GeneralizationRFM(机器人基础模型)的泛化远不及 LLM 在 NLP 的水平——是 AGI 级难题
④ Multimodality多模态嵌入对齐仍是开放问题;audio / haptics / gaze 未充分整合
⑤ Long-Horizon Tasks层次化框架目前最实用,但增加系统复杂度和失败点;端到端长程是开放方向
⑥ Real-Time Responsiveness大模型推理慢 vs 实时控制需求;需新机制做速度-容量权衡
⑦ Multiagent Systems多智能体协作 + 异构 fleet + 冲突目标
⑧ Ethical & Societal隐私、就业、偏见、社会规范
⑨ Applications从家庭/工业扩展到自动驾驶、农业、医疗(手术/护理机器人)

对于「数据稀缺」这个老大难,综述把应对策略归为四类

策略代表
仿真数据各种 simulator(存在 sim-to-real gap)
自动数据采集RoboGen(生成仿真 + 自动训策略)、AutoRT(LLM 编排机器人)、DIAL(VLM 增强语言注释)
人类数据UMI(手持夹爪)、人类视频;存在视角不一致 + 跨本体迁移难
真实机器人数据Open X-Embodiment、DROID 等
关键洞察:综述判断 VLA 的最大瓶颈是「泛化」——LLM 在文本上做到的 zero-shot,VLA 在物理世界里还差得远。这正好被 2 年后的 DreamZero 用视频世界模型路线推进了一步:通过视频预训练把物理先验塞进策略,让 VLA 不再只会套训练时学过的「抓取-放置」套路。

🌐 在领域中的位置

RT-2 提出 VLA 概念(2023-07) 本综述:第一次系统化(2024-05 初版,2026-05 v8 持续更新)⭐ 后续工作按 taxonomy 分类导航

这篇综述是「VLA 入门地图」级别的工作——KB 项目把它当作导航根目录:当你需要查任何 VLA 相关概念、找某类工作的代表作、或定位一篇新论文在领域中的位置时,从它出发。它的 Awesome-VLA GitHub 仓库持续更新,到 2026 年 v8 已是事实标准。和 BFM 综述(基础模型综述,更宽口径)形成互补。

❓ 常见误区

「VLA」和「LVLA」有啥区别?

综述特意做了区分:LVLA(Large VLA)专指那些从大 LLM/VLM 蒸馏来的模型(RT-2、π0、OpenVLA 这类);VLA 是广义概念,包括所有「视觉+语言→动作」的模型,含传统 RL 控制策略、BC 方法等。所以 LVLA ⊂ VLA。

这篇综述和 Firooibot/Wang 等人的具身 AI 综述有什么不同?

综述 §I-B 明确比较过:Firooibi 综述截止 2023、聚焦「具身 AI 基础模型」整体;Wang 综述聚焦「LLM in robotics」;Hu 综述更宽,含视觉/语言/机器人基础模型;Kawaharazuka 聚焦真机应用。本综述是第一篇专攻「VLA 模型」的,所以taxonomy 颗粒度更细。

taxonomy 里的「Policy Steering」是什么?

这是组件研究(§III-A9)的一个小类——指那些在测试时(test-time)调整/引导已训好的策略的工作,比如 V-GPS(用学到的价值函数对生成动作重排序)、RoboMonkey(用 VLM 验证器从采样集合里选最优动作)。它不需要重新训练,而是「让现成策略更好用」的工具集。

综述里说的「Point-based Actions」是什么?

指策略直接输出图像上的「点」(如「点这里抓」)而不是末端位姿。优点是可以从 VLM 零样本得到(VLM 擅长指出图像上的点),缺点是粒度粗,复杂任务不够用——这是「VLM 作为动作源」的一种妥协方案。