VLA 综述:把「具身大模型」这三年的所有论文塞进一张图
它把所有看起来各异的具身大模型(RT-1/2、PaLM-E、OpenVLA、π0、SayCan…)装进一个三层框架:① 单组件(视觉/世界模型/推理)② 低层控制策略 ③ 高层任务规划。读完它,你就能拿到整张 VLA 演进地图——这是 KB 知识脉络的根目录。
🎯 为什么重要:VLA 是「具身 AGI」的入场券
「具身 AI 是 AGI 的基石」——这是这篇综述的开篇判断。因为只有它真的控制物理实体在世界里做事,其他 AI(对话、画图)都只在数字空间里转。而 VLA 模型是这条路上目前最有共识的范式:
原始「VLA」词是 RT-2 提出的(VLM 蒸馏出动作)。为避免概念狭义化,综述把基于大 LLM/VLM 的叫 LVLA(Large VLA),把更广义的(含传统 RL、BC)统称 VLA。
综述主要价值有三:
| 价值 | 具体 |
|---|---|
| ① 一张图理清概念关系 | Fig.2 用 Venn 图把「具身 AI / 控制策略 / 任务规划 / VLA(含 LVLA)」的层级包含关系讲清楚(CV/NLP/RL 作为基础学科喂入)——这是初学者最容易混乱的地方 |
| ② 一棵 taxonomy 树导航论文 | Fig.3 把 VLA 拆成 3 大类(组件 9 + 控制 9 + 规划 5,共 23 个叶子小类),每篇论文挂一个叶子节点——这是「找相关工作」的索引 |
| ③ 资源全汇总 | Table V/VI/VII 列了所有数据集、模拟器、benchmark,加上 challenges & future directions——这是「找选题」的索引 |
💡 核心思想:VLA 的三层分类法
论文借用了机器人系统的层次结构:高层「想」→ 中层「动」→ 低层「执行」。
- 组件研究 = 强化某个「零件」(更好的视觉编码器、更好的世界模型)
- 控制策略 = 中层「看图说话→动作」的端到端映射
- 任务规划器 = 高层把「打扫房间」拆成「捡玩具→放桌上→...」
这套层次结构和经典 hierarchical RL 一致,所以它既能装新论文(π0、GR00T),也能装老工作(DQN、DeepMimic)。
🛠️ 综述里最实用的 4 张「对照表」
| 表 | 内容 | 怎么用 |
|---|---|---|
| Table I(PVR 对照) | 10 种预训练视觉表征(CLIP / R3M / MVP / VIP / VC-1 / Voltron / RPT / DINOv2 / I-JEPA / Theia),列出网络、损失、机器人任务 | 选视觉 encoder 时查这张——告诉你每个 PVR 适合什么任务 |
| Table III(控制策略) | 几十个控制策略模型按类别分类:动作类型(连续/离散/SE(2)/SE(3)/点)+ 训练目标(BC / DDPM / RL / flow matching) | 选策略架构时查这张——告诉你 RT 系、OpenVLA、π0 各属哪一档 |
| Table IV(任务规划器) | 15+ 任务规划器:用的 VLM、用的低层策略、架构类型(concat / xattn)、是否需要训练 | 对比 SayCan / PaLM-E / Inner Monologue / ProgPrompt 的差异 |
| Table V/VI/VII(资源) | 所有具身数据集 + 模拟器 + EQA benchmark 的横向对比 | 选数据集/模拟器/benchmark 时查这三张 |
论文 §III-B 还总结了 4 种动作表达范式及对应训练目标(另有 point-based 点动作见 §III-B8),对理解 VLA 输出空间非常关键:
| 动作类型 | 表达 | 典型任务 | 训练目标 |
|---|---|---|---|
| 连续 | 末端执行器位姿(连续向量) | 精细操作 | $\mathcal{L}_{\text{Cont}} = \sum_t \text{MSE}(a_t, \hat{a}_t)$ |
| 离散 | 分桶(bins) | RT-1 等 | $\mathcal{L}_{\text{Disc}} = \sum_t \text{CE}(a_t, \hat{a}_t)$ |
| SE(2) | 只预测 pick / place 两个位姿 | 桌面操作(CLIPort) | $\mathcal{L}_{\text{SE(2)}} = \text{CE}(a_{\text{pick}}, \hat{a}_{\text{pick}}) + \text{CE}(a_{\text{place}}, \hat{a}_{\text{place}})$ |
| Diffusion | 扩散生成的动作序列 | Diffusion Policy / π0 | $\mathcal{L}_{\text{DDPM}} = \text{MSE}(\epsilon^k, \epsilon_\theta(a_t^k, k))$ |
📊 综述的核心「输出」:9 大挑战 + 资源地图
综述不是实验论文,没有「关键结果」传统意义。它的核心输出是对领域现状的诊断。综述 §VI 列出了 9 个开放挑战:
| 挑战 | 综述判断 |
|---|---|
| ① Safety(安全) | 需 risk assessment + HITL + RLHF + 可解释性;医疗等高安全场景需特殊设计 |
| ② Datasets & Benchmarks | 现有 benchmark 覆盖窄;除 success rate 外需细粒度指标(如 EAI 的 input-output 形式化) |
| ③ Foundation Models & Generalization | RFM(机器人基础模型)的泛化远不及 LLM 在 NLP 的水平——是 AGI 级难题 |
| ④ Multimodality | 多模态嵌入对齐仍是开放问题;audio / haptics / gaze 未充分整合 |
| ⑤ Long-Horizon Tasks | 层次化框架目前最实用,但增加系统复杂度和失败点;端到端长程是开放方向 |
| ⑥ Real-Time Responsiveness | 大模型推理慢 vs 实时控制需求;需新机制做速度-容量权衡 |
| ⑦ Multiagent Systems | 多智能体协作 + 异构 fleet + 冲突目标 |
| ⑧ Ethical & Societal | 隐私、就业、偏见、社会规范 |
| ⑨ Applications | 从家庭/工业扩展到自动驾驶、农业、医疗(手术/护理机器人) |
对于「数据稀缺」这个老大难,综述把应对策略归为四类:
| 策略 | 代表 |
|---|---|
| 仿真数据 | 各种 simulator(存在 sim-to-real gap) |
| 自动数据采集 | RoboGen(生成仿真 + 自动训策略)、AutoRT(LLM 编排机器人)、DIAL(VLM 增强语言注释) |
| 人类数据 | UMI(手持夹爪)、人类视频;存在视角不一致 + 跨本体迁移难 |
| 真实机器人数据 | Open X-Embodiment、DROID 等 |
🌐 在领域中的位置
这篇综述是「VLA 入门地图」级别的工作——KB 项目把它当作导航根目录:当你需要查任何 VLA 相关概念、找某类工作的代表作、或定位一篇新论文在领域中的位置时,从它出发。它的 Awesome-VLA GitHub 仓库持续更新,到 2026 年 v8 已是事实标准。和 BFM 综述(基础模型综述,更宽口径)形成互补。
❓ 常见误区
「VLA」和「LVLA」有啥区别?
综述特意做了区分:LVLA(Large VLA)专指那些从大 LLM/VLM 蒸馏来的模型(RT-2、π0、OpenVLA 这类);VLA 是广义概念,包括所有「视觉+语言→动作」的模型,含传统 RL 控制策略、BC 方法等。所以 LVLA ⊂ VLA。
这篇综述和 Firooibot/Wang 等人的具身 AI 综述有什么不同?
综述 §I-B 明确比较过:Firooibi 综述截止 2023、聚焦「具身 AI 基础模型」整体;Wang 综述聚焦「LLM in robotics」;Hu 综述更宽,含视觉/语言/机器人基础模型;Kawaharazuka 聚焦真机应用。本综述是第一篇专攻「VLA 模型」的,所以taxonomy 颗粒度更细。
taxonomy 里的「Policy Steering」是什么?
这是组件研究(§III-A9)的一个小类——指那些在测试时(test-time)调整/引导已训好的策略的工作,比如 V-GPS(用学到的价值函数对生成动作重排序)、RoboMonkey(用 VLM 验证器从采样集合里选最优动作)。它不需要重新训练,而是「让现成策略更好用」的工具集。
综述里说的「Point-based Actions」是什么?
指策略直接输出图像上的「点」(如「点这里抓」)而不是末端位姿。优点是可以从 VLM 零样本得到(VLM 擅长指出图像上的点),缺点是粒度粗,复杂任务不够用——这是「VLM 作为动作源」的一种妥协方案。