PaLM-E:把图像、状态「当词」喂进 LLM 的具身大模型
<img>」就成了一段「多模态句子」。模型继续像读字一样读它、像写字一样输出下一步动作。结果是:一个 562B 的模型,既能 SOTA 解 OK-VQA,又能指挥机器人端到端去拿米片。
🎯 为什么重要:「grounding」是 LLM 进真实世界的最后一公里
2023 年初,LLM 已经能写代码、做数学、讲笑话,但把它们接上机器人时遇到一个根本问题——grounding:
PaLM-E 想做的不是「LLM 调用机器人接口」,而是把机器人传感器直接熔进 LLM 的 embedding 空间,让一个模型同时是「语言模型」「视觉模型」「机器人规划器」。这种「全融合」是后续所有 VLA 的范式起点。
💡 核心思想:多模态句子——把图像「插」进文字 token 流
PaLM-E 不改 LLM 结构,只是把编码器产出的向量直接插到文本 token 序列里,让 LLM 用同样的 self-attention 处理它们。形式上:
xi = γ(wi) 如果是文字 token; 或 φj(Oj)i 如果是观测 Oj 的第 i 个嵌入
关键设计点:
- 保留 LLM 的位置编码:观测 token 不固定在某个位置,可以动态穿插在文本里("I see <img> here, what's next?")。
- 输出仍是文字:PaLM-E 不直接输出低层动作,而是输出高层动作的文本描述("go to drawer", "pick the cup"),再由现成的低层策略(RT-1 等)执行。
- 实体引用:「Object 1 is <obj1>. ... grab <obj1>」——用占位 token 让模型能引用视觉上无法用三两句话描述的物体。
🛠️ 三种观测编码器 + 三种规模 + 一个训练食谱
| 观测编码器 φ | 规模/来源 | 适用场景 |
|---|---|---|
| State MLP | 小 MLP | 已有 state estimate(pose、size、color)的最简版本 |
| ViT-4B / ViT-22B | 预训练图像分类大模型 | 把图像 patch 化、投影到语言空间 |
| OSRT(Object Scene Rep. Transformer) | 3D 感知的 object-centric | 无监督分出物体 slots,最适合需要 object reasoning 的任务 |
| 规模 | 构成 | 用途 |
|---|---|---|
| PaLM-E-12B | PaLM 8B + ViT-4B | 主实验,可训可调 |
| PaLM-E-84B | PaLM 62B + ViT-22B | 规模化消融 |
| PaLM-E-562B | PaLM 540B + ViT-22B | 「视觉-语言通才」版,OK-VQA SOTA |
多模态训练最怕「学新忘旧」——把机器人数据塞进去后,模型原本的语言能力崩了。PaLM-E 发现:12B 模型 NLG 能力掉了 87.3%(相对),而 562B 只掉了 3.9%。换句话说,模型越大越「装得下」多种能力,越不容易被新任务污染——这是大模型做 VLA 的根本理由之一。
机器人数据极少(TAMP 只有 320 个 planning 样本)。但把互联网视觉-语言数据(WebLI、VQA、COCO)一起训("full mixture",机器人数据只占 8.9%),TAMP 的 planning 成功率从 30-50% 跳到 74-83%。语言的世界知识和视觉的场景理解会迁移到机器人任务上——这是 embodied LLM 的「暗中红利」。
📊 结果:三个机器人环境 + 视觉语言通才
| 环境 | 关键数字 |
|---|---|
| TAMP(桌面抓取-堆叠) | OSRT 输入:planning 成功率 p1/p2 = 82.5% / 76.2%(SayCan 38.7/33.3;PaLI 未参与 planning,仅 VQA q2/q3 = 0);embodied VQA 四题 93-100% |
| Language-Table(仿真推动) | few-shot:PaLM-E-12B(10 demo, Task 1)70%、84B(80 demo, Task 3)64.4%;SayCan/PaLI 全 0 |
| Mobile Manipulation(真实厨房 Everyday Robotics) | failure detection F1 = 0.77,affordance F1 = 0.91;长时序任务「我洒了水→找海绵→拿→递→放下」端到端跑通 |
| OK-VQA(视觉问答通才) | PaLM-E-562B SOTA(超过专门 finetune 的模型) |
| VQAv2(frozen LLM 路线) | PaLM-E 是已知 frozen-LLM 路线里最好的 |
| 语言能力保留 | 562B 仅掉 3.9%(NLG 相对);12B 掉 87.3% |
| 规划频率 | 1 Hz 输出高层子目标;TAMP 桌面环境中低层策略(Lynch et al. 2022)在 5 Hz 执行,Mobile Manipulation 厨房环境低层策略为 RT-1 |
🌐 在领域中的位置
PaLM-E 是 VLA 范式的「开端」之一(和 RT-2 并列)。它把「把感知当 token 插进 LLM」这个想法推到了 562B 规模并验证了正向迁移。后续所有 VLA 本质上都在用这套范式,只是把高层文字规划换成了低层动作。关联线索:T06 VLA 谱系。
❓ 常见误区
PaLM-E 输出动作吗?
不直接输出。它输出的是文字(自然语言子目标),比如「go to drawer, open it, pick the rice」。这些文字再喂给低层策略(RT-1 等)执行。它是「高层规划器」,不是「低层控制器」。后续 RT-2 才把 VLM 直接当 policy。
562B 这么大,能跑在机器人上吗?
不能实时。它是云端模型,机器人通过 API 调用,1 Hz 输出子目标。低层策略在本地较高频率执行——TAMP 桌面环境用 Lynch et al. (2022) 策略在 5 Hz 执行,Mobile Manipulation 厨房环境用 RT-1 作为低层策略。这种「云大脑 + 本地小脑」的分层架构是当年 Google 的招牌,后续被开源 VLA 抛弃(走向完全本地化)。
把图像当 token 插进 LLM 不是 VLM 的常规操作吗?
2023 年初还不是常规。Flamingo、PaLI 之类 VLM 大多有自己的视觉-语言对齐机制;PaLM-E 的特别之处是:观测 token 不固定在开头,可以动态穿插在文本里("I see <img>, what should I do?"),并且把机器人状态也当成 token 一起塞进去——这种「多模态句子」的统一视角是它的贡献。
它能 zero-shot 处理新物体吗?
能一定程度。论文展示了对训练时没见过的物体(玩具乌龟)做长时序任务,以及新颖物体对的组合任务。这归功于语言先验 + 大模型泛化,而不是机器人数据本身覆盖了这些物体。