枢纽
机器人Google Everyday Robots (mobile manipulator)
数据集内嵌多任务 + OpenX 风格数据
上真机
输入模态vision,language,proprioception

PaLM-E:把图像、状态「当词」喂进 LLM 的具身大模型

Danny Driess, Fei Xia 等(Google + TU Berlin)。arXiv 2303.03378, ICRA 2023。 项目页 · embodied LLMVLA 线索 T01

🧠 一句话心智模型:LLM 已经会「读字」了,PaLM-E 让它把图像和机器人状态也当成「特殊的词」进句子里一起读。一句像「Bring me the rice chips from the drawer. I see <img>」就成了一段「多模态句子」。模型继续像读字一样读它、像写字一样输出下一步动作。结果是:一个 562B 的模型,既能 SOTA 解 OK-VQA,又能指挥机器人端到端去拿米片。

🎯 为什么重要:「grounding」是 LLM 进真实世界的最后一公里

2023 年初,LLM 已经能写代码、做数学、讲笑话,但把它们接上机器人时遇到一个根本问题——grounding

核心矛盾:LLM 训练数据是纯文本。它从没「看」过一张真实的桌子、从没「感受」过一个物体的位置。SayCan 那种做法(LLM 出文本,再交给 affordance 模型判可行性)能凑合,但 LLM 本身看不到场景——很多任务里几何配置是关键,光靠文字描述远远不够。当时的 SOTA VLM(PaLI)在机器人任务上直接 0 分。

PaLM-E 想做的不是「LLM 调用机器人接口」,而是把机器人传感器直接熔进 LLM 的 embedding 空间,让一个模型同时是「语言模型」「视觉模型」「机器人规划器」。这种「全融合」是后续所有 VLA 的范式起点。

💡 核心思想:多模态句子——把图像「插」进文字 token 流

PaLM-E 不改 LLM 结构,只是把编码器产出的向量直接插到文本 token 序列里,让 LLM 用同样的 self-attention 处理它们。形式上:

xi = γ(wi) 如果是文字 token;   或   φj(Oj)i 如果是观测 Oj 的第 i 个嵌入

"Bring" "rice" <img> (q 个嵌入) "from" "drawer" state s PaLM decoder-only LLM 8B / 62B / 540B + ViT 4B/22B 编码器 输出:文字 = 动作序列 如 "1. open drawer 2. pick rice"
图 1:多模态句子。图像、状态都被各自的编码器 φ 映射到和文字 token 同维的向量,与文字 token 交错排列;PaLM 用同一个 self-attention 读它们,输出仍然是文字(被解释成动作)。

关键设计点:

  • 保留 LLM 的位置编码:观测 token 不固定在某个位置,可以动态穿插在文本里("I see <img> here, what's next?")。
  • 输出仍是文字:PaLM-E 不直接输出低层动作,而是输出高层动作的文本描述("go to drawer", "pick the cup"),再由现成的低层策略(RT-1 等)执行。
  • 实体引用:「Object 1 is <obj1>. ... grab <obj1>」——用占位 token 让模型能引用视觉上无法用三两句话描述的物体。

🛠️ 三种观测编码器 + 三种规模 + 一个训练食谱

观测编码器 φ规模/来源适用场景
State MLP小 MLP已有 state estimate(pose、size、color)的最简版本
ViT-4B / ViT-22B预训练图像分类大模型把图像 patch 化、投影到语言空间
OSRT(Object Scene Rep. Transformer)3D 感知的 object-centric无监督分出物体 slots,最适合需要 object reasoning 的任务
规模构成用途
PaLM-E-12BPaLM 8B + ViT-4B主实验,可训可调
PaLM-E-84BPaLM 62B + ViT-22B规模化消融
PaLM-E-562BPaLM 540B + ViT-22B「视觉-语言通才」版,OK-VQA SOTA
🔮 关键洞察 1:规模越大,语言能力掉得越少(catastrophic forgetting 反而减弱)
多模态训练最怕「学新忘旧」——把机器人数据塞进去后,模型原本的语言能力崩了。PaLM-E 发现:12B 模型 NLG 能力掉了 87.3%(相对),而 562B 只掉了 3.9%。换句话说,模型越大越「装得下」多种能力,越不容易被新任务污染——这是大模型做 VLA 的根本理由之一。
🔮 关键洞察 2:Co-training 是数据效率的杠杆
机器人数据极少(TAMP 只有 320 个 planning 样本)。但把互联网视觉-语言数据(WebLI、VQA、COCO)一起训("full mixture",机器人数据只占 8.9%),TAMP 的 planning 成功率从 30-50% 跳到 74-83%。语言的世界知识和视觉的场景理解会迁移到机器人任务上——这是 embodied LLM 的「暗中红利」。

📊 结果:三个机器人环境 + 视觉语言通才

环境关键数字
TAMP(桌面抓取-堆叠)OSRT 输入:planning 成功率 p1/p2 = 82.5% / 76.2%(SayCan 38.7/33.3;PaLI 未参与 planning,仅 VQA q2/q3 = 0);embodied VQA 四题 93-100%
Language-Table(仿真推动)few-shot:PaLM-E-12B(10 demo, Task 1)70%、84B(80 demo, Task 3)64.4%;SayCan/PaLI 全 0
Mobile Manipulation(真实厨房 Everyday Robotics)failure detection F1 = 0.77,affordance F1 = 0.91;长时序任务「我洒了水→找海绵→拿→递→放下」端到端跑通
OK-VQA(视觉问答通才)PaLM-E-562B SOTA(超过专门 finetune 的模型)
VQAv2(frozen LLM 路线)PaLM-E 是已知 frozen-LLM 路线里最好的
语言能力保留562B 仅掉 3.9%(NLG 相对);12B 掉 87.3%
规划频率1 Hz 输出高层子目标;TAMP 桌面环境中低层策略(Lynch et al. 2022)在 5 Hz 执行,Mobile Manipulation 厨房环境低层策略为 RT-1
关键洞察:PaLM-E 不是一个「机器人模型」,它是一个 562B 的通用多模态大模型,机器人只是它的「课外活动」之一。它的胜利是规模 + 多任务共训的胜利——证明了 embodied reasoning 不是要造一个新架构,而是要让模型大到装得下「语言、视觉、机器人」三个世界。

🌐 在领域中的位置

SayCan(LLM 外接 affordance) PaLM-E(多模态 sentence 端到端)⭐ RT-2(VLM = policy,端到端低层动作) OpenVLA / π0(开源 + 低层 VLA)

PaLM-E 是 VLA 范式的「开端」之一(和 RT-2 并列)。它把「把感知当 token 插进 LLM」这个想法推到了 562B 规模并验证了正向迁移。后续所有 VLA 本质上都在用这套范式,只是把高层文字规划换成了低层动作。关联线索:T06 VLA 谱系

❓ 常见误区

PaLM-E 输出动作吗?

不直接输出。它输出的是文字(自然语言子目标),比如「go to drawer, open it, pick the rice」。这些文字再喂给低层策略(RT-1 等)执行。它是「高层规划器」,不是「低层控制器」。后续 RT-2 才把 VLM 直接当 policy。

562B 这么大,能跑在机器人上吗?

不能实时。它是云端模型,机器人通过 API 调用,1 Hz 输出子目标。低层策略在本地较高频率执行——TAMP 桌面环境用 Lynch et al. (2022) 策略在 5 Hz 执行,Mobile Manipulation 厨房环境用 RT-1 作为低层策略。这种「云大脑 + 本地小脑」的分层架构是当年 Google 的招牌,后续被开源 VLA 抛弃(走向完全本地化)。

把图像当 token 插进 LLM 不是 VLM 的常规操作吗?

2023 年初还不是常规。Flamingo、PaLI 之类 VLM 大多有自己的视觉-语言对齐机制;PaLM-E 的特别之处是:观测 token 不固定在开头,可以动态穿插在文本里("I see <img>, what should I do?"),并且把机器人状态也当成 token 一起塞进去——这种「多模态句子」的统一视角是它的贡献。

它能 zero-shot 处理新物体吗?

能一定程度。论文展示了对训练时没见过的物体(玩具乌龟)做长时序任务,以及新颖物体对的组合任务。这归功于语言先验 + 大模型泛化,而不是机器人数据本身覆盖了这些物体。