⏱ ~52 min

概念辨析 · 「多模态」的三种含义

在机器人与深度学习文献里,"multimodal"几乎是个被用滥的词。同一篇论文里的"multimodal policy"可能指输入侧(视觉+语言+触觉),也可能指输出侧(同一观测下多个合理动作),还可能指训练数据侧(多种任务/本体混合)。这三个含义数学上完全不同,但社区共用一个词,导致频繁混淆。本条辨析把三者彻底分开,并指出何时该用哪种、误用的后果。

「多模态」辨析图:左卡 (A) 多模态感知·输入端(视觉/触觉/本体感受/语言四通道 + 对齐/同步/缺失三问题 + PaLM-E/RT-2 代表),右卡 (B) 多模态动作分布·输出端(双峰高斯曲线 + MSE 平均化失败 + Diffusion/π0 解法),中间窄卡解释为何易混(同名 multimodal、中文都译多模态、π0 同时具备)

本页内容

基础解释

一句话直觉

"多模态"这个词在机器人圈被用滥了。三个完全不同的东西共用一个名字。好比"打"字,打车、打架、打电话都是"打"。

是什么·为什么

机器人论文里"多模态"几乎是个被用滥的词。同一个词在不同论文里指三件完全不同的事。读者脑子里只有一种含义就会看不懂。

为什么重要:现在最火的几篇工作把三种含义全混在一起。π0 既是多感知输入,又是多动作输出。它还跨任务训练。读这类论文时脑子里只有一种含义就完全懵。

三种含义的通俗版

第一种叫"多感知输入"。机器人同时用眼睛、触觉、语言指令来感知。好比人有五官,每种感官信息要拼到一起。

第二种叫"多峰动作分布"。同一情况下有多个合理动作。拧扳手既能左转也能右转。绕障能从左也能从右。

第三种叫"多源数据"。训练数据来自多种任务或多种机器人。好比教材同时塞了数学、语文、英语,要小心互相干扰。

核心大白话:这三种含义完全正交。一个方法可以同时是三种。也可以只是其中一种。看到"多模态"必须先问是输入侧、输出侧、还是数据侧。

一句话类比:三种"多模态"之于机器人论文,像同名的三个人。身份证号完全不同却都叫一个名。读论文要先用上下文确定说的是哪一个。

为什么必须先吃透这一篇

近三年的代表工作恰好把这三个含义全部混在一起:

  • π0 / GR00T N1 / OpenVLA 是"多模态输入"(视觉+语言+本体感受)同时是"多模态输出"(flow matching 学多峰动作分布)同时是"多模态数据"(跨任务/跨本体训练)。
  • 读这类论文时如果脑子里只有"multimodal = 多感知通道",就会完全看不懂为什么它们要用 flow matching 而不是 MSE 回归——因为这里要解决的"多模态"是输出分布的多峰,和传感器无关。

这条辨析贯穿 T05 diffusion policy 谱系(输出多模态)、T06 VLA 五段演进(输入多模态)、T11 灵巧操作(视觉+触觉多模态)。


一、三种含义的总览

含义作用对象数学定位典型方法关键问题
(A) 多模态感知 / 输入观测 $o$$o = (o_v, o_t, o_p, o_l)$ 多通道VLA、VisuoTactile模态对齐、缺失、同步
(B) 多模态动作分布动作 $a$$p(a\mid o)$ 多峰Diffusion/Flow/MixtureMSE 平均化失败
(C) 多模态数据 / 任务数据集 $\mathcal{D}$$p_\text{data}$ 混合多源OpenX、RT-X、cross-embodiment分布偏移、任务条件化

三者完全正交:一个方法可以同时是三者(π0),也可以只是其中之一(AMP 是 B 不是 A;PaLM-E 是 A 不是 B)。把它们区分清楚是读现代机器人论文的前提。


二、多模态感知 / 输入(multimodal perception / sensing)

2.1 定义与形式化

策略的输入由多个异构通道组成:

$$o = (o_\text{vis},\, o_\text{tac},\, o_\text{prop},\, o_\text{lang},\, o_\text{audio},\, \ldots)$$

每个通道有不同的维度、频率、语义层次:

  • $o_\text{vis} \in \mathbb{R}^{H\times W\times 3}$:RGB(-D) 图像,~10-60 Hz
  • $o_\text{tac} \in \mathbb{R}^{T\times d}$:触觉传感(GelSight/DIGIT/BioTac),~30-1000 Hz
  • $o_\text{prop} \in \mathbb{R}^{n_\text{dof}}$:本体感受(关节角/速度/IMU),~100-1000 Hz
  • $o_\text{lang} \in \Sigma^*$:语言指令(token 序列),事件驱动

策略是 $\pi(a \mid o_\text{vis}, o_\text{tac}, o_\text{prop}, o_\text{lang})$——多个条件输入。本质上是异构数据融合问题。

2.2 三个子问题

(a) 模态对齐(alignment)

不同模态的语义空间不同——图像是像素、触觉是力分布、语言是 token。直接拼起来学不动。早期做法是手动设计 encoder 把每个模态压到 $\mathbb{R}^d$ 再 concat;现代做法是用预训练编码器CLIP/SigLIP 把图像和语言拉到同一嵌入空间)+ cross-attention 让模态互为 query/key。

数学上等价于学一个共享潜空间 $\mathcal{Z}$ 和一组映射 $\phi_i: \mathcal{O}_i \to \mathcal{Z}$,让相关模态在 $\mathcal{Z}$ 里靠近:

$$\min_\phi \sum_{(i,j)\in \mathcal{P}} \big\|\phi_i(o_i) - \phi_j(o_j)\big\|^2 \quad \text{(contrastive)}$$

$\mathcal{P}$ 是正样本对集合(如配对的图像-语言)。CLIP 用 InfoNCE 替代上式以增强 batch 内判别。

(b) 时间同步(synchronization)

触觉 1000 Hz、视觉 30 Hz、语言事件驱动——三者时间戳不同。工程上要么按最快频率采样(其他模态 repeat/latest),要么按最慢频率对齐(其他模态 aggregate)。异步策略(如 RMA 的 100 Hz policy + 10 Hz adapter)是另一种解法。

(c) 模态缺失(missing modality)

真机上某个传感器坏了、或者光照太暗看不清——策略必须能在部分模态缺失时仍工作。这是鲁棒多模态学习的核心问题,常见解法是 dropout 训练(训练时随机 mask 某个模态)或 privileged distillation(让完好模态的 teacher 蒸馏给只有部分模态的 student,见 C-distillation-methods)。

2.3 代表工作

  • PaLM-E [Driess 2023, arxiv:2303.03378]:最早把 LLM 当多模态感知聚合器——视觉/本体感受/语言都编码成 token 喂进 LLM,输出语言/动作。
  • RT-2 [Brohan 2023, arxiv:2307.15818]:VLA = 视觉 + 语言 → 动作 token;证明 web 知识能迁移到控制。
  • VisuoTactile Two Hands [2024, arxiv:2404.16823]:双灵巧手 + 视觉 + 触觉,contact-rich 任务的多模态感知代表。
  • RotateIt(General In-Hand Object Rotation with Vision and Touch) [Qi 2023, CoRL 2023, arxiv:2309.09979]:视觉 + 触觉融合做通用 in-hand 旋转,证明触觉对视觉难追踪的物体(透明/反光/遮挡)不可或缺。
  • PaLI-X、VIMA、OpenVLA 都属于这一类——核心是输入端的多通道聚合。

2.4 数学直觉

把多模态感知看作信息互补:每个模态 $o_i$ 提供 $I(o_i; s^\star)$ 关于真实状态 $s^\star$ 的信息。组合后:

$$I(o_\text{vis}, o_\text{tac}, o_\text{lang}; s^\star) \ge \max_i I(o_i; s^\star)$$

信息论上单调不减。这就是为什么加触觉通常能提升灵巧操作性能——视觉看不到遮挡区域,触觉补上。


三、多模态动作分布(multi-mode / multi-modal action distribution)

3.1 定义与形式化

策略要学的条件分布 $p(a\mid o)$ 是多峰的——同一观测下有多个合理动作。形式化为高斯混合:

$$p(a\mid o) = \sum_{k=1}^{K} w_k(o)\, \mathcal{N}\big(a \mid \mu_k(o), \Sigma_k(o)\big), \quad \sum_k w_k = 1$$

或者更一般的混合分布 $p(a\mid o) = \sum_k w_k(o)\, \phi_k(a)$。

典型例子

  • 拧扳手:左转、右转都对
  • 绕障:从左绕、从右绕
  • 双臂递物:左手在前、右手在前
  • 推物体:推不同面都能到目标位姿

3.2 为什么 MSE 回归失败

这是 IL 理论里最经典的陷阱(详见 C-imitation-learning-theory 第六节)。MSE 回归:

$$\hat\mu(o) = \arg\min_\mu \mathbb{E}_{a\sim p(\cdot\mid o)}\big[\|a - \mu(o)\|^2\big] = \mathbb{E}_{a\sim p}[a\mid o]$$

一阶条件让最优解是条件均值。对对称双峰 $p(a\mid o) = 0.5\delta(a - a_\text{left}) + 0.5\delta(a - a_\text{right})$($a_\text{left} = -a_\text{right}$),$\hat\mu(o) = 0$——什么也不做

更直观地:MSE 假设 $p(a\mid o)$ 是单峰高斯,把所有 mode 平均成无效的中间态。机器人执行 $\hat\mu(o) = 0$ 时不是"在 left 和 right 之间犹豫",而是物理上"不动"。

3.3 三种解法(详细见 C-diffusion-flow-matching

(a) 显式混合分布

策略输出 $K$ 个分量:$\pi_\theta(a\mid o) = \sum_k w_k(o)\mathcal{N}(\mu_k(o), \Sigma_k(o))$。$K$ 需预设,训练用 log-likelihood。问题是 $K$ 不可变、训练不稳(EM-like 优化易 mode collapse)。

(b) Diffusion Policy

去噪过程 $\epsilon_\theta(a_t, t, o)$,从纯噪声迭代去噪到样本。自然支持任意 mode 数——噪声被数据"吸引子"分叉。代表:Diffusion Policy [Chi 2023, arxiv:2303.04137]、3D Diffusion Policy / DP3 [Ze 2024, arxiv:2403.03954]、iDP3 [Ze 2024, arxiv:2410.10803]。

(c) Flow Matching(π0)

学速度场 $v_\theta(a_t, t, o)$,把噪声沿直线路径传输到数据:

$$\frac{da_t}{dt} = v_\theta(a_t, t, o), \quad a_0 \sim \mathcal{N}(0, I), \quad a_1 \sim p_\text{data}(\cdot\mid o)$$

相比 diffusion 的曲线路径,直线 ODE 10 步 Euler 就能解,推理快 5-10 倍。代表:π0 [Physical Intelligence 2024, arxiv:2410.24164]、GR00T N1、RDT-1B。

3.4 数学直觉:为什么 Diffusion/Flow 学得到多峰

连续时间生成过程 $a_t$ 是随机微分方程/ODE。初始噪声 $a_0$ 是连续分布(覆盖整个 $\mathbb{R}^d$),不同初始点被数据分布 $p_\text{data}$ 的不同 mode 吸引——左半空间的噪声点收敛到 $a_\text{left}$,右半空间收敛到 $a_\text{right}$。网络 $v_\theta$ 学的是这个分叉流场

对比 MSE:MSE 只学一个点(条件均值),丢掉了流场的拓扑结构。Diffusion/Flow 学的是整个分布的"地形图"。

3.5 多峰的代价

  • 推理慢:50 步 diffusion 在 30 Hz 控制上吃力。Consistency Policy [Prasad 2024, arxiv:2405.07503] 用一致性蒸馏压到 1-4 步。
  • 数据需求高:学分布比学点要多 1-2 个数量级样本。DP3 用 3D 点云把样本压到 10 条。
  • 评估难:单步 MSE 指标不适用;要用分布距离(MMD、Wasserstein)或 closed-loop success rate。

四、多模态数据 / 任务(multimodal dataset)

4.1 定义

训练数据 $\mathcal{D} = \mathcal{D}_1 \cup \mathcal{D}_2 \cup \ldots \cup \mathcal{D}_K$ 是多个子分布的混合:不同任务、不同本体、不同场景。形式化为 mixture distribution:

$$p_\text{data}(s, a) = \sum_{k=1}^{K} \rho_k\, p_k(s, a), \quad \sum_k \rho_k = 1$$

4.2 与 (A)(B) 的关系

这是数据侧的多模态——既不是输入也不是输出多通道,而是训练分布本身是混合的。代表:

  • Open X-Embodiment [arxiv:2310.08864]:21 家机构、1M+ 真机轨迹、22 种本体混合训练 RT-X。
  • GR00T N1:跨本体(H1/G1/UR5/...)混合 + latent action padding 统一 action 空间。

4.3 关键挑战

  • 负迁移:任务 $i$ 的梯度可能损害任务 $j$。解法是任务条件化(task embedding / language instruction)和多任务 loss 加权。
  • 分布偏移:$\rho_k$ 不均衡时小任务被淹没。重采样或 curriculum 学习缓解。

五、三种含义的彻底对比

维度(A) 多模态感知(B) 多模态动作分布(C) 多模态数据
数学位置输入 $o$输出分布 $p(a\mid o)$训练分布 $p_\text{data}$
本质问题异构融合多峰建模混合分布学习
典型方法VLA、VisuoTactileDiffusion/Flow/MixtureOpenX、RT-X
代表论文PaLM-E、RT-2、VisuoTactileDiffusion Policy、π0OpenX、GR00T N1
失败模式模态没对齐、缺失时崩MSE 平均化任务互相干扰
关键技巧cross-attention、CLIP 对齐噪声 → 数据流场任务条件化、loss 加权

一个工作可以同时是三种

π0 [arxiv:2410.24164] 同时具备:

  • (A):视觉 + 语言 + 本体感受输入
  • (B):flow matching 学多峰动作 chunk
  • (C):跨任务(叠衣服/收拾/操作工具)训练

这就是为什么读 VLA 论文要特别小心——作者说"multimodal"时必须看上下文判断是哪种。


六、何时指哪个:判别手册

6.1 看上下文五个信号

信号多半指
论文谈"sensor fusion"、"visuotactile"、"VLA"(A) 输入
论文谈"MSE fails"、"mode collapse"、"diffusion"、"flow matching"、"action distribution"(B) 输出
论文谈"cross-embodiment"、"multi-task"、"OpenX"、"large-scale pretraining"(C) 数据
论文给 $p(a\mid o)$ 公式(B)
论文给 $o = (o_v, o_l, ...)$ 公式(A)

6.2 三个最易混的高发区

  1. VLA 论文标题:"a multimodal vision-language-action model"——这里 multimodal 通常同时指 (A)(视觉+语言输入)和 (C)(跨任务训练),但很少指 (B)。要看正文。
  2. Diffusion Policy 论文:标题不含"multimodal",但正文的"multimodal action distribution"特指 (B)。
  3. Cross-embodiment / OpenX:"multimodal dataset"指 (C),但训练出的策略本身可能是 (A)。

6.3 安全用法建议

写论文/技术文档时尽量避开歧义

  • 用 "multi-sensor" 或 "multi-input" 替代 "multimodal perception"
  • 用 "multi-mode action" 或 "multi-modal action distribution" 显式标 "action"
  • 用 "multi-task" 或 "cross-embodiment" 替代 "multimodal data"

中文里"多模态"歧义同样严重——尽量说"多模态感知"(A)/"多峰动作分布"(B)/"多源数据"(C)。


七、常见误用

  • "Diffusion Policy 是多模态方法":含混。准确说法是"Diffusion Policy 学多峰动作分布"——明确指 (B)。如果只说"多模态方法",读者可能误以为是视觉+语言融合。
  • "VLA 解决了多模态问题":含混。VLA 主要解决 (A) 多模态输入;其动作分布如果是 MSE 回归则没解决 (B)。π0 才同时解决 (A)(B)。
  • "加个语言指令让策略变多模态":严格说是"加了个输入通道"——(A)。和动作多峰 (B) 完全无关。
  • "MSE 学不到多模态":要补全——"MSE 学不到多峰动作分布 (B)"。MSE 学多模态输入 (A) 完全没问题(图像+语言 → 单动作 MSE 是合法 BC)。
  • 把"multimodal dataset"和"multimodal action"等同:OpenX 是 (C) 多源数据;它训出的 RT-X 模型在动作侧是离散 token argmax(单峰)。数据多源 ≠ 输出多峰。
  • 混淆 multimodality 和 multi-task:multi-task 是 (C) 的特例(任务维度上的混合),multimodality 更宽(还可以是本体/场景/演示者混合)。
  • 以为加了触觉就一定提升:触觉(A 的一个通道)对盲操作任务有用,对开环 locomotion 几乎没用——还要看任务是否需要这个模态的信息。

八、与其他概念的关系

  • C-imitation-learning-theory 第六节:从 IL 视角讲 (B) 多峰动作。本条辨析是它的扩展——加上 (A)(C) 两个维度。
  • C-diffusion-flow-matching:(B) 的数学核心,讲 diffusion/flow/score 三种解 (B) 的统一视角。
  • C-action-representations:action 的表示决定 (B) 的可解性——discrete token 强压成 argmax(破坏多峰),continuous flow 保留多峰。
  • C-distillation-methodsteacher-student / privileged distillation 解决 (A) 的一个子问题——把多通道(含特权)信息压到单通道 student。
  • T06 VLA 五段演进:VLA 的演进同时是 (A) 输入通道逐渐丰富 + (B) 动作表示从单峰(MSE)→ 多峰(flow)。
  • T11 灵巧操作:(A) 的典型受益场景——视觉+触觉对遮挡物体操作必不可少。

九、开放问题

  • 模态缺失的鲁棒性:训练时有视觉+触觉,部署时视觉失效,策略能否仍 work?目前做法是模态 dropout,但理论 bound 缺。
  • (B) 的样本复杂度:学多峰动作分布比单峰多多少样本?DP3 说 3D 表征下 10 条 demo 就够,但 2D 要 100+;缺理论。
  • (A) 和 (B) 是否该共享 backbone:π0 用 VLM backbone 处理 (A),加 action expert 处理 (B)。是否所有 VLA 都该这样分离?开放。
  • (C) 的最优混合比例:跨任务训练时 $\rho_k$ 怎么定?是按数据量、按难度、按 task importance?未有共识。
  • 跨本体动作统一:不同本体的 action space 维度不同,如何在 (B) 多峰基础上再加跨本体维度?GR00T N1 的 latent action 是一种解法,但仍未收敛。
  • (A)(B)(C) 的统一理论:是否存在一个框架同时描述三者?目前没有——(A) 是信息融合、(B) 是分布建模、(C) 是多任务学习,分属不同数学分支。

复盘:误区、检查点与 FAQ

常见误区

"扩散策略是多模态方法" —— 含混。准确说法是"扩散策略学多峰动作分布",指第二种含义。只说"多模态方法"会被误以为是视觉+语言融合的第一种。

"加了语言指令就让策略变多模态" —— 严格说只是加了个输入通道,属于第一种。和同一情况下有多个合理动作(第二种)完全无关。

"多源数据训出的策略一定有多峰动作" —— 不一定。训练数据多源是第三种。训出来的策略动作仍可能是单峰。输出端有没有多峰是另一回事。

检查点

Q1

用一句话说清"多模态"在机器人论文里有几种含义?

💡 显示参考答案
  • 三种完全不同的含义,共用一个名字。
  • 三种分别作用在输入侧、输出侧、数据侧。
Q2

三种含义分别作用在策略的哪一侧?

💡 显示参考答案
  • 多感知输入作用在输入侧(眼睛/触觉/语言)。
  • 多峰动作分布作用在输出侧(同一情况多个合理动作)。
  • 多源数据作用在训练数据侧(多种任务或多种机器人)。
Q3

用"同名三个人"的类比解释:为什么看到"多模态"必须先看上下文?

💡 显示参考答案
  • 三种"多模态"像同名的三个人,身份证号完全不同。
  • 同名不等于同一对象,所以必须靠上下文确定指的是哪一个。
Q4

为什么"加语言指令"和"同一情况有多个合理动作"是两件不同的事?

💡 显示参考答案
  • 加语言指令只是给策略加了个输入通道(第一种,输入侧)。
  • 同一情况多个合理动作指输出端的多峰(第二种,输出侧)。
  • 两者作用在策略的不同侧,数学上完全无关。
Q5

假如一篇论文标题写"multimodal VLA",多半指哪种含义?要看正文哪个信号确认?

💡 显示参考答案
  • VLA 标题里的 multimodal 通常同时指多感知输入(视觉+语言)和跨任务数据,很少指多峰动作。
  • 确认信号:正文若谈 action distribution / mode collapse / diffusion / flow matching,则锁定第二种(多峰动作)。

FAQ

Q1:π0 为什么同时是三种多模态?

π0 接收视觉+语言+本体感受输入(第一种)。用流匹配学多峰动作分布(第二种)。还在叠衣服、收拾等多种任务上混合训练(第三种)。三种含义它全占,所以读 π0 论文要特别小心分辨。

Q2:为什么中文里"多模态"歧义特别严重?

中文"模态"对应英文 mode(模式)和 modality(通道/感官)两个不同概念。英文能用 multi-mode 和 multi-modal 区分,中文一律叫"多模态"。建议中文写作时说"多感知输入""多峰动作""多源数据"来消歧。

Q3:扩散策略和流匹配是哪种多模态?

都是第二种——学多峰动作分布。它们解决的是"同一观测下多个合理动作"的问题,和传感器、数据来源无关。看到"action distribution""mode collapse"这类词就锁定第二种。


深度辨析 → site/concepts/C-multimodal-disambiguation.html

相关