概念辨析 · 「多模态」的三种含义
在机器人与深度学习文献里,"multimodal"几乎是个被用滥的词。同一篇论文里的"multimodal policy"可能指输入侧(视觉+语言+触觉),也可能指输出侧(同一观测下多个合理动作),还可能指训练数据侧(多种任务/本体混合)。这三个含义数学上完全不同,但社区共用一个词,导致频繁混淆。本条辨析把三者彻底分开,并指出何时该用哪种、误用的后果。
本页内容
基础解释
一句话直觉
"多模态"这个词在机器人圈被用滥了。三个完全不同的东西共用一个名字。好比"打"字,打车、打架、打电话都是"打"。
是什么·为什么
机器人论文里"多模态"几乎是个被用滥的词。同一个词在不同论文里指三件完全不同的事。读者脑子里只有一种含义就会看不懂。
为什么重要:现在最火的几篇工作把三种含义全混在一起。π0 既是多感知输入,又是多动作输出。它还跨任务训练。读这类论文时脑子里只有一种含义就完全懵。
三种含义的通俗版。
第一种叫"多感知输入"。机器人同时用眼睛、触觉、语言指令来感知。好比人有五官,每种感官信息要拼到一起。
第二种叫"多峰动作分布"。同一情况下有多个合理动作。拧扳手既能左转也能右转。绕障能从左也能从右。
第三种叫"多源数据"。训练数据来自多种任务或多种机器人。好比教材同时塞了数学、语文、英语,要小心互相干扰。
核心大白话:这三种含义完全正交。一个方法可以同时是三种。也可以只是其中一种。看到"多模态"必须先问是输入侧、输出侧、还是数据侧。
一句话类比:三种"多模态"之于机器人论文,像同名的三个人。身份证号完全不同却都叫一个名。读论文要先用上下文确定说的是哪一个。
为什么必须先吃透这一篇
近三年的代表工作恰好把这三个含义全部混在一起:
- π0 / GR00T N1 / OpenVLA 是"多模态输入"(视觉+语言+本体感受)同时是"多模态输出"(flow matching 学多峰动作分布)同时是"多模态数据"(跨任务/跨本体训练)。
- 读这类论文时如果脑子里只有"multimodal = 多感知通道",就会完全看不懂为什么它们要用 flow matching 而不是 MSE 回归——因为这里要解决的"多模态"是输出分布的多峰,和传感器无关。
这条辨析贯穿 T05 diffusion policy 谱系(输出多模态)、T06 VLA 五段演进(输入多模态)、T11 灵巧操作(视觉+触觉多模态)。
一、三种含义的总览
| 含义 | 作用对象 | 数学定位 | 典型方法 | 关键问题 |
|---|---|---|---|---|
| (A) 多模态感知 / 输入 | 观测 $o$ | $o = (o_v, o_t, o_p, o_l)$ 多通道 | VLA、VisuoTactile | 模态对齐、缺失、同步 |
| (B) 多模态动作分布 | 动作 $a$ | $p(a\mid o)$ 多峰 | Diffusion/Flow/Mixture | MSE 平均化失败 |
| (C) 多模态数据 / 任务 | 数据集 $\mathcal{D}$ | $p_\text{data}$ 混合多源 | OpenX、RT-X、cross-embodiment | 分布偏移、任务条件化 |
三者完全正交:一个方法可以同时是三者(π0),也可以只是其中之一(AMP 是 B 不是 A;PaLM-E 是 A 不是 B)。把它们区分清楚是读现代机器人论文的前提。
二、多模态感知 / 输入(multimodal perception / sensing)
2.1 定义与形式化
策略的输入由多个异构通道组成:
$$o = (o_\text{vis},\, o_\text{tac},\, o_\text{prop},\, o_\text{lang},\, o_\text{audio},\, \ldots)$$
每个通道有不同的维度、频率、语义层次:
- $o_\text{vis} \in \mathbb{R}^{H\times W\times 3}$:RGB(-D) 图像,~10-60 Hz
- $o_\text{tac} \in \mathbb{R}^{T\times d}$:触觉传感(GelSight/DIGIT/BioTac),~30-1000 Hz
- $o_\text{prop} \in \mathbb{R}^{n_\text{dof}}$:本体感受(关节角/速度/IMU),~100-1000 Hz
- $o_\text{lang} \in \Sigma^*$:语言指令(token 序列),事件驱动
策略是 $\pi(a \mid o_\text{vis}, o_\text{tac}, o_\text{prop}, o_\text{lang})$——多个条件输入。本质上是异构数据融合问题。
2.2 三个子问题
(a) 模态对齐(alignment)
不同模态的语义空间不同——图像是像素、触觉是力分布、语言是 token。直接拼起来学不动。早期做法是手动设计 encoder 把每个模态压到 $\mathbb{R}^d$ 再 concat;现代做法是用预训练编码器(CLIP/SigLIP 把图像和语言拉到同一嵌入空间)+ cross-attention 让模态互为 query/key。
数学上等价于学一个共享潜空间 $\mathcal{Z}$ 和一组映射 $\phi_i: \mathcal{O}_i \to \mathcal{Z}$,让相关模态在 $\mathcal{Z}$ 里靠近:
$$\min_\phi \sum_{(i,j)\in \mathcal{P}} \big\|\phi_i(o_i) - \phi_j(o_j)\big\|^2 \quad \text{(contrastive)}$$
$\mathcal{P}$ 是正样本对集合(如配对的图像-语言)。CLIP 用 InfoNCE 替代上式以增强 batch 内判别。
(b) 时间同步(synchronization)
触觉 1000 Hz、视觉 30 Hz、语言事件驱动——三者时间戳不同。工程上要么按最快频率采样(其他模态 repeat/latest),要么按最慢频率对齐(其他模态 aggregate)。异步策略(如 RMA 的 100 Hz policy + 10 Hz adapter)是另一种解法。
(c) 模态缺失(missing modality)
真机上某个传感器坏了、或者光照太暗看不清——策略必须能在部分模态缺失时仍工作。这是鲁棒多模态学习的核心问题,常见解法是 dropout 训练(训练时随机 mask 某个模态)或 privileged distillation(让完好模态的 teacher 蒸馏给只有部分模态的 student,见 C-distillation-methods)。
2.3 代表工作
- PaLM-E [Driess 2023, arxiv:2303.03378]:最早把 LLM 当多模态感知聚合器——视觉/本体感受/语言都编码成 token 喂进 LLM,输出语言/动作。
- RT-2 [Brohan 2023, arxiv:2307.15818]:VLA = 视觉 + 语言 → 动作 token;证明 web 知识能迁移到控制。
- VisuoTactile Two Hands [2024, arxiv:2404.16823]:双灵巧手 + 视觉 + 触觉,contact-rich 任务的多模态感知代表。
- RotateIt(General In-Hand Object Rotation with Vision and Touch) [Qi 2023, CoRL 2023, arxiv:2309.09979]:视觉 + 触觉融合做通用 in-hand 旋转,证明触觉对视觉难追踪的物体(透明/反光/遮挡)不可或缺。
- PaLI-X、VIMA、OpenVLA 都属于这一类——核心是输入端的多通道聚合。
2.4 数学直觉
把多模态感知看作信息互补:每个模态 $o_i$ 提供 $I(o_i; s^\star)$ 关于真实状态 $s^\star$ 的信息。组合后:
$$I(o_\text{vis}, o_\text{tac}, o_\text{lang}; s^\star) \ge \max_i I(o_i; s^\star)$$
信息论上单调不减。这就是为什么加触觉通常能提升灵巧操作性能——视觉看不到遮挡区域,触觉补上。
三、多模态动作分布(multi-mode / multi-modal action distribution)
3.1 定义与形式化
策略要学的条件分布 $p(a\mid o)$ 是多峰的——同一观测下有多个合理动作。形式化为高斯混合:
$$p(a\mid o) = \sum_{k=1}^{K} w_k(o)\, \mathcal{N}\big(a \mid \mu_k(o), \Sigma_k(o)\big), \quad \sum_k w_k = 1$$
或者更一般的混合分布 $p(a\mid o) = \sum_k w_k(o)\, \phi_k(a)$。
典型例子:
- 拧扳手:左转、右转都对
- 绕障:从左绕、从右绕
- 双臂递物:左手在前、右手在前
- 推物体:推不同面都能到目标位姿
3.2 为什么 MSE 回归失败
这是 IL 理论里最经典的陷阱(详见 C-imitation-learning-theory 第六节)。MSE 回归:
$$\hat\mu(o) = \arg\min_\mu \mathbb{E}_{a\sim p(\cdot\mid o)}\big[\|a - \mu(o)\|^2\big] = \mathbb{E}_{a\sim p}[a\mid o]$$
一阶条件让最优解是条件均值。对对称双峰 $p(a\mid o) = 0.5\delta(a - a_\text{left}) + 0.5\delta(a - a_\text{right})$($a_\text{left} = -a_\text{right}$),$\hat\mu(o) = 0$——什么也不做。
更直观地:MSE 假设 $p(a\mid o)$ 是单峰高斯,把所有 mode 平均成无效的中间态。机器人执行 $\hat\mu(o) = 0$ 时不是"在 left 和 right 之间犹豫",而是物理上"不动"。
3.3 三种解法(详细见 C-diffusion-flow-matching)
(a) 显式混合分布
策略输出 $K$ 个分量:$\pi_\theta(a\mid o) = \sum_k w_k(o)\mathcal{N}(\mu_k(o), \Sigma_k(o))$。$K$ 需预设,训练用 log-likelihood。问题是 $K$ 不可变、训练不稳(EM-like 优化易 mode collapse)。
(b) Diffusion Policy
学去噪过程 $\epsilon_\theta(a_t, t, o)$,从纯噪声迭代去噪到样本。自然支持任意 mode 数——噪声被数据"吸引子"分叉。代表:Diffusion Policy [Chi 2023, arxiv:2303.04137]、3D Diffusion Policy / DP3 [Ze 2024, arxiv:2403.03954]、iDP3 [Ze 2024, arxiv:2410.10803]。
(c) Flow Matching(π0)
学速度场 $v_\theta(a_t, t, o)$,把噪声沿直线路径传输到数据:
$$\frac{da_t}{dt} = v_\theta(a_t, t, o), \quad a_0 \sim \mathcal{N}(0, I), \quad a_1 \sim p_\text{data}(\cdot\mid o)$$
相比 diffusion 的曲线路径,直线 ODE 10 步 Euler 就能解,推理快 5-10 倍。代表:π0 [Physical Intelligence 2024, arxiv:2410.24164]、GR00T N1、RDT-1B。
3.4 数学直觉:为什么 Diffusion/Flow 学得到多峰
连续时间生成过程 $a_t$ 是随机微分方程/ODE。初始噪声 $a_0$ 是连续分布(覆盖整个 $\mathbb{R}^d$),不同初始点被数据分布 $p_\text{data}$ 的不同 mode 吸引——左半空间的噪声点收敛到 $a_\text{left}$,右半空间收敛到 $a_\text{right}$。网络 $v_\theta$ 学的是这个分叉流场。
对比 MSE:MSE 只学一个点(条件均值),丢掉了流场的拓扑结构。Diffusion/Flow 学的是整个分布的"地形图"。
3.5 多峰的代价
- 推理慢:50 步 diffusion 在 30 Hz 控制上吃力。Consistency Policy [Prasad 2024, arxiv:2405.07503] 用一致性蒸馏压到 1-4 步。
- 数据需求高:学分布比学点要多 1-2 个数量级样本。DP3 用 3D 点云把样本压到 10 条。
- 评估难:单步 MSE 指标不适用;要用分布距离(MMD、Wasserstein)或 closed-loop success rate。
四、多模态数据 / 任务(multimodal dataset)
4.1 定义
训练数据 $\mathcal{D} = \mathcal{D}_1 \cup \mathcal{D}_2 \cup \ldots \cup \mathcal{D}_K$ 是多个子分布的混合:不同任务、不同本体、不同场景。形式化为 mixture distribution:
$$p_\text{data}(s, a) = \sum_{k=1}^{K} \rho_k\, p_k(s, a), \quad \sum_k \rho_k = 1$$
4.2 与 (A)(B) 的关系
这是数据侧的多模态——既不是输入也不是输出多通道,而是训练分布本身是混合的。代表:
- Open X-Embodiment [arxiv:2310.08864]:21 家机构、1M+ 真机轨迹、22 种本体混合训练 RT-X。
- GR00T N1:跨本体(H1/G1/UR5/...)混合 + latent action padding 统一 action 空间。
4.3 关键挑战
- 负迁移:任务 $i$ 的梯度可能损害任务 $j$。解法是任务条件化(task embedding / language instruction)和多任务 loss 加权。
- 分布偏移:$\rho_k$ 不均衡时小任务被淹没。重采样或 curriculum 学习缓解。
五、三种含义的彻底对比
| 维度 | (A) 多模态感知 | (B) 多模态动作分布 | (C) 多模态数据 |
|---|---|---|---|
| 数学位置 | 输入 $o$ | 输出分布 $p(a\mid o)$ | 训练分布 $p_\text{data}$ |
| 本质问题 | 异构融合 | 多峰建模 | 混合分布学习 |
| 典型方法 | VLA、VisuoTactile | Diffusion/Flow/Mixture | OpenX、RT-X |
| 代表论文 | PaLM-E、RT-2、VisuoTactile | Diffusion Policy、π0 | OpenX、GR00T N1 |
| 失败模式 | 模态没对齐、缺失时崩 | MSE 平均化 | 任务互相干扰 |
| 关键技巧 | cross-attention、CLIP 对齐 | 噪声 → 数据流场 | 任务条件化、loss 加权 |
一个工作可以同时是三种
π0 [arxiv:2410.24164] 同时具备:
- (A):视觉 + 语言 + 本体感受输入
- (B):flow matching 学多峰动作 chunk
- (C):跨任务(叠衣服/收拾/操作工具)训练
这就是为什么读 VLA 论文要特别小心——作者说"multimodal"时必须看上下文判断是哪种。
六、何时指哪个:判别手册
6.1 看上下文五个信号
| 信号 | 多半指 |
|---|---|
| 论文谈"sensor fusion"、"visuotactile"、"VLA" | (A) 输入 |
| 论文谈"MSE fails"、"mode collapse"、"diffusion"、"flow matching"、"action distribution" | (B) 输出 |
| 论文谈"cross-embodiment"、"multi-task"、"OpenX"、"large-scale pretraining" | (C) 数据 |
| 论文给 $p(a\mid o)$ 公式 | (B) |
| 论文给 $o = (o_v, o_l, ...)$ 公式 | (A) |
6.2 三个最易混的高发区
- VLA 论文标题:"a multimodal vision-language-action model"——这里 multimodal 通常同时指 (A)(视觉+语言输入)和 (C)(跨任务训练),但很少指 (B)。要看正文。
- Diffusion Policy 论文:标题不含"multimodal",但正文的"multimodal action distribution"特指 (B)。
- Cross-embodiment / OpenX:"multimodal dataset"指 (C),但训练出的策略本身可能是 (A)。
6.3 安全用法建议
写论文/技术文档时尽量避开歧义:
- 用 "multi-sensor" 或 "multi-input" 替代 "multimodal perception"
- 用 "multi-mode action" 或 "multi-modal action distribution" 显式标 "action"
- 用 "multi-task" 或 "cross-embodiment" 替代 "multimodal data"
中文里"多模态"歧义同样严重——尽量说"多模态感知"(A)/"多峰动作分布"(B)/"多源数据"(C)。
七、常见误用
- ❌ "Diffusion Policy 是多模态方法":含混。准确说法是"Diffusion Policy 学多峰动作分布"——明确指 (B)。如果只说"多模态方法",读者可能误以为是视觉+语言融合。
- ❌ "VLA 解决了多模态问题":含混。VLA 主要解决 (A) 多模态输入;其动作分布如果是 MSE 回归则没解决 (B)。π0 才同时解决 (A)(B)。
- ❌ "加个语言指令让策略变多模态":严格说是"加了个输入通道"——(A)。和动作多峰 (B) 完全无关。
- ❌ "MSE 学不到多模态":要补全——"MSE 学不到多峰动作分布 (B)"。MSE 学多模态输入 (A) 完全没问题(图像+语言 → 单动作 MSE 是合法 BC)。
- ❌ 把"multimodal dataset"和"multimodal action"等同:OpenX 是 (C) 多源数据;它训出的 RT-X 模型在动作侧是离散 token argmax(单峰)。数据多源 ≠ 输出多峰。
- ❌ 混淆 multimodality 和 multi-task:multi-task 是 (C) 的特例(任务维度上的混合),multimodality 更宽(还可以是本体/场景/演示者混合)。
- ❌ 以为加了触觉就一定提升:触觉(A 的一个通道)对盲操作任务有用,对开环 locomotion 几乎没用——还要看任务是否需要这个模态的信息。
八、与其他概念的关系
- C-imitation-learning-theory 第六节:从 IL 视角讲 (B) 多峰动作。本条辨析是它的扩展——加上 (A)(C) 两个维度。
- C-diffusion-flow-matching:(B) 的数学核心,讲 diffusion/flow/score 三种解 (B) 的统一视角。
- C-action-representations:action 的表示决定 (B) 的可解性——discrete token 强压成 argmax(破坏多峰),continuous flow 保留多峰。
- C-distillation-methods:teacher-student / privileged distillation 解决 (A) 的一个子问题——把多通道(含特权)信息压到单通道 student。
- T06 VLA 五段演进:VLA 的演进同时是 (A) 输入通道逐渐丰富 + (B) 动作表示从单峰(MSE)→ 多峰(flow)。
- T11 灵巧操作:(A) 的典型受益场景——视觉+触觉对遮挡物体操作必不可少。
九、开放问题
- 模态缺失的鲁棒性:训练时有视觉+触觉,部署时视觉失效,策略能否仍 work?目前做法是模态 dropout,但理论 bound 缺。
- (B) 的样本复杂度:学多峰动作分布比单峰多多少样本?DP3 说 3D 表征下 10 条 demo 就够,但 2D 要 100+;缺理论。
- (A) 和 (B) 是否该共享 backbone:π0 用 VLM backbone 处理 (A),加 action expert 处理 (B)。是否所有 VLA 都该这样分离?开放。
- (C) 的最优混合比例:跨任务训练时 $\rho_k$ 怎么定?是按数据量、按难度、按 task importance?未有共识。
- 跨本体动作统一:不同本体的 action space 维度不同,如何在 (B) 多峰基础上再加跨本体维度?GR00T N1 的 latent action 是一种解法,但仍未收敛。
- (A)(B)(C) 的统一理论:是否存在一个框架同时描述三者?目前没有——(A) 是信息融合、(B) 是分布建模、(C) 是多任务学习,分属不同数学分支。
复盘:误区、检查点与 FAQ
常见误区
"扩散策略是多模态方法" —— 含混。准确说法是"扩散策略学多峰动作分布",指第二种含义。只说"多模态方法"会被误以为是视觉+语言融合的第一种。
"加了语言指令就让策略变多模态" —— 严格说只是加了个输入通道,属于第一种。和同一情况下有多个合理动作(第二种)完全无关。
"多源数据训出的策略一定有多峰动作" —— 不一定。训练数据多源是第三种。训出来的策略动作仍可能是单峰。输出端有没有多峰是另一回事。
检查点
用一句话说清"多模态"在机器人论文里有几种含义?
💡 显示参考答案
- 三种完全不同的含义,共用一个名字。
- 三种分别作用在输入侧、输出侧、数据侧。
三种含义分别作用在策略的哪一侧?
💡 显示参考答案
- 多感知输入作用在输入侧(眼睛/触觉/语言)。
- 多峰动作分布作用在输出侧(同一情况多个合理动作)。
- 多源数据作用在训练数据侧(多种任务或多种机器人)。
用"同名三个人"的类比解释:为什么看到"多模态"必须先看上下文?
💡 显示参考答案
- 三种"多模态"像同名的三个人,身份证号完全不同。
- 同名不等于同一对象,所以必须靠上下文确定指的是哪一个。
为什么"加语言指令"和"同一情况有多个合理动作"是两件不同的事?
💡 显示参考答案
- 加语言指令只是给策略加了个输入通道(第一种,输入侧)。
- 同一情况多个合理动作指输出端的多峰(第二种,输出侧)。
- 两者作用在策略的不同侧,数学上完全无关。
假如一篇论文标题写"multimodal VLA",多半指哪种含义?要看正文哪个信号确认?
💡 显示参考答案
- VLA 标题里的 multimodal 通常同时指多感知输入(视觉+语言)和跨任务数据,很少指多峰动作。
- 确认信号:正文若谈 action distribution / mode collapse / diffusion / flow matching,则锁定第二种(多峰动作)。
FAQ
Q1:π0 为什么同时是三种多模态?
π0 接收视觉+语言+本体感受输入(第一种)。用流匹配学多峰动作分布(第二种)。还在叠衣服、收拾等多种任务上混合训练(第三种)。三种含义它全占,所以读 π0 论文要特别小心分辨。
Q2:为什么中文里"多模态"歧义特别严重?
中文"模态"对应英文 mode(模式)和 modality(通道/感官)两个不同概念。英文能用 multi-mode 和 multi-modal 区分,中文一律叫"多模态"。建议中文写作时说"多感知输入""多峰动作""多源数据"来消歧。
Q3:扩散策略和流匹配是哪种多模态?
都是第二种——学多峰动作分布。它们解决的是"同一观测下多个合理动作"的问题,和传感器、数据来源无关。看到"action distribution""mode collapse"这类词就锁定第二种。
相关
- 线索:T05-diffusion-policy-lineage.md((B) 的算法谱系)、T06-vla-five-stages.md((A) 的演进)、T11-dexterous-manipulation.md(视觉+触觉 (A))
- 论文笔记:P-DiffusionPolicy-2023.md、P-pi0-2024.md、P-RT2-2023.md、P-OpenVLA-2024.md、P-OpenX-2023.md
- 概念:C-imitation-learning-theory.md((B) 的 IL 视角)、C-diffusion-flow-matching.md((B) 的数学统一)、C-action-representations.md(动作表示决定 (B) 可解性)、C-distillation-methods.md((A) 的 privileged 解法)
- 上游:[Radford 2021 CLIP]、[Chi 2023 Diffusion Policy]、[Black 2024 π0]、[Brohan 2023 RT-X / OpenX]