⏱ ~69 min

概念辨析 · 各种 Distillation(蒸馏)

"distillation"在机器人学习里有至少四种含义,经常被混用:teacher-student/privileged、policy、feature、online。它们都涉及"从一个网络把知识搬到另一个网络",但搬的是什么、为什么搬、什么时候搬完全不同。误用会让工程选错方法——比如把 privileged distillation 当成压缩工具用,或者把 policy distillation 当成适应新本体的手段。本条辨析把四种 distillation 彻底分开,并给出"何时用哪个"的决策表。
词源说明:distillation 的母概念是 Hinton 等 2015 的 Knowledge Distillation(KD)——用 teacher 在温度 $T$ 下的 soft target(softmax 概率分布)作为监督信号,把"暗知识"(dark knowledge,非最大类的概率)从大网络蒸给小网络。机器人领域的 (2)(3)(4) 都是 KD 在不同侧面的特例:(2) 蒸最终输出分布、(3) 蒸中间层表征、(4) 把 KD 的"固定 teacher"放宽到"演化 teacher"。(1) privileged 则是机器人圈自家发展出来的分支,母概念是 asymmetric actor-critic 与 Chen et al. 2020 的 privileged learning,而不是 Hinton 的 KD——但因为形式上也是"teacher 监督 student",被习惯性归入 distillation。

Distillation 五类分类树:通用框架 Teacher-Student(母类)下分四种特殊情形——Privileged(特权信息维度 / ANYmal-C·OmniH2O)、Policy(容量压缩 / Consistency Policy·VLA-OFT)、Feature(中间表征 / RMA·FitNet)、Online(共演化 / AMP·Mean Teacher),每类含定义、代表、场景、loss 形式

本页内容

基础解释

一句话直觉

"蒸馏"在机器人圈有四种完全不同的意思。都叫"搬知识",搬什么、为什么搬却差远了。好比"传"字,传话、传球、传家都叫"传"。

是什么·为什么

机器人学习里"蒸馏"是个被用滥的词。四种完全不同的方法都叫蒸馏。都涉及把知识从一个网络搬到另一个。但搬什么、为什么搬、什么时候搬完全不同。

为什么重要:现代机器人栈里蒸馏无处不在。把仿真里的"上帝视角"蒸给只靠本体感受的学生,是蒸馏。把大模型蒸成小模型加速推理,也是蒸馏。分不清这四种会工程选错方法。

四种蒸馏的通俗版

第一种叫"特权蒸馏"。老师有上帝视角(真实摩擦地形图),学生只有自身感受。老师把判断环境的能力蒸给学生。学生靠历史轨迹反推环境参数。

第二种叫"容量压缩"。老师太大跑不动,蒸成小模型部署。好比把厚教材浓缩成复习笔记,要点不丢但轻便。

第三种叫"中间表征蒸馏"。不蒸最终动作,蒸老师思考过程的中间结果。学生不只学答案,还学老师怎么想。

第四种叫"在线共蒸"。老师和学生一起训,互为监督。没有现成的固定老师,两者在训练中互相进步。

核心大白话:第一种搬信息维度差(老师知道更多)。第二种搬容量差(老师更大)。第三种搬中间层(不只是输出)。第四种搬时间维度(老师不固定)。看论文时要先锁定是哪一种。

一句话类比:四种蒸馏之于机器人训练,像四种"传"。传话搬信息,传球换载体,传家继表征,传人共进步。形式相似,本质不同。

为什么必须先吃透这一篇

现代机器人栈里 distillation 无处不在:

  • ANYmal-C、OmniH2O、HOVER 都用 teacher-student——把仿真里的"上帝视角"(地形图、真实摩擦)蒸给只靠本体感受的 student。
  • Consistency Policy、π0 fast 用 policy distillation——把 50 步 diffusion 蒸成 1-4 步。
  • AMP、对抗式 IL 是 online distillation 的变体——判别器和策略互相蒸。
  • RMA、DreamWaQ 用 feature distillation——把特权 encoder 的中间表征蒸给历史 encoder。

如果分不清这四种,读 ANYmal 论文时会以为它只是在做模型压缩,从而完全错过"特权信息隐式编码"这个核心洞察。

这条辨析贯穿 T01 sim2real(teacher-student 是核心方法)、T04 motion prior(AMP 的对抗蒸馏)、T05 diffusion policy(consistency 蒸馏加速推理)、T06 VLAVLA 的模型压缩)。


一、四种 distillation 的总览

类型搬什么teacher 和 student 关系何时用代表
(1) Teacher-Student / Privileged特权信息 → 本体感受teacher 看上帝视角,student 只看本体感受sim2real、盲 locomotionANYmal-C、OmniH2O、HOVER
(2) Policy Distillation大策略 → 小策略(容量压缩)teacher 大、student 小推理加速、部署到边缘Policy Distillation、Consistency Policy
(3) Feature Distillation中间表征(hidden state)蒸 hidden 而非 output表征对齐、跨模态迁移FitNet、RMA Stage 2、DreamWaQ
(4) Online Distillation共演化(互为 teacher)teacher 和 student 一起训无固定 teacher、自监督Mean Teacher、AMP 判别器↔策略

核心区别:(1) 是信息维度的差异(teacher 知道更多),(2) 是容量维度的差异(teacher 更大),(3) 是表征层次的差异(蒸中间层而非输出),(4) 是时间维度的差异(teacher 不固定)。


二、Teacher-Student / Privileged Distillation

2.1 核心问题

仿真里机器人有"上帝视角"——真实摩擦系数、高度图、接触法向量、未来扰动。真机上这些特权信息(privileged info)测不到。如果策略直接依赖特权信息,部署时就崩。

解决思路:分两阶段。teacher 用特权信息训练(学到最优策略),student 不用特权信息但模仿 teacher 的输出。关键洞察:特权信息的效应可以被本体感受的历史隐式编码——比如机器人命令某个关节运动时,实际运动偏差取决于摩擦/质量,从历史 $(o_{t-T}, ..., o_t)$ 能反推。

2.2 形式化

定义:

  • 特权信息 $e_t \in \mathbb{R}^d$(环境 latent:摩擦、质量、地形等)
  • 本体感受 $o_t$(关节角、IMU、历史)

Stage 1(teacher):用 PPO + privileged state 训练

$$\pi^T = \arg\max_\pi \mathbb{E}\!\left[\sum_t \gamma^t R(s_t, a_t)\right], \quad \text{state} = (o_t, e_t) \tag{T1}$$

Stage 2(student distillation):student 只用历史 $h_t = (o_{t-T}, ..., o_t)$,最小化与 teacher 输出差异

$$\pi^S = \arg\min_\phi \mathbb{E}_{(o, e) \sim \mathcal{D}}\big[\mathcal{L}\big(\pi^S_\phi(h_t),\, \mathrm{sg}(\pi^T(o_t, e_t))\big)\big] \tag{T2}$$

其中 $\mathrm{sg}(\cdot)$ 是 stop-gradient——teacher 不再更新。$\mathcal{L}$ 有三种常见选择:

Loss 形式公式用在
MSE on action$\\pi^S(h_t) - \pi^T(o_t, e_t)\^2$OmniH2O、RMA Stage 2
KL on distribution$D_\text{KL}(\pi^S \\pi^T)$连续动作通用
Feature matching$\\psi^S(h_t) - \psi^T(o_t, e_t)\^2$蒸 latent(见 §4)

2.3 DAgger rollout:和"固定数据集蒸馏"的本质区别

普通 distillation 是固定数据集:收集一批 $(o, e)$,让 teacher 标注,student 在这批数据上学。问题:student 部署时遇到自己诱导的新状态(不在数据集里),就崩——这是 BCcovariate shift 问题在 distillation 里的翻版。

DAgger(Dataset Aggregation)解法:让 student 在仿真里自己 rollout产生数据,再让 teacher 在这些 student 状态上标注。这样 student 的失败状态被反复标 → 学到 recover。

$$\mathcal{D}_\text{rollout} = \bigcup_{i=1}^{N} \{(o_t, e_t) : o_t \sim \pi^S_i\text{-induced trajectory}\}$$

每一轮 $i$:student $\pi^S_i$ 在仿真跑 → 收集状态 → teacher 标注 → 加入 $\mathcal{D}$ → 重训 student。这是 Lee et al. 2020 的盲 ANYmal [arxiv:2010.11251, Science Robotics]、OmniH2O [arxiv:2406.08858] 的核心训练流程。

2.4 和 asymmetric actor-critic 的区别

asymmetric actor-critic:critic 用特权信息(训练时),actor 不用(部署时),但 critic 和 actor 是同一回合内联合训练(共享 PPO loss,actor 通过价值回传间接学到特权信息的影响)。

teacher-student:是两个网络分两阶段——先训 teacher,再蒸 student。

机制相似(都是训练用特权、部署不用)但流程不同:asymmetric 是单阶段端到端,teacher-student 是两阶段解耦。实际工程多选 teacher-student——因为 Stage 2 纯监督,训练快、稳;asymmetric 的 critic 和 actor 一起 PPO 易不稳。

2.5 代表工作

  • Asymmetric Actor-Critic [Pinto 2017, arxiv:1710.06542]:概念前身——critic 用 depth map 等特权信息。
  • Lee et al. 2020 [arxiv:2010.11251, Science Robotics]:盲 ANYmal teacher-student + DAgger 的工程标杆,奠定范式(注意:此文用的是 ANYmal-A/B,不是 -C)。
  • ANYmal-C in the wild [Miki 2022, arxiv:2201.08117, Science Robotics]:在 Lee 2020 基础上把外感知(高度图/lidar)也作为特权信息蒸给带相机的 student,让 ANYmal-C 进入森林、雪地、工地长时间部署。
  • RMA [Kumar 2021, arxiv:2107.04034]:两阶段 RL——Stage 1 训 $\pi(a|s, z)$($z$ 是特权环境参数 $e\in\mathbb{R}^{17}$ 编码出的 8 维 latent),Stage 2 训 $\phi$ 从历史估 $\hat z$。可看作 teacher-student 的显式参数化版本。
  • DreamWaQ [2023, arxiv:2301.10602]:隐式地形估计,类似 RMA 但 latent 不解释。
  • OmniH2O [2024, arxiv:2406.08858]:teacher 维 913 / student 维 1665(25 步历史×63 + 当前 90),DAgger 蒸馏。
  • HOVER [2024, arxiv:2410.21229]: oracle(满血特权 + 全 reference goal)+ mode/sparsity mask 随机化,DAgger 蒸馏出一个支持 15+ 命令模式子集的 universal student。oracle 与 student 同结构(3 层 MLP),不是多 teacher、也不是容量压缩。

2.6 何时用 privileged distillation

场景用 privileged distill?
仿真训练、真机部署,且仿真有真机测不到的信息✅ 必须
仿真训练、仿真部署(纯 sim)❌ 不需要——直接用特权信息
真机数据训练、真机部署❌ 不需要——没"特权"概念
跨本体迁移(A 机器人训的给 B)⚠️ 用 cross-embodiment distill(见 §6)

三、Policy Distillation(容量压缩)

3.1 核心问题

teacher 网络太大(如 7B VLA、50 步 diffusion policy),无法在机器人 onboard 算力(~10 TOPS)上实时跑。需要把大网络蒸成小网络——容量压缩

与 Hinton KD 的关系:Policy Distillation 是 Hinton 2015 Knowledge Distillation 在 RL 上的直接应用。KD 原版用 teacher 的 soft target $\mathrm{softmax}(z_i/T)$($T$ 是温度,$T\to\infty$ 概率越平、暗知识越明显)作为 student 的监督;Rusu 2016 把"分类 logit"换成"策略分布",loss 改成 teacher 和 student 策略分布之间的 KL。所以 (2) Policy Distillation ≡ "KD on $\pi(\cdot\mid o)$",而 (3) Feature Distillation ≡ "KD on 中间层"。

3.2 形式化

teacher $\pi^T$(大、慢)→ student $\pi^S$(小、快)。Loss 通常是 KL 或 MSE:

$$\min_{\pi^S} \mathbb{E}_{o \sim \mathcal{D}}\big[D_\text{KL}\big(\pi^T(\cdot\mid o) \,\|\, \pi^S(\cdot\mid o)\big)\big] \tag{PD-KL}$$

或对确定性策略直接回归:

$$\min_{\pi^S} \mathbb{E}_{o \sim \mathcal{D}}\big[\|\pi^S(o) - \pi^T(o)\|^2\big] \tag{PD-MSE}$$

3.3 三个子场景

(a) 经典 policy distillation

[Policy Distillation, Rusu 2016, arxiv:1511.06295]:把 DQN 的策略分布(softmax over Q-values)蒸成更小的网络,可单任务压缩、也可多任务把多个 Atari expert 蒸成单一 net。是 model distillation 在 RL 上的开山。

(b) Diffusion → Consistency 蒸馏

[Consistency Policy, arxiv:2405.07503]:Diffusion Policy 推理 50 步太慢;用 consistency model 把它蒸成 1-4 步。loss 是一致性约束——沿 ODE 轨迹任意点映射到同一终点。这是当前 VLA 加速的主流路径。

(c) VLA 压缩

7B 的 π0 / OpenVLA 蒸成 1B / 3B 给机器人部署。OpenVLA-OFT 等工作走这条路。loss 通常是 token-level cross-entropy + KL on action expert。

3.4 何时用 policy distillation

场景用 policy distill?
大模型推理太慢
内存不够(边缘部署)
多任务 expert 蒸成通用 student✅(Actor-Mimic [arxiv:1511.06342])
想让 student 比 teacher 更强❌ 不可能——distill 只能复制,不能提升上限
teacher 本身就有特权信息⚠️ 这是 privileged distill(§2),不是纯压缩

3.5 policy distillation 的信息论上界(示意)

student 容量 $C(\pi^S) < C(\pi^T)$ 时,蒸馏损失有不可约下界。直觉式表达:

$$\min_{\pi^S} D_\text{KL}(\pi^T \| \pi^S) \;\gtrsim\; H(\pi^T) - C(\pi^S) \quad \text{(示意,非严格下界)}$$

即 student 容量不足以表达 teacher 分布时,KL 不可能为 0。这就是为什么蒸馏有性能损失——capacity gap 越大,损失越大(严格形式需借率失真理论,待核)。Consistency Policy 实测在机器人动作上损失小(具体 success rate 数字待核),但在图像生成上损失大——因为动作分布比图像分布简单。


四、Feature Distillation(中间表征蒸馏)

4.1 核心问题

有时候直接蒸 output 不够——output 已经被网络最后一层"压扁",丢掉了中间层的丰富信息。蒸中间表征(hidden state)让 student 学到 teacher 的"思考过程"而非只学结论。

4.2 形式化

teacher 有中间层表征 $\psi^T(x) \in \mathbb{R}^{d_T}$,student 有对应层 $\psi^S(x) \in \mathbb{R}^{d_S}$。Loss:

$$\min_{\psi^S} \mathbb{E}_x\big[\|\mathbf{W}\,\psi^S(x) - \psi^T(x)\|^2\big] \tag{FD}$$

$\mathbf{W} \in \mathbb{R}^{d_T \times d_S}$ 是可学的线性投影(如 FitNet),对齐 student 和 teacher 的表征维度。

4.3 在机器人上的代表

  • FitNet [Romero 2014]:经典 CNN 蒸馏的中层 align,思想源头。
  • RMA Stage 2 [Kumar 2021]:teacher encoder $\mu(e_t)$ 输出 latent $z_t$,student encoder $\phi(h_t)$ 蒸这个 $z_t$。这是 feature distillation 的典型——不蒸 action、不蒸 $\pi$,只蒸 environment latent。
  • DreamWaQ [Fu 2023]:隐式地形估计,类似 RMA 但 critic 也在蒸地形特征。
  • Cross-embodiment VLA:把不同本体 teacher 的中间表征对齐到统一空间,让 student 能跨本体泛化(GR00T N1 的 latent action)。

4.4 feature distillation vs policy distillation

维度Feature distillPolicy distill
蒸什么hidden state $\psi(x)$output $\pi(\cdot\mid x)$
LossMSE on featureKL/MSE on action
信息丰富度高(中间层)低(已聚合)
对齐难度需投影矩阵 $\mathbf{W}$维度直接对应
典型用法RMA、跨本体对齐模型压缩、推理加速

经验法则:想保留 teacher 的"思考过程"用 feature;只想复制行为用 policy。两者可以叠加——RMA 的 Stage 2 蒸 feature,之后还可再做一次 policy distillation 压缩容量。


五、Online Distillation(共演化)

5.1 核心问题

前三种 distillation 都假设 teacher 是固定的——先训好 teacher,再蒸 student。但有时候没有"现成的 teacher"——只有一些参考数据(如 MoCap)或一个不完备的 reward。这时 teacher 和 student 需要一起训练、互为监督

5.2 形式化

teacher $\theta_T$ 和 student $\theta_S$ 在训练过程中相互更新。最简单的形式——Mean Teacher [Tarvainen 2017]:

$$\theta_T \leftarrow \alpha\,\theta_T + (1-\alpha)\,\theta_S \quad \text{(EMA update)}$$

teacher 是 student 的指数移动平均(EMA)。student 学带 teacher 一致性约束的 loss:

$$\min_{\theta_S} \mathcal{L}_\text{task}(\theta_S) + \lambda\,\mathbb{E}_x\big[\|f_{\theta_S}(x) - f_{\theta_T}(x)\|^2\big]$$

5.3 AMP:对抗式 online distillation 的特例

AMP [Peng 2021, arxiv:2104.02180] 是机器人上最常用的 online distillation 变体——判别器 $D$ 学区分专家 motion 和策略 motion,策略用 $D$ 的输出当 style reward。

这里"teacher"不是固定的 expert,而是不断更新的判别器。判别器和策略互训:

  • 判别器学:"这动作像 expert 吗?"(从 expert 数据 + 当前策略 rollout 学)
  • 策略学:"让判别器打高分"(用判别器输出当 reward 跑 RL)

形式上类似 GAN 的 min-max,但目标是分布匹配(让 $\rho_\pi$ 匹配 $\rho_\text{expert}$)而非生成样本。

为什么算 distillation:判别器把 expert 数据"凝练"成一个标量 reward 信号,策略用这个信号学——本质上是 expert 知识经由判别器蒸给策略。和 BC 的直接监督不同,AMP 的"蒸馏"是间接的、对抗驱动的

5.4 多 teacher / 多模式蒸馏的变体

真正的多 teacher 蒸馏(multiple pre-trained teachers → one student)在机器人上相对少见,经典案例是 Actor-Mimic [Parisotto 2015, arxiv:1511.06342]:多个 Atari 游戏各自训一个 DQN expert,再蒸成单一多任务 student。数学上:

$$\min_{\pi^S} \sum_{k=1}^{K} w_k\,\mathbb{E}\big[D_\text{KL}(\pi^T_k(\cdot\mid o) \,\|\, \pi^S(\cdot\mid o))\big]$$

teacher 间目标冲突时需要手动调 $w_k$,这是工程难点。

容易混淆的"多模式"≠"多 teacher":HOVER [arxiv:2410.21229] 常被误读为多 teacher 蒸馏,其实它只有一个 oracle(满血特权 + 全 reference goal),通过 mode/sparsity mask 在 episode 开始时随机采样激活的指令维度子集,让单一 student 学到"任意命令子集都能响应"的 universal 能力。它属于 (1) Privileged 的变体(mask 随机化),不是多 teacher、也不是 online——oracle 在蒸馏阶段是固定的。

类似地,Walk These Ways [Margolis 2022] 用 single policy + 在线参数命令(步态频率、脚高、转向速率)实现多步态切换,也属于"单 teacher + 命令空间丰富化",而非多 teacher 蒸馏。


六、何时用哪个:决策表

6.1 一张决策表

你的问题是用哪种 distillation代表方法
仿真有真机测不到的信息,要部署到真机(1) PrivilegedTeacher-Student + DAgger
teacher 太大、推理太慢(2) PolicyConsistency Policy、VLA 压缩
想保留 teacher 中间表征的"思考过程"(3) FeatureRMA Stage 2、FitNet
只有参考数据(MoCap)、没有固定 teacher(4) Online / 对抗AMP、Mean Teacher
多个 task expert 要合成 universal student(2) 多 teacher KDActor-Mimic、多任务 policy distill
单 oracle + 想覆盖多种命令模式(1) privileged + mask 随机化HOVER
跨本体迁移(A 机器人 → B 机器人)(3) Feature 对齐GR00T N1 latent action

6.2 四种可以叠加

工程上常叠加:

  • RMA = (1) privileged(特权信息→历史)+ (3) feature(蒸 latent $z$)
  • HOVER = (1) privileged(单 oracle + mode/sparsity mask 随机化泛化多模式)
  • Consistency Policy = (2) policy distill + 保留 (3) 中间 score 表征
  • AMP = (4) online + (3) feature(判别器蒸 expert 风格特征)

6.3 不该用 distillation 的场景

  • teacher 本身就部署得起:直接用 teacher,distill 多此一举。
  • student 容量远小于 teacher:信息论下界告诉你损失大(见 §3.5)。
  • 任务本身简单:直接从数据训 student,不需要 teacher。
  • teacher 不比数据强:如果 teacher 本身就是在同一数据上训的普通 BC,蒸馏不会带来提升(除了一点正则化效果)。

七、四种 distillation 的对比

维度(1) Privileged(2) Policy(3) Feature(4) Online
搬什么特权信息容量压缩中间表征互训知识
teacher 状态固定固定固定共演化
典型 lossMSE/KL on actionKL on outputMSE on hidden对抗/一致性
数据要求DAgger rollout固定数据集配对中间层双方 rollout
训练阶段两阶段单阶段单阶段或两阶段端到端
机器人典型用法sim2real、多模式 maskVLA 加速RMA、跨本体AMP、Mean Teacher
代表论文ANYmal-C、OmniH2O、HOVERConsistency PolicyRMA Stage 2AMP、Mean Teacher

八、常见误用

  • "Teacher-Student 就是蒸馏":蒸馏只是形式,关键是特权信息的隐式编码(student 从历史 $h$ 反推 $e$)。只做 distillation 但没设计 latent / history,等于白做。
  • "RMA 是 policy distillation":RMA 是 privileged + feature distillation。Stage 2 蒸的是 latent $z$(feature),不是 action(policy)。把它当 policy distill 会误解它的核心贡献。
  • "Consistency Policy 损失很大所以不能用":在机器人动作上实测损失远小于图像生成(具体 success rate 数字待核,详见 [Prasad 2024])。原因是动作分布比图像简单。
  • "AMP 是 policy distillation":AMP 是 online distillation——判别器和策略互训,没有固定 teacher。把它当 policy distill 会错过它的对抗训练动力学
  • "蒸馏能让 student 比 teacher 强":不可能。蒸馏的上限是 teacher。想让 student 超 teacher,只能靠 student 自己的 RL fine-tune(如 ReinFlow)。
  • "feature distillation 一定比 policy 好":不一定。如果 teacher 的中间层已经 collapse(信息都在 output),蒸 feature 没意义。看具体网络结构。
  • "multi-teacher 蒸馏一定比单 teacher 好":teacher 之间冲突时 student 学不出来。Actor-Mimic 等多 teacher 方案靠权重 $w_k$ 调解,但选哪些 teacher、怎么加权是工程难题。注意 HOVER 不是多 teacher——它只有一个 oracle + mask 随机化。
  • 混淆 distillation 和 transfer learning:transfer learning 是把 pretrained 特征当初始点(如 ImageNet pretrain + robot finetune),不涉及 teacher 监督。distillation 一定有 teacher 的软监督信号。

九、与其他概念的关系

  • C-sim2real-methods 第 3 节:teacher-student 是 sim2real 四件套之一,本条辨析是它的深化。
  • C-multimodal-disambiguation:privileged distillation 是 (A) 多模态感知的一个子问题——把多通道(含特权)信息压到单通道 student。
  • C-imitation-learning-theory:BC 是 distillation 的退化情形(teacher = expert dataset,无特权信息);DAgger 是 online distillation 的一种;AMP 是对抗式 online distillation。
  • C-action-representations:distillation 的 target 是 action——action 表示(torque / PD / chunk / latent)决定蒸馏 loss 怎么写。
  • C-representation-learning:feature distillation 是表征学习的一种监督形式。
  • T01 sim2real:teacher-student + DAgger 是 sim2real 工程核心。
  • T04 motion prior:AMP 的对抗蒸馏是 motion prior 谱系的核心一环。
  • T05 diffusion policy:Consistency Policy 是 diffusion 加速的主流路径。

十、开放问题

  • distillation 的信息论基础:student 容量 $C(\pi^S)$ 和能达到的 KL 下界的关系仍不清晰(§3.5 是粗略上界)。特别是当 teacher 用特权信息时,student 的信息瓶颈是 $I(h_t; e_t)$——这个 mutual information 的估计本身是难题。
  • online distillation 的收敛性:AMP、Mean Teacher 等共演化训练在理论上没有收敛保证。判别器和策略可能 limit cycle 而非收敛到 fixed point。
  • cross-embodiment distillation:A 本体的 teacher 蒸给 B 本体的 student,action space 维度不同怎么对齐?GR00T N1 的 latent action 是一种解,但普适理论缺。
  • 多 teacher 冲突仲裁:Actor-Mimic 式多 teacher 蒸馏中,teacher 之间目标冲突时如何自动加权?目前靠手动调 $w_k$。
  • distillation vs RL fine-tune 的最优组合:先 distill 再 RL(ReinFlow)vs 同时 distill + RL(GAIL)vs 先 RL 再 distill(consistency)。不同任务最优组合不同,缺统一理论。
  • 特权信息的可解释性:RMA 的特权输入 $e\in\mathbb{R}^{17}$(质量 + COM + motor strength + 摩擦 + 地形)显式可解释,编码成 8 维 latent $z$;DreamWaQ 的 latent 不解释。哪个更好?工程上 RMA 可调试,理论上隐式 latent 表达力更强。

复盘:误区、检查点与 FAQ

常见误区

"师生蒸馏就是蒸馏" —— 蒸馏只是形式。关键是特权信息的隐式编码,学生从历史轨迹反推环境参数。只做蒸馏但没设计历史编码器,等于白做。

"RMA 是策略蒸馏" —— 错。RMA 是特权蒸馏+特征蒸馏。它第二阶段蒸的是环境隐向量(特征),不是动作(策略)。把它当策略蒸馏会错过它的核心贡献。

"蒸馏能让学生比老师强" —— 不可能。蒸馏的上限就是老师。想让学生超过老师,只能靠学生自己再训强化学习,不是靠蒸馏。

检查点

Q1

用一句话说清"蒸馏"在机器人学习里有几种含义?

💡 显示参考答案
  • 四种完全不同的含义,都涉及把知识从一个网络搬到另一个。
  • 但搬什么、为什么搬、什么时候搬完全不同。
Q2

四种蒸馏分别搬的是什么"差"?

💡 显示参考答案
  • 特权蒸馏搬信息维度差(老师知道更多)。
  • 容量压缩搬容量差(老师更大)。
  • 中间表征蒸馏搬中间层(不只是输出)。
  • 在线共蒸搬时间维度差(老师不固定)。
Q3

用"四种传"的类比解释:为什么形式相似但本质不同?

💡 显示参考答案
  • 传话搬信息、传球换载体、传家继表征、传人共进步——都叫"传"。
  • 形式相似(都涉及从一方到另一方),但搬运对象和目的完全不同。
  • 对应四种蒸馏形式相似(都是网络间搬知识),但本质不同。
Q4

为什么"师生蒸馏"的关键不是蒸馏本身,而是特权信息的隐式编码?

💡 显示参考答案
  • 蒸馏只是形式;真正信息差是老师有特权(真实摩擦/地形图),学生没有。
  • 学生要从历史轨迹反推环境参数,才能补上这个信息差。
  • 只做蒸馏但没设计历史编码器,等于白做。
Q5

假设你要把 7B 的视觉语言动作模型部署到机器人板子上,推理太慢。该用哪种蒸馏?为什么?

💡 显示参考答案
  • 用第二种——容量压缩(policy distillation)。
  • 原因是老师(7B)太大跑不动,目标是蒸成小模型部署。
  • 没有特权信息差、不需要中间表征对齐、也没有共蒸需求,所以不是其他三种。

FAQ

Q1:为什么 RMA 算两种蒸馏?

RMA 第一阶段训一个用特权信息的老师。第二阶段让学生从历史轨迹反推老师的隐向量。所以它是特权蒸馏(搬特权信息)加特征蒸馏(搬隐向量)。不是策略蒸馏,因为学生学的不是老师的动作输出。

Q2:一致性策略蒸馏为什么在机器人上损失小?

一致性策略把 50 步扩散蒸成 1 到 4 步。在机器人动作上损失约 5% 成功率。原因是动作分布比图像分布简单,学生容量足够装下老师的知识。在图像生成上同样方法损失就大得多。

Q3:AMP 算哪一种蒸馏?

AMP 是第四种——在线共蒸。判别器和策略互训,没有固定老师。判别器把专家动作凝练成奖励信号,策略用这个信号学。和有固定老师的前三种完全不同。


深度辨析 → site/concepts/C-distillation-methods.html

相关