概念辨析 · 各种 Distillation(蒸馏)
"distillation"在机器人学习里有至少四种含义,经常被混用:teacher-student/privileged、policy、feature、online。它们都涉及"从一个网络把知识搬到另一个网络",但搬的是什么、为什么搬、什么时候搬完全不同。误用会让工程选错方法——比如把 privileged distillation 当成压缩工具用,或者把 policy distillation 当成适应新本体的手段。本条辨析把四种 distillation 彻底分开,并给出"何时用哪个"的决策表。
词源说明:distillation 的母概念是 Hinton 等 2015 的 Knowledge Distillation(KD)——用 teacher 在温度 $T$ 下的 soft target(softmax 概率分布)作为监督信号,把"暗知识"(dark knowledge,非最大类的概率)从大网络蒸给小网络。机器人领域的 (2)(3)(4) 都是 KD 在不同侧面的特例:(2) 蒸最终输出分布、(3) 蒸中间层表征、(4) 把 KD 的"固定 teacher"放宽到"演化 teacher"。(1) privileged 则是机器人圈自家发展出来的分支,母概念是 asymmetric actor-critic 与 Chen et al. 2020 的 privileged learning,而不是 Hinton 的 KD——但因为形式上也是"teacher 监督 student",被习惯性归入 distillation。
本页内容
基础解释
一句话直觉
"蒸馏"在机器人圈有四种完全不同的意思。都叫"搬知识",搬什么、为什么搬却差远了。好比"传"字,传话、传球、传家都叫"传"。
是什么·为什么
机器人学习里"蒸馏"是个被用滥的词。四种完全不同的方法都叫蒸馏。都涉及把知识从一个网络搬到另一个。但搬什么、为什么搬、什么时候搬完全不同。
为什么重要:现代机器人栈里蒸馏无处不在。把仿真里的"上帝视角"蒸给只靠本体感受的学生,是蒸馏。把大模型蒸成小模型加速推理,也是蒸馏。分不清这四种会工程选错方法。
四种蒸馏的通俗版。
第一种叫"特权蒸馏"。老师有上帝视角(真实摩擦、地形图),学生只有自身感受。老师把判断环境的能力蒸给学生。学生靠历史轨迹反推环境参数。
第二种叫"容量压缩"。老师太大跑不动,蒸成小模型部署。好比把厚教材浓缩成复习笔记,要点不丢但轻便。
第三种叫"中间表征蒸馏"。不蒸最终动作,蒸老师思考过程的中间结果。学生不只学答案,还学老师怎么想。
第四种叫"在线共蒸"。老师和学生一起训,互为监督。没有现成的固定老师,两者在训练中互相进步。
核心大白话:第一种搬信息维度差(老师知道更多)。第二种搬容量差(老师更大)。第三种搬中间层(不只是输出)。第四种搬时间维度(老师不固定)。看论文时要先锁定是哪一种。
一句话类比:四种蒸馏之于机器人训练,像四种"传"。传话搬信息,传球换载体,传家继表征,传人共进步。形式相似,本质不同。
为什么必须先吃透这一篇
现代机器人栈里 distillation 无处不在:
- ANYmal-C、OmniH2O、HOVER 都用 teacher-student——把仿真里的"上帝视角"(地形图、真实摩擦)蒸给只靠本体感受的 student。
- Consistency Policy、π0 fast 用 policy distillation——把 50 步 diffusion 蒸成 1-4 步。
- AMP、对抗式 IL 是 online distillation 的变体——判别器和策略互相蒸。
- RMA、DreamWaQ 用 feature distillation——把特权 encoder 的中间表征蒸给历史 encoder。
如果分不清这四种,读 ANYmal 论文时会以为它只是在做模型压缩,从而完全错过"特权信息隐式编码"这个核心洞察。
这条辨析贯穿 T01 sim2real(teacher-student 是核心方法)、T04 motion prior(AMP 的对抗蒸馏)、T05 diffusion policy(consistency 蒸馏加速推理)、T06 VLA(VLA 的模型压缩)。
一、四种 distillation 的总览
| 类型 | 搬什么 | teacher 和 student 关系 | 何时用 | 代表 |
|---|---|---|---|---|
| (1) Teacher-Student / Privileged | 特权信息 → 本体感受 | teacher 看上帝视角,student 只看本体感受 | sim2real、盲 locomotion | ANYmal-C、OmniH2O、HOVER |
| (2) Policy Distillation | 大策略 → 小策略(容量压缩) | teacher 大、student 小 | 推理加速、部署到边缘 | Policy Distillation、Consistency Policy |
| (3) Feature Distillation | 中间表征(hidden state) | 蒸 hidden 而非 output | 表征对齐、跨模态迁移 | FitNet、RMA Stage 2、DreamWaQ |
| (4) Online Distillation | 共演化(互为 teacher) | teacher 和 student 一起训 | 无固定 teacher、自监督 | Mean Teacher、AMP 判别器↔策略 |
核心区别:(1) 是信息维度的差异(teacher 知道更多),(2) 是容量维度的差异(teacher 更大),(3) 是表征层次的差异(蒸中间层而非输出),(4) 是时间维度的差异(teacher 不固定)。
二、Teacher-Student / Privileged Distillation
2.1 核心问题
仿真里机器人有"上帝视角"——真实摩擦系数、高度图、接触法向量、未来扰动。真机上这些特权信息(privileged info)测不到。如果策略直接依赖特权信息,部署时就崩。
解决思路:分两阶段。teacher 用特权信息训练(学到最优策略),student 不用特权信息但模仿 teacher 的输出。关键洞察:特权信息的效应可以被本体感受的历史隐式编码——比如机器人命令某个关节运动时,实际运动偏差取决于摩擦/质量,从历史 $(o_{t-T}, ..., o_t)$ 能反推。
2.2 形式化
定义:
- 特权信息 $e_t \in \mathbb{R}^d$(环境 latent:摩擦、质量、地形等)
- 本体感受 $o_t$(关节角、IMU、历史)
Stage 1(teacher):用 PPO + privileged state 训练
$$\pi^T = \arg\max_\pi \mathbb{E}\!\left[\sum_t \gamma^t R(s_t, a_t)\right], \quad \text{state} = (o_t, e_t) \tag{T1}$$
Stage 2(student distillation):student 只用历史 $h_t = (o_{t-T}, ..., o_t)$,最小化与 teacher 输出差异
$$\pi^S = \arg\min_\phi \mathbb{E}_{(o, e) \sim \mathcal{D}}\big[\mathcal{L}\big(\pi^S_\phi(h_t),\, \mathrm{sg}(\pi^T(o_t, e_t))\big)\big] \tag{T2}$$
其中 $\mathrm{sg}(\cdot)$ 是 stop-gradient——teacher 不再更新。$\mathcal{L}$ 有三种常见选择:
| Loss 形式 | 公式 | 用在 | ||
|---|---|---|---|---|
| MSE on action | $\ | \pi^S(h_t) - \pi^T(o_t, e_t)\ | ^2$ | OmniH2O、RMA Stage 2 |
| KL on distribution | $D_\text{KL}(\pi^S \ | \pi^T)$ | 连续动作通用 | |
| Feature matching | $\ | \psi^S(h_t) - \psi^T(o_t, e_t)\ | ^2$ | 蒸 latent(见 §4) |
2.3 DAgger rollout:和"固定数据集蒸馏"的本质区别
普通 distillation 是固定数据集:收集一批 $(o, e)$,让 teacher 标注,student 在这批数据上学。问题:student 部署时遇到自己诱导的新状态(不在数据集里),就崩——这是 BC 的 covariate shift 问题在 distillation 里的翻版。
DAgger(Dataset Aggregation)解法:让 student 在仿真里自己 rollout产生数据,再让 teacher 在这些 student 状态上标注。这样 student 的失败状态被反复标 → 学到 recover。
$$\mathcal{D}_\text{rollout} = \bigcup_{i=1}^{N} \{(o_t, e_t) : o_t \sim \pi^S_i\text{-induced trajectory}\}$$
每一轮 $i$:student $\pi^S_i$ 在仿真跑 → 收集状态 → teacher 标注 → 加入 $\mathcal{D}$ → 重训 student。这是 Lee et al. 2020 的盲 ANYmal [arxiv:2010.11251, Science Robotics]、OmniH2O [arxiv:2406.08858] 的核心训练流程。
2.4 和 asymmetric actor-critic 的区别
asymmetric actor-critic:critic 用特权信息(训练时),actor 不用(部署时),但 critic 和 actor 是同一回合内联合训练(共享 PPO loss,actor 通过价值回传间接学到特权信息的影响)。
teacher-student:是两个网络分两阶段——先训 teacher,再蒸 student。
机制相似(都是训练用特权、部署不用)但流程不同:asymmetric 是单阶段端到端,teacher-student 是两阶段解耦。实际工程多选 teacher-student——因为 Stage 2 纯监督,训练快、稳;asymmetric 的 critic 和 actor 一起 PPO 易不稳。
2.5 代表工作
- Asymmetric Actor-Critic [Pinto 2017, arxiv:1710.06542]:概念前身——critic 用 depth map 等特权信息。
- Lee et al. 2020 [arxiv:2010.11251, Science Robotics]:盲 ANYmal teacher-student + DAgger 的工程标杆,奠定范式(注意:此文用的是 ANYmal-A/B,不是 -C)。
- ANYmal-C in the wild [Miki 2022, arxiv:2201.08117, Science Robotics]:在 Lee 2020 基础上把外感知(高度图/lidar)也作为特权信息蒸给带相机的 student,让 ANYmal-C 进入森林、雪地、工地长时间部署。
- RMA [Kumar 2021, arxiv:2107.04034]:两阶段 RL——Stage 1 训 $\pi(a|s, z)$($z$ 是特权环境参数 $e\in\mathbb{R}^{17}$ 编码出的 8 维 latent),Stage 2 训 $\phi$ 从历史估 $\hat z$。可看作 teacher-student 的显式参数化版本。
- DreamWaQ [2023, arxiv:2301.10602]:隐式地形估计,类似 RMA 但 latent 不解释。
- OmniH2O [2024, arxiv:2406.08858]:teacher 维 913 / student 维 1665(25 步历史×63 + 当前 90),DAgger 蒸馏。
- HOVER [2024, arxiv:2410.21229]:单 oracle(满血特权 + 全 reference goal)+ mode/sparsity mask 随机化,DAgger 蒸馏出一个支持 15+ 命令模式子集的 universal student。oracle 与 student 同结构(3 层 MLP),不是多 teacher、也不是容量压缩。
2.6 何时用 privileged distillation
| 场景 | 用 privileged distill? |
|---|---|
| 仿真训练、真机部署,且仿真有真机测不到的信息 | ✅ 必须 |
| 仿真训练、仿真部署(纯 sim) | ❌ 不需要——直接用特权信息 |
| 真机数据训练、真机部署 | ❌ 不需要——没"特权"概念 |
| 跨本体迁移(A 机器人训的给 B) | ⚠️ 用 cross-embodiment distill(见 §6) |
三、Policy Distillation(容量压缩)
3.1 核心问题
teacher 网络太大(如 7B VLA、50 步 diffusion policy),无法在机器人 onboard 算力(~10 TOPS)上实时跑。需要把大网络蒸成小网络——容量压缩。
与 Hinton KD 的关系:Policy Distillation 是 Hinton 2015 Knowledge Distillation 在 RL 上的直接应用。KD 原版用 teacher 的 soft target $\mathrm{softmax}(z_i/T)$($T$ 是温度,$T\to\infty$ 概率越平、暗知识越明显)作为 student 的监督;Rusu 2016 把"分类 logit"换成"策略分布",loss 改成 teacher 和 student 策略分布之间的 KL。所以 (2) Policy Distillation ≡ "KD on $\pi(\cdot\mid o)$",而 (3) Feature Distillation ≡ "KD on 中间层"。
3.2 形式化
teacher $\pi^T$(大、慢)→ student $\pi^S$(小、快)。Loss 通常是 KL 或 MSE:
$$\min_{\pi^S} \mathbb{E}_{o \sim \mathcal{D}}\big[D_\text{KL}\big(\pi^T(\cdot\mid o) \,\|\, \pi^S(\cdot\mid o)\big)\big] \tag{PD-KL}$$
或对确定性策略直接回归:
$$\min_{\pi^S} \mathbb{E}_{o \sim \mathcal{D}}\big[\|\pi^S(o) - \pi^T(o)\|^2\big] \tag{PD-MSE}$$
3.3 三个子场景
(a) 经典 policy distillation
[Policy Distillation, Rusu 2016, arxiv:1511.06295]:把 DQN 的策略分布(softmax over Q-values)蒸成更小的网络,可单任务压缩、也可多任务把多个 Atari expert 蒸成单一 net。是 model distillation 在 RL 上的开山。
(b) Diffusion → Consistency 蒸馏
[Consistency Policy, arxiv:2405.07503]:Diffusion Policy 推理 50 步太慢;用 consistency model 把它蒸成 1-4 步。loss 是一致性约束——沿 ODE 轨迹任意点映射到同一终点。这是当前 VLA 加速的主流路径。
(c) VLA 压缩
7B 的 π0 / OpenVLA 蒸成 1B / 3B 给机器人部署。OpenVLA-OFT 等工作走这条路。loss 通常是 token-level cross-entropy + KL on action expert。
3.4 何时用 policy distillation
| 场景 | 用 policy distill? |
|---|---|
| 大模型推理太慢 | ✅ |
| 内存不够(边缘部署) | ✅ |
| 多任务 expert 蒸成通用 student | ✅(Actor-Mimic [arxiv:1511.06342]) |
| 想让 student 比 teacher 更强 | ❌ 不可能——distill 只能复制,不能提升上限 |
| teacher 本身就有特权信息 | ⚠️ 这是 privileged distill(§2),不是纯压缩 |
3.5 policy distillation 的信息论上界(示意)
student 容量 $C(\pi^S) < C(\pi^T)$ 时,蒸馏损失有不可约下界。直觉式表达:
$$\min_{\pi^S} D_\text{KL}(\pi^T \| \pi^S) \;\gtrsim\; H(\pi^T) - C(\pi^S) \quad \text{(示意,非严格下界)}$$
即 student 容量不足以表达 teacher 分布时,KL 不可能为 0。这就是为什么蒸馏有性能损失——capacity gap 越大,损失越大(严格形式需借率失真理论,待核)。Consistency Policy 实测在机器人动作上损失小(具体 success rate 数字待核),但在图像生成上损失大——因为动作分布比图像分布简单。
四、Feature Distillation(中间表征蒸馏)
4.1 核心问题
有时候直接蒸 output 不够——output 已经被网络最后一层"压扁",丢掉了中间层的丰富信息。蒸中间表征(hidden state)让 student 学到 teacher 的"思考过程"而非只学结论。
4.2 形式化
teacher 有中间层表征 $\psi^T(x) \in \mathbb{R}^{d_T}$,student 有对应层 $\psi^S(x) \in \mathbb{R}^{d_S}$。Loss:
$$\min_{\psi^S} \mathbb{E}_x\big[\|\mathbf{W}\,\psi^S(x) - \psi^T(x)\|^2\big] \tag{FD}$$
$\mathbf{W} \in \mathbb{R}^{d_T \times d_S}$ 是可学的线性投影(如 FitNet),对齐 student 和 teacher 的表征维度。
4.3 在机器人上的代表
- FitNet [Romero 2014]:经典 CNN 蒸馏的中层 align,思想源头。
- RMA Stage 2 [Kumar 2021]:teacher encoder $\mu(e_t)$ 输出 latent $z_t$,student encoder $\phi(h_t)$ 蒸这个 $z_t$。这是 feature distillation 的典型——不蒸 action、不蒸 $\pi$,只蒸 environment latent。
- DreamWaQ [Fu 2023]:隐式地形估计,类似 RMA 但 critic 也在蒸地形特征。
- Cross-embodiment VLA:把不同本体 teacher 的中间表征对齐到统一空间,让 student 能跨本体泛化(GR00T N1 的 latent action)。
4.4 feature distillation vs policy distillation
| 维度 | Feature distill | Policy distill |
|---|---|---|
| 蒸什么 | hidden state $\psi(x)$ | output $\pi(\cdot\mid x)$ |
| Loss | MSE on feature | KL/MSE on action |
| 信息丰富度 | 高(中间层) | 低(已聚合) |
| 对齐难度 | 需投影矩阵 $\mathbf{W}$ | 维度直接对应 |
| 典型用法 | RMA、跨本体对齐 | 模型压缩、推理加速 |
经验法则:想保留 teacher 的"思考过程"用 feature;只想复制行为用 policy。两者可以叠加——RMA 的 Stage 2 蒸 feature,之后还可再做一次 policy distillation 压缩容量。
五、Online Distillation(共演化)
5.1 核心问题
前三种 distillation 都假设 teacher 是固定的——先训好 teacher,再蒸 student。但有时候没有"现成的 teacher"——只有一些参考数据(如 MoCap)或一个不完备的 reward。这时 teacher 和 student 需要一起训练、互为监督。
5.2 形式化
teacher $\theta_T$ 和 student $\theta_S$ 在训练过程中相互更新。最简单的形式——Mean Teacher [Tarvainen 2017]:
$$\theta_T \leftarrow \alpha\,\theta_T + (1-\alpha)\,\theta_S \quad \text{(EMA update)}$$
teacher 是 student 的指数移动平均(EMA)。student 学带 teacher 一致性约束的 loss:
$$\min_{\theta_S} \mathcal{L}_\text{task}(\theta_S) + \lambda\,\mathbb{E}_x\big[\|f_{\theta_S}(x) - f_{\theta_T}(x)\|^2\big]$$
5.3 AMP:对抗式 online distillation 的特例
AMP [Peng 2021, arxiv:2104.02180] 是机器人上最常用的 online distillation 变体——判别器 $D$ 学区分专家 motion 和策略 motion,策略用 $D$ 的输出当 style reward。
这里"teacher"不是固定的 expert,而是不断更新的判别器。判别器和策略互训:
- 判别器学:"这动作像 expert 吗?"(从 expert 数据 + 当前策略 rollout 学)
- 策略学:"让判别器打高分"(用判别器输出当 reward 跑 RL)
形式上类似 GAN 的 min-max,但目标是分布匹配(让 $\rho_\pi$ 匹配 $\rho_\text{expert}$)而非生成样本。
为什么算 distillation:判别器把 expert 数据"凝练"成一个标量 reward 信号,策略用这个信号学——本质上是 expert 知识经由判别器蒸给策略。和 BC 的直接监督不同,AMP 的"蒸馏"是间接的、对抗驱动的。
5.4 多 teacher / 多模式蒸馏的变体
真正的多 teacher 蒸馏(multiple pre-trained teachers → one student)在机器人上相对少见,经典案例是 Actor-Mimic [Parisotto 2015, arxiv:1511.06342]:多个 Atari 游戏各自训一个 DQN expert,再蒸成单一多任务 student。数学上:
$$\min_{\pi^S} \sum_{k=1}^{K} w_k\,\mathbb{E}\big[D_\text{KL}(\pi^T_k(\cdot\mid o) \,\|\, \pi^S(\cdot\mid o))\big]$$
teacher 间目标冲突时需要手动调 $w_k$,这是工程难点。
容易混淆的"多模式"≠"多 teacher":HOVER [arxiv:2410.21229] 常被误读为多 teacher 蒸馏,其实它只有一个 oracle(满血特权 + 全 reference goal),通过 mode/sparsity mask 在 episode 开始时随机采样激活的指令维度子集,让单一 student 学到"任意命令子集都能响应"的 universal 能力。它属于 (1) Privileged 的变体(mask 随机化),不是多 teacher、也不是 online——oracle 在蒸馏阶段是固定的。
类似地,Walk These Ways [Margolis 2022] 用 single policy + 在线参数命令(步态频率、脚高、转向速率)实现多步态切换,也属于"单 teacher + 命令空间丰富化",而非多 teacher 蒸馏。
六、何时用哪个:决策表
6.1 一张决策表
| 你的问题是 | 用哪种 distillation | 代表方法 |
|---|---|---|
| 仿真有真机测不到的信息,要部署到真机 | (1) Privileged | Teacher-Student + DAgger |
| teacher 太大、推理太慢 | (2) Policy | Consistency Policy、VLA 压缩 |
| 想保留 teacher 中间表征的"思考过程" | (3) Feature | RMA Stage 2、FitNet |
| 只有参考数据(MoCap)、没有固定 teacher | (4) Online / 对抗 | AMP、Mean Teacher |
| 多个 task expert 要合成 universal student | (2) 多 teacher KD | Actor-Mimic、多任务 policy distill |
| 单 oracle + 想覆盖多种命令模式 | (1) privileged + mask 随机化 | HOVER |
| 跨本体迁移(A 机器人 → B 机器人) | (3) Feature 对齐 | GR00T N1 latent action |
6.2 四种可以叠加
工程上常叠加:
- RMA = (1) privileged(特权信息→历史)+ (3) feature(蒸 latent $z$)
- HOVER = (1) privileged(单 oracle + mode/sparsity mask 随机化泛化多模式)
- Consistency Policy = (2) policy distill + 保留 (3) 中间 score 表征
- AMP = (4) online + (3) feature(判别器蒸 expert 风格特征)
6.3 不该用 distillation 的场景
- teacher 本身就部署得起:直接用 teacher,distill 多此一举。
- student 容量远小于 teacher:信息论下界告诉你损失大(见 §3.5)。
- 任务本身简单:直接从数据训 student,不需要 teacher。
- teacher 不比数据强:如果 teacher 本身就是在同一数据上训的普通 BC,蒸馏不会带来提升(除了一点正则化效果)。
七、四种 distillation 的对比
| 维度 | (1) Privileged | (2) Policy | (3) Feature | (4) Online |
|---|---|---|---|---|
| 搬什么 | 特权信息 | 容量压缩 | 中间表征 | 互训知识 |
| teacher 状态 | 固定 | 固定 | 固定 | 共演化 |
| 典型 loss | MSE/KL on action | KL on output | MSE on hidden | 对抗/一致性 |
| 数据要求 | DAgger rollout | 固定数据集 | 配对中间层 | 双方 rollout |
| 训练阶段 | 两阶段 | 单阶段 | 单阶段或两阶段 | 端到端 |
| 机器人典型用法 | sim2real、多模式 mask | VLA 加速 | RMA、跨本体 | AMP、Mean Teacher |
| 代表论文 | ANYmal-C、OmniH2O、HOVER | Consistency Policy | RMA Stage 2 | AMP、Mean Teacher |
八、常见误用
- ❌ "Teacher-Student 就是蒸馏":蒸馏只是形式,关键是特权信息的隐式编码(student 从历史 $h$ 反推 $e$)。只做 distillation 但没设计 latent / history,等于白做。
- ❌ "RMA 是 policy distillation":RMA 是 privileged + feature distillation。Stage 2 蒸的是 latent $z$(feature),不是 action(policy)。把它当 policy distill 会误解它的核心贡献。
- ❌ "Consistency Policy 损失很大所以不能用":在机器人动作上实测损失远小于图像生成(具体 success rate 数字待核,详见 [Prasad 2024])。原因是动作分布比图像简单。
- ❌ "AMP 是 policy distillation":AMP 是 online distillation——判别器和策略互训,没有固定 teacher。把它当 policy distill 会错过它的对抗训练动力学。
- ❌ "蒸馏能让 student 比 teacher 强":不可能。蒸馏的上限是 teacher。想让 student 超 teacher,只能靠 student 自己的 RL fine-tune(如 ReinFlow)。
- ❌ "feature distillation 一定比 policy 好":不一定。如果 teacher 的中间层已经 collapse(信息都在 output),蒸 feature 没意义。看具体网络结构。
- ❌ "multi-teacher 蒸馏一定比单 teacher 好":teacher 之间冲突时 student 学不出来。Actor-Mimic 等多 teacher 方案靠权重 $w_k$ 调解,但选哪些 teacher、怎么加权是工程难题。注意 HOVER 不是多 teacher——它只有一个 oracle + mask 随机化。
- ❌ 混淆 distillation 和 transfer learning:transfer learning 是把 pretrained 特征当初始点(如 ImageNet pretrain + robot finetune),不涉及 teacher 监督。distillation 一定有 teacher 的软监督信号。
九、与其他概念的关系
- C-sim2real-methods 第 3 节:teacher-student 是 sim2real 四件套之一,本条辨析是它的深化。
- C-multimodal-disambiguation:privileged distillation 是 (A) 多模态感知的一个子问题——把多通道(含特权)信息压到单通道 student。
- C-imitation-learning-theory:BC 是 distillation 的退化情形(teacher = expert dataset,无特权信息);DAgger 是 online distillation 的一种;AMP 是对抗式 online distillation。
- C-action-representations:distillation 的 target 是 action——action 表示(torque / PD / chunk / latent)决定蒸馏 loss 怎么写。
- C-representation-learning:feature distillation 是表征学习的一种监督形式。
- T01 sim2real:teacher-student + DAgger 是 sim2real 工程核心。
- T04 motion prior:AMP 的对抗蒸馏是 motion prior 谱系的核心一环。
- T05 diffusion policy:Consistency Policy 是 diffusion 加速的主流路径。
十、开放问题
- distillation 的信息论基础:student 容量 $C(\pi^S)$ 和能达到的 KL 下界的关系仍不清晰(§3.5 是粗略上界)。特别是当 teacher 用特权信息时,student 的信息瓶颈是 $I(h_t; e_t)$——这个 mutual information 的估计本身是难题。
- online distillation 的收敛性:AMP、Mean Teacher 等共演化训练在理论上没有收敛保证。判别器和策略可能 limit cycle 而非收敛到 fixed point。
- cross-embodiment distillation:A 本体的 teacher 蒸给 B 本体的 student,action space 维度不同怎么对齐?GR00T N1 的 latent action 是一种解,但普适理论缺。
- 多 teacher 冲突仲裁:Actor-Mimic 式多 teacher 蒸馏中,teacher 之间目标冲突时如何自动加权?目前靠手动调 $w_k$。
- distillation vs RL fine-tune 的最优组合:先 distill 再 RL(ReinFlow)vs 同时 distill + RL(GAIL)vs 先 RL 再 distill(consistency)。不同任务最优组合不同,缺统一理论。
- 特权信息的可解释性:RMA 的特权输入 $e\in\mathbb{R}^{17}$(质量 + COM + motor strength + 摩擦 + 地形)显式可解释,编码成 8 维 latent $z$;DreamWaQ 的 latent 不解释。哪个更好?工程上 RMA 可调试,理论上隐式 latent 表达力更强。
复盘:误区、检查点与 FAQ
常见误区
"师生蒸馏就是蒸馏" —— 蒸馏只是形式。关键是特权信息的隐式编码,学生从历史轨迹反推环境参数。只做蒸馏但没设计历史编码器,等于白做。
"RMA 是策略蒸馏" —— 错。RMA 是特权蒸馏+特征蒸馏。它第二阶段蒸的是环境隐向量(特征),不是动作(策略)。把它当策略蒸馏会错过它的核心贡献。
"蒸馏能让学生比老师强" —— 不可能。蒸馏的上限就是老师。想让学生超过老师,只能靠学生自己再训强化学习,不是靠蒸馏。
检查点
用一句话说清"蒸馏"在机器人学习里有几种含义?
💡 显示参考答案
- 四种完全不同的含义,都涉及把知识从一个网络搬到另一个。
- 但搬什么、为什么搬、什么时候搬完全不同。
四种蒸馏分别搬的是什么"差"?
💡 显示参考答案
- 特权蒸馏搬信息维度差(老师知道更多)。
- 容量压缩搬容量差(老师更大)。
- 中间表征蒸馏搬中间层(不只是输出)。
- 在线共蒸搬时间维度差(老师不固定)。
用"四种传"的类比解释:为什么形式相似但本质不同?
💡 显示参考答案
- 传话搬信息、传球换载体、传家继表征、传人共进步——都叫"传"。
- 形式相似(都涉及从一方到另一方),但搬运对象和目的完全不同。
- 对应四种蒸馏形式相似(都是网络间搬知识),但本质不同。
为什么"师生蒸馏"的关键不是蒸馏本身,而是特权信息的隐式编码?
💡 显示参考答案
- 蒸馏只是形式;真正信息差是老师有特权(真实摩擦/地形图),学生没有。
- 学生要从历史轨迹反推环境参数,才能补上这个信息差。
- 只做蒸馏但没设计历史编码器,等于白做。
假设你要把 7B 的视觉语言动作模型部署到机器人板子上,推理太慢。该用哪种蒸馏?为什么?
💡 显示参考答案
- 用第二种——容量压缩(policy distillation)。
- 原因是老师(7B)太大跑不动,目标是蒸成小模型部署。
- 没有特权信息差、不需要中间表征对齐、也没有共蒸需求,所以不是其他三种。
FAQ
Q1:为什么 RMA 算两种蒸馏?
RMA 第一阶段训一个用特权信息的老师。第二阶段让学生从历史轨迹反推老师的隐向量。所以它是特权蒸馏(搬特权信息)加特征蒸馏(搬隐向量)。不是策略蒸馏,因为学生学的不是老师的动作输出。
Q2:一致性策略蒸馏为什么在机器人上损失小?
一致性策略把 50 步扩散蒸成 1 到 4 步。在机器人动作上损失约 5% 成功率。原因是动作分布比图像分布简单,学生容量足够装下老师的知识。在图像生成上同样方法损失就大得多。
Q3:AMP 算哪一种蒸馏?
AMP 是第四种——在线共蒸。判别器和策略互训,没有固定老师。判别器把专家动作凝练成奖励信号,策略用这个信号学。和有固定老师的前三种完全不同。
相关
- 线索:T01-sim2real-locomotion.md(privileged distill 是 sim2real 四件套)、T04-motion-prior-amp-to-bfm.md(AMP 对抗蒸馏)、T05-diffusion-policy-lineage.md(Consistency 蒸馏加速)
- 论文笔记:P-RMA-2021.md、P-OmniH2O-2024.md、P-AMP-2021.md、P-DiffusionPolicy-2023.md
- 概念:C-sim2real-methods.md(distill 是其中一环)、C-imitation-learning-theory.md(BC/DAgger/GAIL 都是 distill 特例)、C-multimodal-disambiguation.md(privileged distill 解决多模态输入的子问题)、C-action-representations.md、C-representation-learning.md
- 上游:[Hinton 2015 Knowledge Distillation]、[Rusu 2016 Policy Distillation]、[Pinto 2017 Asymmetric Actor-Critic]、[Tarvainen 2017 Mean Teacher]、[Lee 2020 ANYmal teacher-student]、[Kumar 2021 RMA]、[Peng 2021 AMP]、[Prasad 2024 Consistency Policy]