枢纽
物理感知
输入模态vision

VDB:给对抗学习的判别器「戴个口罩」

Xue Bin Peng, Angjoo Kanazawa, Sam Toyer, Pieter Abbeel, Sergey Levine(UC Berkeley)。ICLR 2019, arXiv:1810.00821。 imitationGAIL/对抗 IL

🧠 一句话心智模型:对抗模仿学习(GAIL 式)里,判别器如果太强(100% 分清「人 vs 机器人」),它给出的梯度就成了废话——policy 学不到东西。VDB 的做法:给判别器的内部表征戴个「信息口罩」(信息瓶颈),限制它能看到多少信息,让它永远「差不多就行」——既够强能给有用梯度,又不至于强到梯度消失。

🎯 为什么重要:对抗训练的「判别器过强」难题

GAIL/GAN 的核心矛盾:判别器和策略(生成器)对抗博弈。如果判别器太强(完美区分),梯度变成「非 0 即 1」,policy 收到的信号无信息量(梯度消失);如果太弱,又没指导力。理想是判别器始终「差不多」——保持有用的梯度。但实际中判别器经常过强,尤其当 expert 数据和 policy 数据分布差异大时(如 sim-to-real、视频→动作)。

核心矛盾:判别器 $D$ 太强 → $D(x) \in \{0,1\}$ → 梯度 $\nabla \log D(x)$ 在大部分区域为 0 → policy 收不到学习信号。需要一种自动调节判别器容量的机制。

💡 核心思想:用信息瓶颈约束判别器表征

观察 X (人/policy) 信息瓶颈 编码器 q(z|x) I(X;Z) ≤ I (KL 正则 β) 判别器 D(z) 分数 始终适中 (不 0/1) 有用梯度
图:VDB——观察 X 经信息瓶颈编码器 q(z|x) 压缩(约束 I(X;Z) ≤ I)→ 判别器在压缩表征 z 上打分 → 永远不完美 → 梯度始终有信息量。

🛠️ 关键设计

设计心智为什么必要
变分信息瓶颈编码器 q(z|x) 将观察压缩成 z,约束互信息 $I(X;Z) \leq I$(通过 KL 正则 $\beta \cdot D_{KL}(q(z|x) \| p(z))$)限制判别器容量——不让它「看太多」,保持 D(z) 在有梯度的中间区域
可调信息容量 I通过 β 控制瓶颈紧度(β 大→瓶颈紧→判别器弱;β 小→瓶颈松→判别器强)不同任务需要不同的判别器强度;VDB 提供了一个旋钮来自动平衡
通用性可插入任何对抗学习框架(GAIL / 对抗 IRL / GAN)不改变主框架,只约束判别器 → 即插即用
🔮 关键反直觉:限制判别器反而让 policy 学得更好。直觉上「判别器越强 = 老师越严 = 学得越好」,但对抗学习不是「教」而是「博弈」——判别器太强 = 博弈已结束(一方碾压),没梯度了。VDB 通过人为限制判别器让博弈始终「势均力敌」,从而持续产生有用梯度。

📊 结果

应用结果
模仿学习(从视频)直接从原始视频演示学跑步等连续控制技能,大幅超越先前对抗 IL 方法
对抗逆 RL学到更简洁(parsimonious)的 reward 函数
GAN改善训练稳定性
核心收益通用、即插即用——任何对抗学习框架加一个信息瓶颈即可改善稳定性

🌐 在领域中的位置

GAIL(对抗 IL,判别器易过强) VDB(信息瓶颈约束判别器)⭐ DAC / AMP(改进的对抗 IL 变体)

VDB 是对抗 IL「判别器容量控制」的通用工具,被后续 AMP/DAC 等工作参考。关联 T11

❓ 常见误区

VDB 是在限制 policy 吗?

不是。VDB 限制的是判别器的表征容量(通过信息瓶颈)。policy 不受直接约束。

它和 gradient penalty(WGAN-GP)有什么区别?

WGAN-GP 用梯度惩罚约束判别器的 Lipschitz 连续性(让 D 满足 Wasserstein 距离的数学条件)。VDB 用信息瓶颈约束判别器的信息容量(限制它能看到多少)。两者从不同角度限制判别器,但 VDB 更通用(不限 Wasserstein 框架)。