概念辨析 · 机器人学习的优化与损失函数
机器人学习算法看似五花八门——RL、IL、BC、Diffusion、contrastive、reward shaping——但归根结底都在优化一个 loss。这些 loss 范式的数学根源不同:likelihood ratio vs pathwise gradient、最大似然 vs 对抗、Bellman 残差 vs score matching。理解这些 loss 的数学本质,比记住算法名字重要得多——因为换 backbone、换任务、换数据形态时,只有 loss 的数学结构不变。
💡 一句话总结:机器人学习的所有算法归根结底是"优化一个 loss"——policy gradient(likelihood ratio)/ Bellman 残差 / 对抗 / flow matching / InfoNCE 数学结构不同;选错 loss 范式(如 MSE 训多模态、非-PBRS 改最优策略)训练会"看起来在跑"但学不出。
速查:何时用哪个
| 场景 | 推荐 loss | 原因 |
|------|-----------|------|
| 策略 + 任意动作空间(随机/离散) | Policy Gradient(likelihood ratio) | 无偏估计,PPO 的 clip 是降方差 |
| 连续动作 + off-policy 高样本效率 | Bellman 残差 + pathwise gradient(SAC/TD3) | 方差低,靠 Q 估计做 chain rule |
| reward shaping 不想改最优策略 | Potential-Based($\gamma\Phi(s')-\Phi(s)$) | Ng 1999 证明 policy invariance |
| 多模态动作生成 | Flow Matching(π0)/ DDPM | 学分布的 score / 向量场,不是均值 |
| 视觉表征预训练 | InfoNCE(contrastive) | 判别式 representation,无需 label |
本页内容
基础解释
一句话直觉
给机器人打分的"扣分细则"。机器人照这份细则自我修正。相当于学生对着标准答案改错题。
是什么·为什么
损失函数就是一份"扣分细则"。它告诉机器人当前表现离目标差多远。差得越远,扣分越多。机器人再调参数,让这份扣分慢慢降下来。
为什么重要:所有机器人学习方法归根结底都在优化一个损失。换骨架、换任务、换数据形态,损失的结构不变。看懂损失的数学,比记住算法名字重要得多。
核心一句话:损失函数定义了"什么是好"。定义错了,机器人再努力也学错方向。
几大类别的通俗版:
第一类是"对答案"。给题目和标准答案,神经网络学着输出答案。监督模仿学习走这条。简单直接,但只在答案唯一时好用。
第二类是"看反馈"。不给答案,做对了给分、做错了扣分。强化学习走这条。灵活但样本贵、方差大。
第三类是"找裁判"。让一个网络当裁判,区分机器人做的和师傅做的。裁判打的分当奖励。对抗式模仿学习走这条。但裁判太强会把策略样本全判零、梯度消失,策略反而学不动。
第四类是"打乱重排"。把动作打散成噪点再学着收回来。生成式策略走这条。能处理多模态动作。
关键陷阱:随手改奖励函数可能改了最优策略。比如随手加"动作平滑度"惩罚看似无害,实则让机器人学会偷懒。要保证不改变最优策略,奖励 shaping 必须写成特定形式(势能差)。
一句话类比:损失函数之于机器人学习,像考试评分标准之于学生。细则不同,学生努力的方向就不同。
为什么必须先吃透这一篇
机器人学的几乎所有方法都能归到几种 loss 范式:
- 监督学习 loss(BC、representation learning)
- 策略梯度 loss(PPO、SAC)
- 价值残差 loss(Q-learning、TD3、DreamerV3 的 critic)
- 对抗 loss(GAIL、AMP)
- 生成模型 loss(diffusion、flow matching、VAE)
- 对比 loss(contrastive representation learning)
选错 loss 范式会让训练"看起来在跑"但根本学不出——比如用 MSE 训 diffusion policy、用 reward shaping 改变了最优策略、用 MSE 跑多模态动作。这条辨析把这些 loss 的数学结构和典型误用拆开讲透。
这条辨析贯穿全部 14 条线索——尤其 T03 reward design(reward shaping)、T05 diffusion policy(flow matching loss)、T09 world model(ELBO + KL)、T04 motion prior(GAN + style reward)。
一、Policy Gradient:Likelihood-Ratio 估计(REINFORCE)
形式化
策略 $\pi_\theta(a\mid s)$,目标是 $J(\theta) = \mathbb{E}_{\tau\sim\pi_\theta}\big[\sum_t \gamma^t r_t\big]$。
Policy gradient 定理(详见 C-rl-algorithms):
$$\nabla_\theta J = \mathbb{E}_{\tau}\!\left[\sum_t \nabla_\theta\log\pi_\theta(a_t\mid s_t)\, A_t\right]$$
这个梯度是 likelihood-ratio 估计
数学上:
$$\nabla_\theta J = \nabla_\theta \int p_\theta(\tau)\, R(\tau)\,d\tau = \int p_\theta(\tau)\, R(\tau)\,\nabla_\theta\log p_\theta(\tau)\,d\tau = \mathbb{E}_{\tau}\!\big[R(\tau)\nabla_\theta\log p_\theta(\tau)\big]$$
这就是score function estimator / likelihood ratio estimator:用 $\nabla_\theta\log p_\theta$ 当 score,$R(\tau)$ 当权重。
与 pathwise derivative 的对比
Pathwise derivative(用于 DDPG/TD3/SAC 的 actor):
$$\nabla_\theta J \approx \mathbb{E}_s\!\Big[\nabla_a Q(s,a)\big|_{a=\mu_\theta(s)}\,\nabla_\theta\mu_\theta(s)\Big]$$
| 维度 | Likelihood-ratio(REINFORCE) | Pathwise(DDPG) |
|---|---|---|
| 适用 | 任意策略(随机/离散) | 仅连续 + 可微 actor |
| 方差 | 高(轨迹 noise) | 低(一阶差分) |
| Bias | 0(无偏) | 取决于 Q 估计准不准 |
| 数据利用 | On-policy 友好 | Off-policy 必需(要 buffer) |
| 用于 | PPO、A2C、policy gradient methods | DDPG, TD3, SAC(actor 部分), DreamerV3 actor |
工程后果
- PPO 的 clip 是在 likelihood ratio $r_t(\theta) = \pi_\theta/\pi_{\text{old}}$ 上做截断,降低方差、限制步长。
- SAC 用 reparameterization($a = f_\theta(\epsilon;s), \epsilon\sim\mathcal{N}$)让随机策略也能走 pathwise gradient——把 $\epsilon$ 当外部噪声,$a$ 对 $\theta$ 可微、能 chain rule 到 $Q$。这让 stochastic policy 不必走高方差的 likelihood-ratio 估计。(SAC 比 DDPG 稳定的根本原因另在最大熵目标 + clipped double Q + 自动温度调节,reparameterization 只是 actor 梯度的实现形式。)
二、Value-Based:Bellman 残差最小化
形式化
最优 Q 满足 Bellman 方程:$Q^*(s,a) = \mathbb{E}_{s'}[r + \gamma\max_{a'}Q^*(s',a')]$。
Q-learning 的 loss 是 Bellman 残差:
$$\mathcal{L}_{\text{TD}}(\phi) = \mathbb{E}_{(s,a,r,s')\sim\mathcal{D}}\!\Big[\big(Q_\phi(s,a) - \underbrace{(r + \gamma\max_{a'} Q_{\phi^-}(s',a'))}_{\text{target }y}\big)^2\Big]$$
$\phi^-$ 是 target network(缓慢更新)的参数。
几个关键陷阱
- Semi-gradient:target $y$ 里的 $Q_{\phi^-}$ 不参与梯度(当成常数)。如果用 full gradient $\nabla_\phi$ 对 $y$ 也求导,训练会发散——这是 Sutton & Barto 强调的"semi-gradient TD"。
- Target network:稳定 target,否则 $Q_\phi$ 自己追自己,正反馈发散。Polyak 平均($\phi^- \leftarrow \tau\phi + (1-\tau)\phi^-$)是常见做法。
- Overestimation bias:$\max$ 操作把 noise 也 max 掉,Q 越学越大。Clipped double Q(TD3 / SAC)取 $\min(Q_1, Q_2)$ 是直接对策。
- Replay buffer:必须 off-policy。On-policy 用 Bellman 残差浪费样本。
DreamerV3 的 critic loss
DreamerV3 在 imagination 里训 critic,loss 不是 scalar MSE/Huber——而是 symexp two-hot + categorical cross-entropy(论文 Eq. 11):连续 return $y$ 经 $\mathrm{symexp}$ 压到指数间隔 bin 上做 two-hot 编码当 target,critic 输出在 bin 上的分类分布。
$$\mathcal{L}_V(\psi) = -\,\mathbb{E}\!\Big[\mathrm{twohot}\big(\hat{G}_t^\lambda\big)^{\!\top}\,\log\mathrm{softmax}\big(V_\psi(h_t)\big)\Big]$$
$\hat{G}_t^\lambda$ 是从想象 reward 算的 $\lambda$-return,target 用 EMA critic 参数 $\bar\psi$ + stop-gradient 算。two-hot 分类 loss 只依赖概率而非 bin 位置的连续值,把量级差异和梯度大小解耦——这是 V3「固定超参」跨 Atari(return 几百)与 DMC(return 小数)都能训的关键。decoder/reward head 才用 symlog squared loss(论文 Eq. 8),critic 不用。
三、Actor-Critic:likelihood ratio + value 残差的结合(variance reduction)
为什么结合
- 纯 policy gradient(REINFORCE)方差大——$G_t = \sum_t \gamma^t r_t$ 包含很多 episode-level noise。
- 纯 value-based(Q-learning)只学价值,要 recover policy 需要 $\arg\max$(连续动作难)。
Actor-critic 用 critic $V_\phi$ 当 baseline,让 advantage $A_t = G_t - V_\phi(s_t)$ 方差小很多。
形式化
$$\nabla_\theta J = \mathbb{E}\!\Big[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\, A_t\Big],\quad A_t \approx \delta_t = r_t + \gamma V_\phi(s_{t+1}) - V_\phi(s_t)$$
GAE 进一步平滑:$A_t^{\text{GAE}(\lambda)} = \sum_l (\gamma\lambda)^l \delta_{t+l}$。
Actor-critic 是 variance reduction 技术
数学上,加任何 baseline $b(s)$ 都不改变梯度的期望(因 $\mathbb{E}_a[\nabla_\theta\log\pi] = 0$),但能改变方差。最优 baseline 是 $V^\pi(s)$——用 critic 估它就是 actor-critic。
这是为什么 SAC / PPO / DreamerV3 都同时训 actor 和 critic——单 actor 方差太大,单 critic 没有 policy 接口。
四、监督学习 vs RL:loss 范式的根本区别
| 维度 | 监督学习(BC、IL) | RL |
|---|---|---|
| Loss | $\mathbb{E}_{(o,a)\sim\mathcal{D}}[\ell(\pi_\theta(o), a)]$ | $\mathbb{E}_{\tau\sim\pi_\theta}[R(\tau)]$ |
| 数据来源 | 固定数据集 $\mathcal{D}$ | 策略自己 rollout |
| 梯度信号 | 显式 label $\to$ loss | 通过 return 反传 |
| Covariate shift | 严重(训练 ≠ 部署分布) | 不存在(策略在自己分布上训练) |
| 探索 | 无 | 必需(entropy bonus / SAC $\alpha$) |
| 样本效率 | 高(监督学习) | 低(on-policy)/中(off-policy) |
机器人特殊点:
- IL 的数据采集(teleop)极贵,所以 IL 一旦数据够了,不需要再 RL——除非要 self-improve。
- RL 的数据采集(仿真)几乎免费,所以 RL 在仿真里能吃大数据——但 sim-to-real gap 让"免费"打折扣。
- 现代 VLA 走 IL → RL fine-tune 混合:IL 给冷启动,RL 给自我改进(ReinFlow、VLA-RFT)。
五、Contrastive Learning 在机器人表征
形式化
InfoNCE loss:
$$\mathcal{L}_{\text{NCE}} = -\mathbb{E}_{(o, o^+, \{o^-_i\})}\!\Big[\log\frac{\exp(\text{sim}(z, z^+)/\tau)}{\sum_i \exp(\text{sim}(z, z_i)/\tau)}\Big]$$
$o$ 是 anchor,$o^+$ 是正样本(同语义),$o^-_i$ 是负样本。$\text{sim}$ 通常是 cosine。
机器人应用:R3M / VC-1 / Voltron
机器人表征学习用 contrastive 学 visual encoder:
- R3M [Nair 2022]:从 Ego4D 人类视频学"任务无关"的 visual representation,用 time-contrastive(同一视频不同帧为负)+ alignment。
- VC-1 [Nair 2023]:用 MAE + 多任务预训练,做"通用 robot vision encoder"。
- Voltron [Karamcheti 2023]:用语言-视频对齐 + masked reconstruction。
用途:把 contrastive 学的 encoder 当 downstream policy 的视觉 backbone,少样本学新任务。
工程注意
- Contrastive 学的是判别式 representation(区分正负样本),生成能力差。
- 负样本采样是关键——太多 hard negative 会训崩,太简单学不到。
- 在机器人上常和 VLM 预训练比较:VLM(如 SigLIP、CLIP)的 image encoder 也常作为 policy backbone(OpenVLA 用 Prismatic = SigLIP+DINOv2)。
六、Flow Matching / Diffusion:生成模型 loss
Diffusion: score matching + 噪声预测
DDPM [Ho 2020] 学噪声预测 $\epsilon_\theta(a_t, t, o)$:
$$\mathcal{L}_{\text{DDPM}} = \mathbb{E}_{a_0, t, \epsilon}\!\Big[\big\|\epsilon - \epsilon_\theta(\sqrt{\bar\alpha_t}\,a_0 + \sqrt{1-\bar\alpha_t}\,\epsilon,\, t,\, o)\big\|^2\Big]$$
等价于 score matching(学 $\nabla_a \log p(a\mid o)$ 的回归)。推理时迭代去噪(50-1000 步)。
Flow Matching: OT 路径回归
Flow matching [Lipman 2023] 学一个向量场 $v_\theta(a_t, t, o)$,把噪声分布 $p_0 = \mathcal{N}(0,I)$ 连续传输到数据分布 $p_1$。
条件 flow matching(CFM):给定样本 $a_1\sim p_1$,构造从 $a_0\sim\mathcal{N}$ 到 $a_1$ 的路径,典型为线性:
$$z_t = (1-t)\,a_0 + t\,a_1,\quad \frac{dz_t}{dt} = a_1 - a_0$$
Loss 是向量场回归:
$$\boxed{\;\mathcal{L}_{\text{FM}}(\theta) = \mathbb{E}_{a_1, a_0, t}\!\Big[\big\|v_\theta(z_t, t, o) - (a_1 - a_0)\big\|^2\Big]\;}$$
推理:从 $z_0\sim\mathcal{N}(0,I)$ 出发,欧拉法解 ODE $z_{t+\Delta t} = z_t + \Delta t\, v_\theta(z_t, t, o)$,10 步就够。
Flow Matching vs Diffusion
| 维度 | Diffusion (DDPM) | Flow Matching |
|---|---|---|
| 学什么 | 噪声预测 / score | 向量场 |
| 路径 | SDE(弯曲) | ODE(近直线) |
| 推理步数 | 50-1000 | 1-10 |
| 训练稳定性 | 中 | 高 |
| 机器人代表 | Diffusion Policy | π0, RDT-1B, GR00T |
π0 的 Beta 采样 trick [Black 2024]:采样 $t$ 用 $\text{Beta}(\alpha=1.5, \beta=1)$(cutoff 0.999),强调 lower (noisier) timesteps——让向量场在 noise 端学得更准。
详见 P-pi0-2024。
七、Reward Shaping:optimal policy invariance
问题
机器人 reward 难写。常见做法是加 dense shaping term:$r'(s,a,s') = r(s,a,s') + F(s,a,s')$。
问:加了 $F$ 还会学到同一最优策略吗?
Potential-Based Reward Shaping(PBRS)
[Ng, Harada, Russell 1999] 证明:如果 $F$ 是 potential-based:
$$F(s,a,s') = \gamma\,\Phi(s') - \Phi(s)$$
对任意势函数 $\Phi:\mathcal{S}\to\mathbb{R}$,则 最优策略不变:$\pi^*_{r'} = \pi^*_r$。
证明直觉
把 $F$ 累加进 return:
$$\sum_t \gamma^t F(s_t, a_t, s_{t+1}) = \sum_t \gamma^t (\gamma\Phi(s_{t+1}) - \Phi(s_t)) = -\Phi(s_0) + \lim_{T\to\infty}\gamma^T\Phi(s_T)$$
对有限 horizon 或 $\gamma<1$ + 有界 $\Phi$,第二项 $\to 0$。剩 $-\Phi(s_0)$ 与策略无关——所以加 $F$ 等于加一个常数偏置,不影响 argmax。
反例:非 potential-based shaping 会改策略
经典反例:$F(s) = $ "离目标距离的负值"——这是 PBRS($\Phi(s) = $ 距离)。但如果写 $F(s,a) = $ "做了动作 $a$ 就 +1",这不是 potential-based,会改最优策略(policy 学到狂刷这个 +1)。
工程后果
- 写 dense reward 时要确保是 potential-based,否则改最优策略。
- 速度奖励(forward velocity)= potential-based($\Phi = $ 位置负值)。
- 能量惩罚($-\|a\|^2$)= 不是 potential-based——它改变最优策略(让 policy 偷懒)。这是 locomotion 学不出激进步态的原因之一。
八、其他常见 loss 范式
GAN / Adversarial
判别器 $D_\phi$ + 生成器(policy)$\pi_\theta$ min-max:
$$\min_\theta\max_\phi\; \mathbb{E}_{\text{real}}[\log D_\phi] + \mathbb{E}_{\text{fake}}[\log(1-D_\phi)]$$
GAIL / AMP 的核心 loss。详见 C-imitation-learning-theory。
关键陷阱:模式坍塌(mode collapse)、判别器过强 → reward 稀疏。AMP 用 LSGAN + R1 gradient penalty + replay buffer 缓解。
ELBO(VAE / CVAE / DreamerV3 world model)
变分下界:
$$\mathcal{L}_{\text{ELBO}} = \mathbb{E}_{q(z\mid x)}[\log p(x\mid z)] - D_{\text{KL}}(q(z\mid x)\,\|\,p(z))$$
ACT [Zhao 2023] 用 CVAE ELBO + $\beta$-scaling(Table III 唯一值 $\beta=10$)。DreamerV3 的 world model 训练就是 ELBO + free bits KL(防 posterior 坍缩)。
Supervised regression
最简单的 loss:$\|a - a^*\|^2$。BC 默认。陷阱:多模态动作分布被平均(见 C-imitation-learning-theory 第六节)。
Cross-entropy / token classification
RT-2、OpenVLA 把 action 离散成 256 bin × N 维,用 cross-entropy 训。等价于 categorical MLE。
九、概念辨析表
| Loss 范式 | 数学结构 | 代表算法 | 机器人用例 | ||
|---|---|---|---|---|---|
| Supervised regression | $\ | y - f(x)\ | ^2$ | BC(MSE) | 简单 IL |
| Cross-entropy / MLE | $-\log p_\theta(y\mid x)$ | BC、VLA token | IL default | ||
| Policy gradient | $\nabla\log\pi\cdot A$ | REINFORCE、A2C | 历史算法 | ||
| Clipped PG | $\min(rA, \text{clip}(r)A)$ | PPO | legged locomotion | ||
| Bellman residual | $(Q - y)^2$ | DQN、SAC critic、TD3 | 所有 value-based | ||
| Adversarial | $\min_\theta\max_\phi$ | GAIL、AMP | motion prior | ||
| DDPM score matching | $\ | \epsilon - \epsilon_\theta\ | ^2$ | Diffusion Policy | 多模态操作 |
| Flow matching | $\ | v - (a_1 - a_0)\ | ^2$ | π0、RDT、GR00T | 现代操作基础模型 |
| Contrastive (NCE) | $-\log\frac{e^{+}}{\sum e}$ | R3M、VC-1 | visual representation | ||
| ELBO | $\mathbb{E}[\log p] - \text{KL}$ | ACT、DreamerV3 WM | CVAE policy / world model |
十、常见误用
- ❌ reward shaping 改变了最优策略:随手加 dense reward("动作平滑度"、"能耗"),如果不是 potential-based,会改最优策略。要么写成 $\gamma\Phi(s') - \Phi(s)$ 形式,要么承认改了策略并调权重。
- ❌ MSE 跑多模态动作:如 C-imitation-learning-theory 第六节所述,会把双模平均成无效动作。多模态必须 diffusion / flow / mixture。
- ❌ 用 cross-entropy 训连续动作:cross-entropy 假设离散 token。连续动作要用 NLL(高斯)或 diffusion。
- ❌ GAN 判别器太强不调:判别器输出 saturate(恒 0 或 1)→ 梯度消失 → policy 学不到。AMP 用 LSGAN + R1 gradient penalty + replay buffer + 判别器 stepsize 比 policy 小 1-2 个数量级来稳定。
- ❌ Q-learning 不用 target network:target $y$ 自己追自己,正反馈发散。Polyak 平均是必需。
- ❌ PPO clip 取 0.2 当铁律:剧烈动作 / GAN reward(AMP)应该取 0.02。
- ❌ flow matching 推理步数和训练不一致:训练时 $t\in[0,1]$ 连续;推理时 Euler 离散步数太少会 ODE 误差累积。π0 用 10 步,Diffusion Policy 用 50 步 diffusion。
- ❌ contrastive 负样本太少:NCE 需要 batch 内负样本充足(典型 batch=512+)。负样本不够学不到判别特征。
- ❌ 监督 loss 直接迁到 RL:BC 的 cross-entropy loss 不能直接当 RL loss——RL 没有 label,只有 return。要换 policy gradient 或 Bellman。
- ❌ DreamerV3 的 critic 不做 two-hot:跨任务的 reward scale 差几个数量级(Atari 几百 vs DMC 小数),scalar MSE 梯度量级跟着 return 平方跑($10^6$ vs $10^{-2}$)根本没法统一。critic 必须用 symexp two-hot + categorical cross-entropy 把量级与梯度解耦,漏了会发散。
- ❌ 混淆 KL 方向:ELBO 的 KL 是 $D_{\text{KL}}(q\|p)$(posterior 推 prior),不是 $p\|q$。AMP 的 BFM 用 asymmetric KL(CVAE encoder 看特权信息),方向写反会让 latent 失去信息。
- ❌ stop-gradient 漏掉:Q-learning 的 target network、ACT 的 CVAE posterior(KL 项里的 $q_\phi$)、DreamerV3 的 critic target(EMA $\bar\psi$)、diffusion 的 target $\epsilon$——所有"target"都必须 stop-gradient。漏了会让梯度追着移动 target 跑,发散。(注意:reward shaping / PBRS 是 reward 变换,与 stop-gradient 无关——别混淆。)
十一、开放问题
- 统一 loss 框架:能否把 IL / RL / Diffusion / Contrastive 写到一个 loss 范式里?最近有 work 用"probability matching"统一视角(diffusion BC = trajectory distribution matching;GAIL = occupancy matching;contrastive = mutual info lower bound),但工程上仍各用各的。
- reward shaping 自动化:LLM 生成 reward(Eureka)会自动写成 potential-based 吗?现在 GPT-4 经常写出非-PBRS 的项,导致改最优策略。可能方向:约束 LLM 输出形式。
- Diffusion / Flow 在真机上的实时性:50 步 / 10 步还是慢。Consistency distillation 压到 1 步但有损;能否做"零损失 1 步 flow"?仍未解。
- 多 loss 平衡:ACT 的 $\beta$-KL 权重、AMP 的 $w^G/w^S$、CVAE 的 free bits——这些权重目前都靠手调或多任务 grid search。自动化是开放方向。
- reward learning from preferences (RLHF):在机器人上是否可行?VLA-RFT、pi0.5 在尝试,但真机 preference 数据贵。
复盘:误区、检查点与 FAQ
常见误区
"多加几项奖励总能帮机器人学得更好" —— 错。随手加 dense reward(能耗、平滑度)若不是势能形式,会改变最优策略:机器人学会刷这个奖励偷懒,不做真正任务。
奖励 shaping 有严格的"不变性"条件,不是越多越好。
"均方误差能处理所有动作回归" —— 多模态动作会失败。同一状态多种合理动作,均方误差把它们平均成无效中间态。
多模态必须用扩散、流匹配或混合分布。
"判别器越强,对抗式模仿学得越好" —— 错。判别器太强会让梯度消失——它给所有策略样本都打零分,策略收不到学习信号。AMP 用一堆工程 trick(LSGAN 损失、梯度惩罚、经验池)压住判别器,不是让它更强。
检查点
损失函数在机器人学习中扮演什么角色?
💡 显示参考答案
- 损失定义「什么是好」,机器人按它调参数;定义错了,再努力也学错方向。
- 入门层「核心一句话」。
监督模仿学习的损失属于哪一类?强化学习的损失属于哪一类?
💡 显示参考答案
- 监督模仿=对答案(第一类);强化学习=看反馈(第二类)。
- 入门层 四分类直接给了。
为什么"随手加奖励项"会改最优策略?给个直观解释。
💡 显示参考答案
- 随手加的不是势能形式的奖励会改最优策略:机器人学会刷这个奖励偷懒,不做真正任务。
- 入门层「关键陷阱」+ 常见误区#1。
对抗式模仿学习里,裁判(判别器)太强会出什么问题?
💡 显示参考答案
- 判别器太强会把所有策略样本都判零、梯度消失,策略收不到学习信号。
- 入门层 第三类已补这句。
用"考试评分标准"类比解释:为什么换损失函数比换算法骨架影响更大?
💡 显示参考答案
- 评分标准决定学生努力方向;细则改了方向就变,比换算法骨架影响更大。
- 直觉层 类比直接说明。
FAQ
Q1:监督学习和强化学习的损失本质差别是什么?
数据来源。监督学习从固定数据集采样;强化学习从策略自己诱导的分布采样。前者有显式标签,后者只有回报信号。所以强化学习还要解决探索、信用分配等监督学习没有的问题。
Q2:为什么策略梯度方差这么大?
因为它是"轨迹级"估计——用整条 episode 的累计奖励当权重,episode 之间的随机性都被算进梯度。引入基线(critic)减去状态价值是标准的降方差手段,这就是 actor-critic。
Q3:奖励 shaping 怎么写才不改最优策略?
写成势能差形式:F(s, a, s') = γΦ(s') − Φ(s),对任意势能函数 Φ 都不变。直观理解:累加进回报后只剩初始状态的常数偏置,不影响 argmax。非势能形式的 shaping 会改策略。
相关
- 线索:T03-reward-design-evolution.md(reward shaping 与 LLM reward)、T04-motion-prior-amp-to-bfm.md(GAN + style reward)、T05-diffusion-policy-lineage.md(diffusion / flow matching)、T09-world-model-as-simulator.md(ELBO + symlog + KL)、T06-vla-five-stages.md(cross-entropy on action tokens)
- 论文笔记:P-AMP-2021.md(LSGAN + R1 + clamp reward 精确公式)、P-DiffusionPolicy-2023.md、P-pi0-2024.md(flow matching 精确公式 + Beta 采样)、P-DreamerV3-2023.md(two-hot critic + symlog)、P-ACT-ALOHA-2023.md(CVAE ELBO + $\beta=10$)
- 概念:C-rl-algorithms.md(loss → 算法)、C-imitation-learning-theory.md(IL loss 谱系)、C-mdp-pomdp-formulation.md(reward 的精确形式化)
- 上游文献:[Williams 1992 REINFORCE]、[Schulman 2017 PPO]、[Ho 2020 DDPM]、[Lipman 2023 Flow Matching]、[Ng, Harada, Russell 1999 PBRS]、[Oord 2018 InfoNCE]