⏱ ~63 min

概念辨析 · 强化学习算法家族(PPO / SAC / TD3 / DDPG / DreamerV3)

这五个算法是机器人 RL 的"基础底盘"。最容易把它们当作"调包"——但它们各自源于不同的数学假设:on-policy 还是 off-policy、确定性策略还是随机策略、model-free 还是 model-based。选错算法,比选错超参致命得多。

💡 一句话总结:PPO / SAC / TD3 / DDPG / DreamerV3 都源于 Policy Gradient 定理,但在 on/off-policy、随机/确定性策略、model-free/model-based 三个维度上分化;机器人场景下选错算法比选错超参更致命。

RL 算法家族树:Policy Gradient 定理为根 → on-policy (PPO) / off-policy (DDPG→TD3→SAC) / model-based (DreamerV3) 三分支分化图

速查:何时用哪个
| 场景 | 推荐 | 原因 |
|------|------|------|
| 仿真大规模并行 locomotion(legged_gym 4096 envs) | PPO | on-policy + GPU 并行,wall-clock 反而最快 |
| 真机 manipulation / 灵巧手(样本极贵) | SAC | off-policy + replay buffer,反复重用每条 transition |
| 长程稀疏 reward(horizon 1000+) | DreamerV3 | world model 在 imagination 里显式做 long-horizon credit assignment |
| AMP / motion prior / 剧烈动作 tracking | PPO(clip=0.02) | GAN 式 reward 极敏感,PPO 的 clip 是最稳的 on-policy 选项 |
| 真机大规模抓取数据采集 | QT-Opt(off-policy 变体) | 58 万次真机抓取只能靠 replay buffer 攒 |

本页内容

基础解释

一句话直觉

机器人靠试错学动作的一类方法。好比父母教娃骑自行车:扶着、放手、跌了爬起再试。

是什么·为什么

强化学习算法是机器人靠"试"来学动作的一类方法。它不要人写规则。机器人自己试着动,做对了得分,做错了扣分。靠这份打分慢慢调整,越做越准。

为什么重要:真机一步动辄几秒,样本极贵。选错算法,机器人训到天荒地老也学不会。选对了,二十分钟仿真里就能训出会走的机器狗。

核心一句话:这类算法都在解同一个问题。怎么从"试一次、得一分"的循环里,挤出最好的动作策略?

它们的差别只在两件事。一是"怎么试":每次试完就丢,还是把经验存起来反复用。二是"怎么输出动作":带随机性的爱探索,确定的更好部署。

仿真里能开几千个环境一起试,"丢经验"的反而最快。真机抓东西样本太贵,必须反复用旧经验。这就是仿真和真机常选不同算法的根本原因。

一句话类比:选算法之于机器人,像选变速箱之于赛车。赛道不同,档位就不同。

为什么必须先吃透这一篇

机器人 RL 不是 RL 教科书的简单延伸。机器人有四个特征让 RL 的选择变得敏感:(1) 样本极贵——真机一步动辄数秒;(2) 连续动作 + 高维——12+ 自由度关节力矩/PD target;(3) 并行可做——Isaac Gym 能开 4096 个仿真环境;(4) 奖励稀疏 + horizon 长。在这四个约束下,on-policy/off-policy、model-free/model-based 的差异被放大成"训得出来 vs 训不出来"。

这条辨析贯穿 T01 sim2realT04 motion prior(AMP+PPO)、T11 dexterous(QT-Opt off-policy)、T09 world model(DreamerV3)。


一、Policy Gradient 定理:一切的起点

给定 MDP $(\mathcal{S}, \mathcal{A}, P, R, \gamma)$,参数化策略 $\pi_\theta(a\mid s)$,目标是最大化期望回报

$$J(\theta) = \mathbb{E}_{\tau\sim\pi_\theta}\!\left[\sum_{t=0}^{T} \gamma^t r_t\right]$$

Policy Gradient 定理给出:

$$\boxed{\;\nabla_\theta J(\theta) = \mathbb{E}_{\tau\sim\pi_\theta}\!\left[\sum_{t=0}^{T} \nabla_\theta \log\pi_\theta(a_t\mid s_t)\, A^{\pi_\theta}(s_t, a_t)\right]\;}$$

其中 $A^{\pi}(s_t,a_t) = Q^{\pi}(s_t,a_t) - V^{\pi}(s_t)$ 是 advantage

这条公式怎么来的(必须会推)

下面五步推导:log-likelihood 求导 → exchange-of-derivative → 代回 $J$ → 因果性 trick → baseline trick。

  1. 轨迹概率 $p_\theta(\tau) = \rho_0(s_0)\prod_{t} \pi_\theta(a_t\mid s_t)\, P(s_{t+1}\mid s_t, a_t)$。
  2. 对 $\theta$ 求导:转移核 $P$ 与 $\theta$ 无关,只剩

$$\nabla_\theta p_\theta(\tau) = p_\theta(\tau)\,\sum_t \nabla_\theta \log\pi_\theta(a_t\mid s_t).$$

  1. 代回 $J$:

$$\nabla_\theta J = \mathbb{E}_{\tau}\!\left[\Big(\sum_t \nabla_\theta\log\pi_\theta(a_t\mid s_t)\Big)\Big(\sum_t \gamma^t r_t\Big)\right].$$

  1. 因果性 trick:$a_t$ 不影响 $r_{t'
  2. Baseline trick:减任何只依赖 $s_t$ 的 baseline $b(s_t)$ 不改变期望(因为 $\mathbb{E}_{a\sim\pi}[\nabla_\theta\log\pi(a\mid s)] = \nabla_\theta \sum_a \pi(a\mid s) = 0$),但能大幅降方差。取 $b(s_t)=V^\pi(s_t)$ 即得 advantage 形式。

关键点:这个估计叫 likelihood-ratio estimator(也叫 REINFORCE estimator),它的方差远小于直接对动作求导的 pathwise derivative(但 pathwise 的 bias 更小)。PG 的所有变种都是在「降方差」上做文章:GAE(估计 $A$)、actor-critic(用 $V_\phi$)、PPO(重要性采样截断)。


二、On-policy vs Off-policy:数学定义与样本效率

这是最容易被混淆的一对概念。

定义(精确)

  • On-policy:目标分布和采样分布必须一致。形式上,loss 用 $\mathbb{E}_{s,a\sim\pi_\text{current}}$ 估计,每次 $\theta$ 更新后,旧数据"过期"(因为它们来自 $\pi_{\text{old}}\ne\pi_\theta$)。
  • Off-policy:可以用任意行为策略 $\beta$ 采样,目标 $\pi$ 不同也能学。靠 importance sampling 改写期望:

$$\mathbb{E}_{a\sim\pi}\!\left[f(s,a)\right] = \mathbb{E}_{a\sim\beta}\!\left[\frac{\pi(a\mid s)}{\beta(a\mid s)} f(s,a)\right].$$

或用 Q-learning 形式(不需要重要性权重,直接 Bellman backup)。

样本效率的来源:on-policy 每次策略更新后必须重新采样,经验只能用一次(PPO 用几个 epoch 是个小例外);off-policy 把所有 transition 存进 replay buffer $D$,反复 mini-batch 重用。

数量级:

  • PPO:典型 1e7~1e9 步仿真。靠仿真器并行(Isaac Gym 4096 envs)来 wall-clock 弥补。
  • SAC/TD3:典型 1e5~1e7 步。每步都被多次重用。
  • DreamerV3:典型 1e5~1e6 步真实交互(再在 latent 里 imagine 几十倍)。

机器人的现实:在仿真里,on-policy 反而常常"训练快"——4096 并行环境的吞吐量让 PPO 在 20 分钟内训出四足。真机上 off-policy 占优——你不能让真机跑 1e9 步。这就是为什么真机抓取 QT-Opt 2018 用 off-policy + replay buffer。


三、PPO:On-policy 之王

PPO [Schulman 2017] 不是新算法,而是 TRPO [Schulman 2015] 的工程化简化。

TRPO 的约束优化目标

TRPO 把"策略更新不能太猛"写成显式约束:

$$\max_\theta\; \hat{\mathbb{E}}\!\left[\frac{\pi_\theta(a\mid s)}{\pi_{\theta_{\text{old}}}(a\mid s)} \hat{A}\right]\quad \text{s.t.}\;\; \hat{\mathbb{E}}\!\big[\text{KL}(\pi_{\theta_{\text{old}}}(\cdot\mid s)\,\|\,\pi_\theta(\cdot\mid s))\big] \le \delta$$

求解用 conjugate gradient + line search,工程极复杂。

PPO 的 Clipped Objective

PPO 把 KL 约束换成 likelihood ratio 的直接截断

$$\boxed{\;L^{\text{CLIP}}(\theta) = \hat{\mathbb{E}}_t\!\left[\min\!\Big(r_t(\theta)\hat{A}_t,\;\text{clip}(r_t(\theta),\,1-\epsilon,\,1+\epsilon)\hat{A}_t\Big)\right]\;}$$

其中 $r_t(\theta) = \pi_\theta(a_t\mid s_t)/\pi_{\theta_{\text{old}}}(a_t\mid s_t)$。

为什么是 clip

四种情况:

  • $\hat{A}_t > 0$(动作好):鼓励 $r_t$ 增大,但 clip 在 $1+\epsilon$。不让贪心把策略推飞
  • $\hat{A}_t < 0$(动作差):抑制 $r_t$,clip 在 $1-\epsilon$。
  • 当 $r_t$ 已超出 clip 区间且新数据"反对"原方向(advantage 符号反过来),min 会让梯度回到正常方向——这是 clip 比硬截断更微妙的地方。

$\epsilon$ 通常取 0.2。机器人场景常用更小(如 AMP 用 0.02,因为 PPO+GAN 式 reward 极易震散)。

PPO 的实际配方(机器人场景)

  • Actor/Critic 都是 MLP(2-3 层,宽 256-1024)。
  • Advantage 用 GAE [Schulman 2016]:$A_t^{\text{GAE}(\lambda)} = \sum_l (\gamma\lambda)^l \delta_{t+l}$,$\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)$。
  • 每批数据训 multiple epochs(5-10),mini-batch(如 256)。
  • Ent bonus($\beta H(\pi_\theta)$)鼓励探索,机器人常用 0.01。
  • Observation normalization(running mean/std)是隐性关键。

详见 legged_gym、RSL-RL,是机器人 PPO 的事实参考。


四、SAC:随机策略 + 最大 + off-policy

SAC [Haarnoja 2018] 把 maximum entropy RL 推上主流。

Maximum entropy 目标

不是最大化 $\mathbb{E}[\sum r_t]$,而是:

$$J(\pi) = \sum_{t=0}^{T}\mathbb{E}_{(s_t,a_t)\sim\rho_\pi}\!\Big[r_t + \alpha\, H\!\big(\pi(\cdot\mid s_t)\big)\Big]$$

同时最大化奖励和策略熵。$\alpha$ 是温度,控制"探索 vs 利用"。新版 SAC 用 自适应 $\alpha$:维护目标熵 $\bar{H}$,对 $\alpha$ 做梯度下降让 $H(\pi) \to \bar{H}$(典型 $\bar{H}=-\dim(\mathcal{A})$)。

Soft Bellman 方程

最大熵下,Q 值满足:

$$Q^\pi(s,a) = \mathbb{E}_{s'\sim P}\!\left[r(s,a) + \gamma\, V^\pi(s')\right],\quad V^\pi(s') = \mathbb{E}_{a'\sim\pi}[Q^\pi(s',a') - \alpha\log\pi(a'\mid s')]$$

为什么 sample efficient:三个机制叠加:

  1. Off-policy:所有历史数据进 replay buffer,反复用。
  2. 双 Q + 取 min(clipped double Q):$Q_{\text{target}} = r + \gamma(\min(Q_{\phi_1}', Q_{\phi_2}') - \alpha\log\pi)$,消除 overestimation bias。
  3. 重参数化:$a_t = f_\theta(\epsilon_t; s_t)$,$\epsilon\sim\mathcal{N}(0,I)$。让策略梯度可反传,比 likelihood-ratio 方差更小。

SAC 策略的随机性

SAC 输出的是 tanh-squashed 高斯策略:先在原空间采样 $u\sim\mathcal{N}(\mu(s),\sigma(s))$,再压缩 $a=\tanh(u)$,即 $\pi(a\mid s)$ 由 $u$ 的高斯密度经 tanh 变换得到(雅可比 $\log(1-\tanh^2 u)$ 必须显式补回 $\log\pi$)。这让它在 multi-modal 环境里也能探索——同一状态下可以输出不同动作。代价是部署时"非确定性"——同一个观测会出不同动作,对真机调试和 reproducibility 不友好;工程上常用 deterministic eval 模式(取 $\mu$ 而非采样)规避。

SAC 在机器人上的位置

  • 真机 manipulation(gym-PickPlace、DM Control benchmark)的事实标准。
  • 灵巧手 in-hand rotation(OpenAI Hand 2018 的 meta-learning 用 PPO,但 QT-Opt 系 off-policy 是另一条线)。
  • Locomotion 也能用(很多 DMC 任务的 SOTA 是 SAC),但在腿足仿真大规模并行里不如 PPO——下面会讲为什么。

五、TD3:DDPG 的"修复版"

DDPG 为什么不稳

DDPG [Lillicrap 2015] 把 DQN 扩到连续动作:学 $Q_\phi(s,a)$,确定性策略 $\mu_\theta(s) = \arg\max_a Q_\phi(s,a)$ 用 chain rule 求导:$\nabla_\theta J \approx \mathbb{E}_s[\nabla_a Q_\phi(s,a)\big|_{a=\mu_\theta(s)}\nabla_\theta\mu_\theta(s)]$。

三个致命缺陷:

  1. Q-overestimation:取 max 的 Bellman backup 把噪声也取 max,Q 越学越大。
  2. 策略更新太快:每步都更新 policy,而 Q 还没学准——策略跟着错的 Q 跑飞。
  3. 目标值尖峰target network 缓慢更新仍不够稳。

TD3 的三个 trick

TD3 [Fujimoto 2018] 用三个工程 trick 修复:

Trick形式解决什么
Clipped Double Qtarget 用 $\min(Q_{\phi_1}', Q_{\phi_2}')$Q-overestimation
Delayed Policy Updatepolicy 每 $d$ 步更新一次($d=2$)policy 跟错 Q 跑飞
Target Policy Smoothingtarget action 加 $\epsilon\sim\text{clip}(\mathcal{N}, -c, c)$防止 Q 对 action 过拟合

目标值:

$$y = r + \gamma\,\min_i Q_{\phi_i}'(s', \mu_\theta'(s') + \epsilon),\quad \epsilon\sim\text{clip}(\mathcal{N}(0,\sigma), -c, c).$$

TD3 vs SAC:SAC 把 clipped double Q 也拿过来用,外加 entropy。在大多数 benchmark 上 SAC 略胜,但 TD3 简单、确定性策略部署更友好(同样观测出同样动作)。真机 manipulation 上两者各有支持者

DDPG → TD3 → SAC 的关系


DDPG (2015)                  确定性 + off-policy + 单 Q,不稳定
  └── TD3 (2018)             + 双 Q + 延迟 + smoothing,稳定但无探索机制
       └── SAC (2018)        + 双 Q + 最大熵 + 自适应 α,探索和稳定兼得

SAC 几乎是这条线的"终点"——所有现代 off-policy 连续控制 baseline 都默认和 SAC 比。


六、DreamerV3:Model-based 范式的根本不同

DreamerV3 [Hafner 2023, Nature 2025] 和上面四个 model-free 算法范式不同

Model-free 的循环

$$\text{collect } (s,a,r,s') \to \text{update } Q \text{ or } \pi \to \text{discard } (s,a,r,s')\text{ (on-policy) or buffer it (off-policy)}$$

数据只用来直接训 value/policy,不学环境动力学

Model-based 的循环(DreamerV3)

$$\text{collect } (s,a,r,s') \to \text{train world model } \hat{P},\hat{R} \to \text{imagine trajectories} \to \text{train actor-critic in imagination}$$

DreamerV3 用 RSSM 把 latent state 拆为 $(h_t, z_t)$:

  • 确定性 $h_t = f(h_{t-1}, z_{t-1}, a_{t-1})$(GRU,论文 Eq. 1a);
  • 随机 $z_t$:prior $p(z_t\mid h_t)$ 用于 imagine,posterior $q(z_t\mid h_t, o_t)$ 用于训练。

训练 world model 的 loss:

$$\mathcal{L}_{\text{WM}} = \underbrace{-\log p(o_t\mid h_t,z_t)}_{\text{重建}} + \underbrace{-\log p(r_t\mid h_t,z_t)}_{\text{reward}} + \beta\,\text{KL}\big(q\,\|\,p\big)$$

学好后,完全在 latent 里 rollout:从 $h_T$ 出发,反复采样 $a_t\sim\pi$、$z_{t+1}\sim p$,得到想象的 latent 轨迹 $(\hat{h}_1,\hat{z}_1,\hat{r}_1,\ldots,\hat{h}_H,\hat{z}_H,\hat{r}_H)$。在这条想象轨迹上用 REINFORCE + auto-regressive baseline 训 actor-critic。

和 model-free 的根本区别

维度Model-free(PPO/SAC/TD3)Model-based(DreamerV3)
数据用法直接训 $Q/\pi$先学世界模型,再想象中训
Sample efficiency中(PPO)/高(SAC)极高(1e5 步级)
Wall-clock快(GPU 友好)慢(每步要 imagine rollout)
模型偏差有(模型错了 policy 跟着错)
长程规划隐式(靠 value)显式(imagination horizon)
机器人用例legged locomotion、in-hand RL长程稀疏任务、sim-to-real 的精细控制

DreamerV3 的工程突破是 symlog 归一化 + policy scale 正则化 + free bits KL——固定超参跨 150+ 任务都稳。详见 T09 World Model 线索P-DreamerV3


七、机器人上各算法的适用场景

场景首选备选理由
仿真四足 locomotion(legged_gym)PPO大规模并行(4096 envs),on-policy 反而 wall-clock 最快
仿真人形 locomotionPPOSAC同上
真机 manipulation(gym-PickPlace)SACTD3off-policy + replay buffer,真机样本贵
真机灵巧手 in-handPPO(OpenAI Hand)/ QT-OptSACOpenAI 用 PPO 是因 meta-learning + 大规模并行;QT-Opt 是 off-policy 变体
大 state 稀疏 reward(Minecraft、长程任务)DreamerV3PPOimagination 让 long-horizon credit assignment 可学
剧烈动作 motion tracking(ASAP、DeepMimic)PPOreward + GAN 极敏感,PPO 的 clip 是最稳的 on-policy 选项
AMP / motion prior RLPPOAMP 原论文 + 几乎所有后续都用 PPO;clip 取 0.02(比常规 0.2 严得多)

为什么 locomotion 用 PPO 而非 SAC

直觉上 SAC 更 sample efficient,但 locomotion 仿真有四个特征让 PPO 占优:

  1. 并行性压倒样本效率:4096 环境同时跑,PPO wall-clock 反而更快。
  2. on-policy 的稳定性:腿足要跌倒就发散,PPO 的 clip 比 SAC 的 entropy temperature 更易调。
  3. 历史编码简单:legged_gym 用 stack frame 而非 RNN,on-policy 下足够。
  4. 社区路径依赖:ETH 三件套、RMA、legged_gym 全用 PPO,社区肌肉记忆和 baseline 都基于 PPO。

何时反而要选 SAC

  • 真机抓取 / 灵巧手(QT-Opt 58 万次真机抓取必须 replay buffer)。
  • 仿真样本产出瓶颈(如不能用 GPU 并行)。
  • 探索是大问题(reward 极稀疏且无良好 shaping)。

八、概念辨析表

维度PPOSACTD3DDPGDreamerV3
On/off-policyOnOffOffOffOff(但 imagine)
策略类型随机(高斯)随机(tanh-高斯)确定性确定性随机
是否需要 model(RSSM)
熵/探索Ent bonus自适应 αEnt + 想象
Replay buffer是(学 world model)
估计器likelihood ratioreparameterizationpathwisepathwisepathwise + likelihood
机器人默认选择legged locomotion真机 manipulationSAC 替代基本不用长程稀疏

九、常见误用

  • 用 SAC 训仿真 locomotion:能跑,但 wall-clock 比 PPO 慢得多(无法利用 GPU 并行),且 on-policy 的 GAE advantage 比 SAC 的 Bellman backup 在腿足 reward 上更稳。容易误信"SAC 更 sample efficient"就盲选,结果训练时间翻几倍。
  • 用 DDPG 替代 TD3:DDPG 早就不该用了。TD3 的三个 trick 修复了 DDPG 的所有已知问题,几乎无成本。
  • PPO 不用 GAE:直接用 $G_t$ 当 advantage 是 REINFORCE,方差极大。GAE($\lambda\approx 0.95$)是 PPO 工程化不可省的一环。
  • PPO clip 取 0.2 当铁律:剧烈动作 / GAN 式 reward(AMP)应该取 0.02。clip 区间太大策略会震散。
  • 用 DreamerV3 替代 PPO 做 locomotion:model-based 的 wall-clock 太慢;locomotion 不缺样本(仿真并行),缺的是稳定训练。
  • off-policy 不用 replay buffer:replay ratio 太高(每次 batch 都重用太多旧数据)会让 off-policy 训练发散。SAC 默认 batch=256、buffer=1e6 是经过验证的甜区。
  • SAC 真机部署不固定随机种子:SAC 输出有随机性,同一观测出不同动作,调试时要用 deterministic eval 模式(取 mean)。
  • 混淆"最大熵 RL"和"entropy bonus":PPO 的 entropy bonus 是个 $\beta H$ 项外加在 loss 上,不改变目标函数的最优解(只是优化轨迹);SAC 的最大熵是直接改目标 $J\to J+\alpha H$,最优策略本身被改变(变成 soft optimal policy)。

十、开放问题

  • on-policy + off-policy 混合:能否同时享受 PPO 的稳定和 SAC 的样本效率?最近的优势权重强化学习(AWR / AWAC / ABM)和 CQL 在尝试,机器人上仍未成熟。
  • model-based 在机器人上的 wall-clock 瓶颈:DreamerV3 的 imagine rollout 在 legged_gym 这种 4096-env 设置下不如 PPO 快,但真机上又值得。
  • 是否需要 discrete action RL:随着 VLA 把 action token 化(RT-2、OpenVLA),离散 RL(GRPO、PPO on tokens)开始回到机器人;但连续动作领域 PPO/SAC 仍是事实标准。

复盘:误区、检查点与 FAQ

常见误区

"样本效率高的算法一定更好" —— 不一定。仿真里能并行几千个环境,"丢经验"的算法靠吞吐量反而 wall-clock 最快;样本效率只在真机或仿真样本产出受限时才决定胜负。

算法选择看"样本贵不贵 + 能不能并行",不是单看样本效率。

"PPO 是万能最优" —— PPO 在仿真腿足运动上确实是事实标准,但剧烈动作 + 对抗式奖励(如 AMP)要把 clip 从 0.2 砍到 0.02,否则策略震散。

PPO 的默认超参只适合"温和"任务,敏感任务必须重调。

"SAC 比 PPO 新所以总该选 SAC" —— SAC 样本效率更高、能多模态探索,但仿真腿足的大规模并行里 wall-clock 反而比 PPO 慢得多。

新不等于适合你的场景;仿真并行用 PPO,真机抓取用 SAC,是经验法则。

检查点

Q1

用一句话说清强化学习算法在解什么共同问题?

💡 显示参考答案
  • 入门层「是什么·为什么」段直接说明。
Q2

算法之间的差别可以压到哪两件事?

💡 显示参考答案
  • 相应段落 + 直觉层 类比共同支撑。
Q3

为什么仿真里"丢经验"的算法反而常用?真机上反过来?

💡 显示参考答案
  • 常见误区或 入门层 关键句直接说明。
Q4

父母教娃骑自行车这个类比里,"扶着、放手、跌了爬起"分别对应算法的什么机制?

💡 显示参考答案
  • 入门层 关键句或常见误区直接说明。
Q5

假如你只能在真机上跑一万步、不能并行,你会选"丢经验"还是"反复用经验"的算法?为什么?

💡 显示参考答案
  • 入门层 应用提示。

FAQ

Q1:五个主流算法到底选哪个?

先看两件事:样本贵不贵、能不能大规模并行。仿真腿足 → PPO;真机抓取/灵巧手 → SAC 或 TD3;长程稀疏奖励(导航、家务)→ DreamerV3。这是经验起点,不是铁律。

Q2:为什么仿真里 PPO 反而比 SAC 快?

仿真能开几千个环境并行跑。PPO 虽然样本效率低,但并行吞吐量碾压;SAC 的 replay buffer 在单环境串行下才显出优势。腿足仿真不缺样本,缺的是稳定训练。

Q3:VLA(视觉-语言-动作模型)出来了,这些算法还有用吗?

有。VLA 多用监督模仿学习冷启动;要自我改进、突破演示上限时,仍靠强化学习微调(如 ReinFlow、VLA-RFT)。两者互补,不是替代。


深度辨析 → site/concepts/C-rl-algorithms.html

相关