概念辨析 · 强化学习算法家族(PPO / SAC / TD3 / DDPG / DreamerV3)
这五个算法是机器人 RL 的"基础底盘"。最容易把它们当作"调包"——但它们各自源于不同的数学假设:on-policy 还是 off-policy、确定性策略还是随机策略、model-free 还是 model-based。选错算法,比选错超参致命得多。
💡 一句话总结:PPO / SAC / TD3 / DDPG / DreamerV3 都源于 Policy Gradient 定理,但在 on/off-policy、随机/确定性策略、model-free/model-based 三个维度上分化;机器人场景下选错算法比选错超参更致命。
速查:何时用哪个
| 场景 | 推荐 | 原因 |
|------|------|------|
| 仿真大规模并行 locomotion(legged_gym 4096 envs) | PPO | on-policy + GPU 并行,wall-clock 反而最快 |
| 真机 manipulation / 灵巧手(样本极贵) | SAC | off-policy + replay buffer,反复重用每条 transition |
| 长程稀疏 reward(horizon 1000+) | DreamerV3 | world model 在 imagination 里显式做 long-horizon credit assignment |
| AMP / motion prior / 剧烈动作 tracking | PPO(clip=0.02) | GAN 式 reward 极敏感,PPO 的 clip 是最稳的 on-policy 选项 |
| 真机大规模抓取数据采集 | QT-Opt(off-policy 变体) | 58 万次真机抓取只能靠 replay buffer 攒 |
本页内容
基础解释
一句话直觉
机器人靠试错学动作的一类方法。好比父母教娃骑自行车:扶着、放手、跌了爬起再试。
是什么·为什么
强化学习算法是机器人靠"试"来学动作的一类方法。它不要人写规则。机器人自己试着动,做对了得分,做错了扣分。靠这份打分慢慢调整,越做越准。
为什么重要:真机一步动辄几秒,样本极贵。选错算法,机器人训到天荒地老也学不会。选对了,二十分钟仿真里就能训出会走的机器狗。
核心一句话:这类算法都在解同一个问题。怎么从"试一次、得一分"的循环里,挤出最好的动作策略?
它们的差别只在两件事。一是"怎么试":每次试完就丢,还是把经验存起来反复用。二是"怎么输出动作":带随机性的爱探索,确定的更好部署。
仿真里能开几千个环境一起试,"丢经验"的反而最快。真机抓东西样本太贵,必须反复用旧经验。这就是仿真和真机常选不同算法的根本原因。
一句话类比:选算法之于机器人,像选变速箱之于赛车。赛道不同,档位就不同。
为什么必须先吃透这一篇
机器人 RL 不是 RL 教科书的简单延伸。机器人有四个特征让 RL 的选择变得敏感:(1) 样本极贵——真机一步动辄数秒;(2) 连续动作 + 高维——12+ 自由度的关节力矩/PD target;(3) 并行可做——Isaac Gym 能开 4096 个仿真环境;(4) 奖励稀疏 + horizon 长。在这四个约束下,on-policy/off-policy、model-free/model-based 的差异被放大成"训得出来 vs 训不出来"。
这条辨析贯穿 T01 sim2real、T04 motion prior(AMP+PPO)、T11 dexterous(QT-Opt off-policy)、T09 world model(DreamerV3)。
一、Policy Gradient 定理:一切的起点
给定 MDP $(\mathcal{S}, \mathcal{A}, P, R, \gamma)$,参数化策略 $\pi_\theta(a\mid s)$,目标是最大化期望回报:
$$J(\theta) = \mathbb{E}_{\tau\sim\pi_\theta}\!\left[\sum_{t=0}^{T} \gamma^t r_t\right]$$
Policy Gradient 定理给出:
$$\boxed{\;\nabla_\theta J(\theta) = \mathbb{E}_{\tau\sim\pi_\theta}\!\left[\sum_{t=0}^{T} \nabla_\theta \log\pi_\theta(a_t\mid s_t)\, A^{\pi_\theta}(s_t, a_t)\right]\;}$$
其中 $A^{\pi}(s_t,a_t) = Q^{\pi}(s_t,a_t) - V^{\pi}(s_t)$ 是 advantage。
这条公式怎么来的(必须会推)
下面五步推导:log-likelihood 求导 → exchange-of-derivative → 代回 $J$ → 因果性 trick → baseline trick。
- 轨迹概率 $p_\theta(\tau) = \rho_0(s_0)\prod_{t} \pi_\theta(a_t\mid s_t)\, P(s_{t+1}\mid s_t, a_t)$。
- 对 $\theta$ 求导:转移核 $P$ 与 $\theta$ 无关,只剩
$$\nabla_\theta p_\theta(\tau) = p_\theta(\tau)\,\sum_t \nabla_\theta \log\pi_\theta(a_t\mid s_t).$$
- 代回 $J$:
$$\nabla_\theta J = \mathbb{E}_{\tau}\!\left[\Big(\sum_t \nabla_\theta\log\pi_\theta(a_t\mid s_t)\Big)\Big(\sum_t \gamma^t r_t\Big)\right].$$
- 因果性 trick:$a_t$ 不影响 $r_{t'
- Baseline trick:减任何只依赖 $s_t$ 的 baseline $b(s_t)$ 不改变期望(因为 $\mathbb{E}_{a\sim\pi}[\nabla_\theta\log\pi(a\mid s)] = \nabla_\theta \sum_a \pi(a\mid s) = 0$),但能大幅降方差。取 $b(s_t)=V^\pi(s_t)$ 即得 advantage 形式。
关键点:这个估计叫 likelihood-ratio estimator(也叫 REINFORCE estimator),它的方差远小于直接对动作求导的 pathwise derivative(但 pathwise 的 bias 更小)。PG 的所有变种都是在「降方差」上做文章:GAE(估计 $A$)、actor-critic(用 $V_\phi$)、PPO(重要性采样截断)。
二、On-policy vs Off-policy:数学定义与样本效率
这是最容易被混淆的一对概念。
定义(精确):
- On-policy:目标分布和采样分布必须一致。形式上,loss 用 $\mathbb{E}_{s,a\sim\pi_\text{current}}$ 估计,每次 $\theta$ 更新后,旧数据"过期"(因为它们来自 $\pi_{\text{old}}\ne\pi_\theta$)。
- Off-policy:可以用任意行为策略 $\beta$ 采样,目标 $\pi$ 不同也能学。靠 importance sampling 改写期望:
$$\mathbb{E}_{a\sim\pi}\!\left[f(s,a)\right] = \mathbb{E}_{a\sim\beta}\!\left[\frac{\pi(a\mid s)}{\beta(a\mid s)} f(s,a)\right].$$
或用 Q-learning 形式(不需要重要性权重,直接 Bellman backup)。
样本效率的来源:on-policy 每次策略更新后必须重新采样,经验只能用一次(PPO 用几个 epoch 是个小例外);off-policy 把所有 transition 存进 replay buffer $D$,反复 mini-batch 重用。
数量级:
- PPO:典型 1e7~1e9 步仿真。靠仿真器并行(Isaac Gym 4096 envs)来 wall-clock 弥补。
- SAC/TD3:典型 1e5~1e7 步。每步都被多次重用。
- DreamerV3:典型 1e5~1e6 步真实交互(再在 latent 里 imagine 几十倍)。
机器人的现实:在仿真里,on-policy 反而常常"训练快"——4096 并行环境的吞吐量让 PPO 在 20 分钟内训出四足。真机上 off-policy 占优——你不能让真机跑 1e9 步。这就是为什么真机抓取 QT-Opt 2018 用 off-policy + replay buffer。
三、PPO:On-policy 之王
PPO [Schulman 2017] 不是新算法,而是 TRPO [Schulman 2015] 的工程化简化。
TRPO 的约束优化目标
TRPO 把"策略更新不能太猛"写成显式约束:
$$\max_\theta\; \hat{\mathbb{E}}\!\left[\frac{\pi_\theta(a\mid s)}{\pi_{\theta_{\text{old}}}(a\mid s)} \hat{A}\right]\quad \text{s.t.}\;\; \hat{\mathbb{E}}\!\big[\text{KL}(\pi_{\theta_{\text{old}}}(\cdot\mid s)\,\|\,\pi_\theta(\cdot\mid s))\big] \le \delta$$
求解用 conjugate gradient + line search,工程极复杂。
PPO 的 Clipped Objective
PPO 把 KL 约束换成 likelihood ratio 的直接截断:
$$\boxed{\;L^{\text{CLIP}}(\theta) = \hat{\mathbb{E}}_t\!\left[\min\!\Big(r_t(\theta)\hat{A}_t,\;\text{clip}(r_t(\theta),\,1-\epsilon,\,1+\epsilon)\hat{A}_t\Big)\right]\;}$$
其中 $r_t(\theta) = \pi_\theta(a_t\mid s_t)/\pi_{\theta_{\text{old}}}(a_t\mid s_t)$。
为什么是 clip
四种情况:
- $\hat{A}_t > 0$(动作好):鼓励 $r_t$ 增大,但 clip 在 $1+\epsilon$。不让贪心把策略推飞。
- $\hat{A}_t < 0$(动作差):抑制 $r_t$,clip 在 $1-\epsilon$。
- 当 $r_t$ 已超出 clip 区间且新数据"反对"原方向(advantage 符号反过来),min 会让梯度回到正常方向——这是 clip 比硬截断更微妙的地方。
$\epsilon$ 通常取 0.2。机器人场景常用更小(如 AMP 用 0.02,因为 PPO+GAN 式 reward 极易震散)。
PPO 的实际配方(机器人场景)
- Actor/Critic 都是 MLP(2-3 层,宽 256-1024)。
- Advantage 用 GAE [Schulman 2016]:$A_t^{\text{GAE}(\lambda)} = \sum_l (\gamma\lambda)^l \delta_{t+l}$,$\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)$。
- 每批数据训 multiple epochs(5-10),mini-batch(如 256)。
- Ent bonus($\beta H(\pi_\theta)$)鼓励探索,机器人常用 0.01。
- Observation normalization(running mean/std)是隐性关键。
详见 legged_gym、RSL-RL,是机器人 PPO 的事实参考。
四、SAC:随机策略 + 最大熵 + off-policy
SAC [Haarnoja 2018] 把 maximum entropy RL 推上主流。
Maximum entropy 目标
不是最大化 $\mathbb{E}[\sum r_t]$,而是:
$$J(\pi) = \sum_{t=0}^{T}\mathbb{E}_{(s_t,a_t)\sim\rho_\pi}\!\Big[r_t + \alpha\, H\!\big(\pi(\cdot\mid s_t)\big)\Big]$$
即同时最大化奖励和策略熵。$\alpha$ 是温度,控制"探索 vs 利用"。新版 SAC 用 自适应 $\alpha$:维护目标熵 $\bar{H}$,对 $\alpha$ 做梯度下降让 $H(\pi) \to \bar{H}$(典型 $\bar{H}=-\dim(\mathcal{A})$)。
Soft Bellman 方程
最大熵下,Q 值满足:
$$Q^\pi(s,a) = \mathbb{E}_{s'\sim P}\!\left[r(s,a) + \gamma\, V^\pi(s')\right],\quad V^\pi(s') = \mathbb{E}_{a'\sim\pi}[Q^\pi(s',a') - \alpha\log\pi(a'\mid s')]$$
为什么 sample efficient:三个机制叠加:
- Off-policy:所有历史数据进 replay buffer,反复用。
- 双 Q + 取 min(clipped double Q):$Q_{\text{target}} = r + \gamma(\min(Q_{\phi_1}', Q_{\phi_2}') - \alpha\log\pi)$,消除 overestimation bias。
- 重参数化:$a_t = f_\theta(\epsilon_t; s_t)$,$\epsilon\sim\mathcal{N}(0,I)$。让策略梯度可反传,比 likelihood-ratio 方差更小。
SAC 策略的随机性
SAC 输出的是 tanh-squashed 高斯策略:先在原空间采样 $u\sim\mathcal{N}(\mu(s),\sigma(s))$,再压缩 $a=\tanh(u)$,即 $\pi(a\mid s)$ 由 $u$ 的高斯密度经 tanh 变换得到(雅可比 $\log(1-\tanh^2 u)$ 必须显式补回 $\log\pi$)。这让它在 multi-modal 环境里也能探索——同一状态下可以输出不同动作。代价是部署时"非确定性"——同一个观测会出不同动作,对真机调试和 reproducibility 不友好;工程上常用 deterministic eval 模式(取 $\mu$ 而非采样)规避。
SAC 在机器人上的位置
- 真机 manipulation(gym-PickPlace、DM Control benchmark)的事实标准。
- 灵巧手 in-hand rotation(OpenAI Hand 2018 的 meta-learning 用 PPO,但 QT-Opt 系 off-policy 是另一条线)。
- Locomotion 也能用(很多 DMC 任务的 SOTA 是 SAC),但在腿足仿真大规模并行里不如 PPO——下面会讲为什么。
五、TD3:DDPG 的"修复版"
DDPG 为什么不稳
DDPG [Lillicrap 2015] 把 DQN 扩到连续动作:学 $Q_\phi(s,a)$,确定性策略 $\mu_\theta(s) = \arg\max_a Q_\phi(s,a)$ 用 chain rule 求导:$\nabla_\theta J \approx \mathbb{E}_s[\nabla_a Q_\phi(s,a)\big|_{a=\mu_\theta(s)}\nabla_\theta\mu_\theta(s)]$。
三个致命缺陷:
- Q-overestimation:取 max 的 Bellman backup 把噪声也取 max,Q 越学越大。
- 策略更新太快:每步都更新 policy,而 Q 还没学准——策略跟着错的 Q 跑飞。
- 目标值尖峰:target network 缓慢更新仍不够稳。
TD3 的三个 trick
TD3 [Fujimoto 2018] 用三个工程 trick 修复:
| Trick | 形式 | 解决什么 |
|---|---|---|
| Clipped Double Q | target 用 $\min(Q_{\phi_1}', Q_{\phi_2}')$ | Q-overestimation |
| Delayed Policy Update | policy 每 $d$ 步更新一次($d=2$) | policy 跟错 Q 跑飞 |
| Target Policy Smoothing | target action 加 $\epsilon\sim\text{clip}(\mathcal{N}, -c, c)$ | 防止 Q 对 action 过拟合 |
目标值:
$$y = r + \gamma\,\min_i Q_{\phi_i}'(s', \mu_\theta'(s') + \epsilon),\quad \epsilon\sim\text{clip}(\mathcal{N}(0,\sigma), -c, c).$$
TD3 vs SAC:SAC 把 clipped double Q 也拿过来用,外加 entropy。在大多数 benchmark 上 SAC 略胜,但 TD3 简单、确定性策略部署更友好(同样观测出同样动作)。真机 manipulation 上两者各有支持者。
DDPG → TD3 → SAC 的关系
DDPG (2015) 确定性 + off-policy + 单 Q,不稳定
└── TD3 (2018) + 双 Q + 延迟 + smoothing,稳定但无探索机制
└── SAC (2018) + 双 Q + 最大熵 + 自适应 α,探索和稳定兼得
SAC 几乎是这条线的"终点"——所有现代 off-policy 连续控制 baseline 都默认和 SAC 比。
六、DreamerV3:Model-based 范式的根本不同
DreamerV3 [Hafner 2023, Nature 2025] 和上面四个 model-free 算法范式不同。
Model-free 的循环
$$\text{collect } (s,a,r,s') \to \text{update } Q \text{ or } \pi \to \text{discard } (s,a,r,s')\text{ (on-policy) or buffer it (off-policy)}$$
数据只用来直接训 value/policy,不学环境动力学。
Model-based 的循环(DreamerV3)
$$\text{collect } (s,a,r,s') \to \text{train world model } \hat{P},\hat{R} \to \text{imagine trajectories} \to \text{train actor-critic in imagination}$$
DreamerV3 用 RSSM 把 latent state 拆为 $(h_t, z_t)$:
- 确定性 $h_t = f(h_{t-1}, z_{t-1}, a_{t-1})$(GRU,论文 Eq. 1a);
- 随机 $z_t$:prior $p(z_t\mid h_t)$ 用于 imagine,posterior $q(z_t\mid h_t, o_t)$ 用于训练。
训练 world model 的 loss:
$$\mathcal{L}_{\text{WM}} = \underbrace{-\log p(o_t\mid h_t,z_t)}_{\text{重建}} + \underbrace{-\log p(r_t\mid h_t,z_t)}_{\text{reward}} + \beta\,\text{KL}\big(q\,\|\,p\big)$$
学好后,完全在 latent 里 rollout:从 $h_T$ 出发,反复采样 $a_t\sim\pi$、$z_{t+1}\sim p$,得到想象的 latent 轨迹 $(\hat{h}_1,\hat{z}_1,\hat{r}_1,\ldots,\hat{h}_H,\hat{z}_H,\hat{r}_H)$。在这条想象轨迹上用 REINFORCE + auto-regressive baseline 训 actor-critic。
和 model-free 的根本区别
| 维度 | Model-free(PPO/SAC/TD3) | Model-based(DreamerV3) |
|---|---|---|
| 数据用法 | 直接训 $Q/\pi$ | 先学世界模型,再想象中训 |
| Sample efficiency | 中(PPO)/高(SAC) | 极高(1e5 步级) |
| Wall-clock | 快(GPU 友好) | 慢(每步要 imagine rollout) |
| 模型偏差 | 无 | 有(模型错了 policy 跟着错) |
| 长程规划 | 隐式(靠 value) | 显式(imagination horizon) |
| 机器人用例 | legged locomotion、in-hand RL | 长程稀疏任务、sim-to-real 的精细控制 |
DreamerV3 的工程突破是 symlog 归一化 + policy scale 正则化 + free bits KL——固定超参跨 150+ 任务都稳。详见 T09 World Model 线索、P-DreamerV3。
七、机器人上各算法的适用场景
| 场景 | 首选 | 备选 | 理由 |
|---|---|---|---|
| 仿真四足 locomotion(legged_gym) | PPO | — | 大规模并行(4096 envs),on-policy 反而 wall-clock 最快 |
| 仿真人形 locomotion | PPO | SAC | 同上 |
| 真机 manipulation(gym-PickPlace) | SAC | TD3 | off-policy + replay buffer,真机样本贵 |
| 真机灵巧手 in-hand | PPO(OpenAI Hand)/ QT-Opt | SAC | OpenAI 用 PPO 是因 meta-learning + 大规模并行;QT-Opt 是 off-policy 变体 |
| 大 state 稀疏 reward(Minecraft、长程任务) | DreamerV3 | PPO | imagination 让 long-horizon credit assignment 可学 |
| 剧烈动作 motion tracking(ASAP、DeepMimic) | PPO | — | reward + GAN 极敏感,PPO 的 clip 是最稳的 on-policy 选项 |
| AMP / motion prior RL | PPO | — | AMP 原论文 + 几乎所有后续都用 PPO;clip 取 0.02(比常规 0.2 严得多) |
为什么 locomotion 用 PPO 而非 SAC
直觉上 SAC 更 sample efficient,但 locomotion 仿真有四个特征让 PPO 占优:
- 并行性压倒样本效率:4096 环境同时跑,PPO wall-clock 反而更快。
- on-policy 的稳定性:腿足要跌倒就发散,PPO 的 clip 比 SAC 的 entropy temperature 更易调。
- 历史编码简单:legged_gym 用 stack frame 而非 RNN,on-policy 下足够。
- 社区路径依赖:ETH 三件套、RMA、legged_gym 全用 PPO,社区肌肉记忆和 baseline 都基于 PPO。
何时反而要选 SAC
- 真机抓取 / 灵巧手(QT-Opt 58 万次真机抓取必须 replay buffer)。
- 仿真样本产出瓶颈(如不能用 GPU 并行)。
- 探索是大问题(reward 极稀疏且无良好 shaping)。
八、概念辨析表
| 维度 | PPO | SAC | TD3 | DDPG | DreamerV3 |
|---|---|---|---|---|---|
| On/off-policy | On | Off | Off | Off | Off(但 imagine) |
| 策略类型 | 随机(高斯) | 随机(tanh-高斯) | 确定性 | 确定性 | 随机 |
| 是否需要 model | 否 | 否 | 否 | 否 | 是(RSSM) |
| 熵/探索 | Ent bonus | 自适应 α | 无 | 无 | Ent + 想象 |
| Replay buffer | 否 | 是 | 是 | 是 | 是(学 world model) |
| 估计器 | likelihood ratio | reparameterization | pathwise | pathwise | pathwise + likelihood |
| 机器人默认选择 | legged locomotion | 真机 manipulation | SAC 替代 | 基本不用 | 长程稀疏 |
九、常见误用
- ❌ 用 SAC 训仿真 locomotion:能跑,但 wall-clock 比 PPO 慢得多(无法利用 GPU 并行),且 on-policy 的 GAE advantage 比 SAC 的 Bellman backup 在腿足 reward 上更稳。容易误信"SAC 更 sample efficient"就盲选,结果训练时间翻几倍。
- ❌ 用 DDPG 替代 TD3:DDPG 早就不该用了。TD3 的三个 trick 修复了 DDPG 的所有已知问题,几乎无成本。
- ❌ PPO 不用 GAE:直接用 $G_t$ 当 advantage 是 REINFORCE,方差极大。GAE($\lambda\approx 0.95$)是 PPO 工程化不可省的一环。
- ❌ PPO clip 取 0.2 当铁律:剧烈动作 / GAN 式 reward(AMP)应该取 0.02。clip 区间太大策略会震散。
- ❌ 用 DreamerV3 替代 PPO 做 locomotion:model-based 的 wall-clock 太慢;locomotion 不缺样本(仿真并行),缺的是稳定训练。
- ❌ off-policy 不用 replay buffer:replay ratio 太高(每次 batch 都重用太多旧数据)会让 off-policy 训练发散。SAC 默认 batch=256、buffer=1e6 是经过验证的甜区。
- ❌ SAC 真机部署不固定随机种子:SAC 输出有随机性,同一观测出不同动作,调试时要用 deterministic eval 模式(取 mean)。
- ❌ 混淆"最大熵 RL"和"entropy bonus":PPO 的 entropy bonus 是个 $\beta H$ 项外加在 loss 上,不改变目标函数的最优解(只是优化轨迹);SAC 的最大熵是直接改目标 $J\to J+\alpha H$,最优策略本身被改变(变成 soft optimal policy)。
十、开放问题
- on-policy + off-policy 混合:能否同时享受 PPO 的稳定和 SAC 的样本效率?最近的优势权重强化学习(AWR / AWAC / ABM)和 CQL 在尝试,机器人上仍未成熟。
- model-based 在机器人上的 wall-clock 瓶颈:DreamerV3 的 imagine rollout 在 legged_gym 这种 4096-env 设置下不如 PPO 快,但真机上又值得。
- 是否需要 discrete action RL:随着 VLA 把 action token 化(RT-2、OpenVLA),离散 RL(GRPO、PPO on tokens)开始回到机器人;但连续动作领域 PPO/SAC 仍是事实标准。
复盘:误区、检查点与 FAQ
常见误区
"样本效率高的算法一定更好" —— 不一定。仿真里能并行几千个环境,"丢经验"的算法靠吞吐量反而 wall-clock 最快;样本效率只在真机或仿真样本产出受限时才决定胜负。
算法选择看"样本贵不贵 + 能不能并行",不是单看样本效率。
"PPO 是万能最优" —— PPO 在仿真腿足运动上确实是事实标准,但剧烈动作 + 对抗式奖励(如 AMP)要把 clip 从 0.2 砍到 0.02,否则策略震散。
PPO 的默认超参只适合"温和"任务,敏感任务必须重调。
"SAC 比 PPO 新所以总该选 SAC" —— SAC 样本效率更高、能多模态探索,但仿真腿足的大规模并行里 wall-clock 反而比 PPO 慢得多。
新不等于适合你的场景;仿真并行用 PPO,真机抓取用 SAC,是经验法则。
检查点
用一句话说清强化学习算法在解什么共同问题?
💡 显示参考答案
- 入门层「是什么·为什么」段直接说明。
算法之间的差别可以压到哪两件事?
💡 显示参考答案
- 相应段落 + 直觉层 类比共同支撑。
为什么仿真里"丢经验"的算法反而常用?真机上反过来?
💡 显示参考答案
- 常见误区或 入门层 关键句直接说明。
父母教娃骑自行车这个类比里,"扶着、放手、跌了爬起"分别对应算法的什么机制?
💡 显示参考答案
- 入门层 关键句或常见误区直接说明。
假如你只能在真机上跑一万步、不能并行,你会选"丢经验"还是"反复用经验"的算法?为什么?
💡 显示参考答案
- 入门层 应用提示。
FAQ
Q1:五个主流算法到底选哪个?
先看两件事:样本贵不贵、能不能大规模并行。仿真腿足 → PPO;真机抓取/灵巧手 → SAC 或 TD3;长程稀疏奖励(导航、家务)→ DreamerV3。这是经验起点,不是铁律。
Q2:为什么仿真里 PPO 反而比 SAC 快?
仿真能开几千个环境并行跑。PPO 虽然样本效率低,但并行吞吐量碾压;SAC 的 replay buffer 在单环境串行下才显出优势。腿足仿真不缺样本,缺的是稳定训练。
Q3:VLA(视觉-语言-动作模型)出来了,这些算法还有用吗?
有。VLA 多用监督模仿学习冷启动;要自我改进、突破演示上限时,仍靠强化学习微调(如 ReinFlow、VLA-RFT)。两者互补,不是替代。
相关
- 线索:T01-sim2real-locomotion.md(DR/RMA/ASAP 全用 PPO)、T04-motion-prior-amp-to-bfm.md(AMP 用 PPO)、T09-world-model-as-simulator.md(DreamerV3 主线)、T11-dexterous-manipulation.md(QT-Opt off-policy)
- 论文笔记:P-DreamerV3-2023.md、P-AMP-2021.md、P-QTOpt-2018.md、P-ExtremeParkour-2023.md
- 上游算法文献:[Schulman 2017 PPO]、[Haarnoja 2018 SAC]、[Fujimoto 2018 TD3]、[Lillicrap 2015 DDPG]、[Hafner 2023 DreamerV3]