概念辨析 · RL 与传统控制的统一视角(LQR / MPC / 反馈控制 vs RL)
这是个容易被忽视的盲点:很多做 RL 的不懂传统控制,做控制的不懂 RL。但现代机器人系统是两者结合的。本辨析建立统一视角。
本页内容
基础解释
一句话直觉
让试错学和按公式算两套办法搭伙干活。像老牌大厨和新派厨师共灶:一个保底,一个出新。
是什么·为什么
机器人运动控制有两套平行话语体系。
一套叫经典控制:基于精确物理模型,有稳定性证明,工业部署成熟。适合轨迹跟踪、平衡控制这些能写清的任务。
另一套叫强化学习:靠试错学,无需精确模型,能学复杂接触任务。但缺稳定性保证。
两者各有短板。经典控制处理不了接触丰富、未知环境、非线性强的任务。强化学习在简单任务上反而不如经典控制稳。
核心大白话:现代机器人是两者结合。上层用强化学习决策"做什么"。下层用经典控制执行"怎么做"。
为什么重要:看懂论文要看懂这两套话语的接口。真机部署必须考虑底层控制和高层策略怎么对接。
一句话类比:强化学习和经典控制之于机器人,像自创菜谱和祖传手艺之于厨房。一个出新,一个保底。
为什么这个辨析重要
机器人运动控制有两套平行话语体系:
- 传统控制(LQR、MPC、PID、反馈线性化):基于精确模型、有理论保证、工业部署成熟
- 强化学习(PPO、SAC、Q-learning):基于数据/试错、无需精确模型、能学复杂技能
两套体系各自的问题:
- 传统控制在接触丰富、非线性、未知环境(locomotion、灵巧操作)力不从心
- RL 缺乏安全保证、sample inefficient、sim-real gap
现代系统的趋势是结合:RL 学高层策略 + 传统控制做低层稳定(如 RL 输出 PD target + 底层 PD 控制;或 MPC 做 warm-start + RL 微调)。必须懂两者怎么对接。
核心概念对照表
| 维度 | 传统控制 | RL |
|---|---|---|
| 模型 | 需要精确动力学 $f(s,a)$ | 不需要(model-free)/ 学习近似 |
| 目标 | 最小化 cost $J = \sum c_t$ | 最大化 reward $J = \sum r_t$(cost = -reward) |
| 求解 | 解析(LQR)/ 数值优化(MPC) | 采样 + 梯度上升(policy gradient) |
| 保证 | 稳定性、收敛性可证 | 几乎无保证 |
| 数据 | 不需要(模型已知) | 大量试错 |
| 计算 | 在线优化(MPC 重) | 离线训练,在线推理(轻) |
| 泛化 | 受限于模型范围 | 可泛化到训练分布内 |
四个关键统一视角
视角 1 · 最优控制 = RL 的特例
Bellman 方程是两者的共同基础:
$$V^*(s) = \max_a \left[r(s,a) + \gamma \mathbb{E}[V^*(s')]\right]$$
- 传统控制:用动力学模型精确算 $\mathbb{E}[V^*]$(确定性 + LQR 闭式解)
- RL:用采样估 $\mathbb{E}[V^*]$(随机 + 用神经网络近似 $V^*$)
统一:RL 是「model-free 的最优控制」;最优控制是「model-based 的 RL」。
视角 2 · LQR 是 RL 的简化
LQR(线性二次调节器)假设:
- 动力学线性:$s_{t+1} = As_t + Ba_t$($A \in \mathbb{R}^{n\times n}$, $B \in \mathbb{R}^{n\times m}$)
- cost 二次:$c(s,a) = s^\top Q s + a^\top R a$($Q \succeq 0$, $R \succ 0$)
此时 Bellman 方程有闭式解。完整推导如下:
第 1 步:值函数猜想 $V^*(s) = s^\top P s$($P \succeq 0$ 待定)。Bellman 方程:
$$V^*(s) = \min_a \left[s^\top Q s + a^\top R a + (As+Ba)^\top P (As+Ba)\right]$$
第 2 步:对 $a$ 求导置零。展开并关于 $a$ 求梯度:
$$\frac{\partial}{\partial a} = 2 R a + 2 B^\top P (As + Ba) = 0$$
解得最优策略(线性反馈):
$$a^*(s) = -\underbrace{(R + B^\top P B)^{-1} B^\top P A}_{K} s$$
增益 $K = (R + B^\top P B)^{-1} B^\top P A$,这就是工程上「LQR gain」。
第 3 步:代回 Bellman 得 Riccati 方程。把 $a^*$ 代回,$V^*$ 必须等于 $s^\top P s$,两边系数匹配:
$$P = Q + A^\top P A - A^\top P B (R + B^\top P B)^{-1} B^\top P A$$
这是离散代数 Riccati 方程(DARE)。$P$ 通过迭代求解:$P_{k+1} = Q + A^\top P_k A - A^\top P_k B(R+B^\top P_k B)^{-1} B^\top P_k A$,从 $P_0 = Q$ 起迭代到收敛(通常 10-1000 步,与系统规模有关)。
稳定性保证:当 $(A, B)$ 可控、$(Q^{1/2}, A)$ 可观时,DARE 有唯一解 $P \succeq 0$,且闭环 $A - BK$ 的所有特征值严格在单位圆内($\rho(A-BK) < 1$),即渐近稳定。这是 LQR/Riccati 框架给 RL 没有的强保证。
RL 视角:LQR 是「线性动力学 + 二次 reward + 线性策略」的特例。RL 松弛了这些假设(任意动力学、任意 reward、非线性策略),但失去闭式解和稳定保证——稳定只能靠 reward shaping 和 sim-to-real 调参近似。
视角 3 · MPC 是在线规划版 RL
MPC(模型预测控制):每个时刻,用动力学模型预测未来 $H$ 步,优化这 $H$ 步的 action 序列,执行第一步,下一时刻重新优化(receding horizon)。精确优化形式:
$$\begin{aligned}
a_{t:t+H}^* = \;\arg\min_{a_{t:t+H}} \quad & \sum_{k=0}^{H-1} \ell(s_{t+k}, a_{t+k}) + V_f(s_{t+H}) \\
\text{s.t.} \quad & s_{t+k+1} = f(s_{t+k}, a_{t+k}), \quad k=0,\dots,H-1 \\
& s_{t+k} \in \mathcal{X}, \quad a_{t+k} \in \mathcal{U} \quad \text{(状态/输入约束)} \\
& s_t = \hat{s}_t \quad \text{(当前观测)}
\end{aligned}$$
其中 $\ell$ 是阶段 cost(如 $\|s-s_{\text{ref}}\|_Q^2 + \|a\|_R^2$),$V_f$ 是终端 cost(保证稳定性的「安全集」),$\mathcal{X}, \mathcal{U}$ 是状态/输入可行集(如关节力矩上限、工作空间约束)。只执行 $a_t^*$,下一时刻 $t+1$ 重新求解整个 $H$-horizon 问题。
求解方法:当 $f$ 非线性时(如机器人全身动力学),常用iLQR / DDP(迭代 LQR / 微分动态规划):
- 在标称轨迹 $\bar{s}, \bar{a}$ 附近线性化:$\delta s_{k+1} \approx A_k \delta s_k + B_k \delta a_k$
- 在线性化近似下求 LQR 子问题(用上述 Riccati 解)
- 用 LQR gain 算出新 $\delta a$,沿 backtracking line search 更新轨迹
- 收敛到局部最优(不保证全局)
典型求解时间 1-50 ms(视 horizon 和系统规模),这是 MPC 频率限制在 20-200 Hz 的主因(vs RL 前向推理可到 100-1000 Hz)。
RL 视角:MPC 是「显式模型 + 短 horizon 优化」;RL 是「隐式模型(value function 近似)+ 长 horizon 优化」。两者可在 Bellman 框架下统一:MPC 用精确 $f$ 算 $\mathbb{E}[V^*]$,RL 用神经网络近似 $V^*$。
关系:
- MPC horizon 短但精确(依赖好模型),RL horizon 长但近似
- MPC 慢(每步优化),RL 快(每步前向推理)
- MPC 泛化受模型限制,RL 泛化受训练分布限制
- MPC 在新环境能在线重新规划(鲁棒),RL 在 OOD 状态可能崩溃
视角 4 · RL + 传统控制的现代结合
实际系统的几种结合方式:
结合 A · RL 学残差
传统控制(MPC/PID)做基线,RL 学一个残差 $\Delta a$:
$$a_t = a_t^{\text{control}}(s_t) + \Delta a_t^{\text{RL}}(s_t; \theta)$$
其中 $a^{\text{control}}$ 是控制基线(如 PD 目标、MPC 输出),$\Delta a^{\text{RL}}$ 是 RL policy 输出。关键优势:当 RL policy 还没学好时 $\Delta a \approx 0$,系统退化成稳定的控制基线,不会失控;RL 只需学「基线做不好的部分」(如接触建立瞬间、复杂地形),降低学习难度。代表:Residual Policy Learning(Silver, Allen, Tenenbaum, Kaelbling 2018, arXiv:1812.06298)、Residual Reinforcement Learning for Robot Contact Control(Johannink et al. 2019, ICRA)。稳定性证明:若基线控制器 Lyapunov 稳定($V$ 是 Lyapunov 函数),且残差有界 $\|\Delta a^{\text{RL}}\| \le \epsilon$,则闭环仍有输入-状态稳定(ISS)保证(Johannink et al. 2019 给出形式化论述)。
结合 B · RL 出高层命令 + 传统控制执行
RL 输出「目标速度」「footstep plan」「关节 PD target」,底层用 MPC/PD 控制把目标转成力矩。
代表:四足 RMA [Kumar et al. 2021] ——RL policy $\pi_\theta$ @ 100 Hz 出 12 维目标关节角 $\hat q$,PD 控制器($K_p{=}55, K_d{=}0.8$)转力矩 $\tau = K_p(\hat q{-}q) + K_d(0{-}\dot q)$;adaptation module $\phi_\omega$ @ 10 Hz 异步推断未知环境参数 $\hat z_t$。人形 locomotion 同范式(Unitree H1/G1 等 19–43 DoF,RL 出全身目标关节角 + PD 稳定)。
结合 C · MPC 做 warm-start + RL 微调
用 MPC 生成初始数据训 RL,然后用 RL 探索 MPC 处理不好的情况。
代表:manipulation 的 MPC + RL fine-tune 工作、 locomotion 领域 MPC-Injection(把 MPC 解出的转移直接插入 RL replay buffer 引导步态,Xing et al. 2026)。
结合 D · 可微分 MPC / differentiable control
把 MPC 写成可微分层,让 RL 梯度能流过 MPC。设 RL 输出残差 $\Delta a$,MPC 解出实际动作 $a^{\text{MPC}} = \text{MPC}(s, \Delta a)$,外层损失 $L(a^{\text{MPC}})$,则梯度流:
$$\frac{\partial L}{\partial \theta_{\text{RL}}} = \frac{\partial L}{\partial a^{\text{MPC}}} \cdot \underbrace{\frac{\partial a^{\text{MPC}}}{\partial \Delta a}}_{\text{MPC 的雅可比}} \cdot \frac{\partial \Delta a}{\partial \theta_{\text{RL}}}$$
中间项 $\partial a^{\text{MPC}} / \partial \Delta a$ 是 MPC 优化解对扰动的灵敏度,可通过KKT 条件的隐函数定理算出(Amos & Kolter 2017, OptNet;Amos 2018, diff-MPC)。直觉:MPC 是个 QP,最优解是 KKT 线性系统的解,对其参数(包括 $\Delta a$)求导就是解一个灵敏度 QP。
工程含义:可微 MPC 让 RL 梯度「顺着 MPC 的结构」传播——RL 学到的 $\Delta a$ 不会破坏 MPC 的约束满足性(因为梯度已经经过 MPC 的可行性约束),比「MPC + RL 完全分离」更安全。但工程复杂(要可微 QP solver、horizon 调参),实际部署不多。代表:Differentiable MPC(Amos 2018, ICLR)、Diff-MPC-RL manipulation 工作。
2024–2025 落地代表:从「单层 RL+PD」到「多层异频分工」
上述四种结合是抽象模式,2024–2025 已沉淀出明确的工业级实例:
- GR00T N1 双系统(NVIDIA, [Bjorck 2025, arXiv:2503.14734]):System-2 Eagle-2 VLM(~1.34B)@ ~10 Hz 慢思考语言+场景,System-1 DiT action expert(~0.86B)@ 120 Hz 出关节角 action chunk(H=16,flow matching 4 步)——本质是「学习式语义层 + 学习式 motor 层」两层堆叠,运行时分层、训练时通过 latent(VLM 第 12 层 embedding)联合。System-1 输出的关节角最终由机器人本体 PD/WBC 转力矩,构成「VLM → DiT → PD」三层异频分工。详见 P-GR00T-N1-2025.md、线索 T10-vla-wbc-integration.md。
- HOVER 多模式 WBC([Fu, Luo, Cheng, ..., Hutter, Wang 2024, arXiv:2410.21229]):单一 unified policy 同时支持 kinematic-position / joint-angle / root-tracking 三类指令的任意子集(>15 种模式),用 mode mask + sparsity mask + DAgger 蒸馏训练。它替代了 ExBody / H2O / OmniH2O / HumanPlus 一堆 specialist WBC,是「一个学习式 WBC 吃下所有指令空间」的代表。运行时仍是 RL 输出关节角 → PD 转力矩的范式,但 command space 工程化为统一接口。详见 P-HOVER-2024.md。
- Helix 02 / Figure 03 三层架构([Figure AI, 2026]):在 S2(7B VLM @ 7–9 Hz)+ S1(80M visuomotor @ 200 Hz)之上再插 System 0(S0)@ 1 kHz 专门处理平衡/接触/协调——把「学习式语义 + 学习式 motor + 经典物理稳定」三层显式拆开,进一步凸显「RL 出指令、传统控制稳态执行」的分工。待核:Helix 02 仅以 industry blog 发布,无 arXiv/同行评议。
💡 核心洞察:现代系统的「分层」不是「RL vs 控制」的对立,而是「学习层负责泛化与语义、控制层(PD/MPC/WBC)负责物理稳定」的异频分工。RL 与传统控制在工程上已经缝合为同一栈的不同层。
机器人上的具体映射
| 任务 | 传统控制方法 | RL 方法 | 当前主流 |
|---|---|---|---|
| 机械臂轨迹跟踪 | LQR / MPC / computed torque | SAC / PPO | 传统控制为主 |
| 四足 locomotion | MPC(MIT Cheetah 2018+)、Raibert hopper(经典) | PPO + teacher-student(ANYmal 系) | 学术 RL 占主导,工业机型(Spot 等)仍以 MPC 为底 |
| 人形平衡 | ZMP(Honda ASIMO 系)、WBC | PPO + WBC(Unitree H1/G1 系) | RL + 传统 WBC 结合 |
| 灵巧操作 | 力控 + 阻抗控制 | RL + IL(OpenAI Hand) | RL 为主 |
| 自动驾驶 | MPC | RL(很少独立用) | 传统为主 + RL 辅助 |
稳定性保证:Lyapunov 分析(传统控制的护城河)
传统控制相对于 RL 最深的护城河是稳定性可证。Lyapunov 分析是核心工具:
Lyapunov 函数法:对动力系统 $s_{t+1} = f(s_t)$(平衡点 $s^*=0$),若存在正定函数 $V: \mathbb{R}^n \to \mathbb{R}$ 满足:
$$V(0) = 0, \quad V(s) > 0 \;\forall s \ne 0 \quad \text{(正定)}$$
$$\Delta V(s) = V(f(s)) - V(s) < 0 \;\forall s \ne 0 \quad \text{(递减)}$$
则平衡点渐近稳定。直觉:找到一个「能量函数」$V$,每步都减少 → 系统必然收敛到 $V=0$ 的点。
LQR 的 Lyapunov 证明:取 $V(s) = s^\top P s$($P$ 是 Riccati 解),则:
$$\Delta V = s^\top \!\left[(A-BK)^\top P (A-BK) - P\right]\!s = -(s^\top Q s + a^\top R a) < 0$$
(最后等式来自 Riccati 方程变形)。所以 LQR 闭环渐近稳定——这就是「LQR 有保证」的数学根源。
RL 缺失的保证:神经网络 policy $\pi_\theta$ 没有这种 Lyapunov 结构。Safe RL 的研究方向之一是强制学一个 Lyapunov 函数:
$$\min_\theta \; \mathcal{L}_{\text{task}}(\theta) \quad \text{s.t.} \quad V_\phi(f(s, \pi_\theta(s))) - V_\phi(s) \le -\alpha \|s\|^2 \;\forall s \in \mathcal{D}$$
即学 policy $\pi_\theta$ 的同时学一个 Lyapunov candidate $V_\phi$,约束 $\Delta V < 0$(用 LQR 学 V、或神经网络参数化 $V_\phi$ + soft constraint)。代表:Lyapunov Neural Networks(Chang 2019)、Safe RL via Control Barrier Functions。但工程上远未成熟,目前 RL 稳定性主要靠:仿真 reward shaping + 真机保守部署,没有形式化保证。
对接 RL+控制的工程含义:把 RL 输出 $\Delta a$(残差)叠加在 Lyapunov 稳定的基线控制器上,若 $\|\Delta a\|$ 有界且小于基线控制器稳定裕度,可证明 ISS(输入-状态稳定)。这就是「结合 A · RL 学残差」能安全部署的理论依据。
- ❌ 「RL 一定比 MPC 好」——在简单任务(轨迹跟踪)上 MPC 更稳、更安全
- ❌ 「传统控制过时了」——locomotion WBC、人形平衡仍大量用 MPC/PD,RL 主要学高层策略;Boston Dynamics Atlas 长期以 MPC + WBC 为主,2024 新版才在部分行为上引入学习
- ❌ 「RL 和控制是对立的」——现代系统是结合,看 Unitree H1/G1(RL 出目标关节角 + PD)、Figure 03(VLA + WBC + 1 kHz S0)、GR00T N1(VLM + DiT + PD)
- ❌ 「RL 不需要模型」——model-based RL(DreamerV3)显式学模型;model-free RL 也隐式利用模型假设(如 sim-to-real 用仿真器模型)
为什么这个辨析关键
- 看懂 paper:locomotion 论文常说「PD 控制 + RL policy」,不懂 PD 就看不懂
- 设计系统:真机部署必须考虑底层控制(PD/MPC)和高层策略(RL)的接口
- 解释结果:RL 在「传统控制做不好的任务」(接触丰富、未知地形)上才有优势,简单任务没必要用 RL
- 扩展视野:很多 control theory 的工具(Lyapunov 稳定性、reachability analysis)正在被引入 RL 做 safe RL
关键论文(两者结合的代表)
- [Silver, Allen, Tenenbaum, Kaelbling 2018] Residual Policy Learning(arXiv:1812.06298)——RL 学残差的开山
- [Johannink et al. 2019] Residual Reinforcement Learning for Robot Contact Control(ICRA)——残差 RL 的 ISS 稳定性论述
- [Tassa et al. 2012] iLQG-MPC(Synthesis and Stabilization through Online Trajectory Optimization)——MPC 经典
- [Hutter et al. 2016] ANYmal platform(IROS)——传统控制腿足平台
- [Hwangbo et al. 2019] Learning agile and dynamic motor skills for legged robots(Science Robotics)——RaiSim + system ID + curriculum 的 sim-to-real RL 早期代表
- [Miki et al. 2022] ANYmal-C in the wild(Science Robotics)——RL + teacher-student + 外感知,四足 RL 走出实验室的转折点
- [Kumar et al. 2021] RMA: Rapid Motor Adaptation(arXiv:2107.04034)——RL @ 100 Hz 出 PD target + adaptation @ 10 Hz 异步分工的范本,见 P-RMA-2021.md
- [Radosavovic et al. 2023] Real-World Humanoid Locomotion with RL(arXiv:2303.03381)——人形 Digit 的纯 RL 室外行走
- [Amos et al. 2018] Differentiable MPC(ICLR)——可微 MPC 让 RL 梯度过优化层
- [Bjorck et al. 2025] GR00T N1(arXiv:2503.14734)——双系统 VLA 的现代工业级 RL+控制分层,见 P-GR00T-N1-2025.md
- [Fu, Luo, Cheng, ..., Hutter, Wang 2024] HOVER(arXiv:2410.21229)——多模式统一 WBC,见 P-HOVER-2024.md
复盘:误区、检查点与 FAQ
常见误区
"强化学习一定比经典控制好" —— 错。简单任务(轨迹跟踪、平衡控制)上经典控制更稳更安全。
两者各有适用范围,剧烈接触和未知环境才是强化学习的舞台。
"经典控制过时了" —— 错。腿足运动、人形平衡仍大量用经典控制做底层。主流厂商都是两者混用。
经典控制是底层执行不可替代的基石。
"两者是对立的" —— 错。现代系统都是结合。上层强化学习出目标,下层经典控制跟踪。
对立是误解,分工才是真相。
检查点
两套办法分别叫什么?各有什么长短?
💡 显示参考答案
- 入门层「是什么·为什么」段直接说明。
现代机器人系统通常怎么把两者结合起来?
💡 显示参考答案
- 相应段落 + 直觉层 类比共同支撑。
"老牌大厨和新派厨师共灶"这个类比里,各自对应什么角色?
💡 显示参考答案
- 常见误区或 入门层 关键句直接说明。
为什么简单任务(如轨迹跟踪)反而经典控制更合适?
💡 显示参考答案
- 入门层 关键句或常见误区直接说明。
假如你要做一个会在沙地上跑还会捡东西的人形,你会怎么分工?
💡 显示参考答案
- 入门层 应用提示。
FAQ
Q1:经典控制具体指哪些方法?
常见的有比例-积分-微分控制、线性二次调节器、模型预测控制。工业界用得最多的是第一种,腿足平衡常用第二种和第三种。
Q2:强化学习能完全替代经典控制吗?
不能。经典控制有稳定性证明,强化学习没有。涉及人和贵重硬件的场景必须留经典控制做兜底。
Q3:为什么腿足运动流行强化学习?
相关
- 概念:C-rl-algorithms.md(RL 算法)、C-mdp-pomdp-formulation.md
- 线索:T01-sim2real-locomotion.md(sim2real 涉及控制+RL)、T04-motion-prior-amp-to-bfm.md(AMP 是 RL+style reward)、T10-vla-wbc-integration.md(VLA + WBC 分层 = 现代 RL+控制整合)
- 论文:P-RMA-2021.md(RMA 在线适应 = RL + 自适应控制)、P-GR00T-N1-2025.md(双系统 VLA 分层)、P-HOVER-2024.md(多模式统一 WBC)