⏱ ~60 min

概念辨析 · MDP / POMDP 与机器人控制的形式化

强化学习教科书从 MDP 开始讲起,但机器人几乎从不是 MDP——它是 POMDP。这一字之差决定了为什么机器人 RL 需要 history encoder、为什么 recurrent policy 不是"锦上添花"而是"必需品"、为什么 RL 和 control theory 看似在做同一件事却用完全不同的语言。这篇辨析把这些形式化到底,把每一个符号背后的工程含义讲透。

💡 一句话总结:机器人几乎都是 POMDP——state 不可全观测(摩擦/payload/电机温度等是隐变量),这一字之差决定了为什么需要 history encoder、recurrent policy 和 asymmetric critic;所有"用 stack frame 假装 Markov"的工程选择都会在长依赖任务上翻车。

MDP → POMDP → 机器人 水平流程图:三阶段每阶段含形式化框 (五元组/七元组/实例) + 关键性质框 + 工程解药框

速查:何时用哪个
| 场景 | 推荐 | 原因 |
|------|------|------|
| 仿真训练时有特权信息 $e_t$(摩擦/地形) | asymmetric actor-critic | critic 看特权信息让 target 更准,actor 部署时只用本体感受 |
| 真机只有 proprioception + 长依赖(>50 步) | RNN/GRU history encoder | 近似 belief state $b_t=\phi(h_t)$,POMDP 的充分统计量 |
| 短 horizon + 短依赖(< 50 步) | stack frame(如 50 步窗口) | 工程最简单,on-policy 下足够 |
| 已知线性动力学 + 二次 cost(平衡任务) | LQR / MPC | 有解析最优控制律 + Lyapunov 稳定性保证 |
| 长程 multi-stage 任务 | 分层 RL / DreamerV3 | 显式 imagination horizon 或分层 subgoal 处理 credit assignment |

本页内容

基础解释

一句话直觉

把"边做决定边看反馈"写成一张规则图。像下棋:看局面、走子、得分;看不到对手的手牌也算一种。

是什么·为什么

这套形式化是给"边做决定边看反馈"画一张规则图。图里写清四件事。现在什么情况、能做什么动作、做完变到哪、得多少分。机器人就照这张图想办法拿高分。

为什么重要:没有这张图,连"机器人该学什么"都说不清。所有强化学习方法都默认这张图存在。图画错了,方法再厉害也学不对。

最简单的版本叫"完全可见"规则图。它的要求很苛刻。当前情况写全了,未来就和过去无关。像下棋,看当前棋盘就够。

但真实机器人几乎都不满足这个苛刻要求。它看到的只是传感器读数。不是真正的"完整情况"。地面摩擦、电机温度、电池老化(SoC/SOH)都难直接测、需估算。却悄悄影响每个动作的结果。

这就像你只看到对手的表情,看不到他的手牌。最优策略不能只看当前一帧。要记住过去几秒发生了什么。短依赖堆几十帧关节角就够;更长依赖要靠带记忆的网络(循环或注意力)。所以机器人策略常要带一段历史记忆。

核心一句话:前者叫完全可见,后者叫部分可见。机器人几乎都是后者。

一句话类比:完全可见之于部分可见,像下明棋之于下暗牌。前者看全局,后者要靠记忆和推断补缺。

为什么必须先吃透这一篇

如果不分清 MDP 和 POMDP,会出现一系列"看似合理但实际有 bug"的工程选择:

  • 把几帧关节角堆叠当 observation,认为这就解决了 POMDP(其实没有)。
  • 在 POMDP 上用 Markov 假设的 Bellman 方程,target 估不准还怪 reward 设计。
  • 拿 LQR 公式套到 sim-to-real 的机器人上,结论完全不对。

这条辨析贯穿全部 14 条线索——从 T01 sim2realRMA 为什么需要 history 编码)到 T09 world model(DreamerV3 的 RSSM 就是 belief state)。


一、MDP:五元组的精确定义

马尔可夫决策过程(MDP) 是一个五元组 $\mathcal{M} = (\mathcal{S}, \mathcal{A}, P, R, \gamma)$:

  • $\mathcal{S}$:状态空间(state space)。
  • $\mathcal{A}$:动作空间(action space)。
  • $P:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\to[0,1]$:转移核,$P(s'\mid s,a)$ 表示在 $s$ 做 $a$ 转移到 $s'$ 的概率。
  • $R:\mathcal{S}\times\mathcal{A}\to\mathbb{R}$(或 $R:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\to\mathbb{R}$):奖励函数
  • $\gamma\in[0,1)$:折扣因子

核心是马尔可夫性

$$P(s_{t+1}\mid s_t, a_t, s_{t-1}, a_{t-1},\ldots) = P(s_{t+1}\mid s_t, a_t)$$

即"未来只依赖当前状态和动作,与历史无关"。这一假设让一切变得可处理:策略只需 $\pi(a\mid s)$,价值函数只需 $V(s)$。

Bellman 方程

状态价值函数:

$$V^\pi(s) = \mathbb{E}_{a\sim\pi(\cdot\mid s),\,s'\sim P(\cdot\mid s,a)}\!\Big[R(s,a,s') + \gamma V^\pi(s')\Big]$$

动作价值函数:

$$Q^\pi(s,a) = \mathbb{E}_{s'\sim P(\cdot\mid s,a)}\!\Big[R(s,a,s') + \gamma\,\mathbb{E}_{a'\sim\pi}[Q^\pi(s',a')]\Big]$$

最优 Bellman:

$$Q^*(s,a) = \mathbb{E}_{s'\sim P}\!\Big[R(s,a,s') + \gamma \max_{a'} Q^*(s',a')\Big]$$

这三个方程是所有 value-based RL(Q-learning、DQN、DDPGSACTD3)的训练目标。

RL 的优化目标 $J(\pi)$

更精确地写:

$$J(\pi) = \mathbb{E}_{\tau\sim\pi}\!\left[\sum_{t=0}^{\infty}\gamma^t R(s_t,a_t,s_{t+1})\right],\quad \tau=(s_0,a_0,s_1,a_1,\ldots),\;\; s_0\sim\rho_0$$

最优策略 $\pi^* = \arg\max_\pi J(\pi)$。在 discounted infinite-horizon 设定下,最优策略是 deterministic 且 stationary 的(只依赖 $s$)。

折扣因子 $\gamma$ 的真实含义

数学上 $\gamma<1$ 保证无穷级数收敛。但工程上 $\gamma$ 有两个具体含义

  1. effective horizon:策略"看多远"。$H_{\text{eff}} \approx 1/(1-\gamma)$。
  • $\gamma=0.95$:$\approx 20$ 步。
  • $\gamma=0.99$:$\approx 100$ 步。
  • $\gamma=0.999$:$\approx 1000$ 步。
  1. 数值稳定性:$\gamma$ 越接近 1,$V$ 的 range 越大,TD target 越嘈杂,训练越难收敛。

机器人场景的选择:

  • Locomotion(短程 reward):$\gamma=0.95\sim 0.99$。
  • 长程任务(导航、manipulation multi-stage):$\gamma=0.99\sim 0.999$,但训练慢。
  • 真机 RL(30-100 Hz):$\gamma=0.99$ 对应物理时间 1-3 秒——长任务用 $\gamma=0.999$ + auxiliary reward。

finite-horizon 替代:有时直接写 $J(\pi) = \mathbb{E}_{\tau\sim\pi}\sum_{t=0}^{T} r_t$(无 $\gamma$,硬截断 $T$),这在机器人 episode 有限时更自然。legged_gym 默认就是 finite horizon。


二、POMDP:机器人真实的样子

部分可观测马尔可夫决策过程(POMDP) 是七元组 $(\mathcal{S}, \mathcal{A}, P, R, \gamma, \mathcal{O}, \mathcal{Z})$,比 MDP 多两个:

  • $\mathcal{O}$:观测空间(observation space)。
  • $\mathcal{Z}:\mathcal{S}\times\mathcal{O}\to[0,1]$:观测核,$Z(o\mid s)$ 是在隐状态 $s$ 下看到观测 $o$ 的概率。

关键:agent 不见 $s$,只见 $o$。$s$ 是"上帝视角",$o$ 是 sensor 给的投影。

信念状态 b(h_t)

定义:在看到历史 $h_t = (o_0, a_0, o_1, a_1,\ldots,o_t)$ 后对隐状态的 posterior:

$$b_t(s) = P(s_t = s\mid h_t)$$

核心定理(Åström 1965):在 POMDP 中,$b_t$ 本身满足 MDP——即 $b_t$ 是 POMDP 的"充分统计量"。理论上最优策略可以写成 $\pi^*(a\mid b_t)$。

但 $b_t$ 通常不可解析(连续状态空间下维度灾难),所以实践中用历史 $h_t$ 本身或 $h_t$ 的编码 $\phi(h_t)$ 近似 $b_t$。这就引出 history-based policy。


三、为什么机器人是 POMDP

机器人有四类不完整感知:

感知缺失例子物理原因
触觉缺失灵巧手大多数没有 tactile sensor,但接触力决定下一刻动力学触觉传感器带宽、噪声、磨损
外部地形未知腿足踩在沙地/冰面/水泥上,state $s$ 包含地面摩擦但 robot 测不到摩擦是接触面的物理属性
传感器延迟 + 噪声视觉有 30-80ms 延迟,IMU 有零偏漂移电子学 + 物理学
执行器隐变量电机温度、电池电量、齿轮磨损都影响 torque-velocity curve老化、热效应

形式化地:在腿足机器人里,真正的 MDP state $s_t$ 至少包含:

$$s_t = \underbrace{(\text{joint pos}, \text{joint vel}, \text{base ori}, \text{base ang vel})}_{\text{proprioception }o_t^{\text{prop}}} \;\cup\; \underbrace{(\mu_{\text{friction}}, m_{\text{payload}}, \tau_{\text{motor}}(\cdot))}_{\text{特权 }e_t}$$

Proprioception 可观测,特权 $e_t$ 不可观测。所以机器人 RL 的观测方程是:

$$o_t = (o_t^{\text{prop}}) = \text{Proj}(s_t),\quad e_t\text{ 完全隐}$$

这是 POMDP。MDP 假设破坏。

history-based policy π(a|h_t)

如果只在 proprioception 上做 Markov 策略 $\pi(a\mid o_t^{\text{prop}})$,会丢掉所有"通过动作响应推断隐变量"的信息。机器人的动作响应本身就编码了隐环境——同样 torque 在沙地和水泥地上产生不同的下一刻 base velocity。

最优策略应该是:

$$\pi^*(a\mid h_t) = \pi^*(a\mid o_0^{\text{prop}}, a_0, o_1^{\text{prop}}, a_1,\ldots, o_t^{\text{prop}})$$

recurrent policy / history encoder 的数学角色

训练一个 $\phi_\psi$ 把 $h_t$ 编码成固定维向量 $\hat{b}_t = \phi_\psi(h_t)$,让 $\hat{b}_t$ 近似 $b_t$(隐式 belief)。策略变成:

$$\pi_\theta(a_t\mid o_t, \hat{b}_t),\quad \hat{b}_t = \phi_\psi(\hat{b}_{t-1}, o_{t-1}, a_{t-1}, o_t)$$

$\phi_\psi$ 的常见选择:

  • LSTM / GRU:经典。ANYmal-C 的 belief encoder 就是 2 层 GRU × 50 hidden + exteroceptive attention gate;rsl_rl 提供 recurrent 变体。
  • 1D Causal Convolution:RMA [Kumar 2021] 用 $k=50$ 步(@100Hz 即 0.5 秒)的 1D causal conv 作 adaptation module。比 LSTM 训练稳。
  • Transformer:决策变换器系(Decision Transformer、Trajectory Transformer)。

数学上 $\hat{b}_t$ 是 belief $b_t$ 的函数拟合。拟合好坏直接决定 POMDP 上策略能不能接近最优


四、为什么 POMDP 上 Markov Bellman 会失效

一种常见的直觉是:把 $\phi(h_t)$ 当输入,价值函数写成 $V(h_t)$ 不就行了?

部分对,但有个 trap。Bellman 方程在 POMDP 上变成:

$$V^\pi(h_t) = \mathbb{E}_{a\sim\pi}\!\Big[r(h_t,a) + \gamma\,\mathbb{E}_{o_{t+1}}\big[V^\pi(h_t, a, o_{t+1})\big]\Big]$$

这本身没错,问题在 target 估计的方差:从 $h_t$ 预测 $V$ 需要 $\phi$ 充分压缩历史,但 $\phi$ 训练早期很差,TD error 的 noise 会被 recurrent state 反向放大。

实际工程解药

  • Asymmetric actor-critic:critic 看特权信息 $e_t$,actor 只看 $o_t$ + history。critic 的 target 更准,actor 通过 gradient 间接学。DreamWaQ 的核心 trick(ANYmal-C 走的是下一条 teacher-student 蒸馏路线)。
  • Teacher-student 蒸馏:teacher 用特权信息训出"oracle policy",student 蒸馏 teacher 输出(详见 C-sim2real-methods)。
  • RMA 两阶段:stage 1 训 $\pi(a\mid s, e)$ 用特权信息;stage 2 训 $\phi(h_t) \to \hat{e}$ 监督学 latent。详见 P-RMA

五、连续动作、稀疏奖励、长 horizon:机器人特有挑战

机器人的 POMDP 化身有几个让教科书 RL 直接失效的特征:

1. 连续动作空间

$\mathcal{A}\subset\mathbb{R}^d$,$d=7$(机械臂)到 $d=40+$(人形)。这意味着:

  • $\max_a Q(s,a)$ 没解析解,要靠 actor $\mu_\theta(s)$ 近似(DDPG/TD3/SAC)。
  • 离散化(如 RT-2 把每维 256 bin)会维度爆炸,且丢失精度。
  • Policy gradient 必须用 reparameterization 或 likelihood-ratio 估计。详见 C-rl-algorithms

2. 稀疏奖励

只给"任务完成"reward,几乎学不出。常见 reward 形态:

  • 稀疏任务 reward + dense shaping reward:$r = r_{\text{task}} + \lambda r_{\text{shape}}$。
  • motion prior rewardAMP 用判别器把"像不像人"当 dense reward。见 T04 motion prior
  • curriculum:从简单到难逐步加难度(任务距离、地形复杂度)。legged_gym 默认 curriculum。
  • LLM 生成 reward(Eureka/DrEureka):让 LLM 写 dense reward 代码。见 T03 reward design

3. 长 horizon

家务任务 horizon 几千步,credit assignment 极难。三种应对:

  • 分层 policy / 双系统:高层输出 subgoal / latent,低层执行。如 ASE 的 skill latent、Helix/GR00T N1 的双系统 VLA(System-2 VLM 出 latent,System-1 出动作)。见 T06 VLA
  • Model-based imagination:DreamerV3 在 latent 里 rollout 长 horizon。见 T09 world model
  • Hierarchical IL:MimicPlay 高层从 play 数据学,低层从 demo 学。

4. Sim-to-real gap

仿真的 $P$ 和真机的 $P^{\text{real}}$ 不同。形式化地,训练分布是 $\mathcal{D}_{\text{sim}} = \{P_1, P_2,\ldots,P_k\}$(domain randomization 覆盖),部署分布是单点 $P^{\text{real}}$。这是 distributional robustness 问题。详见 C-sim2real-methods


六、RL 与 control theory 的统一视角

机器人学界历来有两个看似不通的范式:

  • 控制论(LQR / MPC):已知动力学 $\dot{s} = f(s,a)$,求最优控制律。
  • 强化学习(RL):不知道动力学,从交互学最优策略。

但两者在数学上是同一回事——都在求解最优控制问题:

$$\pi^* = \arg\min_\pi\;\mathbb{E}\!\left[\sum_t \gamma^t\, c(s_t, a_t)\right]\quad (\text{RL 用 } r=-c)$$

LQR:当 dynamics 是线性、cost 是二次

$$s_{t+1} = As_t + Ba_t,\quad c(s,a) = s^\top Q s + a^\top R a$$

最优控制律是 线性反馈:$\pi^*(s) = -K s$,$K$ 由 Riccati 方程解析求出。

这告诉我们什么:当动力学接近线性、cost 是二次的(如平衡任务),RL 学出的策略应该是接近线性反馈的。这也是为什么 inverted pendulum / cartpole 上 RL 和 LQR 几乎等价。

MPC:每步在线解最优控制

MPC 在 horizon $H$ 上解 $\min \sum_{t=0}^{H} c(s_t,a_t)$ s.t. dynamics,执行第一步 $a_0$,下一时刻滚动重解。

MPC 和 model-based RL(DreamerV3)的对应:

  • MPC 用已知 dynamics,model-based RL 用学到的 dynamics。
  • MPC 每步解,DreamerV3 离线训 policy。
  • MPC 计算贵但 adapt 快,DreamerV3 推理快但模型固化。

为什么机器人上 RL 才是主流

  • 动力学复杂:腿足接触、灵巧手抓取的动力学根本写不出 closed form,无法 LQR/MPC。
  • 感知是图像:MPC 处理图像 observation 极难,RL 端到端学。
  • reward 易写、cost 难写:很多任务"做到 X"易定义(reward=1),但"用 quadratic cost 渐近引导到 X"很难设计。
  • 可并行仿真器(Isaac Gym)让 RL 能用 4096 envs,MPC 的 online opt 反而难并行。

反过来 control theory 的智慧

  • 稳定性:Lyapunov function 是 RL 没有的硬保证。Constrained policy optimization(CPO)、Lyapunov-based RL 在尝试把稳定性带回 RL。
  • Robustness:$\mathcal{H}_\infty$ 控制、robust MPC 给 sim-to-real 的"分布鲁棒"有形式化理论。当前 sim-to-real RL 缺这一层。
  • WBC(whole body control):传统控制(QPs + inverse dynamics)做高频全身控制,RL 学高层指令——这是 T10 VLA-WBC 分层 的物理基础。

七、概念辨析表

概念形式化定义机器人对应
MDP state $s_t$马尔可夫,未来只依赖 $s_t,a_t$仿真器内部状态(含特权)
Observation $o_t$sensor 投影 $o_t = \text{Proj}(s_t)$proprioception + 视觉 + 触觉
History $h_t$$(o_0,a_0,\ldots,o_t)$RNN / stack frame 的输入
Belief $b_t$$P(s_t\mid h_t)$,POMDP 的充分统计量隐式编码进 $\hat{b}_t = \phi(h_t)$
特权信息 $e_t$训练时可见、部署时不可见的状态分量摩擦、payload、电机曲线
Joint pos / vel关节角度/速度proprioception 的核心
Action $a_t$机器人施加的输入torque / PD target / end-effector

详见C-action-representations(action 七种表示的辨析)。


八、常见误用

  • 在 POMDP 上写 $V^\pi(s)$ 假装 Markov:$s$ 不可观测,应该写 $V^\pi(h_t)$ 或 $V^\pi(b_t)$。Markov 假设破坏会让 TD target 有偏,policy 学不准。
  • stack frame 等于 RNN:50 帧 stack 能编码短历史,但长依赖(>50 步)完全丢。剧烈动作 / 长程任务必须用真 RNN。
  • critic 和 actor 用同一观测空间:critic 应该用 asymmetric 特权信息(仿真里),不然 POMDP 上 value 估不准。
  • $\gamma=0.99$ 当默认:locomotion 短 horizon 用 0.95 就够;长程用 0.99 + auxiliary reward;硬上 0.999 训不出来。
  • 真机 RL 不区分 sim 和 real 的 $P$:仿真 $P$ 学出的 policy 默认部署时 $P^{\text{real}}=P$,但 sim-real gap 让 $P^{\text{real}}\ne P$。这正是 sim-to-real 这条线的全部动机。
  • MPC 替代 RL 做 locomotion:腿足接触动力学写不出 closed form,MPC 推不动;RL 才是腿足主流。但双足平衡可以用 MPC(如 CasADi-based WBC),是 RL + control 的混合范式。
  • 混淆 RL 的 $\pi(a\mid s)$ 和 IL 的 $\pi(a\mid o)$:教科书 RL 用 $s$(Markov 假设),IL 用 $o$(观测就够)。在机器人上两者都应该是 $\pi(a\mid h_t)$。

九、开放问题

  • belief 编码的理论保证:$\hat{b}_t = \phi(h_t)$ 多接近 $b_t$?目前没有定量的近似误差 bound。这影响"recurrent policy 比较于 oracle policy 的差距"。
  • POMDP 上的 sample efficiency lower bound:理论上 POMDP 比对应 MDP 难多少?POMDP PAC 探索方向(待核:具体引用)给出过部分答案,但机器人尺度的实证 lower bound 仍缺。
  • RL + control theory 的统一框架:能否把 LQR 的稳定性、MPC 的 adaptivity、RL 的端到端学习合到一个框架?constrained RL、safe RL、differentiable MPC 都在尝试。
  • 长程 credit assignment:1000 步 horizon 的任务,TD error 怎么不爆?DreamerV3 用 imagination + free bits;hindsight relabeling(HER)是另一条路;仍开放。

复盘:误区、检查点与 FAQ

常见误区

"把几帧关节角堆叠起来就解决了部分可见" —— 不完全。堆叠 50 帧只能编码短历史,长依赖(>50 步)完全丢失;剧烈动作或长程任务必须用真正的循环网络。

堆帧是穷人的历史编码,不是万能解药。

"评估价值函数时假装当前状态完全可见" —— 这是常见陷阱。状态部分不可见时,价值函数应该写在历史或信念上,否则时序差分目标会有偏。

部分可见下要写 V(历史),不是 V(状态)。

"折扣因子 0.99 是默认万能值" —— 不行。短程运动任务用 0.95 就够;长程导航才用 0.99 或更高;硬上 0.999 大概率训不出来。

折扣因子对应"策略看多远",要匹配任务的物理 horizon。

检查点

Q1

这张规则图里必须写清哪四件事?

💡 显示参考答案
  • 规则图必须写清:现在什么情况、能做什么动作、做完变到哪、得多少分(状态/动作/转移/奖励四元素)。
  • 类比锚:下棋看当前棋盘就够决策。
Q2

用下棋的类比解释:什么叫"未来只依赖当前,与过去无关"?

💡 显示参考答案
  • 完全可见的规则图定义:未来只依赖当前状态和动作,与历史无关。
  • 直觉层 类比直接说明这一点。
Q3

为什么真实机器人几乎都不满足"完全可见"的苛刻要求?举一个测不到的隐变量例子。

💡 显示参考答案
  • 因为机器人只见传感器读数,不是完整情况;隐变量例子:地面摩擦、电机温度、电池 SoC/SOH。
  • 入门层 明确点出这些难直接测、需估算。
Q4

既然看不到对手的手牌,机器人靠什么补上这个信息缺口?

💡 显示参考答案
  • 靠记住过去几秒的历史记忆补缺。
  • 短依赖堆几十帧关节角;更长依赖用带记忆的网络(循环或注意力)。
Q5

假如你给机器人堆 50 帧关节角当输入,能解决多长的历史依赖?更长的依赖怎么办?

💡 显示参考答案
  • 50 帧只能编码约 50 步以内的短历史;更长依赖必须用循环或注意力网络。
  • 入门层 末段给了这条关键句。

FAQ

Q1:这套形式化和控制论(LQR、MPC)是一回事吗?

数学本质相同——都是最优控制问题。LQR 假设动力学线性、cost 二次,有解析解;强化学习不假设动力学,从交互学。机器人接触动力学写不出解析式,所以强化学习才是主流。

Q2:为什么长程任务这么难?

误差会沿时间级联。每步一点偏差,千步之后轨迹完全跑偏;折扣因子接近 1 时价值函数的方差也爆炸。长程任务要靠分层、世界模型想象、或事后重标注。

Q3:机器人怎么"记住过去几秒"?

三种常见做法:循环网络(LSTM/GRU)、一维因果卷积(RMA 用 45 步卷积)、或 Transformer。数学上都是在拟合一个"信念状态"——从历史推断隐变量。


深度辨析 → site/concepts/C-mdp-pomdp-formulation.html

相关