概念辨析 · MDP / POMDP 与机器人控制的形式化
强化学习教科书从 MDP 开始讲起,但机器人几乎从不是 MDP——它是 POMDP。这一字之差决定了为什么机器人 RL 需要 history encoder、为什么 recurrent policy 不是"锦上添花"而是"必需品"、为什么 RL 和 control theory 看似在做同一件事却用完全不同的语言。这篇辨析把这些形式化到底,把每一个符号背后的工程含义讲透。
💡 一句话总结:机器人几乎都是 POMDP——state 不可全观测(摩擦/payload/电机温度等是隐变量),这一字之差决定了为什么需要 history encoder、recurrent policy 和 asymmetric critic;所有"用 stack frame 假装 Markov"的工程选择都会在长依赖任务上翻车。
速查:何时用哪个
| 场景 | 推荐 | 原因 |
|------|------|------|
| 仿真训练时有特权信息 $e_t$(摩擦/地形) | asymmetric actor-critic | critic 看特权信息让 target 更准,actor 部署时只用本体感受 |
| 真机只有 proprioception + 长依赖(>50 步) | RNN/GRU history encoder | 近似 belief state $b_t=\phi(h_t)$,POMDP 的充分统计量 |
| 短 horizon + 短依赖(< 50 步) | stack frame(如 50 步窗口) | 工程最简单,on-policy 下足够 |
| 已知线性动力学 + 二次 cost(平衡任务) | LQR / MPC | 有解析最优控制律 + Lyapunov 稳定性保证 |
| 长程 multi-stage 任务 | 分层 RL / DreamerV3 | 显式 imagination horizon 或分层 subgoal 处理 credit assignment |
本页内容
基础解释
一句话直觉
把"边做决定边看反馈"写成一张规则图。像下棋:看局面、走子、得分;看不到对手的手牌也算一种。
是什么·为什么
这套形式化是给"边做决定边看反馈"画一张规则图。图里写清四件事。现在什么情况、能做什么动作、做完变到哪、得多少分。机器人就照这张图想办法拿高分。
为什么重要:没有这张图,连"机器人该学什么"都说不清。所有强化学习方法都默认这张图存在。图画错了,方法再厉害也学不对。
最简单的版本叫"完全可见"规则图。它的要求很苛刻。当前情况写全了,未来就和过去无关。像下棋,看当前棋盘就够。
但真实机器人几乎都不满足这个苛刻要求。它看到的只是传感器读数。不是真正的"完整情况"。地面摩擦、电机温度、电池老化(SoC/SOH)都难直接测、需估算。却悄悄影响每个动作的结果。
这就像你只看到对手的表情,看不到他的手牌。最优策略不能只看当前一帧。要记住过去几秒发生了什么。短依赖堆几十帧关节角就够;更长依赖要靠带记忆的网络(循环或注意力)。所以机器人策略常要带一段历史记忆。
核心一句话:前者叫完全可见,后者叫部分可见。机器人几乎都是后者。
一句话类比:完全可见之于部分可见,像下明棋之于下暗牌。前者看全局,后者要靠记忆和推断补缺。
为什么必须先吃透这一篇
如果不分清 MDP 和 POMDP,会出现一系列"看似合理但实际有 bug"的工程选择:
- 把几帧关节角堆叠当 observation,认为这就解决了 POMDP(其实没有)。
- 在 POMDP 上用 Markov 假设的 Bellman 方程,target 估不准还怪 reward 设计。
- 拿 LQR 公式套到 sim-to-real 的机器人上,结论完全不对。
这条辨析贯穿全部 14 条线索——从 T01 sim2real(RMA 为什么需要 history 编码)到 T09 world model(DreamerV3 的 RSSM 就是 belief state)。
一、MDP:五元组的精确定义
马尔可夫决策过程(MDP) 是一个五元组 $\mathcal{M} = (\mathcal{S}, \mathcal{A}, P, R, \gamma)$:
- $\mathcal{S}$:状态空间(state space)。
- $\mathcal{A}$:动作空间(action space)。
- $P:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\to[0,1]$:转移核,$P(s'\mid s,a)$ 表示在 $s$ 做 $a$ 转移到 $s'$ 的概率。
- $R:\mathcal{S}\times\mathcal{A}\to\mathbb{R}$(或 $R:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\to\mathbb{R}$):奖励函数。
- $\gamma\in[0,1)$:折扣因子。
核心是马尔可夫性:
$$P(s_{t+1}\mid s_t, a_t, s_{t-1}, a_{t-1},\ldots) = P(s_{t+1}\mid s_t, a_t)$$
即"未来只依赖当前状态和动作,与历史无关"。这一假设让一切变得可处理:策略只需 $\pi(a\mid s)$,价值函数只需 $V(s)$。
Bellman 方程
状态价值函数:
$$V^\pi(s) = \mathbb{E}_{a\sim\pi(\cdot\mid s),\,s'\sim P(\cdot\mid s,a)}\!\Big[R(s,a,s') + \gamma V^\pi(s')\Big]$$
动作价值函数:
$$Q^\pi(s,a) = \mathbb{E}_{s'\sim P(\cdot\mid s,a)}\!\Big[R(s,a,s') + \gamma\,\mathbb{E}_{a'\sim\pi}[Q^\pi(s',a')]\Big]$$
最优 Bellman:
$$Q^*(s,a) = \mathbb{E}_{s'\sim P}\!\Big[R(s,a,s') + \gamma \max_{a'} Q^*(s',a')\Big]$$
这三个方程是所有 value-based RL(Q-learning、DQN、DDPG、SAC、TD3)的训练目标。
RL 的优化目标 $J(\pi)$
更精确地写:
$$J(\pi) = \mathbb{E}_{\tau\sim\pi}\!\left[\sum_{t=0}^{\infty}\gamma^t R(s_t,a_t,s_{t+1})\right],\quad \tau=(s_0,a_0,s_1,a_1,\ldots),\;\; s_0\sim\rho_0$$
最优策略 $\pi^* = \arg\max_\pi J(\pi)$。在 discounted infinite-horizon 设定下,最优策略是 deterministic 且 stationary 的(只依赖 $s$)。
折扣因子 $\gamma$ 的真实含义
数学上 $\gamma<1$ 保证无穷级数收敛。但工程上 $\gamma$ 有两个具体含义:
- effective horizon:策略"看多远"。$H_{\text{eff}} \approx 1/(1-\gamma)$。
- $\gamma=0.95$:$\approx 20$ 步。
- $\gamma=0.99$:$\approx 100$ 步。
- $\gamma=0.999$:$\approx 1000$ 步。
- 数值稳定性:$\gamma$ 越接近 1,$V$ 的 range 越大,TD target 越嘈杂,训练越难收敛。
机器人场景的选择:
- Locomotion(短程 reward):$\gamma=0.95\sim 0.99$。
- 长程任务(导航、manipulation multi-stage):$\gamma=0.99\sim 0.999$,但训练慢。
- 真机 RL(30-100 Hz):$\gamma=0.99$ 对应物理时间 1-3 秒——长任务用 $\gamma=0.999$ + auxiliary reward。
finite-horizon 替代:有时直接写 $J(\pi) = \mathbb{E}_{\tau\sim\pi}\sum_{t=0}^{T} r_t$(无 $\gamma$,硬截断 $T$),这在机器人 episode 有限时更自然。legged_gym 默认就是 finite horizon。
二、POMDP:机器人真实的样子
部分可观测马尔可夫决策过程(POMDP) 是七元组 $(\mathcal{S}, \mathcal{A}, P, R, \gamma, \mathcal{O}, \mathcal{Z})$,比 MDP 多两个:
- $\mathcal{O}$:观测空间(observation space)。
- $\mathcal{Z}:\mathcal{S}\times\mathcal{O}\to[0,1]$:观测核,$Z(o\mid s)$ 是在隐状态 $s$ 下看到观测 $o$ 的概率。
关键:agent 不见 $s$,只见 $o$。$s$ 是"上帝视角",$o$ 是 sensor 给的投影。
信念状态 b(h_t)
定义:在看到历史 $h_t = (o_0, a_0, o_1, a_1,\ldots,o_t)$ 后对隐状态的 posterior:
$$b_t(s) = P(s_t = s\mid h_t)$$
核心定理(Åström 1965):在 POMDP 中,$b_t$ 本身满足 MDP——即 $b_t$ 是 POMDP 的"充分统计量"。理论上最优策略可以写成 $\pi^*(a\mid b_t)$。
但 $b_t$ 通常不可解析(连续状态空间下维度灾难),所以实践中用历史 $h_t$ 本身或 $h_t$ 的编码 $\phi(h_t)$ 近似 $b_t$。这就引出 history-based policy。
三、为什么机器人是 POMDP
机器人有四类不完整感知:
| 感知缺失 | 例子 | 物理原因 |
|---|---|---|
| 触觉缺失 | 灵巧手大多数没有 tactile sensor,但接触力决定下一刻动力学 | 触觉传感器带宽、噪声、磨损 |
| 外部地形未知 | 腿足踩在沙地/冰面/水泥上,state $s$ 包含地面摩擦但 robot 测不到 | 摩擦是接触面的物理属性 |
| 传感器延迟 + 噪声 | 视觉有 30-80ms 延迟,IMU 有零偏漂移 | 电子学 + 物理学 |
| 执行器隐变量 | 电机温度、电池电量、齿轮磨损都影响 torque-velocity curve | 老化、热效应 |
形式化地:在腿足机器人里,真正的 MDP state $s_t$ 至少包含:
$$s_t = \underbrace{(\text{joint pos}, \text{joint vel}, \text{base ori}, \text{base ang vel})}_{\text{proprioception }o_t^{\text{prop}}} \;\cup\; \underbrace{(\mu_{\text{friction}}, m_{\text{payload}}, \tau_{\text{motor}}(\cdot))}_{\text{特权 }e_t}$$
Proprioception 可观测,特权 $e_t$ 不可观测。所以机器人 RL 的观测方程是:
$$o_t = (o_t^{\text{prop}}) = \text{Proj}(s_t),\quad e_t\text{ 完全隐}$$
这是 POMDP。MDP 假设破坏。
history-based policy π(a|h_t)
如果只在 proprioception 上做 Markov 策略 $\pi(a\mid o_t^{\text{prop}})$,会丢掉所有"通过动作响应推断隐变量"的信息。但机器人的动作响应本身就编码了隐环境——同样 torque 在沙地和水泥地上产生不同的下一刻 base velocity。
最优策略应该是:
$$\pi^*(a\mid h_t) = \pi^*(a\mid o_0^{\text{prop}}, a_0, o_1^{\text{prop}}, a_1,\ldots, o_t^{\text{prop}})$$
recurrent policy / history encoder 的数学角色
训练一个 $\phi_\psi$ 把 $h_t$ 编码成固定维向量 $\hat{b}_t = \phi_\psi(h_t)$,让 $\hat{b}_t$ 近似 $b_t$(隐式 belief)。策略变成:
$$\pi_\theta(a_t\mid o_t, \hat{b}_t),\quad \hat{b}_t = \phi_\psi(\hat{b}_{t-1}, o_{t-1}, a_{t-1}, o_t)$$
$\phi_\psi$ 的常见选择:
- LSTM / GRU:经典。ANYmal-C 的 belief encoder 就是 2 层 GRU × 50 hidden + exteroceptive attention gate;rsl_rl 提供 recurrent 变体。
- 1D Causal Convolution:RMA [Kumar 2021] 用 $k=50$ 步(@100Hz 即 0.5 秒)的 1D causal conv 作 adaptation module。比 LSTM 训练稳。
- Transformer:决策变换器系(Decision Transformer、Trajectory Transformer)。
数学上 $\hat{b}_t$ 是 belief $b_t$ 的函数拟合。拟合好坏直接决定 POMDP 上策略能不能接近最优。
四、为什么 POMDP 上 Markov Bellman 会失效
一种常见的直觉是:把 $\phi(h_t)$ 当输入,价值函数写成 $V(h_t)$ 不就行了?
部分对,但有个 trap。Bellman 方程在 POMDP 上变成:
$$V^\pi(h_t) = \mathbb{E}_{a\sim\pi}\!\Big[r(h_t,a) + \gamma\,\mathbb{E}_{o_{t+1}}\big[V^\pi(h_t, a, o_{t+1})\big]\Big]$$
这本身没错,问题在 target 估计的方差:从 $h_t$ 预测 $V$ 需要 $\phi$ 充分压缩历史,但 $\phi$ 训练早期很差,TD error 的 noise 会被 recurrent state 反向放大。
实际工程解药:
- Asymmetric actor-critic:critic 看特权信息 $e_t$,actor 只看 $o_t$ + history。critic 的 target 更准,actor 通过 gradient 间接学。DreamWaQ 的核心 trick(ANYmal-C 走的是下一条 teacher-student 蒸馏路线)。
- Teacher-student 蒸馏:teacher 用特权信息训出"oracle policy",student 蒸馏 teacher 输出(详见 C-sim2real-methods)。
- RMA 两阶段:stage 1 训 $\pi(a\mid s, e)$ 用特权信息;stage 2 训 $\phi(h_t) \to \hat{e}$ 监督学 latent。详见 P-RMA。
五、连续动作、稀疏奖励、长 horizon:机器人特有挑战
机器人的 POMDP 化身有几个让教科书 RL 直接失效的特征:
1. 连续动作空间
$\mathcal{A}\subset\mathbb{R}^d$,$d=7$(机械臂)到 $d=40+$(人形)。这意味着:
- $\max_a Q(s,a)$ 没解析解,要靠 actor $\mu_\theta(s)$ 近似(DDPG/TD3/SAC)。
- 离散化(如 RT-2 把每维 256 bin)会维度爆炸,且丢失精度。
- Policy gradient 必须用 reparameterization 或 likelihood-ratio 估计。详见 C-rl-algorithms。
2. 稀疏奖励
只给"任务完成"reward,几乎学不出。常见 reward 形态:
- 稀疏任务 reward + dense shaping reward:$r = r_{\text{task}} + \lambda r_{\text{shape}}$。
- motion prior reward:AMP 用判别器把"像不像人"当 dense reward。见 T04 motion prior。
- curriculum:从简单到难逐步加难度(任务距离、地形复杂度)。legged_gym 默认 curriculum。
- LLM 生成 reward(Eureka/DrEureka):让 LLM 写 dense reward 代码。见 T03 reward design。
3. 长 horizon
家务任务 horizon 几千步,credit assignment 极难。三种应对:
- 分层 policy / 双系统:高层输出 subgoal / latent,低层执行。如 ASE 的 skill latent、Helix/GR00T N1 的双系统 VLA(System-2 VLM 出 latent,System-1 出动作)。见 T06 VLA。
- Model-based imagination:DreamerV3 在 latent 里 rollout 长 horizon。见 T09 world model。
- Hierarchical IL:MimicPlay 高层从 play 数据学,低层从 demo 学。
4. Sim-to-real gap
仿真的 $P$ 和真机的 $P^{\text{real}}$ 不同。形式化地,训练分布是 $\mathcal{D}_{\text{sim}} = \{P_1, P_2,\ldots,P_k\}$(domain randomization 覆盖),部署分布是单点 $P^{\text{real}}$。这是 distributional robustness 问题。详见 C-sim2real-methods。
六、RL 与 control theory 的统一视角
机器人学界历来有两个看似不通的范式:
- 控制论(LQR / MPC):已知动力学 $\dot{s} = f(s,a)$,求最优控制律。
- 强化学习(RL):不知道动力学,从交互学最优策略。
但两者在数学上是同一回事——都在求解最优控制问题:
$$\pi^* = \arg\min_\pi\;\mathbb{E}\!\left[\sum_t \gamma^t\, c(s_t, a_t)\right]\quad (\text{RL 用 } r=-c)$$
LQR:当 dynamics 是线性、cost 是二次
$$s_{t+1} = As_t + Ba_t,\quad c(s,a) = s^\top Q s + a^\top R a$$
最优控制律是 线性反馈:$\pi^*(s) = -K s$,$K$ 由 Riccati 方程解析求出。
这告诉我们什么:当动力学接近线性、cost 是二次的(如平衡任务),RL 学出的策略应该是接近线性反馈的。这也是为什么 inverted pendulum / cartpole 上 RL 和 LQR 几乎等价。
MPC:每步在线解最优控制
MPC 在 horizon $H$ 上解 $\min \sum_{t=0}^{H} c(s_t,a_t)$ s.t. dynamics,执行第一步 $a_0$,下一时刻滚动重解。
MPC 和 model-based RL(DreamerV3)的对应:
- MPC 用已知 dynamics,model-based RL 用学到的 dynamics。
- MPC 每步解,DreamerV3 离线训 policy。
- MPC 计算贵但 adapt 快,DreamerV3 推理快但模型固化。
为什么机器人上 RL 才是主流
- 动力学复杂:腿足接触、灵巧手抓取的动力学根本写不出 closed form,无法 LQR/MPC。
- 感知是图像:MPC 处理图像 observation 极难,RL 端到端学。
- reward 易写、cost 难写:很多任务"做到 X"易定义(reward=1),但"用 quadratic cost 渐近引导到 X"很难设计。
- 可并行:仿真器(Isaac Gym)让 RL 能用 4096 envs,MPC 的 online opt 反而难并行。
反过来 control theory 的智慧
- 稳定性:Lyapunov function 是 RL 没有的硬保证。Constrained policy optimization(CPO)、Lyapunov-based RL 在尝试把稳定性带回 RL。
- Robustness:$\mathcal{H}_\infty$ 控制、robust MPC 给 sim-to-real 的"分布鲁棒"有形式化理论。当前 sim-to-real RL 缺这一层。
- WBC(whole body control):传统控制(QPs + inverse dynamics)做高频全身控制,RL 学高层指令——这是 T10 VLA-WBC 分层 的物理基础。
七、概念辨析表
| 概念 | 形式化定义 | 机器人对应 |
|---|---|---|
| MDP state $s_t$ | 马尔可夫,未来只依赖 $s_t,a_t$ | 仿真器内部状态(含特权) |
| Observation $o_t$ | sensor 投影 $o_t = \text{Proj}(s_t)$ | proprioception + 视觉 + 触觉 |
| History $h_t$ | $(o_0,a_0,\ldots,o_t)$ | RNN / stack frame 的输入 |
| Belief $b_t$ | $P(s_t\mid h_t)$,POMDP 的充分统计量 | 隐式编码进 $\hat{b}_t = \phi(h_t)$ |
| 特权信息 $e_t$ | 训练时可见、部署时不可见的状态分量 | 摩擦、payload、电机曲线 |
| Joint pos / vel | 关节角度/速度 | proprioception 的核心 |
| Action $a_t$ | 机器人施加的输入 | torque / PD target / end-effector |
详见:C-action-representations(action 七种表示的辨析)。
八、常见误用
- ❌ 在 POMDP 上写 $V^\pi(s)$ 假装 Markov:$s$ 不可观测,应该写 $V^\pi(h_t)$ 或 $V^\pi(b_t)$。Markov 假设破坏会让 TD target 有偏,policy 学不准。
- ❌ stack frame 等于 RNN:50 帧 stack 能编码短历史,但长依赖(>50 步)完全丢。剧烈动作 / 长程任务必须用真 RNN。
- ❌ critic 和 actor 用同一观测空间:critic 应该用 asymmetric 特权信息(仿真里),不然 POMDP 上 value 估不准。
- ❌ $\gamma=0.99$ 当默认:locomotion 短 horizon 用 0.95 就够;长程用 0.99 + auxiliary reward;硬上 0.999 训不出来。
- ❌ 真机 RL 不区分 sim 和 real 的 $P$:仿真 $P$ 学出的 policy 默认部署时 $P^{\text{real}}=P$,但 sim-real gap 让 $P^{\text{real}}\ne P$。这正是 sim-to-real 这条线的全部动机。
- ❌ MPC 替代 RL 做 locomotion:腿足接触动力学写不出 closed form,MPC 推不动;RL 才是腿足主流。但双足平衡可以用 MPC(如 CasADi-based WBC),是 RL + control 的混合范式。
- ❌ 混淆 RL 的 $\pi(a\mid s)$ 和 IL 的 $\pi(a\mid o)$:教科书 RL 用 $s$(Markov 假设),IL 用 $o$(观测就够)。在机器人上两者都应该是 $\pi(a\mid h_t)$。
九、开放问题
- belief 编码的理论保证:$\hat{b}_t = \phi(h_t)$ 多接近 $b_t$?目前没有定量的近似误差 bound。这影响"recurrent policy 比较于 oracle policy 的差距"。
- POMDP 上的 sample efficiency lower bound:理论上 POMDP 比对应 MDP 难多少?POMDP PAC 探索方向(待核:具体引用)给出过部分答案,但机器人尺度的实证 lower bound 仍缺。
- RL + control theory 的统一框架:能否把 LQR 的稳定性、MPC 的 adaptivity、RL 的端到端学习合到一个框架?constrained RL、safe RL、differentiable MPC 都在尝试。
- 长程 credit assignment:1000 步 horizon 的任务,TD error 怎么不爆?DreamerV3 用 imagination + free bits;hindsight relabeling(HER)是另一条路;仍开放。
复盘:误区、检查点与 FAQ
常见误区
"把几帧关节角堆叠起来就解决了部分可见" —— 不完全。堆叠 50 帧只能编码短历史,长依赖(>50 步)完全丢失;剧烈动作或长程任务必须用真正的循环网络。
堆帧是穷人的历史编码,不是万能解药。
"评估价值函数时假装当前状态完全可见" —— 这是常见陷阱。状态部分不可见时,价值函数应该写在历史或信念上,否则时序差分目标会有偏。
部分可见下要写 V(历史),不是 V(状态)。
"折扣因子 0.99 是默认万能值" —— 不行。短程运动任务用 0.95 就够;长程导航才用 0.99 或更高;硬上 0.999 大概率训不出来。
折扣因子对应"策略看多远",要匹配任务的物理 horizon。
检查点
这张规则图里必须写清哪四件事?
💡 显示参考答案
- 规则图必须写清:现在什么情况、能做什么动作、做完变到哪、得多少分(状态/动作/转移/奖励四元素)。
- 类比锚:下棋看当前棋盘就够决策。
用下棋的类比解释:什么叫"未来只依赖当前,与过去无关"?
💡 显示参考答案
- 完全可见的规则图定义:未来只依赖当前状态和动作,与历史无关。
- 直觉层 类比直接说明这一点。
为什么真实机器人几乎都不满足"完全可见"的苛刻要求?举一个测不到的隐变量例子。
💡 显示参考答案
- 因为机器人只见传感器读数,不是完整情况;隐变量例子:地面摩擦、电机温度、电池 SoC/SOH。
- 入门层 明确点出这些难直接测、需估算。
既然看不到对手的手牌,机器人靠什么补上这个信息缺口?
💡 显示参考答案
- 靠记住过去几秒的历史记忆补缺。
- 短依赖堆几十帧关节角;更长依赖用带记忆的网络(循环或注意力)。
假如你给机器人堆 50 帧关节角当输入,能解决多长的历史依赖?更长的依赖怎么办?
💡 显示参考答案
- 50 帧只能编码约 50 步以内的短历史;更长依赖必须用循环或注意力网络。
- 入门层 末段给了这条关键句。
FAQ
Q1:这套形式化和控制论(LQR、MPC)是一回事吗?
数学本质相同——都是最优控制问题。LQR 假设动力学线性、cost 二次,有解析解;强化学习不假设动力学,从交互学。机器人接触动力学写不出解析式,所以强化学习才是主流。
Q2:为什么长程任务这么难?
误差会沿时间级联。每步一点偏差,千步之后轨迹完全跑偏;折扣因子接近 1 时价值函数的方差也爆炸。长程任务要靠分层、世界模型想象、或事后重标注。
Q3:机器人怎么"记住过去几秒"?
三种常见做法:循环网络(LSTM/GRU)、一维因果卷积(RMA 用 45 步卷积)、或 Transformer。数学上都是在拟合一个"信念状态"——从历史推断隐变量。
相关
- 线索:T01-sim2real-locomotion.md(POMDP 上的 RMA)、T04-motion-prior-amp-to-bfm.md(AMP 在 POMDP 上判别 $(s,s')$)、T09-world-model-as-simulator.md(DreamerV3 RSSM 就是 belief state)、T10-vla-wbc-integration.md(WBC 是 control theory)
- 论文笔记:P-RMA-2021.md(两阶段 belief 推断)、P-DreamerV3-2023.md(RSSM)、P-OmniH2O-2024.md(kinematic pose interface 在 POMDP 上当观测)
- 概念:C-sim2real-methods.md(特权和观测的边界)、C-action-representations.md(action 表示)
- 上游文献:[Åström 1965, Optimal Control of Markov Processes with Incomplete State Information, JMAA]、[Kaelbling, Littman, Cassandra 1998, Planning and Acting in Partially Observable Stochastic Domains (AIJ)、POMDP 综述]、[Sutton & Barto, Reinforcement Learning: An Introduction]