强化学习的数学原理(二):贝尔曼公式(笔记整理版)
贝尔曼方程笔记整理
一、基本过程与定义
1. 单步过程 (A single step process) $$S_t \xrightarrow{A_t} R_{t+1}, S_{t+1}$$
- $t, t+1$: 离散时间步 (discrete time instances)。
- $S_t$: 状态
- $A_t$: 动作
- $R_{t+1}$: 奖励
- $S_{t+1}$: 下一状态
此过程由以下概率分布所决定:
- $S_t \to A_t$ 由策略决定: $\pi(A_t=a | S_t=s)$
- $S_t, A_t \to R_{t+1}$ 由环境动态决定: $p(R_{t+1}=r | S_t=s, A_t=a)$
- $S_t, A_t \to S_{t+1}$ 由环境动态决定: $p(S_{t+1}=s’ | S_t=s, A_t=a)$
2. 多步轨迹 (Multi-step trajectory) $$S_t \xrightarrow{A_t} R_{t+1}, S_{t+1} \xrightarrow{A_{t+1}} R_{t+2}, S_{t+2} \xrightarrow{A_{t+2}} \dots$$
