强化学习数学基础(3)
Policy Criterion Ⅱ
假设修改马尔可夫决策过程的奖励, 在原奖励的基础上增加一个熵奖励, 即 rt→rt+αHH[π(⋅∣st)]r^{t}\rightarrow r_{t}+\alpha_{H}H[\pi(\cdot |s_{t})]rt→rt+αHH[π(⋅∣st)]. (H[π(⋅∣s)]=−∑aπ(a∣s)lnπ(a∣s)H[\pi(\cdot|s)]=-\sum_{a}\pi(a|s)\ln \pi(a|s)H[π(⋅∣s)]=−∑aπ(a∣s)lnπ(a∣s))
显然, 更改奖励后的马尔可夫决策过程仍然构成一个马尔可夫决策过程, 设其奖励函数为 R(H)R^{(H)}R(H), 则
RH(s,a,s′)=R(s,a,s′)+αHH[π(⋅∣s)], s∈S,a∈A,s′∈S R_{H}(s,a,s')=R(s,a,s')+\alpha_{H} H[\pi(\cdot|s)], \ s\in \mathcal{S}, a\in \mathcal{A}, s'\in \mathcal{S} RH(s,a,s′)=R(s,a,s′)+αHH[π(⋅∣s)], s∈S,a∈A,s′∈S
(修改奖励后的其他概念均加注下标或上标HHH以表区分)
Soft Q
引入一个抛去首个奖励中的熵奖励的动作价值函数(柔性动作价值函数):
Qsoftπ(s,a)=Eτ∣s0=s,a0=aπ[r0+∑i=1∞γiriH]=Eτt∣st=s,at=a,π[rt+∑i=1∞γiri+tH], s∈S,a∈A Q^{\pi}_{soft}(s,a)=\mathbb{E}_{\tau_|s_0=s, a_0=a\pi}[r_0+\sum_{i=1}^{\infty}\gamma^{i} r_{i}^{H}]=\mathbb{E}_{\tau_{t}|s_t=s,a_t=a,\pi}[r_t+\sum_{i=1}^{\infty}\gamma^{i} r_{i+t}^{H}],\ s\in \mathcal{S}, a\in \mathcal{A} Qsoftπ(s,a)=Eτ∣s0=s,a0=aπ[r0+i=1∑∞γiriH]=Eτt∣st=s,at=a,π[rt+i=1∑∞γiri+tH], s∈S,a∈A
显然:
Qsoftπ(s,a)=QHπ(s,a)−αHH[π(⋅∣s)], s∈S,a∈A Q^{\pi}_{soft}(s,a)=Q_{H}^{\pi}(s,a)-\alpha_{H}H[\pi(\cdot|s)], \ s\in \mathcal{S}, a\in \mathcal{A} Qsoftπ(s,a)=QHπ(s,a)−αHH[π(⋅∣s)], s∈S,a∈A
“柔性” 译自 “soft”
此外, VHπV^{\pi}_{H}VHπ 与 QsoftπQ^{\pi}_{soft}Qsoftπ 具有这样的关系:
[1] VHπ(s)=Ea∼π(⋅∣s)Qsoftπ(s,a)+αHH[π(⋅∣s)]V^{\pi}_{H}(s) = \mathbb{E}_{a\sim \pi(\cdot|s)}Q_{soft}^{\pi}(s,a) + \alpha_{H}H[\pi(\cdot|s)]VHπ(s)=Ea∼π(⋅∣s)Qsoftπ(s,a)+αHH[π(⋅∣s)], s∈Ss\in \mathcal{S}s∈S.
证明:
VHπ(s)=Ea∼π(⋅∣s)QHπ(s,a)=Ea∼π(⋅∣s){Qsoftπ(s,a)+αHH[π(⋅∣s)]}=Ea∼π(⋅∣s)Qsoftπ(s,a)+αHH[π(⋅∣s)], s∈S \begin{align} V^{\pi}_{H}(s) &= \mathbb{E}_{a\sim \pi(\cdot|s)}Q_{H}^{\pi}(s,a)\notag\\ &= \mathbb{E}_{a\sim \pi(\cdot|s)} \{Q^{\pi}_{soft}(s,a) + \alpha_{H}H[\pi(\cdot|s)]\}\notag\\ &=\mathbb{E}_{a\sim \pi(\cdot|s)}Q_{soft}^{\pi}(s,a) + \alpha_{H}H[\pi(\cdot|s)], \ s\in \mathcal{S} \end{align} VHπ(s)=Ea∼π(⋅∣s)QHπ(s,a)=Ea∼π(⋅∣s){Qsoftπ(s,a)+αHH[π(⋅∣s)]}=Ea∼π(⋅∣s)Qsoftπ(s,a)+αHH[π(⋅∣s)], s∈S
[2] Qsoftπ(s,a)=Es′∼T(s,a)[R(s,a,s′)+γVHπ(s′)]Q^{\pi}_{soft}(s,a)=\mathbb{E}_{s'\sim T(s,a)}[R(s,a,s')+\gamma V^{\pi}_{H}(s')]Qsoftπ(s,a)=Es′∼T(s,a)[R(s,a,s′)+γVHπ(s′)], s∈Ss\in \mathcal{S}s∈S, a∈Aa\in \mathcal{A}a∈A.
证明:
Qsoftπ(s,a)=QHπ(s,a)−αHH[π(⋅∣s)] Q^{\pi}_{soft}(s,a)=Q^{\pi}_{H}(s,a)-\alpha_{H}H[\pi(\cdot|s)] Qsoftπ(s,a)=QHπ(s,a)−αHH[π(⋅∣s)]
QHπ(s,a)=Eτt∣st=s,at=a,π[rtH+γVHπ(st+1)]=Eτt∣st=s,at=a,π[rt+γVHπ(st+1)]+αHH[π(⋅∣s)] Q^{\pi}_{H}(s,a)=\mathbb{E}_{\tau_t|s_{t}=s,a_t=a,\pi}[r_t^{H}+\gamma V^{\pi}_{H}(s_{t+1})]=\mathbb{E}_{\tau_t|s_{t}=s,a_t=a,\pi}[r_t+\gamma V^{\pi}_{H}(s_{t+1})]+\alpha_{H}H[\pi(\cdot|s)] QHπ(s,a)=Eτt∣st=s,at=a,π[rtH+γVHπ(st+1)]=Eτt∣st=s,at=a,π[rt+γVHπ(st+1)]+αHH[π(⋅∣s)]
Qsoftπ(s,a)=Eτt∣st=s,at=a,π[rt+γVHπ(st+1)] Q^{\pi}_{soft}(s,a)=\mathbb{E}_{\tau_t|s_{t}=s,a_t=a,\pi}[r_t+\gamma V^{\pi}_{H}(s_{t+1})] Qsoftπ(s,a)=Eτt∣st=s,at=a,π[rt+γVHπ(st+1)]
由此可知
Qsoftπ(s,a)=Es′∼T(s,a)[R(s,a,s′)+γVHπ(s′)] Q^{\pi}_{soft}(s,a)=\mathbb{E}_{s'\sim T(s,a)}[R(s,a,s')+\gamma V^{\pi}_{H}(s')] Qsoftπ(s,a)=Es′∼T(s,a)[R(s,a,s′)+γVHπ(s′)]
定义策略的评判标准为如下. 若策略 π\piπ 和 π~\tilde{\pi}π~ 满足: Qsoftπ(s,a)≥Qsoftπ~(s,a)Q^{\pi}_{soft}(s,a)\geq Q^{\tilde{\pi}}_{soft}(s,a)Qsoftπ(s,a)≥Qsoftπ~(s,a), s∈Ss\in \mathcal{S}s∈S, a∈Aa\in \mathcal{A}a∈A, 则称 π\piπ 不差于 π~\tilde{\pi}π~, 进一步地若存在 s0∈Ss_0\in \mathcal{S}s0∈S, a0∈Aa_0\in \mathcal{A}a0∈A, 使得 Qsoftπ(s0,a0)>Qsoftπ~(s0,a0)Q^{\pi}_{soft}(s_0,a_0)> Q^{\tilde{\pi}}_{soft}(s_0,a_0)Qsoftπ(s0,a0)>Qsoftπ~(s0,a0), 则称 π\piπ 优于 π~\tilde{\pi}π~.
Soft V
定义柔性状态价值函数: Vsoftπ(s)=αHln∑aexp{1αHQsoftπ(s,a)}V^{\pi}_{soft}(s)=\alpha_{H}\ln \sum_{a}\exp\{\frac{1}{\alpha_{H}}Q^{\pi}_{soft}(s,a)\}Vsoftπ(s)=αHln∑aexp{αH1Qsoftπ(s,a)}, s∈Ss\in \mathcal{S}s∈S.
引入记号 logsumexp\mathop{\mathrm{logsumexp}}logsumexp, logsumexpx∈X(f(x))\mathop{\mathrm{logsumexp}}\limits_{x\in \mathcal{X}}(f(x))x∈Xlogsumexp(f(x)): logsumexpx∈X(x)=ln∑x∈Xexp{f(x)}\mathop{\mathrm{logsumexp}}\limits_{x\in \mathcal{X}}(x)= \ln \sum_{x\in \mathcal{X}}\exp\{f(x)\}x∈Xlogsumexp(x)=ln∑x∈Xexp{f(x)}.
则 Vsoftπ(s)=αHlogsumexpa∈A(1αHQsoftπ(s,a))V^{\pi}_{soft}(s)=\alpha_{H} \mathop{\mathrm{logsumexp}}\limits_{a\in \mathcal{A}}(\frac{1}{\alpha_{H}}Q_{soft}^{\pi}(s,a))Vsoftπ(s)=αHa∈Alogsumexp(αH1Qsoftπ(s,a)).
定义柔性优势函数: Asoftπ(s,a)=Qsoftπ(s,a)−Vsoftπ(s)A^{\pi}_{soft}(s,a)=Q_{soft}^{\pi}(s,a)-V_{soft}^{\pi}(s)Asoftπ(s,a)=Qsoftπ(s,a)−Vsoftπ(s).
Policy Improvement Theorem
定理. 如果一个策略 π~\tilde{\pi}π~ 满足:
VHπ(s)=αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Qsoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Qsoftπ(s,a)], s∈S V_{H}^{\pi}(s) = \alpha_{H} H[\pi(\cdot|s)]+\mathbb{E}_{a\sim \pi(\cdot|s)}[Q^{\pi}_{soft}(s,a)] \leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[Q_{soft}^{\pi}(s,a)], \ s\in \mathcal{S} VHπ(s)=αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Qsoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Qsoftπ(s,a)], s∈S
则这个策略比当前的策略更好.
证明: 这个条件等价于:
VHπ(s)≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)Es′∼T(s,a)[R(s,a,s′)+γVπ(s′)] V^{\pi}_{H}(s)\leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}\mathbb{E}_{s'\sim T(s,a)}[R(s,a,s')+\gamma V^{\pi}(s')] VHπ(s)≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)Es′∼T(s,a)[R(s,a,s′)+γVπ(s′)]
其中 RHS=Eat,st+1∣st=s,π~[αHH[π~(⋅∣st)]+rt+γVHπ(st+1)]=Eat,st+1∣st=s,π~[rtH+γVπ(st+1)]RHS=\mathbb{E}_{a_t,s_{t+1}|s_t=s, \tilde{\pi}} [\alpha_{H} H[\tilde{\pi}(\cdot |s_t)]+r_{t}+\gamma V^{\pi}_{H}(s_{t+1})]=\mathbb{E}_{a_t,s_{t+1}|s_t=s,\tilde{\pi}}[r_{t}^{H}+\gamma V^{\pi}(s_{t+1})]RHS=Eat,st+1∣st=s,π~[αHH[π~(⋅∣st)]+rt+γVHπ(st+1)]=Eat,st+1∣st=s,π~[rtH+γVπ(st+1)], (RHS: Right-Hand-Side, 表示右侧的式子; LHS: Left-Hand-Side, 表示左侧的式子)
VHπ(st)∣st=s≤Eat,st+1∣st=s,π~[αHH[π~(⋅∣st)]+rt+γVHπ(st+1)]=Eat,st+1∣st=s,π~[rtH+γVπ(st+1)] V^{\pi}_{H}(s_{t})|_{s_t=s}\leq \mathbb{E}_{a_t,s_{t+1}|s_t=s, \tilde{\pi}} [\alpha_{H} H[\tilde{\pi}(\cdot |s_t)]+r_{t}+\gamma V^{\pi}_{H}(s_{t+1})]=\mathbb{E}_{a_t,s_{t+1}|s_t=s,\tilde{\pi}}[r_{t}^{H}+\gamma V^{\pi}(s_{t+1})] VHπ(st)∣st=s≤Eat,st+1∣st=s,π~[αHH[π~(⋅∣st)]+rt+γVHπ(st+1)]=Eat,st+1∣st=s,π~[rtH+γVπ(st+1)]
Eτ∣s0=s,π~VHπ(st)=Est∣s0=s,π~VHπ(st)≤Est∣s0=s,π~Eat,st+1∣st,π~[rtH+γVHπ(st+1)]=Eτ∣s0=s,π~[rtH+γVHπ(st+1)] \mathbb{E}_{\tau|s_0=s,\tilde{\pi}}V_{H}^{\pi}(s_{t})=\mathbb{E}_{s_t|s_0=s, \tilde{\pi}}V_{H}^{\pi}(s_t) \leq \mathbb{E}_{s_t|s_0=s, \tilde{\pi}}\mathbb{E}_{a_t,s_{t+1}|s_t, \tilde{\pi}}[r_{t}^{H}+\gamma V_{H}^{\pi}(s_{t+1})]=\mathbb{E}_{\tau|s_0=s,\tilde{\pi}}[r_{t}^{H}+\gamma V_{H}^{\pi}(s_{t+1})] Eτ∣s0=s,π~VHπ(st)=Est∣s0=s,π~VHπ(st)≤Est∣s0=s,π~Eat,st+1∣st,π~[rtH+γVHπ(st+1)]=Eτ∣s0=s,π~[rtH+γVHπ(st+1)]
Qsoftπ(s,a)=Eτ∣s0=s,a0=a,π[r0+γVHπ(s1)] Q^{\pi}_{soft}(s,a)=\mathbb{E}_{\tau|s_0=s,a_0=a,\pi}[r_{0}+\gamma V^{\pi}_{H}(s_1)] Qsoftπ(s,a)=Eτ∣s0=s,a0=a,π[r0+γVHπ(s1)]
r0r_0r0与VHπ(st+1)V^{\pi}_{H}(s_{t+1})VHπ(st+1)都与π\piπ无关, 因此
Eτ∣s0=s,a0=a,π[r0+γVHπ(s1)]=Eτ∣s0=s,a0=a,π~[r0+γVHπ(s1)] \mathbb{E}_{\tau|s_0=s,a_0=a,\pi}[r_{0}+\gamma V^{\pi}_{H}(s_1)]=\mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_{0}+\gamma V^{\pi}_{H}(s_1)] Eτ∣s0=s,a0=a,π[r0+γVHπ(s1)]=Eτ∣s0=s,a0=a,π~[r0+γVHπ(s1)]
Eτ∣s0=s,a0=a,π~[r0+γVHπ(s1)]≤Eτ∣s0=s,a0=a,π~[r0+γr1H+γ2VHπ(s2)]≤Eτ∣s0=s,a0=a,π~[r0+γr1H+γ2r2H+γ3VHπ(s3)]≤... \begin{align} \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_{0}+\gamma V^{\pi}_{H}(s_1)]&\leq \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_0+\gamma r_1^{H}+\gamma^2 V^{\pi}_{H}(s_2)]\notag\\ &\leq \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_0+ \gamma r_{1}^{H}+\gamma^2 r_{2}^{H}+\gamma^{3} V^{\pi}_{H}(s_3)]\notag\\ &\leq... \end{align} Eτ∣s0=s,a0=a,π~[r0+γVHπ(s1)]≤Eτ∣s0=s,a0=a,π~[r0+γr1H+γ2VHπ(s2)]≤Eτ∣s0=s,a0=a,π~[r0+γr1H+γ2r2H+γ3VHπ(s3)]≤...
进而
Qsoftπ(s,a)≤Eτ∣s0=s,a0=a,π~[r0+∑i=1∞γiriH]=Qsoftπ~(s,a) Q^{\pi}_{soft}(s,a)\leq \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_0+\sum_{i=1}^{\infty}\gamma^{i}r_{i}^{H}]=Q_{soft}^{\tilde{\pi}}(s,a) Qsoftπ(s,a)≤Eτ∣s0=s,a0=a,π~[r0+i=1∑∞γiriH]=Qsoftπ~(s,a)
注: 这个条件等价于
DKL(π~(⋅∣s)∣∣Qsoftπ(s,a))≥DKL(π(⋅∣s)∣∣Qsoftπ(s,a)) D_{KL}\big(\tilde{\pi}(\cdot|s)||Q_{soft}^{\pi}(s,a)\big)\geq D_{KL}\big(\pi(\cdot|s)||Q_{soft}^{\pi}(s,a)\big) DKL(π~(⋅∣s)∣∣Qsoftπ(s,a))≥DKL(π(⋅∣s)∣∣Qsoftπ(s,a))
证明略.
定理. 策略 π~\tilde{\pi}π~: π~(a∣s)=exp{1αHAsoftπ(s,a)}\tilde{\pi}(a|s)=\exp\{\frac{1}{\alpha_{H}}A^{\pi}_{soft}(s,a)\}π~(a∣s)=exp{αH1Asoftπ(s,a)}, s∈Ss\in \mathcal{S}s∈S, a∈Aa\in \mathcal{A}a∈A 是一个不差于当前策略的策略.
证明: 只需证明: αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Qsoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Qsoftπ(s,a)], s∈S\alpha_{H} H[\pi(\cdot|s)]+\mathbb{E}_{a\sim \pi(\cdot|s)}[Q^{\pi}_{soft}(s,a)] \leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[Q_{soft}^{\pi}(s,a)], \ s\in \mathcal{S}αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Qsoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Qsoftπ(s,a)], s∈S.
两边同减 Vsoftπ(s)V^{\pi}_{soft}(s)Vsoftπ(s), 得:
αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Asoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Asoftπ(s,a)] \alpha_{H} H[\pi(\cdot|s)]+\mathbb{E}_{a\sim \pi(\cdot|s)}[A^{\pi}_{soft}(s,a)] \leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[A_{soft}^{\pi}(s,a)] αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Asoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Asoftπ(s,a)]
RHS=Ea∼π~(⋅∣s)[−αHlnπ~(⋅∣s)+Asoftπ(s,a)]=Ea∼π~(⋅∣s)[−αHlnπ~(⋅∣s)+αHlnπ~(a∣s)]=0 RHS=\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[-\alpha_{H} \ln\tilde{\pi}(\cdot |s)+A_{soft}^{\pi}(s,a)]=\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[-\alpha_{H} \ln\tilde{\pi}(\cdot |s)+\alpha_{H}\ln\tilde{\pi}(a|s)]=0 RHS=Ea∼π~(⋅∣s)[−αHlnπ~(⋅∣s)+Asoftπ(s,a)]=Ea∼π~(⋅∣s)[−αHlnπ~(⋅∣s)+αHlnπ~(a∣s)]=0
LHS=Ea∼π~(⋅∣s)[−αHlnπ(⋅∣s)+αHlnπ~(a∣s)]=αHEa∼π~(⋅∣s)[lnπ~(a∣s)π(a∣s)]=αHDKL(π~(a∣s)∣∣π(a∣s))≥0 LHS=\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[-\alpha_{H} \ln\pi(\cdot |s)+\alpha_{H}\ln\tilde{\pi}(a|s)]=\alpha_{H}\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[\ln\frac{\tilde{\pi}(a|s)}{\pi(a|s)}]=\alpha_{H}D_{KL}\big(\tilde{\pi}(a|s)||\pi(a|s)\big)\geq 0 LHS=Ea∼π~(⋅∣s)[−αHlnπ(⋅∣s)+αHlnπ~(a∣s)]=αHEa∼π~(⋅∣s)[lnπ(a∣s)π~(a∣s)]=αHDKL(π~(a∣s)∣∣π(a∣s))≥0
证毕.
更多推荐



所有评论(0)