Policy Criterion Ⅱ

假设修改马尔可夫决策过程的奖励, 在原奖励的基础上增加一个熵奖励, 即 rt→rt+αHH[π(⋅∣st)]r^{t}\rightarrow r_{t}+\alpha_{H}H[\pi(\cdot |s_{t})]rt→rt​+αH​H[π(⋅∣st​)]. (H[π(⋅∣s)]=−∑aπ(a∣s)ln⁡π(a∣s)H[\pi(\cdot|s)]=-\sum_{a}\pi(a|s)\ln \pi(a|s)H[π(⋅∣s)]=−∑a​π(a∣s)lnπ(a∣s))

显然, 更改奖励后的马尔可夫决策过程仍然构成一个马尔可夫决策过程, 设其奖励函数为 R(H)R^{(H)}R(H), 则
RH(s,a,s′)=R(s,a,s′)+αHH[π(⋅∣s)], s∈S,a∈A,s′∈S R_{H}(s,a,s')=R(s,a,s')+\alpha_{H} H[\pi(\cdot|s)], \ s\in \mathcal{S}, a\in \mathcal{A}, s'\in \mathcal{S} RH​(s,a,s′)=R(s,a,s′)+αH​H[π(⋅∣s)], s∈S,a∈A,s′∈S

(修改奖励后的其他概念均加注下标或上标HHH以表区分)

Soft Q

引入一个抛去首个奖励中的熵奖励的动作价值函数(柔性动作价值函数):
Qsoftπ(s,a)=Eτ∣s0=s,a0=aπ[r0+∑i=1∞γiriH]=Eτt∣st=s,at=a,π[rt+∑i=1∞γiri+tH], s∈S,a∈A Q^{\pi}_{soft}(s,a)=\mathbb{E}_{\tau_|s_0=s, a_0=a\pi}[r_0+\sum_{i=1}^{\infty}\gamma^{i} r_{i}^{H}]=\mathbb{E}_{\tau_{t}|s_t=s,a_t=a,\pi}[r_t+\sum_{i=1}^{\infty}\gamma^{i} r_{i+t}^{H}],\ s\in \mathcal{S}, a\in \mathcal{A} Qsoftπ​(s,a)=Eτ∣​s0​=s,a0​=aπ​[r0​+i=1∑∞​γiriH​]=Eτt​∣st​=s,at​=a,π​[rt​+i=1∑∞​γiri+tH​], s∈S,a∈A
显然:
Qsoftπ(s,a)=QHπ(s,a)−αHH[π(⋅∣s)], s∈S,a∈A Q^{\pi}_{soft}(s,a)=Q_{H}^{\pi}(s,a)-\alpha_{H}H[\pi(\cdot|s)], \ s\in \mathcal{S}, a\in \mathcal{A} Qsoftπ​(s,a)=QHπ​(s,a)−αH​H[π(⋅∣s)], s∈S,a∈A

“柔性” 译自 “soft”

此外, VHπV^{\pi}_{H}VHπ​ 与 QsoftπQ^{\pi}_{soft}Qsoftπ​ 具有这样的关系:

[1] VHπ(s)=Ea∼π(⋅∣s)Qsoftπ(s,a)+αHH[π(⋅∣s)]V^{\pi}_{H}(s) = \mathbb{E}_{a\sim \pi(\cdot|s)}Q_{soft}^{\pi}(s,a) + \alpha_{H}H[\pi(\cdot|s)]VHπ​(s)=Ea∼π(⋅∣s)​Qsoftπ​(s,a)+αH​H[π(⋅∣s)], s∈Ss\in \mathcal{S}s∈S.

证明:
VHπ(s)=Ea∼π(⋅∣s)QHπ(s,a)=Ea∼π(⋅∣s){Qsoftπ(s,a)+αHH[π(⋅∣s)]}=Ea∼π(⋅∣s)Qsoftπ(s,a)+αHH[π(⋅∣s)], s∈S \begin{align} V^{\pi}_{H}(s) &= \mathbb{E}_{a\sim \pi(\cdot|s)}Q_{H}^{\pi}(s,a)\notag\\ &= \mathbb{E}_{a\sim \pi(\cdot|s)} \{Q^{\pi}_{soft}(s,a) + \alpha_{H}H[\pi(\cdot|s)]\}\notag\\ &=\mathbb{E}_{a\sim \pi(\cdot|s)}Q_{soft}^{\pi}(s,a) + \alpha_{H}H[\pi(\cdot|s)], \ s\in \mathcal{S} \end{align} VHπ​(s)​=Ea∼π(⋅∣s)​QHπ​(s,a)=Ea∼π(⋅∣s)​{Qsoftπ​(s,a)+αH​H[π(⋅∣s)]}=Ea∼π(⋅∣s)​Qsoftπ​(s,a)+αH​H[π(⋅∣s)], s∈S​​
[2] Qsoftπ(s,a)=Es′∼T(s,a)[R(s,a,s′)+γVHπ(s′)]Q^{\pi}_{soft}(s,a)=\mathbb{E}_{s'\sim T(s,a)}[R(s,a,s')+\gamma V^{\pi}_{H}(s')]Qsoftπ​(s,a)=Es′∼T(s,a)​[R(s,a,s′)+γVHπ​(s′)], s∈Ss\in \mathcal{S}s∈S, a∈Aa\in \mathcal{A}a∈A.

证明:
Qsoftπ(s,a)=QHπ(s,a)−αHH[π(⋅∣s)] Q^{\pi}_{soft}(s,a)=Q^{\pi}_{H}(s,a)-\alpha_{H}H[\pi(\cdot|s)] Qsoftπ​(s,a)=QHπ​(s,a)−αH​H[π(⋅∣s)]

QHπ(s,a)=Eτt∣st=s,at=a,π[rtH+γVHπ(st+1)]=Eτt∣st=s,at=a,π[rt+γVHπ(st+1)]+αHH[π(⋅∣s)] Q^{\pi}_{H}(s,a)=\mathbb{E}_{\tau_t|s_{t}=s,a_t=a,\pi}[r_t^{H}+\gamma V^{\pi}_{H}(s_{t+1})]=\mathbb{E}_{\tau_t|s_{t}=s,a_t=a,\pi}[r_t+\gamma V^{\pi}_{H}(s_{t+1})]+\alpha_{H}H[\pi(\cdot|s)] QHπ​(s,a)=Eτt​∣st​=s,at​=a,π​[rtH​+γVHπ​(st+1​)]=Eτt​∣st​=s,at​=a,π​[rt​+γVHπ​(st+1​)]+αH​H[π(⋅∣s)]

Qsoftπ(s,a)=Eτt∣st=s,at=a,π[rt+γVHπ(st+1)] Q^{\pi}_{soft}(s,a)=\mathbb{E}_{\tau_t|s_{t}=s,a_t=a,\pi}[r_t+\gamma V^{\pi}_{H}(s_{t+1})] Qsoftπ​(s,a)=Eτt​∣st​=s,at​=a,π​[rt​+γVHπ​(st+1​)]

由此可知
Qsoftπ(s,a)=Es′∼T(s,a)[R(s,a,s′)+γVHπ(s′)] Q^{\pi}_{soft}(s,a)=\mathbb{E}_{s'\sim T(s,a)}[R(s,a,s')+\gamma V^{\pi}_{H}(s')] Qsoftπ​(s,a)=Es′∼T(s,a)​[R(s,a,s′)+γVHπ​(s′)]
定义策略的评判标准为如下. 若策略 π\piπ 和 π~\tilde{\pi}π~ 满足: Qsoftπ(s,a)≥Qsoftπ~(s,a)Q^{\pi}_{soft}(s,a)\geq Q^{\tilde{\pi}}_{soft}(s,a)Qsoftπ​(s,a)≥Qsoftπ~​(s,a), s∈Ss\in \mathcal{S}s∈S, a∈Aa\in \mathcal{A}a∈A, 则称 π\piπ 不差于 π~\tilde{\pi}π~, 进一步地若存在 s0∈Ss_0\in \mathcal{S}s0​∈S, a0∈Aa_0\in \mathcal{A}a0​∈A, 使得 Qsoftπ(s0,a0)>Qsoftπ~(s0,a0)Q^{\pi}_{soft}(s_0,a_0)> Q^{\tilde{\pi}}_{soft}(s_0,a_0)Qsoftπ​(s0​,a0​)>Qsoftπ~​(s0​,a0​), 则称 π\piπ 优于 π~\tilde{\pi}π~.

Soft V

定义柔性状态价值函数: Vsoftπ(s)=αHln⁡∑aexp⁡{1αHQsoftπ(s,a)}V^{\pi}_{soft}(s)=\alpha_{H}\ln \sum_{a}\exp\{\frac{1}{\alpha_{H}}Q^{\pi}_{soft}(s,a)\}Vsoftπ​(s)=αH​ln∑a​exp{αH​1​Qsoftπ​(s,a)}, s∈Ss\in \mathcal{S}s∈S.

引入记号 logsumexp\mathop{\mathrm{logsumexp}}logsumexp, logsumexpx∈X(f(x))\mathop{\mathrm{logsumexp}}\limits_{x\in \mathcal{X}}(f(x))x∈Xlogsumexp​(f(x)): logsumexpx∈X(x)=ln⁡∑x∈Xexp⁡{f(x)}\mathop{\mathrm{logsumexp}}\limits_{x\in \mathcal{X}}(x)= \ln \sum_{x\in \mathcal{X}}\exp\{f(x)\}x∈Xlogsumexp​(x)=ln∑x∈X​exp{f(x)}.

则 Vsoftπ(s)=αHlogsumexpa∈A(1αHQsoftπ(s,a))V^{\pi}_{soft}(s)=\alpha_{H} \mathop{\mathrm{logsumexp}}\limits_{a\in \mathcal{A}}(\frac{1}{\alpha_{H}}Q_{soft}^{\pi}(s,a))Vsoftπ​(s)=αH​a∈Alogsumexp​(αH​1​Qsoftπ​(s,a)).

定义柔性优势函数: Asoftπ(s,a)=Qsoftπ(s,a)−Vsoftπ(s)A^{\pi}_{soft}(s,a)=Q_{soft}^{\pi}(s,a)-V_{soft}^{\pi}(s)Asoftπ​(s,a)=Qsoftπ​(s,a)−Vsoftπ​(s).

Policy Improvement Theorem

定理. 如果一个策略 π~\tilde{\pi}π~ 满足:
VHπ(s)=αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Qsoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Qsoftπ(s,a)], s∈S V_{H}^{\pi}(s) = \alpha_{H} H[\pi(\cdot|s)]+\mathbb{E}_{a\sim \pi(\cdot|s)}[Q^{\pi}_{soft}(s,a)] \leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[Q_{soft}^{\pi}(s,a)], \ s\in \mathcal{S} VHπ​(s)=αH​H[π(⋅∣s)]+Ea∼π(⋅∣s)​[Qsoftπ​(s,a)]≤αH​H[π~(⋅∣s)]+Ea∼π~(⋅∣s)​[Qsoftπ​(s,a)], s∈S
则这个策略比当前的策略更好.

证明: 这个条件等价于:
VHπ(s)≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)Es′∼T(s,a)[R(s,a,s′)+γVπ(s′)] V^{\pi}_{H}(s)\leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}\mathbb{E}_{s'\sim T(s,a)}[R(s,a,s')+\gamma V^{\pi}(s')] VHπ​(s)≤αH​H[π~(⋅∣s)]+Ea∼π~(⋅∣s)​Es′∼T(s,a)​[R(s,a,s′)+γVπ(s′)]
其中 RHS=Eat,st+1∣st=s,π~[αHH[π~(⋅∣st)]+rt+γVHπ(st+1)]=Eat,st+1∣st=s,π~[rtH+γVπ(st+1)]RHS=\mathbb{E}_{a_t,s_{t+1}|s_t=s, \tilde{\pi}} [\alpha_{H} H[\tilde{\pi}(\cdot |s_t)]+r_{t}+\gamma V^{\pi}_{H}(s_{t+1})]=\mathbb{E}_{a_t,s_{t+1}|s_t=s,\tilde{\pi}}[r_{t}^{H}+\gamma V^{\pi}(s_{t+1})]RHS=Eat​,st+1​∣st​=s,π~​[αH​H[π~(⋅∣st​)]+rt​+γVHπ​(st+1​)]=Eat​,st+1​∣st​=s,π~​[rtH​+γVπ(st+1​)], (RHS: Right-Hand-Side, 表示右侧的式子; LHS: Left-Hand-Side, 表示左侧的式子)
VHπ(st)∣st=s≤Eat,st+1∣st=s,π~[αHH[π~(⋅∣st)]+rt+γVHπ(st+1)]=Eat,st+1∣st=s,π~[rtH+γVπ(st+1)] V^{\pi}_{H}(s_{t})|_{s_t=s}\leq \mathbb{E}_{a_t,s_{t+1}|s_t=s, \tilde{\pi}} [\alpha_{H} H[\tilde{\pi}(\cdot |s_t)]+r_{t}+\gamma V^{\pi}_{H}(s_{t+1})]=\mathbb{E}_{a_t,s_{t+1}|s_t=s,\tilde{\pi}}[r_{t}^{H}+\gamma V^{\pi}(s_{t+1})] VHπ​(st​)∣st​=s​≤Eat​,st+1​∣st​=s,π~​[αH​H[π~(⋅∣st​)]+rt​+γVHπ​(st+1​)]=Eat​,st+1​∣st​=s,π~​[rtH​+γVπ(st+1​)]

Eτ∣s0=s,π~VHπ(st)=Est∣s0=s,π~VHπ(st)≤Est∣s0=s,π~Eat,st+1∣st,π~[rtH+γVHπ(st+1)]=Eτ∣s0=s,π~[rtH+γVHπ(st+1)] \mathbb{E}_{\tau|s_0=s,\tilde{\pi}}V_{H}^{\pi}(s_{t})=\mathbb{E}_{s_t|s_0=s, \tilde{\pi}}V_{H}^{\pi}(s_t) \leq \mathbb{E}_{s_t|s_0=s, \tilde{\pi}}\mathbb{E}_{a_t,s_{t+1}|s_t, \tilde{\pi}}[r_{t}^{H}+\gamma V_{H}^{\pi}(s_{t+1})]=\mathbb{E}_{\tau|s_0=s,\tilde{\pi}}[r_{t}^{H}+\gamma V_{H}^{\pi}(s_{t+1})] Eτ∣s0​=s,π~​VHπ​(st​)=Est​∣s0​=s,π~​VHπ​(st​)≤Est​∣s0​=s,π~​Eat​,st+1​∣st​,π~​[rtH​+γVHπ​(st+1​)]=Eτ∣s0​=s,π~​[rtH​+γVHπ​(st+1​)]

Qsoftπ(s,a)=Eτ∣s0=s,a0=a,π[r0+γVHπ(s1)] Q^{\pi}_{soft}(s,a)=\mathbb{E}_{\tau|s_0=s,a_0=a,\pi}[r_{0}+\gamma V^{\pi}_{H}(s_1)] Qsoftπ​(s,a)=Eτ∣s0​=s,a0​=a,π​[r0​+γVHπ​(s1​)]

r0r_0r0​与VHπ(st+1)V^{\pi}_{H}(s_{t+1})VHπ​(st+1​)都与π\piπ无关, 因此
Eτ∣s0=s,a0=a,π[r0+γVHπ(s1)]=Eτ∣s0=s,a0=a,π~[r0+γVHπ(s1)] \mathbb{E}_{\tau|s_0=s,a_0=a,\pi}[r_{0}+\gamma V^{\pi}_{H}(s_1)]=\mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_{0}+\gamma V^{\pi}_{H}(s_1)] Eτ∣s0​=s,a0​=a,π​[r0​+γVHπ​(s1​)]=Eτ∣s0​=s,a0​=a,π~​[r0​+γVHπ​(s1​)]

Eτ∣s0=s,a0=a,π~[r0+γVHπ(s1)]≤Eτ∣s0=s,a0=a,π~[r0+γr1H+γ2VHπ(s2)]≤Eτ∣s0=s,a0=a,π~[r0+γr1H+γ2r2H+γ3VHπ(s3)]≤... \begin{align} \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_{0}+\gamma V^{\pi}_{H}(s_1)]&\leq \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_0+\gamma r_1^{H}+\gamma^2 V^{\pi}_{H}(s_2)]\notag\\ &\leq \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_0+ \gamma r_{1}^{H}+\gamma^2 r_{2}^{H}+\gamma^{3} V^{\pi}_{H}(s_3)]\notag\\ &\leq... \end{align} Eτ∣s0​=s,a0​=a,π~​[r0​+γVHπ​(s1​)]​≤Eτ∣s0​=s,a0​=a,π~​[r0​+γr1H​+γ2VHπ​(s2​)]≤Eτ∣s0​=s,a0​=a,π~​[r0​+γr1H​+γ2r2H​+γ3VHπ​(s3​)]≤...​​

进而
Qsoftπ(s,a)≤Eτ∣s0=s,a0=a,π~[r0+∑i=1∞γiriH]=Qsoftπ~(s,a) Q^{\pi}_{soft}(s,a)\leq \mathbb{E}_{\tau|s_0=s,a_0=a,\tilde{\pi}}[r_0+\sum_{i=1}^{\infty}\gamma^{i}r_{i}^{H}]=Q_{soft}^{\tilde{\pi}}(s,a) Qsoftπ​(s,a)≤Eτ∣s0​=s,a0​=a,π~​[r0​+i=1∑∞​γiriH​]=Qsoftπ~​(s,a)
注: 这个条件等价于
DKL(π~(⋅∣s)∣∣Qsoftπ(s,a))≥DKL(π(⋅∣s)∣∣Qsoftπ(s,a)) D_{KL}\big(\tilde{\pi}(\cdot|s)||Q_{soft}^{\pi}(s,a)\big)\geq D_{KL}\big(\pi(\cdot|s)||Q_{soft}^{\pi}(s,a)\big) DKL​(π~(⋅∣s)∣∣Qsoftπ​(s,a))≥DKL​(π(⋅∣s)∣∣Qsoftπ​(s,a))

证明略.

定理. 策略 π~\tilde{\pi}π~: π~(a∣s)=exp⁡{1αHAsoftπ(s,a)}\tilde{\pi}(a|s)=\exp\{\frac{1}{\alpha_{H}}A^{\pi}_{soft}(s,a)\}π~(a∣s)=exp{αH​1​Asoftπ​(s,a)}, s∈Ss\in \mathcal{S}s∈S, a∈Aa\in \mathcal{A}a∈A 是一个不差于当前策略的策略.

证明: 只需证明: αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Qsoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Qsoftπ(s,a)], s∈S\alpha_{H} H[\pi(\cdot|s)]+\mathbb{E}_{a\sim \pi(\cdot|s)}[Q^{\pi}_{soft}(s,a)] \leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[Q_{soft}^{\pi}(s,a)], \ s\in \mathcal{S}αH​H[π(⋅∣s)]+Ea∼π(⋅∣s)​[Qsoftπ​(s,a)]≤αH​H[π~(⋅∣s)]+Ea∼π~(⋅∣s)​[Qsoftπ​(s,a)], s∈S.

两边同减 Vsoftπ(s)V^{\pi}_{soft}(s)Vsoftπ​(s), 得:
αHH[π(⋅∣s)]+Ea∼π(⋅∣s)[Asoftπ(s,a)]≤αHH[π~(⋅∣s)]+Ea∼π~(⋅∣s)[Asoftπ(s,a)] \alpha_{H} H[\pi(\cdot|s)]+\mathbb{E}_{a\sim \pi(\cdot|s)}[A^{\pi}_{soft}(s,a)] \leq \alpha_{H} H[\tilde{\pi}(\cdot |s)]+\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[A_{soft}^{\pi}(s,a)] αH​H[π(⋅∣s)]+Ea∼π(⋅∣s)​[Asoftπ​(s,a)]≤αH​H[π~(⋅∣s)]+Ea∼π~(⋅∣s)​[Asoftπ​(s,a)]

RHS=Ea∼π~(⋅∣s)[−αHln⁡π~(⋅∣s)+Asoftπ(s,a)]=Ea∼π~(⋅∣s)[−αHln⁡π~(⋅∣s)+αHln⁡π~(a∣s)]=0 RHS=\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[-\alpha_{H} \ln\tilde{\pi}(\cdot |s)+A_{soft}^{\pi}(s,a)]=\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[-\alpha_{H} \ln\tilde{\pi}(\cdot |s)+\alpha_{H}\ln\tilde{\pi}(a|s)]=0 RHS=Ea∼π~(⋅∣s)​[−αH​lnπ~(⋅∣s)+Asoftπ​(s,a)]=Ea∼π~(⋅∣s)​[−αH​lnπ~(⋅∣s)+αH​lnπ~(a∣s)]=0

LHS=Ea∼π~(⋅∣s)[−αHln⁡π(⋅∣s)+αHln⁡π~(a∣s)]=αHEa∼π~(⋅∣s)[ln⁡π~(a∣s)π(a∣s)]=αHDKL(π~(a∣s)∣∣π(a∣s))≥0 LHS=\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[-\alpha_{H} \ln\pi(\cdot |s)+\alpha_{H}\ln\tilde{\pi}(a|s)]=\alpha_{H}\mathbb{E}_{a\sim \tilde{\pi}(\cdot|s)}[\ln\frac{\tilde{\pi}(a|s)}{\pi(a|s)}]=\alpha_{H}D_{KL}\big(\tilde{\pi}(a|s)||\pi(a|s)\big)\geq 0 LHS=Ea∼π~(⋅∣s)​[−αH​lnπ(⋅∣s)+αH​lnπ~(a∣s)]=αH​Ea∼π~(⋅∣s)​[lnπ(a∣s)π~(a∣s)​]=αH​DKL​(π~(a∣s)∣∣π(a∣s))≥0

证毕.

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐