AAAI2024论文解读|Long-Term Safe Reinforcement Learning with Binary Feedback-water-merged
·
论文标题
Long-Term Safe Reinforcement Learning with Binary Feedback 基于二元反馈的长期安全强化学习
论文链接
Long-Term Safe Reinforcement Learning with Binary Feedback 论文下载
论文作者
Akifumi Wachi, Wataru Hashimoto, Kazumune Hashimoto
内容简介
本文提出了一种新的安全强化学习算法,称为长期二元反馈安全强化学习(LoBiSaRL),旨在解决具有二元安全反馈和未知随机状态转移的约束马尔可夫决策过程(CMDPs)中的安全问题。现有的安全强化学习方法通常依赖于数值安全反馈,无法保证学习过程中的安全性,且假设存在已知的安全策略。LoBiSaRL通过建模二元安全函数,确保在每个时间步长上仅执行安全的状态-动作对,同时优化策略以最大化奖励。理论分析表明,LoBiSaRL能够以高概率保证长期安全约束。实证结果显示,该算法在安全性方面优于现有方法,同时在奖励性能上没有显著下降。
分点关键点
-
LoBiSaRL算法
- LoBiSaRL是一种针对CMDPs的安全强化学习算法,能够处理二元安全反馈和未知随机状态转移。该算法通过广义线性模型(GLM)建模安全函数,并在每个时间步长上保守地选择安全动作,以确保长期安全。

- LoBiSaRL是一种针对CMDPs的安全强化学习算法,能够处理二元安全反馈和未知随机状态转移。该算法通过广义线性模型(GLM)建模安全函数,并在每个时间步长上保守地选择安全动作,以确保长期安全。
-
长期安全约束
- 本文提出的长期安全约束要求代理在当前时间步到终止时间步之间,确保执行的状态-动作对在未来的每个时间步上也保持安全。这一约束是概率性的,旨在应对随机状态转移带来的不确定性。

- 本文提出的长期安全约束要求代理在当前时间步到终止时间步之间,确保执行的状态-动作对在未来的每个时间步上也保持安全。这一约束是概率性的,旨在应对随机状态转移带来的不确定性。
-
理论与实证结果
- 理论分析表明,LoBiSaRL能够以高概率满足长期安全约束。实证结果显示,该算法在安全性方面优于现有方法,并且在奖励性能上没有显著下降,证明了其有效性。

- 理论分析表明,LoBiSaRL能够以高概率满足长期安全约束。实证结果显示,该算法在安全性方面优于现有方法,并且在奖励性能上没有显著下降,证明了其有效性。
-
应用场景
- LoBiSaRL适用于安全至关重要的决策问题,如自动驾驶、医疗保健和机器人技术等领域,能够有效防止在学习过程中出现不安全的行为。
论文代码
代码链接:https://github.com/LoBiSaRL
AAAI2024论文合集:
希望这些论文能帮到你!如果觉得有用,记得点赞关注哦~ 后续还会更新更多论文合集!!
中文关键词
- 安全强化学习
- 二元反馈
- 长期安全
- 约束马尔可夫决策过程
- 广义线性模型
- 随机状态转移
更多推荐


所有评论(0)