一、文章核心总结
主要内容
本文聚焦线性约束马尔可夫决策过程(线性CMDP)中的安全强化学习问题,目标是在每一轮episode中满足期望总效用约束的前提下,最大化智能体的累积奖励。针对现有算法要么存在约束违反、要么计算成本指数级增长的缺陷,提出了OPSE-LCMDP算法,实现了次线性遗憾(O~(K)\\tilde{O}(\\sqrt{K})O
本文聚焦线性约束马尔可夫决策过程(线性CMDP)中的安全强化学习问题,目标是在每一轮episode中满足期望总效用约束的前提下,最大化智能体的累积奖励。针对现有算法要么存在约束违反、要么计算成本指数级增长的缺陷,提出了OPSE-LCMDP算法,实现了次线性遗憾(O~(K)\\tilde{O}(\\sqrt{K})O