欢迎光临
我们一直在努力

2025_NIPS_Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function A

一、文章核心总结

主要内容

本文聚焦线性约束马尔可夫决策过程(线性CMDP)中的安全强化学习问题,目标是在每一轮episode中满足期望总效用约束的前提下,最大化智能体的累积奖励。针对现有算法要么存在约束违反、要么计算成本指数级增长的缺陷,提出了OPSE-LCMDP算法,实现了次线性遗憾(O~(K)\\tilde{O}(\\sqrt{K})O

赞(0)
未经允许不得转载:171主机测评 » 2025_NIPS_Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function A
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址