欢迎光临
我们一直在努力

2025_NIPS_Performance Bounds for Policy-Based Average Reward Reinforcement Learning Algorithms

文章总结与翻译

一、主要内容

本文聚焦平均奖励马尔可夫决策过程(MDPs)中基于策略的强化学习(RL)算法,核心解决了长期以来平均奖励场景下近似策略迭代(PI)缺乏有意义性能边界的问题。

  • 背景与问题:现有基于折扣奖励的MDPs理论中,当折扣因子趋近于1(等价于 horizon 极大化)时,性能边界会随 horizon 平方增长,导致平均奖励问题的边界趋于无穷,无法反映实际算法性能,且平均奖励MDPs因缺乏贝尔曼算子的无穷范数收缩特性,分析难度高于折扣奖励场景。
  • 核心假设:假设每个平稳策略均诱导不可约马尔可夫链,且转移矩阵对角元素为正(通过Schweitzer变换等方法可使多数MDPs满足该假设)。
  • 主要成果:
    • 通过Schweitzer变换推导了平均奖励近似策略迭代的有限时间误差边界,证明当策略评估和改进误差趋近于0时,渐近误差也趋近于0。
    • 扩展分析了迭代依赖型、随机型误差场景,得到有限迭代次数下的期望误差边界。
    • 将通用框架应用于多种基于策略的RL算法(贪婪更新、Softmax更新、镜像下降更新),结合TD学习的线性函数近似,给出具体的有限时间性能边界。
    • 建立了与在线学习遗憾边界的关联,并与现有镜像下降类算法(POLITEX)进行了性能对比。
  • 二、创新点

  • 首次提出平
  • 赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_Performance Bounds for Policy-Based Average Reward Reinforcement Learning Algorithms
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址