文章总结与翻译
一、主要内容
本文聚焦平均奖励马尔可夫决策过程(MDPs)中基于策略的强化学习(RL)算法,核心解决了长期以来平均奖励场景下近似策略迭代(PI)缺乏有意义性能边界的问题。
- 通过Schweitzer变换推导了平均奖励近似策略迭代的有限时间误差边界,证明当策略评估和改进误差趋近于0时,渐近误差也趋近于0。
- 扩展分析了迭代依赖型、随机型误差场景,得到有限迭代次数下的期望误差边界。
- 将通用框架应用于多种基于策略的RL算法(贪婪更新、Softmax更新、镜像下降更新),结合TD学习的线性函数近似,给出具体的有限时间性能边界。
- 建立了与在线学习遗憾边界的关联,并与现有镜像下降类算法(POLITEX)进行了性能对比。




