文章核心总结与创新点
核心内容
本文聚焦竞争强化学习(RL)中的后验采样算法,针对双人零和马尔可夫博弈(MG),研究了自博弈和对抗性学习两种场景,同时覆盖完全可观测(FOMG)和部分可观测(POMG)状态设置。通过提出通用函数逼近的复杂度度量指标,设计了基于模型的后验采样算法,实现纳什均衡学习,并证明了算法的次线性遗憾界。
主要创新点
翻译部分(Markdown格式)
Abstract
本文研究了通用函数逼近下竞争强化学习(RL)的后验采样算法。聚焦两类关键场景下的零和马尔可夫博弈(MG)——自博弈和对抗性学习,我们首先提出自博弈和对抗性广义逃逸系数(GEC)作为函数逼

