欢迎光临
我们一直在努力

2025_NIPS_Posterior Sampling for Competitive RL: Function Approximation and Partial Observation

文章核心总结与创新点

核心内容

本文聚焦竞争强化学习(RL)中的后验采样算法,针对双人零和马尔可夫博弈(MG),研究了自博弈和对抗性学习两种场景,同时覆盖完全可观测(FOMG)和部分可观测(POMG)状态设置。通过提出通用函数逼近的复杂度度量指标,设计了基于模型的后验采样算法,实现纳什均衡学习,并证明了算法的次线性遗憾界。

主要创新点

  • 提出自博弈广义逃逸系数(self-play GEC) 和对抗性广义逃逸系数(adversarial GEC),量化函数逼近下的探索-利用权衡,覆盖线性MG、线性混合MG、弱揭示POMG等多种博弈类型。
  • 设计两类基于模型的后验采样算法:自博弈场景下协调双方学习纳什均衡,对抗性场景下应对对手任意策略,均支持部分可观测状态。
  • 证明算法的遗憾界与GEC、迭代次数T次线性相关,且无需严格的贝尔曼完备性假设,仅需可实现性假设,覆盖更多实用博弈模型。
  • 提出可解码POMG类,将单智能体可解码POMDP推广到多智能体场景,拓展了部分可观测博弈的研究范围。
  • 翻译部分(Markdown格式)

    Abstract

    本文研究了通用函数逼近下竞争强化学习(RL)的后验采样算法。聚焦两类关键场景下的零和马尔可夫博弈(MG)——自博弈和对抗性学习,我们首先提出自博弈和对抗性广义逃逸系数(GEC)作为函数逼

    赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_Posterior Sampling for Competitive RL: Function Approximation and Partial Observation
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址