一、文章主要内容总结
本文聚焦于风险敏感强化学习(Risk-Sensitive Reinforcement Learning)中的模型学习问题,核心是解决“在近似模型中进行风险敏感规划能否迁移到真实环境”这一关键问题,具体内容如下:
- 证明价值等价仅适用于风险中性场景,风险敏感规划的性能会随风险敏感度提升而下降;
- 提出分布等价原理(Distribution Equivalence Principle),理论上可支持任意风险度量的最优规划,但存在计算不可行性;
- 提出统计泛函等价(Statistical Functional Equivalence),通过选择统计泛函(Sketch)灵活控制需捕捉的回报分布特征,既解决了分布等价的计算难题,又能精准适配目标风险度量;
- 推导了统计泛函等价与投影分布等价的关联,证明统计泛函的选择直接决定可最优规划的风险度量范围。
- 设计了可用于学习统计泛函




