AIDC
← 返回全部动态
arXiv 机器学习AI 评分 45/10009月25日 12:00

针对多链鲁棒平均奖励MDP的向量贝尔曼理论研究

该研究针对存在不确定性的长期性能优化问题,探讨了多链鲁棒平均奖励马尔可夫决策过程(MDP)。在此类问题中,最优长期奖励通常依赖于初始状态,需要建立兼顾递归类奖励和转移不确定性的向量贝尔曼理论。论文针对具有紧凑、动作后(s,a)-矩形模糊集的有限模型构建了该理论,提出了“增益优先、偏差第二”的优化原则,导出了耦合的向量增益-偏差系统,用于求解最优鲁棒增益。

推荐理由强化学习与控制理论的前沿基础研究,拓展了多链鲁棒MDP的理论求解框架。

原标题:Vector Bellman Theory for Multichain Robust Average-Reward Markov Decision Processes

阅读 arXiv 机器学习 原文 ↗