强化学习中的策略复杂度、反应时间与有限理性研究
针对标准强化学习通常忽略生物智能体感知、注意力和工作记忆等认知计算成本的问题,该研究探讨了有限理性条件下的强化学习建模。作者推导并提出了 MI-SARSA 算法,这是一种同策略时序差分强化学习算法,通过引入学习到的边际动作互信息正则化来限制策略复杂度,旨在更好地模拟受计算约束的生物智能决策行为。
推荐理由将认知科学中的有限理性与互信息正则化引入强化学习,提出了新的 MI-SARSA 算法架构。
原标题:Policy Complexity, Reaction Time, and Bounded Rationality in Reinforcement Learning
阅读 arXiv 机器学习 原文 ↗