AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 机器学习✦ 精选AI 评分 70/10012:00

强化学习中的策略复杂度、反应时间与有限理性研究

针对标准强化学习通常忽略生物智能体感知、注意力和工作记忆等认知计算成本的问题,该研究探讨了有限理性条件下的强化学习建模。作者推导并提出了 MI-SARSA 算法,这是一种同策略时序差分强化学习算法,通过引入学习到的边际动作互信息正则化来限制策略复杂度,旨在更好地模拟受计算约束的生物智能决策行为。

阅读原文 ↗推荐理由:将认知科学中的有限理性与互信息正则化引入强化学习,提出了新的 MI-SARSA 算法架构。# 强化学习# 有限理性# MI-SARSA# 策略复杂度# 认知建模