AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 机器学习✦ 精选AI 评分 70/10012:00

强化学习中的策略复杂度、反应时间与有限理性研究

针对标准强化学习通常忽略生物智能体感知、注意力和工作记忆等认知计算成本的问题,该研究探讨了有限理性条件下的强化学习建模。作者推导并提出了 MI-SARSA 算法,这是一种同策略时序差分强化学习算法,通过引入学习到的边际动作互信息正则化来限制策略复杂度,旨在更好地模拟受计算约束的生物智能决策行为。

阅读原文 ↗推荐理由:将认知科学中的有限理性与互信息正则化引入强化学习,提出了新的 MI-SARSA 算法架构。# 强化学习# 有限理性# MI-SARSA# 策略复杂度# 认知建模
9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

抓住关键信息:面向大规模复杂推理的原则性上下文表示方法

在科学、医疗、法律和金融等领域解决复杂任务时,通常需要整合分散在海量异构数据源中的关联信息,其规模远超模型自身的上下文长度限制。现有方法多将信息组织为图谱、文本记忆或检索集合等形式以便推理,但其构建方式大多缺乏统一原则。本研究借鉴认知科学等理论,探讨如何规范化构建上下文表示以提升大规模推理能力。由于提供的内容在方法阐述处截断,具体技术细节有待进一步公开。

阅读原文 ↗推荐理由:针对大模型超长异构上下文推理面临的信息组织碎片化痛点,提出了规范化的上下文表示新思路。# 大模型# 上下文表示# 复杂推理# 认知建模# 长上下文