针对多链鲁棒平均奖励MDP的向量贝尔曼理论研究
该研究针对存在不确定性的长期性能优化问题,探讨了多链鲁棒平均奖励马尔可夫决策过程(MDP)。在此类问题中,最优长期奖励通常依赖于初始状态,需要建立兼顾递归类奖励和转移不确定性的向量贝尔曼理论。论文针对具有紧凑、动作后(s,a)-矩形模糊集的有限模型构建了该理论,提出了“增益优先、偏差第二”的优化原则,导出了耦合的向量增益-偏差系统,用于求解最优鲁棒增益。
该研究针对存在不确定性的长期性能优化问题,探讨了多链鲁棒平均奖励马尔可夫决策过程(MDP)。在此类问题中,最优长期奖励通常依赖于初始状态,需要建立兼顾递归类奖励和转移不确定性的向量贝尔曼理论。论文针对具有紧凑、动作后(s,a)-矩形模糊集的有限模型构建了该理论,提出了“增益优先、偏差第二”的优化原则,导出了耦合的向量增益-偏差系统,用于求解最优鲁棒增益。
该研究针对可解释性与表征学习中的“线性表征假说”提出了理论层面的反思。作者指出,要让关于表征的结论跨越具体训练模型实现泛化,必须明确两个表征何时被视为等价。由于现有讨论普遍缺乏对等价性的明确定义,导致看似研究同一表征的指标、探测器和干预手段实际上可能对应着不同的假设。研究认为,线性表征假说并非单一假设,而是由不同表征等价性所区分的一个假说家族。
该研究探讨了Transformer架构在序列排序判断任务中的表达能力。论文证明,判断一个比特序列是否处于有序状态的任务无法由单头单层(1-head 1-layer)Transformer完成,但可以通过双头单层(2-head 1-layer)Transformer实现。与以往同类理论成果不同的是,该研究的结论建立在模型包含输出多层感知机(MLP)的架构设定之下。