强化学习可审计性研究:通过离散行为规则实现策略解释与组合
针对强化学习策略通常以不透明神经权重分发、训练日志难以解释模型具体学到何种行为的问题,该研究探讨了能否通过可审计的离散行为规则来表征和组合独立训练的策略。作者将“可审计性”拆解为轨迹完整性、无损编码、规则覆盖率、行为一致性、组合质量和价值模型可靠性六项独立可测试的属性,并采用共享冻结符号化器、被动规则提取及只追加的哈希绑定账本等机制构建验证协议。
针对强化学习策略通常以不透明神经权重分发、训练日志难以解释模型具体学到何种行为的问题,该研究探讨了能否通过可审计的离散行为规则来表征和组合独立训练的策略。作者将“可审计性”拆解为轨迹完整性、无损编码、规则覆盖率、行为一致性、组合质量和价值模型可靠性六项独立可测试的属性,并采用共享冻结符号化器、被动规则提取及只追加的哈希绑定账本等机制构建验证协议。
该研究针对联邦学习在隐私保护应用中面临的性能削弱、信息窃取以及聚合脆弱性等鲁棒性挑战进行了全面综述。论文从三个核心维度对联邦学习鲁棒性进行了系统梳理:首先以威胁为中心对多维攻击面进行分类;其次构建了鲁棒聚合策略的结构化分类体系,明确区分以结果为中心和以安全为中心的方法;最后提出了分层框架,旨在为提升分布式学习系统的安全性与稳健性提供研究指引。