知识追踪模型的可解释性与稳定性验证研究
该研究针对知识追踪(KT)模型黑盒预测导致难以有效指导教学实践的问题,提出了一套综合验证协议。该协议系统评估了模型的预测竞争力、解释稳定性以及基于重新训练的忠实度。研究基于ASSISTments 2009和2012数据集,围绕五个教学主题构建了13个行为特征,并修正重建了原始数据集中存在技能构建重复记录的问题,为教育AI模型的可解释性评估提供了更可靠的基准。
该研究针对知识追踪(KT)模型黑盒预测导致难以有效指导教学实践的问题,提出了一套综合验证协议。该协议系统评估了模型的预测竞争力、解释稳定性以及基于重新训练的忠实度。研究基于ASSISTments 2009和2012数据集,围绕五个教学主题构建了13个行为特征,并修正重建了原始数据集中存在技能构建重复记录的问题,为教育AI模型的可解释性评估提供了更可靠的基准。
针对药物研发中毒性预测面临的样本严重失衡、骨架泛化差以及缺乏临床可解释性等难题,研究人员提出了多模态网络架构 SMILESGNN。该模型通过交叉注意力机制,融合了 SMILES Transformer 编码器与 GATv2 图编码器,弥补了单一序列模型无法提供图归因解释的缺陷。此外,研究还推出了预训练变体 SMILESGNN-PT,有效提升了分子表征的泛化性能与临床解释能力。
针对压气机叶栅开式叶尖间隙流中CFD预测与实验存在偏差且高分辨率实验真值缺失的问题,该研究提出一种基于变分自编码器(VAE)与潜在空间自适应的非侵入式修正方法。研究首先使用166个参数化采样的CFD总压损失场数据集训练VAE以获取流场的低维统计表征,随后冻结该VAE,并利用少量数据训练低秩潜在空间适配器进行流场修正(注:原摘要末尾不完整)。
该研究针对扩散模型中表征正则化方法常忽视内置条件(如标签或文本)影响的问题,揭示了条件信号对特征分布的作用机制,并提出了 CARE(条件感知表征正则化)框架。CARE 是一种轻量级且即插即用的正则化方案,能够根据条件相似性动态调整特征分布,从而进一步优化扩散模型的样本生成质量并提升训练效率。
空间转录组学能够描绘组织结构内的基因表达,但高昂的成本限制了其日常应用。利用常见的HE病理图像预测空间基因表达是一种可扩展的替代方案,但传统方法通常将高维基因输出视为独立目标,忽略了基因间的生物学协同作用,且极易受高维噪声影响而发生过拟合。为此,该研究提出了轻量级模型SpaFactor,旨在摆脱对高开销图网络或复杂辅助组件的依赖,实现高效的空间上下文感知基因程序建模。
针对SHAP和LIME等事后解释方法在阿拉伯语、波斯语、乌尔都语和希伯来语等从右至左(RTL)语言中出现的可视化失效问题,该研究进行了系统评估与修正。论文指出,尽管特征归因在数学计算上依然有效,但现有可视化渲染会导致词元顺序错乱、连字符断裂及图表阅读方向错误。研究将此界定为可视化层面的工程缺陷,并提出了针对性的度量基准与渲染校正方案。
针对宏观经济等统计机构常对历史发布数据进行事后修订、导致模型训练容易引入前瞻偏差的问题,研究人员提出了具备数据修订感知能力的时间序列基座模型VINTAGE-TS。该架构明确区分了“观察时间”与“信息可用时间”,避免将单一版本假定为最终真值,而是同时预测下一周期的首次发布值及其发布后固定时间跨度内的修订值,从而更贴合真实场景下的时序预测需求。
该论文针对时间序列基础模型(TSFM)在长周期多步预测中面临的固有不确定性问题展开研究。现有模型在各时间步衍生出的预测分支会向后续步骤扩散,导致预测表现不一并削弱了结果的可信度。为此,作者提出了切片-图化-对齐(SGA)方法来对该不确定性进行量化。因原始摘要结尾截断,关于 SGA 方法的具体机制与实验效果等信息不足。
针对甲状腺细针穿刺活检在深度学习分类中面临的高假阴性率及临床域偏移下的过度自信问题,研究人员提出了 TAM-Chain 框架。该研究结合吸收马尔可夫链理论与基于香农熵的不确定性量化方法,在 10x、20x 和 40x 等多尺度下动态建模特征提取过程,旨在抑制假阴性漏诊并增强跨域适应能力,提升早期甲状腺癌病理诊断的可靠性。
该研究探讨了大语言模型在数学定理推测与证明中的价值评估问题。针对 AI 产出的大量新数学定理是否“有趣”或“有用”这一开放课题,作者提出了定理内在趣味性(Intrinsic Interestingness)的量化定义,即定理的证明长度与其命题陈述长度之比。实验表明,该指标与定理在下游的外在价值度量强相关,为评估和引导 AI 拓展高价值数学知识提供了新路径。
针对多线平行板雪崩计数器(MWPPAC)传统校准依赖标注数据、难以适应工况变化与设备老化的问题,研究人员提出了一种物理信息自监督学习框架。该框架无需标注的位置测量或专用校准测量,即可联合实现探测器导线校准与粒子相互作用位置的高精度重构,显著提升了科学探测仪器在长期运行中的自适应能力。
针对FIE2026中文事实性推理评估任务中的类别严重不平衡(单类别占64.1%)及兼顾精确度与邻近区间惩罚的评价机制,研究人员提出UO-FIE系统。实验发现mDeBERTa分类模型易偏向多数类,而Huber回归基线虽能落在相近区间但精确匹配率低。UO-FIE采用参数高效架构,综合精确标签监督与分级效用设计,改善了九分类有序事实性区间的推断表现。
针对备件需求与零售销售中常见的间歇性时间序列,由于预测误差成本通常不对称,库存控制等决策需要完整的概率分布而非单点预测。此前相关方法分散于不同软件框架中难以系统比较,该研究推出了R语言工具包fable.intermittent。该工具包在fable框架下集成了多种针对间歇性序列的概率预测方法,为相关领域的算法开发与标准化性能比对提供了统一工具。
该论文研究了带有可验证奖励的强化学习(RLVR)在迭代群与拟群乘法等算法任务中的优化景观,探讨其学习新推理能力的极限。作者将近视表格策略下的熵正则化RLVR映射到确定性策略的自旋玻璃能量模型,不仅给出了RLVR能力的理论上限,还严格刻画了表格环境下的景观特征。理论与实验表明该优化景观可以是良态的;因原文摘要截断,具体实验细节未完全展开。
针对虚拟药物筛选中候选分子众多但实际合成与测试资源受限的痛点,研究人员提出了OPDiv多样性选择与评估算法。在化合物筛选过程中,高预测分数与分子结构多样性往往存在权衡取舍。该算法基于整数优化技术,能够在保证化合物高评分的同时最大化样本多样性,自动计算出最优的Top-K分子子集,为药物发现后期的合成验证提供更高效的决策支持。
针对现有基于图的世界模型多局限于固定拓扑或确定性、完全可观测环境的问题,研究人员提出了图动力学模型(GDM)。该模型专为图结构观测设计,能够处理在随机和部分可观测环境中拓扑结构动态演化的更通用场景。GDM利用稀疏循环邻接矩阵对拓扑更新进行建模并执行消息传递,结合循环状态空间机制以捕捉潜空间动力学。
针对混合推理模型在无显式思考(NoThink)模式下的后训练机制,本研究探讨了其性能提升是否源于基座模型“思考(Think)”模式能力的潜在迁移。作者将这种“思考泄漏”纳入因果中介分析框架,并基于激活方向的双向干预进行审计。在3个模型、3种后训练方法及竞赛数学基准上的实验表明,“思考泄漏”在行为和表征层面均真实存在、具备因果性且影响显著,揭示了快推理模式下的内在表征机制。
该研究提出了一种在分布式环境中训练平均 n-依赖估计器(AnDE)的联邦学习框架。该方案重点关注判别式设定,模型权重在本地学习后进行全局聚合,并支持任意依赖阶数 n。由于无需传输具有直接语义的参数,该设计显著提升了隐私安全性。此外,研究还实现了生成式 AnDE 联邦基准,支持在概率表聚合中引入差分隐私,并在 12 个离散数据集上完成了有效性验证。
针对标准强化学习通常忽略生物智能体感知、注意力和工作记忆等认知计算成本的问题,该研究探讨了有限理性条件下的强化学习建模。作者推导并提出了 MI-SARSA 算法,这是一种同策略时序差分强化学习算法,通过引入学习到的边际动作互信息正则化来限制策略复杂度,旨在更好地模拟受计算约束的生物智能决策行为。
本研究基于小波扩散模型(WDM)框架,系统评估了扩散模型在公里级降水降尺度任务中的跨区域与跨事件泛化能力。研究覆盖了代表对流、冬季、热带及大气河流等降水机制的美国六个区域,通过对NOAA多雷达/多传感器复合反射率场进行块平均生成低分辨率输入。研究重点测试了仅在俄克拉荷马州样本上训练的模型向其他未知地理区域和天气形态迁移的实际表现。
在科学机器学习中,增量学习通常针对物理基线残差训练模型,传统观点认为基线越精确、残差尺度越小,下游性能就越好。该研究表明,仅靠残差尺度不足以评估目标的可学习性。通过在分子图神经网络的总能量预测任务中进行评估,研究发现复杂的局部描述符基线虽然残差绝对尺度更小,但在架构代理空间中表现得极不平滑,相对其尺度反而更难学习。论文揭示了面向泛化科学机器学习的目标设计关键机制。
该研究针对存在不确定性的长期性能优化问题,探讨了多链鲁棒平均奖励马尔可夫决策过程(MDP)。在此类问题中,最优长期奖励通常依赖于初始状态,需要建立兼顾递归类奖励和转移不确定性的向量贝尔曼理论。论文针对具有紧凑、动作后(s,a)-矩形模糊集的有限模型构建了该理论,提出了“增益优先、偏差第二”的优化原则,导出了耦合的向量增益-偏差系统,用于求解最优鲁棒增益。
该研究针对机制可解释性技术难以随大语言模型规模与深度扩展的问题,提出了一种新型架构——流递归模型(SRM)。SRM 是对分层推理模型(HRM)的改进,通过将计算过程组织为多个相互交互的潜在流,在保持模型可扩展性的同时暴露其内部计算结构。该工作旨在通过设计天然具备可解释性结构的小型模型,为验证和理解模型内部行为提供新的探索路径。
该研究探讨了基于重构的无监督异常检测在模型过度拟合异常或丢失正常变异时的失败机理。论文借助“子空间追求”(PoS)假说,从交集、并集和联接几何视角对失败模式进行理论表征:模型容量过大易引发联接盲区,容量不足则会导致交集偏好与正常保真度下降。研究证明紧凑的正常数据并集是最优保真范围,通常依赖非线性重构映射实现。
该研究针对大模型同策略蒸馏(OPD)缺乏教师模型隐层思考过程的问题展开探索。尽管引入隐状态监督(Latent supervision)能对齐学生与教师模型的内部状态,但在将Qwen3-4B/8B蒸馏至Qwen3-1.7B-Base的实验中,研究人员发现该方法存在“早期增益、后期崩溃”的失效现象,MATH-500准确率虽迅速提升但随后崩溃。为此,论文提出了LastOPD方法以抑制此类崩溃。
该论文针对科学断层扫描中神经场优化的核心难题展开研究。作者指出,由于2D到3D的正向映射为多对一关系,较低的2D图像误差并不能保证隐式3D物理场的准确性,且该隐式场在训练中缺乏直接监督。为此,研究团队提出了CoroNeRF框架,利用可微原子发射渲染器,直接从多视角、多谱线辐射强度中联合优化3D电子密度与温度场,并在日冕断层扫描场景中进行了测试与验证(注:原摘要结尾处有所截断)。
针对振动光谱预测在跨化学空间场景下易受局部立体电子环境扰动而导致精度下降的问题,研究提出 SO(3) 等变神经卡尔曼网络(SENK)。该框架构建了响应态级联结构,融合了用于学习 Hessian 矩阵、偶极导数及极化率导数的等变 Transformer 骨干网络,通过等变神经卡尔曼桥实现状态依赖精炼与可靠性感知,并结合 NBO 电子先验以提升光谱表征的可迁移性。
该研究深入探讨了基于埃尔米特多项式构建的谱图神经网络,并提出了 HermNet 模型。该模型将节点级预测器与归一化埃尔米特传播相结合,依靠稀疏递推关系实现计算,既无需昂贵的特征值分解也不依赖可学习基底。研究还评估了坐标校准、响应归一化和高斯导数正则化等可选机制,并系统分析了在有限训练预算下,不同完备多项式基底在优化行为上的差异。
低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0
局部学习通过各层独立的辅助损失避免了全局反向传播,具备天然的结构并行优势,但长期受困于深度增加时的精度衰减和超参数脆弱性。该研究首次将类似 Muon 的谱更新几何(包含动量正交化与谱步长缩放)应用于逐层局部更新。在 CIFAR-10 MLP 基准测试中,该方法在深度 12 至 48 层、宽度 128 至 2048 的范围内,仅需单一固定步长即可取得最优表现,显著提升了局部学习对网络深度的鲁棒性。