SpaFactor:面向组织学到转录组推断的轻量级空间上下文感知基因程序建模
空间转录组学能够描绘组织结构内的基因表达,但高昂的成本限制了其日常应用。利用常见的HE病理图像预测空间基因表达是一种可扩展的替代方案,但传统方法通常将高维基因输出视为独立目标,忽略了基因间的生物学协同作用,且极易受高维噪声影响而发生过拟合。为此,该研究提出了轻量级模型SpaFactor,旨在摆脱对高开销图网络或复杂辅助组件的依赖,实现高效的空间上下文感知基因程序建模。
空间转录组学能够描绘组织结构内的基因表达,但高昂的成本限制了其日常应用。利用常见的HE病理图像预测空间基因表达是一种可扩展的替代方案,但传统方法通常将高维基因输出视为独立目标,忽略了基因间的生物学协同作用,且极易受高维噪声影响而发生过拟合。为此,该研究提出了轻量级模型SpaFactor,旨在摆脱对高开销图网络或复杂辅助组件的依赖,实现高效的空间上下文感知基因程序建模。
该研究针对机制可解释性技术难以随大语言模型规模与深度扩展的问题,提出了一种新型架构——流递归模型(SRM)。SRM 是对分层推理模型(HRM)的改进,通过将计算过程组织为多个相互交互的潜在流,在保持模型可扩展性的同时暴露其内部计算结构。该工作旨在通过设计天然具备可解释性结构的小型模型,为验证和理解模型内部行为提供新的探索路径。
该研究深入探讨了基于埃尔米特多项式构建的谱图神经网络,并提出了 HermNet 模型。该模型将节点级预测器与归一化埃尔米特传播相结合,依靠稀疏递推关系实现计算,既无需昂贵的特征值分解也不依赖可学习基底。研究还评估了坐标校准、响应归一化和高斯导数正则化等可选机制,并系统分析了在有限训练预算下,不同完备多项式基底在优化行为上的差异。
低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0
针对金融时间序列在多时间尺度预测中重复计算不变表征的难题,研究者提出了分层联想共振网络(HARN)。该模型专为事件驱动的多周期预测设计,通过在不同时间层级维护持久化表征,仅在对应周期的K线数据生成完成后才触发该层更新,显著避免了冗余计算。其架构综合了因果多尺度时间编码、门控联想记忆、跨层级共振以及分层证据聚合机制。
该研究提出了一种面向在线自适应的贝叶斯神经网络训练方法。研究将神经网络各层视为状态空间模型的时间步,把贝叶斯训练转化为平滑问题:前向过程传播高斯矩,反向 RTS 平滑过程则以闭式解更新权重后验。这种方法单次遍历即可完成学习,具备不确定性感知能力,且无需梯度迭代或经验回放,非常适用于高数据效率的在线自适应场景。针对以往方法受限于激活对角协方差的瓶颈,该工作展开了全协方差平滑研究。
针对自回归语言模型仅能通过序列分解间接表示全局结构、缺乏类似图像领域的忠实连续表征这一问题,研究人员提出了LLMAE方法。该方法将预训练的仅解码器(decoder-only)大语言模型重新利用为连续文本自编码器,通过在其内部激活状态中构建一个中间固定长度的潜在瓶颈(latent bottleneck),成功为文本生成提供了可操作的高保真连续潜空间表征。
柏拉图表征假设提出高能力模型会趋向于收敛至共享表征,而近期研究将其范围缩减为共享局部邻域关系,并认为校准后全局相似性趋势大多消失。该研究对这一解读提出质疑,指出以往的局部与全局对比混淆了结构尺度(局部与全局)与对比对象本身的差异,即由样本关联定义的“关系结构”和由距离等量化关系表征的“度量几何”被混为一谈,重新澄清了模型表征收敛的实质。