AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 73/10012:00

TW3Cast:基于微调基础模型冻结路由的时序预测系统

研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。

阅读原文 ↗推荐理由:展示了一种无需复杂智能体推理或大语言模型即可在时序预测基准中名列前茅的轻量级基础模型路由方案。# 时间序列# 大模型# 模型架构# GIFT-Eval# 路由机制
arXiv 机器学习✦ 精选AI 评分 68/10012:00

SpaFactor:面向组织学到转录组推断的轻量级空间上下文感知基因程序建模

空间转录组学能够描绘组织结构内的基因表达,但高昂的成本限制了其日常应用。利用常见的HE病理图像预测空间基因表达是一种可扩展的替代方案,但传统方法通常将高维基因输出视为独立目标,忽略了基因间的生物学协同作用,且极易受高维噪声影响而发生过拟合。为此,该研究提出了轻量级模型SpaFactor,旨在摆脱对高开销图网络或复杂辅助组件的依赖,实现高效的空间上下文感知基因程序建模。

阅读原文 ↗推荐理由:提出了一种面向组织病理图像推断空间转录组的轻量级模型,兼顾了基因协同关系与计算效率。# AI for Science# 空间转录组学# 计算病理学# 深度学习# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

连续扩散语言模型推理突破:ELF-REG将连续扩散架构扩展至数学与代码任务

该研究针对全连续扩散语言模型(dLM)在复杂推理任务中落后于自回归(AR)模型的难题,提出了ELF-REG架构。研究团队将嵌入语言流(ELF)拓展至GSM8K、MATH-500、HumanEval等数学与代码基准,并引入结合表征对齐与纠缠的机制(REPA+REG),通过冻结的AR教师模型监督中间去噪步骤,有效提升了连续扩散模型并行解码与复杂逻辑推理的扩展能力。

阅读原文 ↗推荐理由:探索了利用连续扩散模型替代自回归架构解决复杂推理与代码生成的前沿方向,具有较高的学术创新价值。# 扩散语言模型# 非自回归# 模型架构# 数学推理# AI编程
arXiv 人工智能✦ 精选AI 评分 78/10012:00

多任务模型中的跨任务关系学习:在YouTube生产推荐系统中的落地验证

该研究提出了一种在多任务模型中学习跨任务关系的新框架。该框架通过针对性的成对关系来近似任务标签的联合分布,从而在避免对完整联合空间建模的高昂复杂度下,利用迁移学习提升模型性能与信息抽取能力。该方法具备通用性,并在YouTube生产级推荐系统(涵盖通知、主页及“接下来播放”等场景)中完成部署验证,实验表明其显著提升了预测准确率与用户满意度。

阅读原文 ↗推荐理由:提出了一种高效逼近任务标签联合分布的多任务学习框架,并在YouTube超大规模工业推荐场景中得到有效落地与验证。# 多任务学习# 推荐系统# 迁移学习# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

受控实验复检极小规模三值语言模型:基线架构设置主导性能评估结论

该研究针对微控制器级的三值(1.58-bit)权重语言模型进行了严格的受控复验。此前有研究称混合路由三值模块在6万参数规模下性能超越参数匹配的全精度Transformer达22%,并归因于归纳偏置。研究人员通过固定训练配方、多随机种子及98次测试进行复查,发现基线Transformer的具体结构形状对性能起主导作用,揭示了此前结论可能受基线设计差异误导,强调了极小模型对比的评估规范。

阅读原文 ↗推荐理由:严谨复查了超低参数量三值语言模型的实验基线,揭示了模型评估中易被忽视的基线结构偏差。# 模型压缩# 模型架构# 评测# 边缘计算
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

流式全双工语音模型中的主动附和反馈控制研究

该研究针对全双工语音对话模型缺乏显式自然附和(如“嗯”、“对”等应答词)的问题,提出了一种轻量级预测头结构。该机制直接利用全双工模型自身的隐藏状态来预测附和时机,当概率超过设定阈值时即强制解码生成反馈。实验在7B规模的PersonaPlex和1B规模的F-Actor模型上验证了该方法的跨尺度泛化能力,探针分析也证实其隐藏状态能够有效契合人类真实的交谈节奏。

阅读原文 ↗推荐理由:针对全双工实时语音交互的拟人化痛点,提出轻量级附和时机预测方案,有效提升了对话自然度。# 全双工对话# 语音大模型# 人机交互# Backchannel# 模型架构
arXiv 机器学习✦ 精选AI 评分 72/10012:00

面向机制可解释性的流递归模型(SRM)

该研究针对机制可解释性技术难以随大语言模型规模与深度扩展的问题,提出了一种新型架构——流递归模型(SRM)。SRM 是对分层推理模型(HRM)的改进,通过将计算过程组织为多个相互交互的潜在流,在保持模型可扩展性的同时暴露其内部计算结构。该工作旨在通过设计天然具备可解释性结构的小型模型,为验证和理解模型内部行为提供新的探索路径。

阅读原文 ↗推荐理由:提出了一种面向机制可解释性的新型模型架构,通过多潜在流交互设计探索可扩展与透明性并存的路径。# 模型架构# 可解释性# SRM# 前沿研究# 大模型
arXiv 机器学习✦ 精选AI 评分 70/10012:00

基于埃尔米特多项式的谱图神经网络架构 HermNet 研究

该研究深入探讨了基于埃尔米特多项式构建的谱图神经网络,并提出了 HermNet 模型。该模型将节点级预测器与归一化埃尔米特传播相结合,依靠稀疏递推关系实现计算,既无需昂贵的特征值分解也不依赖可学习基底。研究还评估了坐标校准、响应归一化和高斯导数正则化等可选机制,并系统分析了在有限训练预算下,不同完备多项式基底在优化行为上的差异。

阅读原文 ↗推荐理由:提出了一种基于埃尔米特多项式且无需特征分解的高效谱图神经网络新架构 HermNet。# 图神经网络# HermNet# 谱图理论# 多项式基底# 模型架构
arXiv 机器学习✦ 精选AI 评分 68/10012:00

基于lp正则化的大语言模型LoRA自动秩分配方法

低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0

阅读原文 ↗推荐理由:提出了一种基于lp正则化的LoRA自动秩分配新方案,改进了大模型参数高效微调的优化理论与实现。# 大模型# LoRA# 微调# 模型架构# 稀疏正则化
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:13

盘点梁文锋署名技术论文:聚焦底层架构与核心算子创新

该文梳理了梁文锋在学术论文中的署名脉络。过去三年中,梁文锋极少作为第一作者或通讯作者出现在动辄上百人署名的旗舰模型整体报告中,而是将研究精力与署名重点投向最底层的原子技术,包括MLA注意力机制、MoE路由机制、mHC拓扑流形、DSpark推理算子以及DSec智能体沙盒等关键底层技术论文,展现了其对AI基础架构研发的深耕。

阅读原文 ↗推荐理由:梳理了梁文锋在MLA、MoE路由等关键底层模型架构与算子上的核心技术论文贡献。# 模型架构# MLA# MoE# 芯片
AITNT · AI头条(网页)✦ 精选AI 评分 78/10010:11

GLM-5.3-Flash融合Kimi与DeepSeek注意力架构,大模型设计走向混合组合

GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。

阅读原文 ↗推荐理由:体现了大模型底层注意力机制从单一路线竞争向异构融合设计演进的重要技术趋势。# GLM# DeepSeek# Kimi# 注意力机制# 模型架构
9月24日2026-09-24
NVIDIA Developer Blog✦ 精选AI 评分 75/10023:00

面向生物基础模型的高效混合专家(MoE)训练方法

随着语言模型规模的持续扩大,扩展传统密集架构的计算成本变得愈发昂贵。在密集 Transformer 模型中,每个标记都会经过所有网络层,导致算力消耗剧增。针对这一挑战,该研究探讨了面向生物基础模型的高效混合专家(MoE)训练技术,旨在通过稀疏激活机制降低计算开销,提升大模型在生物医学等特定领域的训练效率与扩展能力。

阅读原文 ↗推荐理由:聚焦混合专家(MoE)架构在生物基础模型中的高效训练实践,对大模型轻量化与垂直领域扩展具有参考价值。# MoE# 混合专家# 生物基础模型# 模型架构# 算力
arXiv 机器学习✦ 精选AI 评分 68/10012:00

HARN:面向事件驱动多时间周期预测的分层联想共振网络

针对金融时间序列在多时间尺度预测中重复计算不变表征的难题,研究者提出了分层联想共振网络(HARN)。该模型专为事件驱动的多周期预测设计,通过在不同时间层级维护持久化表征,仅在对应周期的K线数据生成完成后才触发该层更新,显著避免了冗余计算。其架构综合了因果多尺度时间编码、门控联想记忆、跨层级共振以及分层证据聚合机制。

阅读原文 ↗推荐理由:提出了一种事件驱动的多时间尺度预测架构,有效降低了时序表征更新中的冗余计算。# 时间序列# 模型架构# 金融AI# 深度学习# 联想记忆
arXiv 自然语言处理✦ 精选AI 评分 73/10012:00

Ruby-ASR:面向正字法与词汇读音联合识别的语音识别监督新方法

针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。

阅读原文 ↗推荐理由:提出创新的监督表征结构,有效解决了日语等语言在语音识别中同字异音的监督信息缺失问题。# 语音# 日语处理# 音素识别# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

MORSE:通过反向评分优化多上下文排序以实现证据保留压缩

该研究探讨了基于似然的多上下文压缩技术对上下文输入顺序的高度敏感性问题。实验表明,相同上下文集合的不同排列顺序会导致显著不同的关键证据保留结果。论文将这种敏感性归因于“信息抢占”现象,即较早出现的部分相关上下文会提前消耗共享信息的置信度权重,从而压低后续更关键证据载体的增量评分,大幅增加强证据被错误删除的风险。研究通过受控干预实验深入分析了该机制。

阅读原文 ↗推荐理由:深入揭示了多上下文压缩中由信息抢占导致的顺序敏感问题,对长文本证据保留与压缩优化具有重要参考价值。# 上下文压缩# 长上下文# 信息抢占# 大模型# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

DPara:结合并行草稿器与并行投机解码的高效推理框架

针对大模型推理加速,现有并行投机解码(PSD)虽能重叠草稿生成与验证过程,但往往依赖对接受前缀和额外标记的预先猜测,猜错会导致批处理回退至低效的串行起草。论文提出 DPara 框架,在复用高效并行草稿器的同时,确保目标模型验证与起草阶段在每一轮均实现重叠,彻底消除了概率性回退缺陷,保障了投机解码流水线的高效利用。注:素材末尾存在文本截断。

阅读原文 ↗推荐理由:提出 DPara 框架解决了并行投机解码中因猜测失误而退化为串行的痛点,进一步提升大模型推理吞吐与时延表现。# 投机解码# 大模型# 推理# 并行计算# 模型架构
arXiv 人工智能✦ 精选AI 评分 68/10012:00

研究揭示Transformer注意力头数对序列有序性判断的表达能力界限

该研究探讨了Transformer架构在序列排序判断任务中的表达能力。论文证明,判断一个比特序列是否处于有序状态的任务无法由单头单层(1-head 1-layer)Transformer完成,但可以通过双头单层(2-head 1-layer)Transformer实现。与以往同类理论成果不同的是,该研究的结论建立在模型包含输出多层感知机(MLP)的架构设定之下。

阅读原文 ↗推荐理由:该论文从理论上严格证明了注意力头数量对基础逻辑任务的影响,推进了带MLP的Transformer模型表达能力边界研究。# Transformer# 表达能力# 注意力机制# 理论研究# 模型架构
arXiv 机器学习✦ 精选AI 评分 72/10012:00

面向在线自适应的贝叶斯神经网络全协方差平滑算法

该研究提出了一种面向在线自适应的贝叶斯神经网络训练方法。研究将神经网络各层视为状态空间模型的时间步,把贝叶斯训练转化为平滑问题:前向过程传播高斯矩,反向 RTS 平滑过程则以闭式解更新权重后验。这种方法单次遍历即可完成学习,具备不确定性感知能力,且无需梯度迭代或经验回放,非常适用于高数据效率的在线自适应场景。针对以往方法受限于激活对角协方差的瓶颈,该工作展开了全协方差平滑研究。

阅读原文 ↗推荐理由:提出无需梯度迭代的贝叶斯神经网络在线自适应方法,为小样本增量学习与不确定性量化提供了新思路。# 贝叶斯神经网络# 在线自适应# 状态空间模型# 模型架构# 无梯度学习
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LLMAE:将预训练大语言模型改造为高保真连续文本自编码器

针对自回归语言模型仅能通过序列分解间接表示全局结构、缺乏类似图像领域的忠实连续表征这一问题,研究人员提出了LLMAE方法。该方法将预训练的仅解码器(decoder-only)大语言模型重新利用为连续文本自编码器,通过在其内部激活状态中构建一个中间固定长度的潜在瓶颈(latent bottleneck),成功为文本生成提供了可操作的高保真连续潜空间表征。

阅读原文 ↗推荐理由:探索了利用预训练LLM构建文本连续潜空间的新架构方法,对文本生成与表征学习具有重要参考价值。# 大模型# 自编码器# 连续潜空间# 模型架构# 表征学习
arXiv 机器学习✦ 精选AI 评分 75/10012:00

柏拉图表征假设中究竟在收敛什么?结构优先于几何

柏拉图表征假设提出高能力模型会趋向于收敛至共享表征,而近期研究将其范围缩减为共享局部邻域关系,并认为校准后全局相似性趋势大多消失。该研究对这一解读提出质疑,指出以往的局部与全局对比混淆了结构尺度(局部与全局)与对比对象本身的差异,即由样本关联定义的“关系结构”和由距离等量化关系表征的“度量几何”被混为一谈,重新澄清了模型表征收敛的实质。

阅读原文 ↗推荐理由:深入探讨了模型表征收敛的理论机制,纠正了学界对局部与全局几何相似性分析的混淆。# 表征学习# 柏拉图假设# 深度学习理论# 模型架构# 几何结构
arXiv 人工智能✦ 精选AI 评分 80/10012:00

腾讯发布Hunyuan-A13B开源MoE模型技术报告

该技术报告介绍了开源大语言模型Hunyuan-A13B。该模型采用混合专家(MoE)架构,总参数量为800亿,推理时仅激活130亿参数,有效兼顾了模型性能、计算效率与部署成本。模型在经过严格清洗且强化STEM领域的20T token语料上进行预训练,并结合高质量SFT与大规模强化学习,同时引入了双模式思维链(CoT)框架,显著提升了事实可靠性与逻辑推理能力。

阅读原文 ↗推荐理由:混元开源80B MoE大模型并公开技术报告,其激活13B参数的设计对端侧及高效部署极具参考价值。# 混元大模型# MoE# 开源# 大模型# 模型架构
InfoQ · 架构与云计算AI 评分 40/10006:51

PrismAlign提出多视角立体对齐技术,提升文档结构化提取精度

根据标题信息,新技术或模型PrismAlign提出从传统的“单目感知”转向“多视角立体对齐”方案,旨在重新定义文档结构化信息提取的精度上限。由于所提供的素材原文内容缺失,缺乏具体的架构细节、实验评估数据及应用场景等详细信息,更多技术实现与性能表现有待官方或原文进一步披露。

阅读原文 ↗推荐理由:涉及文档结构化提取的新方法PrismAlign,但因有效信息极度缺失,实用与研究参考价值受限。# PrismAlign# 文档提取# 多模态# 结构化解析# 模型架构