AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 机器学习✦ 精选AI 评分 75/10012:00

感知数据修订的时间序列基座模型VINTAGE-TS

针对宏观经济等统计机构常对历史发布数据进行事后修订、导致模型训练容易引入前瞻偏差的问题,研究人员提出了具备数据修订感知能力的时间序列基座模型VINTAGE-TS。该架构明确区分了“观察时间”与“信息可用时间”,避免将单一版本假定为最终真值,而是同时预测下一周期的首次发布值及其发布后固定时间跨度内的修订值,从而更贴合真实场景下的时序预测需求。

阅读原文 ↗推荐理由:针对现实数据中普遍存在的历史修订与前瞻偏差痛点,提出了创新的时间序列基座模型架构。# 时间序列# 大模型# 深度学习# 前沿研究
arXiv 机器学习✦ 精选AI 评分 70/10012:00

SGA:面向时间序列基础模型多步预测的不确定性量化方法

该论文针对时间序列基础模型(TSFM)在长周期多步预测中面临的固有不确定性问题展开研究。现有模型在各时间步衍生出的预测分支会向后续步骤扩散,导致预测表现不一并削弱了结果的可信度。为此,作者提出了切片-图化-对齐(SGA)方法来对该不确定性进行量化。因原始摘要结尾截断,关于 SGA 方法的具体机制与实验效果等信息不足。

阅读原文 ↗推荐理由:针对时间序列基础模型在长周期预测中不确定性扩散的技术痛点,提出了一种专门的量化方法。# 时间序列# 大模型# 不确定性量化# 多步预测# 前沿研究
arXiv 机器学习✦ 精选AI 评分 75/10012:00

学习发现有价值的数学定理:量化 AI 数学发现的趣味性

该研究探讨了大语言模型在数学定理推测与证明中的价值评估问题。针对 AI 产出的大量新数学定理是否“有趣”或“有用”这一开放课题,作者提出了定理内在趣味性(Intrinsic Interestingness)的量化定义,即定理的证明长度与其命题陈述长度之比。实验表明,该指标与定理在下游的外在价值度量强相关,为评估和引导 AI 拓展高价值数学知识提供了新路径。

阅读原文 ↗推荐理由:针对 AI 自动定理发现中“价值判断”难题提出了具体的量化指标,对 AI for Math 研究具有启发意义。# 大模型# AI数学# 定理证明# 前沿研究# 知识发现
arXiv 机器学习✦ 精选AI 评分 72/10012:00

面向机制可解释性的流递归模型(SRM)

该研究针对机制可解释性技术难以随大语言模型规模与深度扩展的问题,提出了一种新型架构——流递归模型(SRM)。SRM 是对分层推理模型(HRM)的改进,通过将计算过程组织为多个相互交互的潜在流,在保持模型可扩展性的同时暴露其内部计算结构。该工作旨在通过设计天然具备可解释性结构的小型模型,为验证和理解模型内部行为提供新的探索路径。

阅读原文 ↗推荐理由:提出了一种面向机制可解释性的新型模型架构,通过多潜在流交互设计探索可扩展与透明性并存的路径。# 模型架构# 可解释性# SRM# 前沿研究# 大模型
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LastOPD:解决隐状态同策略大模型蒸馏中的后期崩溃问题

该研究针对大模型同策略蒸馏(OPD)缺乏教师模型隐层思考过程的问题展开探索。尽管引入隐状态监督(Latent supervision)能对齐学生与教师模型的内部状态,但在将Qwen3-4B/8B蒸馏至Qwen3-1.7B-Base的实验中,研究人员发现该方法存在“早期增益、后期崩溃”的失效现象,MATH-500准确率虽迅速提升但随后崩溃。为此,论文提出了LastOPD方法以抑制此类崩溃。

阅读原文 ↗推荐理由:针对大语言模型同策略隐层蒸馏中性能崩溃问题提出解决方案,对模型轻量化与对齐训练具有参考价值。# 蒸馏# Qwen3# 大模型# 前沿研究
arXiv 机器学习✦ 精选AI 评分 68/10012:00

基于lp正则化的大语言模型LoRA自动秩分配方法

低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0

阅读原文 ↗推荐理由:提出了一种基于lp正则化的LoRA自动秩分配新方案,改进了大模型参数高效微调的优化理论与实现。# 大模型# LoRA# 微调# 模型架构# 稀疏正则化
9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 78/10012:00

终端基准测试何以称“难”?研究揭示智能体评测中的“真假难度”陷阱

前沿基准测试常依赖当前模型无法解决的任务来衡量能力边界,但零通过率并不等同于真正的高难度。该研究指出,任务全军覆没既可能源于真实的能力代差,也可能是由缺失上下文、损坏的参考方案或基础设施故障等“虚假难度”导致。基于 Terminal-Bench 3 等基准中涵盖 639 个任务、2.8 万余次试验及逾 10 万美元开销的真实记录,研究系统性厘清了导致智能体任务失败的本质原因,为评测体系纠偏。

阅读原文 ↗推荐理由:通过大规模实证分析揭示了智能体基准评测中零通过率背后的工程与设计缺陷,对规范 Agent 评估体系具有重要参考意义。# 智能体# 评测# Terminal-Bench# Agent评测# 大模型
arXiv 机器学习✦ 精选AI 评分 75/10012:00

COPE:利用用户嵌入与自评估实现大模型在稀疏反馈下的持续个性化

针对大语言模型在标准对齐后输出同质化、难以满足用户多样化偏好的问题,研究人员提出了COPE优化框架。现有免训练方法多依赖提示工程占用上下文窗口,而微调方法在训练后保持静态,无法持续适应动态偏好。COPE结合个性化用户嵌入与模型自评估机制,有效克服了现实场景中用户反馈稀疏的挑战,实现了大语言模型在部署后的持续个性化优化。

阅读原文 ↗推荐理由:提出了一种结合用户嵌入和自评估的新算法框架,有效解决了大模型在稀疏反馈场景下的持续个性化对齐难题。# 大模型# 个性化对齐# 持续学习# 用户嵌入# 自评估
arXiv 机器学习✦ 精选AI 评分 70/10012:00

ChipMEM:面向电子设计自动化智能体的基于验证记忆机制

基于大语言模型的智能体可利用电子设计自动化(EDA)工具,根据综合与验证反馈生成并修正寄存器传输级(RTL)设计。然而,现有方法通常在产生经验的同一任务上评估提炼的技能或奖励模型,容易诱发针对特定任务的反复修改,而非沉淀出可迁移的复用知识。为此,论文提出了名为 ChipMEM 的基于验证的记忆机制(注:输入摘要在介绍 ChipMEM 具体细节处被截断)。

阅读原文 ↗推荐理由:针对芯片设计自动化智能体中反馈难以迁移为复用经验的痛点,提出了新的记忆架构思路。# EDA# 大模型# 智能体# 芯片设计# RTL
arXiv 机器学习✦ 精选AI 评分 78/10012:00

大型推理模型推理阶段能力与效率的扩展规律研究

该研究探讨了大语言模型在推理任务中的“能力”(解题正确率)与“效率”(所需资源消耗)两个核心维度。当模型利用思维链(CoT)处理不同难度的问题时,正确率和所需Token数量均受问题难度与模型规模影响,但两者的联合作用机制此前尚不明确。研究采用分层贝叶斯方法建模分析,旨在揭示模型规模与问题难度如何共同影响推理期的能力与效率扩展。(注:原文摘要存在截断)

阅读原文 ↗推荐理由:聚焦当前热门的推理阶段扩展(Inference-time Scaling)规律,对理解模型推理成本与能力的平衡具有学术参考价值。# 大模型# 思维链# 推理扩展# 推理效率# Scaling Law
arXiv 机器学习✦ 精选AI 评分 68/10012:00

fMRI基础模型扩展法则实证研究

针对功能性磁共振成像(fMRI)基础模型中数据规模、模型大小与算力关系尚不明确的问题,研究团队进行了一项系统性的对照实证扩展研究。该研究汇聚了超过200个源数据集的预训练数据,消耗逾10,000个GPU时。在固定预训练框架与下游评测协议的条件下,系统探究了数据量、参数量和训练时长的协同变化规律,结果显示下游任务性能总体上随着计算量的增加而提升。

阅读原文 ↗推荐理由:该研究系统性探索了fMRI神经影像基础模型的扩展法则,为脑科学与医学影像大模型设计提供了重要实证参考。# fMRI# 大模型# 扩展法则# 神经影像# AI医疗
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LLMAE:将预训练大语言模型改造为高保真连续文本自编码器

针对自回归语言模型仅能通过序列分解间接表示全局结构、缺乏类似图像领域的忠实连续表征这一问题,研究人员提出了LLMAE方法。该方法将预训练的仅解码器(decoder-only)大语言模型重新利用为连续文本自编码器,通过在其内部激活状态中构建一个中间固定长度的潜在瓶颈(latent bottleneck),成功为文本生成提供了可操作的高保真连续潜空间表征。

阅读原文 ↗推荐理由:探索了利用预训练LLM构建文本连续潜空间的新架构方法,对文本生成与表征学习具有重要参考价值。# 大模型# 自编码器# 连续潜空间# 模型架构# 表征学习