AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

EMPATH:追踪危机心理咨询对话中的多层级情绪动态

针对以往计算方法常将情绪视为静态单句标签的局限,研究人员提出了 EMPATH 计算框架,用于在多粒度层面理解心理健康危机干预对话中的情感动态。该框架涵盖单轮标签、状态转移概率和全局对话原型三个维度。将其应用于涉及哀伤议题的危机文本对话分析后,研究揭示了求助者持续的负面情绪特征、向希望的逐步转变趋势,以及求助者与志愿者之间截然不同的情绪角色与异质的心理恢复轨迹。

阅读原文 ↗推荐理由:该研究提出了建模危机干预对话情绪动态的多粒度新框架,推进了NLP在心理健康支持领域的深入分析。# 自然语言处理# 情感分析# 人机交互# 情感计算
arXiv 机器学习✦ 精选AI 评分 65/10012:00

可解释性可视化的多语言适配缺陷:SHAP与LIME在从右至左语言中的渲染校正

针对SHAP和LIME等事后解释方法在阿拉伯语、波斯语、乌尔都语和希伯来语等从右至左(RTL)语言中出现的可视化失效问题,该研究进行了系统评估与修正。论文指出,尽管特征归因在数学计算上依然有效,但现有可视化渲染会导致词元顺序错乱、连字符断裂及图表阅读方向错误。研究将此界定为可视化层面的工程缺陷,并提出了针对性的度量基准与渲染校正方案。

阅读原文 ↗推荐理由:揭示并修复了主流AI可解释性工具在非拉丁语系中的可视化渲染缺陷,增强了多语言环境下的模型透明度。# 可解释AI# SHAP# LIME# 自然语言处理# 多语言
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

经典语义抽取式文本摘要能否在印地语中进行评估?一项复现研究

该论文复现了Mohd等人在2020年提出的基于分布语义的抽取式文本摘要方法,并将其适配至印地语,在每个语言特定步骤中均替换为适配天城文的组件。研究在XL-Sum印地语部分和FIRE ILSUM 2.0 Hindi两个语料库上进行了评估,采用适配天城文的ROUGE指标进行对比。实验结果显示,在原论文发表的等权重配置下,该复现系统的表现显著劣于简单的基线方法(如选取前三句)。

阅读原文 ↗推荐理由:该研究探讨了低资源语言(印地语)下经典抽取式文本摘要算法的复现与适配问题,对NLP鲁棒性评估有参考价值。# 文本摘要# 模型复现# 自然语言处理# 前沿研究
arXiv 人工智能✦ 精选AI 评分 68/10012:00

可验证奖励强化学习在小型搜索智能体中的应用研究

该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。

阅读原文 ↗推荐理由:探索了端侧极小参数模型直接利用GRPO和可验证强化学习进行搜索问答训练的新路径。# 强化学习# 搜索智能体# 小模型
arXiv 机器学习✦ 精选AI 评分 75/10012:00

感知数据修订的时间序列基座模型VINTAGE-TS

针对宏观经济等统计机构常对历史发布数据进行事后修订、导致模型训练容易引入前瞻偏差的问题,研究人员提出了具备数据修订感知能力的时间序列基座模型VINTAGE-TS。该架构明确区分了“观察时间”与“信息可用时间”,避免将单一版本假定为最终真值,而是同时预测下一周期的首次发布值及其发布后固定时间跨度内的修订值,从而更贴合真实场景下的时序预测需求。

阅读原文 ↗推荐理由:针对现实数据中普遍存在的历史修订与前瞻偏差痛点,提出了创新的时间序列基座模型架构。# 时间序列# 大模型# 深度学习# 前沿研究
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

连续扩散语言模型推理突破:ELF-REG将连续扩散架构扩展至数学与代码任务

该研究针对全连续扩散语言模型(dLM)在复杂推理任务中落后于自回归(AR)模型的难题,提出了ELF-REG架构。研究团队将嵌入语言流(ELF)拓展至GSM8K、MATH-500、HumanEval等数学与代码基准,并引入结合表征对齐与纠缠的机制(REPA+REG),通过冻结的AR教师模型监督中间去噪步骤,有效提升了连续扩散模型并行解码与复杂逻辑推理的扩展能力。

阅读原文 ↗推荐理由:探索了利用连续扩散模型替代自回归架构解决复杂推理与代码生成的前沿方向,具有较高的学术创新价值。# 扩散语言模型# 非自回归# 模型架构# 数学推理# AI编程
arXiv 自然语言处理✦ 精选AI 评分 65/10012:00

标签感知型结构化文本翻译:系统化理解与方法探索

互联网文本中广泛存在承载结构、语义与功能的格式标签,而当前基于大语言模型的翻译系统在处理此类文本时,难以兼顾翻译流畅度与标签保真度。该研究提出应从数据合成、能力构建和多目标对齐三个层面系统化解决这一问题。在数据层面,论文形式化定义了合成数据生成过程中结构标签多样性与翻译自然度之间的权衡关系,为优化带标签文本翻译提供了新视角。

阅读原文 ↗推荐理由:针对大模型在结构化与带格式文本翻译中保真度不足的痛点,提出了涵盖数据合成与对齐的系统化框架。# 大模型# 机器翻译# 结构化文本# 合成数据# 多目标对齐
arXiv 人工智能✦ 精选AI 评分 78/10012:00

多任务模型中的跨任务关系学习:在YouTube生产推荐系统中的落地验证

该研究提出了一种在多任务模型中学习跨任务关系的新框架。该框架通过针对性的成对关系来近似任务标签的联合分布,从而在避免对完整联合空间建模的高昂复杂度下,利用迁移学习提升模型性能与信息抽取能力。该方法具备通用性,并在YouTube生产级推荐系统(涵盖通知、主页及“接下来播放”等场景)中完成部署验证,实验表明其显著提升了预测准确率与用户满意度。

阅读原文 ↗推荐理由:提出了一种高效逼近任务标签联合分布的多任务学习框架,并在YouTube超大规模工业推荐场景中得到有效落地与验证。# 多任务学习# 推荐系统# 迁移学习# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 65/10012:00

孟加拉语长文本语音合成数据集BanglaKontho发布

针对孟加拉语在神经文本转语音(TTS)领域缺乏高质量长文本朗读资源的现状,研究人员推出了BanglaKontho数据集。该数据集源自专业有声读物录音,包含20小时单人发音数据、7050条经转写校验的24 kHz切分片段,旨在解决现有语料缺乏长文本韵律与连贯叙述的问题。此外,研究团队还发布了支持孟加拉风格数字分组、货币与日期表达的文本正则化工具。

阅读原文 ↗推荐理由:填补了世界第七大语言孟加拉语在长文本神经语音合成领域的高质量专业有声读法语料空白。# 语音# 数据集# 文本正则化
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

基于嵌入空间离群值的前瞻性新兴主题预测研究

该研究探讨了如何仅利用文档发表时的初始信息,前瞻性地从嵌入式主题模型的离群点中识别新兴主题的弱信号。在基于嵌入的主题建模中,部分最初被视作散乱噪声的文档未来可能会演化为新兴主题的基石,但在当时极难与普通噪声区分。研究通过追踪离群文档后续的发展轨迹构建标签体系,探索如何提前区分能够催生新主题的先兆离群点与单纯强化既有主题或作为背景噪声的文档,为趋势前瞻发现提供了新方法。

阅读原文 ↗推荐理由:探索了从嵌入空间离群噪声中前瞻性挖掘新兴主题的算法思路,对科技趋势预测和主题建模研究具有参考价值。# 主题模型# 嵌入空间# 弱信号识别# 趋势预测# 自然语言处理
arXiv 机器学习✦ 精选AI 评分 70/10012:00

SGA:面向时间序列基础模型多步预测的不确定性量化方法

该论文针对时间序列基础模型(TSFM)在长周期多步预测中面临的固有不确定性问题展开研究。现有模型在各时间步衍生出的预测分支会向后续步骤扩散,导致预测表现不一并削弱了结果的可信度。为此,作者提出了切片-图化-对齐(SGA)方法来对该不确定性进行量化。因原始摘要结尾截断,关于 SGA 方法的具体机制与实验效果等信息不足。

阅读原文 ↗推荐理由:针对时间序列基础模型在长周期预测中不确定性扩散的技术痛点,提出了一种专门的量化方法。# 时间序列# 大模型# 不确定性量化# 多步预测# 前沿研究
arXiv 人工智能✦ 精选AI 评分 72/10012:00

人机协同假设检验:基于成本感知的AI筛选评分与序贯人工复核机制

该研究针对大语言模型作为低成本评审员在统计推断中的局限性展开探讨。研究指出,AI评估往往存在偏差和噪声,而严谨的假设检验必须明确控制第一类和第二类错误。为此,论文提出了一种人机协同的假设检验方案,结合成本感知的AI选择性评分与序贯人工核验升级机制,旨在满足严格统计推断有效性与错误率控制的前提下,最大限度降低整体评估成本。

阅读原文 ↗推荐理由:针对LLM作为评估员的噪声与偏差问题,提出了兼顾统计严谨性与成本效益的人机协同检验方法。# 大模型# LLM-as-a-Judge# 假设检验# 人机协同# 统计推断
arXiv 自然语言处理✦ 精选AI 评分 72/10012:00

EAGER:基于可验证奖励强化学习增强生成式事件抽取

针对大语言模型在端到端事件抽取中面临的多任务协同挑战,研究人员提出了名为 EAGER 的强化学习框架。该方法将细粒度可验证奖励与基于模式对比的优势估计机制相结合,有效缓解了稀疏二元奖励导致的优势崩溃问题。其奖励设计针对结构有效性、抽取准确性、扎根性、覆盖率和跨度精度等多维度指标进行了优化,显著增强了生成式事件抽取的准确性与鲁棒性。

阅读原文 ↗推荐理由:提出结合细粒度可验证奖励与对比优势估计的强化学习框架,为提升大模型复杂结构化信息抽取能力提供了新方案。# 强化学习# 事件抽取# 大模型# 可验证奖励# 自然语言处理
arXiv 机器学习✦ 精选AI 评分 65/10012:00

TAM-Chain:结合吸收马尔可夫链与香农熵的多尺度甲状腺细胞学分类框架

针对甲状腺细针穿刺活检在深度学习分类中面临的高假阴性率及临床域偏移下的过度自信问题,研究人员提出了 TAM-Chain 框架。该研究结合吸收马尔可夫链理论与基于香农熵的不确定性量化方法,在 10x、20x 和 40x 等多尺度下动态建模特征提取过程,旨在抑制假阴性漏诊并增强跨域适应能力,提升早期甲状腺癌病理诊断的可靠性。

阅读原文 ↗推荐理由:该研究创新性地将吸收马尔可夫链与不确定性量化引入多尺度医学图像分类,针对性解决了临床漏诊痛点。# 计算机视觉# 马尔可夫链# 不确定性量化# 医疗AI
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

后训练会在无关决策中留下行为阴影:新型主动无任务蒸馏方法提出

最新研究发现,大语言模型的能力可以通过与目标任务无关的文本进行传递。传统后训练通常依赖任务特定数据,而研究团队提出了一种“主动无任务蒸馏”(ATD)方法,仅需教师模型针对每个提示生成一个词即可实现能力转移。该方法揭示了后训练会在任务无关的决策中留下可被探测的“行为阴影”,突破了此前潜意识学习研究需依赖大量生成的限制,深化了对模型后训练表征变化及知识蒸馏机制的理解。

阅读原文 ↗推荐理由:该研究揭示了语言模型后训练中能力隐式转移的新机理,提出的单词蒸馏方法对模型对齐与泛化研究具有重要启发。# 大模型# 后训练# 蒸馏# 潜意识学习# 模型行为分析
arXiv 机器学习✦ 精选AI 评分 75/10012:00

学习发现有价值的数学定理:量化 AI 数学发现的趣味性

该研究探讨了大语言模型在数学定理推测与证明中的价值评估问题。针对 AI 产出的大量新数学定理是否“有趣”或“有用”这一开放课题,作者提出了定理内在趣味性(Intrinsic Interestingness)的量化定义,即定理的证明长度与其命题陈述长度之比。实验表明,该指标与定理在下游的外在价值度量强相关,为评估和引导 AI 拓展高价值数学知识提供了新路径。

阅读原文 ↗推荐理由:针对 AI 自动定理发现中“价值判断”难题提出了具体的量化指标,对 AI for Math 研究具有启发意义。# 大模型# AI数学# 定理证明# 前沿研究# 知识发现
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

天下没有免费的午餐:语料库规模扩大下的任务复杂度研究

针对超大语料库场景下不同任务难度的本质差异,该研究提出了“语料任务复杂度”(CTC)概念,根据任务难度随语料规模增长的规律来刻画任务特性。例如,基础检索任务仅需对语料库进行单次线性扫描,而查找矛盾等深层任务则需对呈二次方增长的主张对进行比对。研究指出以往工作在此类复杂度分析上的局限,为理解和评估大规模语料下的模型任务提供了新的计算理论视角。

阅读原文 ↗推荐理由:提出了语料任务复杂度(CTC)的新概念,为分析大模型在海量语料下的计算瓶颈提供了前沿理论框架。# 自然语言处理# 语料任务复杂度# 计算复杂度# 大模型# 前沿研究
arXiv 机器学习✦ 精选AI 评分 65/10012:00

融合物理信息的自监督学习用于多线平行板雪崩计数器校准与位置重建

针对多线平行板雪崩计数器(MWPPAC)传统校准依赖标注数据、难以适应工况变化与设备老化的问题,研究人员提出了一种物理信息自监督学习框架。该框架无需标注的位置测量或专用校准测量,即可联合实现探测器导线校准与粒子相互作用位置的高精度重构,显著提升了科学探测仪器在长期运行中的自适应能力。

阅读原文 ↗推荐理由:提出了一种将物理先验与自监督学习结合的新方法,用于解决物理探测仪器的无标注校准难题。# AI for Science# 自监督学习# 物理信息模型# 探测器校准# 前沿研究
arXiv 人工智能✦ 精选AI 评分 68/10012:00

PFArena:面向蛋白质修饰语言模型的全新评测基准

针对蛋白质修饰中序列空间庞大且湿实验验证成本高的问题,研究人员推出了名为 PFArena 的评测基准。尽管蛋白质语言模型(PLM)、大语言模型(LLM)及智能体在蛋白质修饰领域展现出潜力,但其在实际实验决策场景中的相对表现尚不明确。PFArena 包含四个受控任务接口,覆盖单突变体生成与多突变体排序,通过提供不同梯度的突变适应度数据,系统性评估各类模型在蛋白质设计与修饰任务中的决策能力。

阅读原文 ↗推荐理由:针对蛋白质工程与AI for Science领域,提出了评估语言模型和智能体修饰能力的标准化基准。# AI for Science# 蛋白质语言模型# 大模型# 评测基准# 蛋白质工程
arXiv 机器学习✦ 精选AI 评分 60/10012:00

UO-FIE:结合精确标签监督与分级效用的中文事实性推理系统

针对FIE2026中文事实性推理评估任务中的类别严重不平衡(单类别占64.1%)及兼顾精确度与邻近区间惩罚的评价机制,研究人员提出UO-FIE系统。实验发现mDeBERTa分类模型易偏向多数类,而Huber回归基线虽能落在相近区间但精确匹配率低。UO-FIE采用参数高效架构,综合精确标签监督与分级效用设计,改善了九分类有序事实性区间的推断表现。

阅读原文 ↗推荐理由:针对中文事实性推理中的长尾数据与有序分类指标提出了结合精确监督与分级效用的有效改进方案。# 事实性推理# 自然语言处理# 有序分类# mDeBERTa# 数据不平衡
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于贝叶斯情境化价值对齐的大语言模型个性化研究

针对大语言模型个性化价值对齐中常采用静态画像、忽视情境对价值偏好动态影响的局限,研究人员受勒温场论启发,提出将个人价值观建模为先验、情境依赖偏好建模为后验的新范式。基于此,该研究提出了名为 BaCVA 的推理时贝叶斯情境价值对齐方法,使模型输出能够结合用户内在特质与具体环境约束,实现更动态、情境化的个性化对齐。

阅读原文 ↗推荐理由:提出结合心理学场论的贝叶斯情境价值对齐新框架,突破了传统静态对齐的局限。# 大模型# 对齐# 个性化# 贝叶斯推断
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

研究揭示思维链前缀指令或导致视觉语言模型答案解码失效

最新研究探讨了视觉语言模型(VLM)在多项选择评测中存在的解码陷阱。当评测系统追加思维链(CoT)推理提示,却在模型生成完整推理过程前直接读取答案标签的对数几率时,会导致严重的评估失真。实验显示,Qwen2.5-VL-7B在ScienceQA任务上的准确率从80.76%骤降至45.48%,且超93%的预测倾向于选择首个选项。探针测试证实隐藏层仍保留正确答案,表明失效源于不当的即时读取机制。

阅读原文 ↗推荐理由:揭示了多模态大模型在思维链评测中的隐蔽解码偏差及机理,对大模型基准测试具有重要指导意义。# 视觉语言模型# 思维链# 评测# Qwen-VL# 解码机制
arXiv 机器学习AI 评分 55/10012:00

R语言工具包fable.intermittent发布:用于间歇性时间序列的概率预测基准测试

针对备件需求与零售销售中常见的间歇性时间序列,由于预测误差成本通常不对称,库存控制等决策需要完整的概率分布而非单点预测。此前相关方法分散于不同软件框架中难以系统比较,该研究推出了R语言工具包fable.intermittent。该工具包在fable框架下集成了多种针对间歇性序列的概率预测方法,为相关领域的算法开发与标准化性能比对提供了统一工具。

阅读原文 ↗推荐理由:该工具包为间歇性时间序列的概率预测提供了统一的基准测试框架,对供应链管理与库存优化预测具有参考价值。# 时间序列# 概率预测# 评测# 供应链
arXiv 人工智能✦ 精选AI 评分 78/10012:00

基于轨迹图估算单步优势:面向智能体强化学习的新方法

以GRPO为代表的分组强化学习已成为训练推理与智能体大模型的主流范式。然而,这类方法在全轨迹层面的优势估计虽然可靠,但在单步层面上存在系统性偏差,粗粒度的轨迹级反馈难以准确评估单个步骤的实际贡献(例如失败轨迹中往往包含有价值的操作步骤)。论文回归强化学习基础定义,提出通过构建轨迹图来精确估计步骤级优势,以解决多轮复杂智能体任务中的信用分配难题并提升模型训练效果。

阅读原文 ↗推荐理由:针对当前热门的GRPO算法在多步智能体任务中粗粒度优势估计的痛点,提出了有效的步骤级信用分配改进方案。# 强化学习# 智能体# 大模型# 模型训练
arXiv 自然语言处理✦ 精选AI 评分 72/10012:00

研究发现大语言模型中语法“祖母神经元”罕见,提出无探针分析框架

理解大语言模型(LLM)如何编码语言结构是可解释性研究的核心难题。传统的诊断分类器(探针)方法存在引入容量混淆与校准偏差等局限,往往难以区分模型自身的内禀表征与探针本身的拟合能力。为解决这一问题,该研究提出了一个无探针(probe-free)框架,用于在单个神经元层面上定位语言选择性,探索模型内部表征机制。

阅读原文 ↗推荐理由:针对大模型可解释性中探针方法的固有缺陷,提出了在神经元级别分析语言表征的全新无探针框架。# 大模型# 可解释性# 表征学习# 神经网络# 前沿研究
arXiv 机器学习✦ 精选AI 评分 72/10012:00

基于自旋玻璃理论:可验证奖励强化学习(RLVR)在迭代乘法任务中的优化景观可呈良态

该论文研究了带有可验证奖励的强化学习(RLVR)在迭代群与拟群乘法等算法任务中的优化景观,探讨其学习新推理能力的极限。作者将近视表格策略下的熵正则化RLVR映射到确定性策略的自旋玻璃能量模型,不仅给出了RLVR能力的理论上限,还严格刻画了表格环境下的景观特征。理论与实验表明该优化景观可以是良态的;因原文摘要截断,具体实验细节未完全展开。

阅读原文 ↗推荐理由:引入统计物理中的自旋玻璃理论深入分析RLVR的优化景观,为理解大模型推理与强化学习机制提供了坚实的理论工具。# 强化学习# 自旋玻璃# 数学推理# 模型优化
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

大模型自动批卷的成败边界:两门计算机考试的实证研究

一项来自学术界的新研究评估了大语言模型(LLM)用于高校考试自动评分的可靠性与局限。研究团队在包含570名学生的计算机视觉考试上测试了开源与闭源模型的171种配置。结果显示,最优模型的平均绝对误差达到1.64/35,甚至优于两位人类评分员之间2.61/35的分歧水平。然而实验发现模型对提示词极度脆弱:加入一句简短的“严格评分”提示,便导致17个开源模型中的14个评分严重失常,甚至有模型直接停止评分。

阅读原文 ↗推荐理由:通过严谨实证揭示了大模型在主观题阅卷中的高精度潜力与对提示词微调的极端脆弱性。# 大模型# 评测# 自动阅卷# 提示词工程# 计算机教育
arXiv 机器学习✦ 精选AI 评分 68/10012:00

OPDiv:用于高分且多样化候选化合物最优筛选的算法

针对虚拟药物筛选中候选分子众多但实际合成与测试资源受限的痛点,研究人员提出了OPDiv多样性选择与评估算法。在化合物筛选过程中,高预测分数与分子结构多样性往往存在权衡取舍。该算法基于整数优化技术,能够在保证化合物高评分的同时最大化样本多样性,自动计算出最优的Top-K分子子集,为药物发现后期的合成验证提供更高效的决策支持。

阅读原文 ↗推荐理由:提出了一种基于整数优化的分子筛选算法,有效解决了AI药物发现中化合物评分与结构多样性难以兼顾的核心权衡难题。# 医疗AI# 虚拟筛选# 整数优化# 前沿研究
arXiv 机器学习✦ 精选AI 评分 75/10012:00

超越静态图世界模型:面向动态演化拓扑的随机潜空间动力学学习

针对现有基于图的世界模型多局限于固定拓扑或确定性、完全可观测环境的问题,研究人员提出了图动力学模型(GDM)。该模型专为图结构观测设计,能够处理在随机和部分可观测环境中拓扑结构动态演化的更通用场景。GDM利用稀疏循环邻接矩阵对拓扑更新进行建模并执行消息传递,结合循环状态空间机制以捕捉潜空间动力学。

阅读原文 ↗推荐理由:提出了一种能够处理动态拓扑与部分可观测环境的新型图世界模型,拓展了关系表征学习的研究前沿。# 世界模型# 图神经网络# 强化学习# 动态拓扑# 表征学习
arXiv 自然语言处理✦ 精选AI 评分 72/10012:00

稀疏自编码器隐空间中作为涌现类别的词性结构研究

该研究探讨了稀疏自编码器(SAE)在解析语言模型内部表征时揭示的语言学结构。作者以词性(PoS)类别为受控实验案例,分析形态句法信息究竟是由单个隐特征还是结构化特征组所编码。实验表明,词性差异高度可从SAE激活中恢复,但并非简单的一对一隐变量映射,且该恢复能力无法归结为单纯的词汇记忆,同时开放类与封闭类词性在表征特性上存在显著差异。

阅读原文 ↗推荐理由:聚焦大模型机制可解释性前沿,探讨了稀疏自编码器在解析语言形态句法表征时的有效性与结构特征。# 稀疏自编码器# 可解释性# 语言模型# 表征学习# 计算语言学