AIDC
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

LexLattice:基于文档层级与神经元胞自动机的多语言抽取式摘要模型

在法律文本摘要中,真实性至关重要,因而通常采用内容可溯源的抽取式方法。但现有方法多孤立评估段落等结构单元,忽视了长距离分散证据的有效整合。研究人员提出抽取式摘要模型 LexLattice,将法律文书的层级结构具象化为二维语义网格,并在选择文本前利用带掩码的二维神经元胞自动机对其进行跨区域特征整合,以改善证据整合能力与摘要质量。

阅读原文 ↗推荐理由:创新性地将二维神经元胞自动机应用于长文档层级结构建模,为法律领域的抽取式摘要提供了新架构思路。# 抽取式摘要# 神经元胞自动机# 法律文本# 自然语言处理# 长文本建模
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

研究人员开源ISAAC大规模社会态度语料库,覆盖超5.27亿条Reddit帖子

研究人员推出了伊利诺伊社会态度综合语料库(ISAAC)及其可复现的处理流水线。该语料库汇集了2007年至2023年间超过5.27亿条英文Reddit帖子,重点围绕种族、性取向、年龄、身体能力、体重和肤色六大社会群体维度。通过多步骤的人工审计过滤流程,各分类的不相关内容比例均控制在10%以下,并且每条帖子均通过算法标注了用户的推断居住区域等元数据,为大规模分析社会群体话语提供了开放工具。

阅读原文 ↗推荐理由:发布了跨度长达17年、规模超5亿条的高质量社会群体话语标注语料库,为自然语言处理与计算社会科学研究提供了重要资源。# 语料库# 数据工程# 自然语言处理# 社交网络# 计算社会科学
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

事实核查评分提升由何驱动?针对验证模型与大语言模型的证据与答案归因研究

该论文探讨了联合事实核查评分提升背后的机制,分析在固定答案的前提下证据质量对综合评分的独立贡献。研究基于FEVEROUS基准数据集中的7,890条声明及4个DeBERTa模型检查点展开实验。结果显示,将DCUF证据替换为UnifEE证据后,严格核查评分显著提升9.61个百分点,而答案准确率仅提高1.96个百分点。该研究通过细粒度归因,揭示了高质量证据检索对联合事实核查评估指标的决定性影响。

阅读原文 ↗推荐理由:深入解耦了事实核查任务中证据检索与预测答案对评分的各自贡献,为大模型事实性评估提供了严谨的分析框架。# 事实核查# 大模型# 评测# 自然语言处理# DeBERTa
arXiv 自然语言处理✦ 精选AI 评分 62/10012:00

NADI 2026:第二届多方言阿拉伯语语音处理共享任务发布

NADI 2026 是精细阿拉伯语方言识别(NADI)系列的第七届共享任务,也是第二次专注于多方言阿拉伯语语音处理的评测。本届任务包含五项核心任务与八个子任务,覆盖自动语音识别(ASR)、方言识别(SDID)、语音合成(TTS)、语音翻译(SLT)和口语理解(SLU)。该评测重点关注低带宽、混合方言、语码转换、域外及零样本等真实场景,并首次在该系列中引入了 TTS、SLT 和 SLU 赛道。

阅读原文 ↗推荐理由:该任务系统性推进了多方言及低资源阿拉伯语语音处理的基准建设,涵盖多项复杂真实场景评估。# 语音处理# 阿拉伯语方言# 评测# 语音
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

RECAP:面向大语言模型高效推理的冗余感知归因学习

针对大语言推理模型常生成正确却冗长低效的推理链问题,现有优化方法多依赖轨迹级或局部标记信号,未能充分建模步骤间的语义依赖,导致难以有效区分冗余步骤与关键支撑步骤。研究团队提出了 RECAP(通过传播实现的冗余感知信用分配)方法。该方法基于推理步骤在后续推导中的实际下游作用精准分配信用,从而在确保模型推理准确率的前提下精简推理过程,显著提升推理效率。

阅读原文 ↗推荐理由:针对大语言模型推理过程冗长低效的痛点,提出了通过建模步骤依赖关系来精简推理链的新算法。# 大模型# 高效推理# 思维链# 模型优化# RECAP
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

基于证据融合的LLM长文本价值测量新方法TEF

在利用大语言模型评估社交媒体长文本的公众价值取向时,文本通常夹杂背景信息、引用及少数关键立场句。现有方法直接预测篇章标签易导致过度自信,而传统的句子级聚合投票则忽视了句子间置信度的差异。为此,研究团队将长文本价值测量构建为决策融合问题,并提出了无需训练的“回火证据融合”(TEF)方法,旨在更有效地聚合模型判断并提升长文本价值衡量的准确性。

阅读原文 ↗推荐理由:提出了一种解决大模型在长文本价值评估中置信度不均衡问题的无训练融合算法。# 大模型# 长文本分析# 证据融合# 观点挖掘# 自然语言处理
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

抓住关键信息:面向大规模复杂推理的原则性上下文表示方法

在科学、医疗、法律和金融等领域解决复杂任务时,通常需要整合分散在海量异构数据源中的关联信息,其规模远超模型自身的上下文长度限制。现有方法多将信息组织为图谱、文本记忆或检索集合等形式以便推理,但其构建方式大多缺乏统一原则。本研究借鉴认知科学等理论,探讨如何规范化构建上下文表示以提升大规模推理能力。由于提供的内容在方法阐述处截断,具体技术细节有待进一步公开。

阅读原文 ↗推荐理由:针对大模型超长异构上下文推理面临的信息组织碎片化痛点,提出了规范化的上下文表示新思路。# 大模型# 上下文表示# 复杂推理# 认知建模# 长上下文
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

超越重叠:评估基准数据泄露对模型性能因果效应的LeakScale框架

训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。

阅读原文 ↗推荐理由:提出了一种基于反事实干预的新框架,有效解决了大语言模型基准数据污染难以量化因果影响的痛点。# 评测# 数据污染# 因果推断# 大模型
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

面向网络生成文本的字素转音素基准 UGTPhon:涵盖多语言与组合式方法

文本转语音(TTS)系统在处理网络生成文本(如缩写 ppl、imo)时,需根据规范表达而非表面拼写来推断发音。为此,研究人员推出了首个针对英语、越南语和韩语网络文本的字素转音素(G2P)基准 UGTPhon,并配套提出用于细粒度诊断的分类体系。测试显示,现有 G2P 模型及前沿大模型在此类文本上的音素错误率(PER)最高落后 66.8 点。研究团队进一步提出了一种结合规范形式证据的组合式 G2P 基线方法。

阅读原文 ↗推荐理由:针对语音合成在处理网络缩写及非规范文本时的发音难题,首创了多语言 G2P 基准与评估分类体系。# 文本转语音# G2P# 评测# 网络文本# 大模型
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

LOCKR:基于隐状态轨迹引导检测与修复扩散语言模型的推理锁定问题

扩散语言模型通过迭代去噪生成文本。研究团队发现该类模型中存在一种“稳定但错误锁定”的推理故障,即答案在去噪阶段早期便过早稳定于错误结果。置信度、熵等常规表层解码信号难以有效区分正误锁定。为此,论文将选择性推理修复建模为轻量级测试时规划任务,并提出了 LOCKR,一种基于隐状态轨迹引导的规划器,专门用于检测与修复该问题。

阅读原文 ↗推荐理由:针对扩散语言模型迭代去噪中过早锁定错误答案的核心缺陷,提出了轻量级测试时规划修复机制。# 扩散语言模型# 推理修复# 隐状态# 测试时计算# 深度学习
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

LatWeave:基于知识格的确定性多跳问答框架

针对现有大语言模型和检索增强生成(RAG)等概率系统易产生幻觉、证据链难以审计及强行作答等缺陷,该研究提出了 LatWeave 框架。LatWeave 将知识组织为多维知识格,并将复杂的多跳问答编译为三个确定性算子:约束交集(meet)、格序比较(compare)与弃权判断(abstain),旨在将知识存储与逻辑推理过程彻底解耦,提供可审计、零幻觉风险且知错能弃权的问答能力。

阅读原文 ↗推荐理由:通过引入形式化知识格与确定性算子,为解决大模型多跳推理中的幻觉与审计难题提供了新范式。# 多跳问答# 知识图谱# 确定性推理# RAG# 模型幻觉
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

Transformer语言模型的序列计算蒸馏方法

针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。

阅读原文 ↗推荐理由:提出了一种动态压缩Token序列以减少Transformer自回归计算开销的高效架构优化方案。# Transformer# 模型压缩# 序列计算# 注意力机制# AI架构
arXiv 自然语言处理✦ 精选AI 评分 73/10012:00

Ruby-ASR:面向正字法与词汇读音联合识别的语音识别监督新方法

针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。

阅读原文 ↗推荐理由:提出创新的监督表征结构,有效解决了日语等语言在语音识别中同字异音的监督信息缺失问题。# 语音# 日语处理# 音素识别# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

基于意图驱动的全双工语音对话轮换评测基准TACT

现有的全双工语音对话模型评测多采用固定窗口规则,机械地通过停顿或打断重叠来判定轮换成败。研究人员指出,响应时机的合理性取决于说话人的潜在意图。为此,该研究提出了评测基准 TACT,包含来自 5 个双人对话语料库的 9,728 个片段(共 73.2 小时),整合了对话历史、说话人记忆画像以及针对 6 类意图的标注,旨在提供更符合人类自然交互习惯的意图条件化轮换评估。

阅读原文 ↗推荐理由:针对全双工语音交互中停顿与重叠评估过于僵化的痛点,提出了符合真实对话意图的新基准。# 全双工语音# 语音对话模型# 轮换机制# 评测基准# 自然语言处理
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

注意力路由提前稳定:面向循环语言模型的工作集推理机制

针对循环语言模型在每个循环步骤重复计算全局注意力导致的高开销问题,研究人员分析了跨循环深度的注意力动态。研究发现,注意力分布和支撑集稳定的时间显著早于隐藏状态与输出,呈现出两阶段特征:前期步骤先确定相关上下文的稀疏工作集,后期步骤则在基本固定的路由支撑上细化表征。基于该发现,论文提出了名为 WISE 的工作集推理方法以优化推理过程(原文摘要末尾有所截断)。

阅读原文 ↗推荐理由:揭示了循环语言模型中注意力路由提前稳定的关键特性,为长序列与循环推理加速提供了新思路。# 循环语言模型# 注意力机制# 推理# 深度学习
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

协同推理路径的规划型测试时扩展方法 PTTS

针对复杂推理任务,并行分支的测试时扩展(Test-Time Scaling)已得到广泛应用,但传统的独立重复采样容易生成冗余尝试,制约了推理算力增加所带来的收益。为此,研究团队提出了规划型测试时扩展(PTTS)方法,以协调的联合策略取代独立采样。该架构通过规划器为各个分支生成解答大纲,引导不同分支探索差异化的推理路径,再由执行器生成完整解答,从而提升计算效率和推理表现。

阅读原文 ↗推荐理由:针对当前大模型推理阶段算力扩展的核心瓶颈,提出了协调多分支推理路径的有效规划策略。# 测试时扩展# 大模型# 推理路径# 规划器# 并行采样
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

MORSE:通过反向评分优化多上下文排序以实现证据保留压缩

该研究探讨了基于似然的多上下文压缩技术对上下文输入顺序的高度敏感性问题。实验表明,相同上下文集合的不同排列顺序会导致显著不同的关键证据保留结果。论文将这种敏感性归因于“信息抢占”现象,即较早出现的部分相关上下文会提前消耗共享信息的置信度权重,从而压低后续更关键证据载体的增量评分,大幅增加强证据被错误删除的风险。研究通过受控干预实验深入分析了该机制。

阅读原文 ↗推荐理由:深入揭示了多上下文压缩中由信息抢占导致的顺序敏感问题,对长文本证据保留与压缩优化具有重要参考价值。# 上下文压缩# 长上下文# 信息抢占# 大模型# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

AraGenre 2026:基于定义指导的层级阿拉伯语文体分类评测任务

针对阿拉伯语等低资源语言标注数据稀缺的问题,AraGenre 2026 评测任务提出了一种基于定义指导的层级阿拉伯语文体分类基准。该任务要求系统为文本分配宽泛的交际文体以及细粒度的具体文体标签。其公开的训练与开发集主要包含有限的合成与受控样本,而最终测试基准则涵盖了包含现代标准阿拉伯语、古典阿拉伯语及多种方言的真实噪声文本,旨在评估模型利用自然语言定义进行文本分类的泛化能力。

阅读原文 ↗推荐理由:针对低资源语言场景推出了结合层级结构与定义指导的阿拉伯语文体分类评测基准。# 自然语言处理# 文本分类# 评测基准# 低资源语言
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

PRISM-VLM:面向紧凑型视觉语言模型的多维度判别评测基准

针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。

阅读原文 ↗推荐理由:针对轻量级多模态模型评测区分度不足的痛点,提出了涵盖多失效模式的细粒度评测体系。# 视觉语言模型# 评测# 多模态# 紧凑模型
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

DPara:结合并行草稿器与并行投机解码的高效推理框架

针对大模型推理加速,现有并行投机解码(PSD)虽能重叠草稿生成与验证过程,但往往依赖对接受前缀和额外标记的预先猜测,猜错会导致批处理回退至低效的串行起草。论文提出 DPara 框架,在复用高效并行草稿器的同时,确保目标模型验证与起草阶段在每一轮均实现重叠,彻底消除了概率性回退缺陷,保障了投机解码流水线的高效利用。注:素材末尾存在文本截断。

阅读原文 ↗推荐理由:提出 DPara 框架解决了并行投机解码中因猜测失误而退化为串行的痛点,进一步提升大模型推理吞吐与时延表现。# 投机解码# 大模型# 推理# 并行计算# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Uncheatable Eval:基于动态压缩机制的语言模型防污染评估基准

针对现代大语言模型因海量预训练数据导致基准泄露、评估可靠性受损的问题,以及基座模型因指令遵循能力受限而难以通过任务型标准评估的挑战,研究人员提出了 Uncheatable Eval。该动态基准通过定期采集最新发布的文本来评估基座语言模型,以规避数据污染风险,并利用模型预测能力与文本压缩能力之间的关联设计评估机制。原摘要在方法细节处截断。

阅读原文 ↗推荐理由:针对大模型评测中普遍存在的数据污染痛点,提出结合动态数据与压缩理论的新评估方案,具较高学术参考价值。# 大模型# 评测# 数据污染# 文本压缩
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

ThaiTrees:多领域泰语句法依存树库与处理流水线

针对泰语缺乏用于定量句法研究的大规模自动解析语料库的问题,研究团队推出了 ThaiTrees。该语料库规模达 3.42 亿词元(tokens),涵盖新闻、维基百科、口语转录及社交媒体等多个领域。此外,研究人员在通用依存(Universal Dependencies)框架下构建了一套可复现的泰语文本清洗、预处理和句法解析流水线,为泰语的定量句法分析和语言学研究提供了有力的数据支撑。

阅读原文 ↗推荐理由:推出了包含 3.42 亿词元的多领域泰语依存句法语料库及解析流水线,填补了泰语大规模计算句法资源的空白。# 自然语言处理# 句法分析# 泰语语料库# 依存树库# 通用依存