AIDC
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

注意力路由提前稳定:面向循环语言模型的工作集推理机制

针对循环语言模型在每个循环步骤重复计算全局注意力导致的高开销问题,研究人员分析了跨循环深度的注意力动态。研究发现,注意力分布和支撑集稳定的时间显著早于隐藏状态与输出,呈现出两阶段特征:前期步骤先确定相关上下文的稀疏工作集,后期步骤则在基本固定的路由支撑上细化表征。基于该发现,论文提出了名为 WISE 的工作集推理方法以优化推理过程(原文摘要末尾有所截断)。

阅读原文 ↗推荐理由:揭示了循环语言模型中注意力路由提前稳定的关键特性,为长序列与循环推理加速提供了新思路。# 循环语言模型# 注意力机制# 推理# 深度学习
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

协同推理路径的规划型测试时扩展方法 PTTS

针对复杂推理任务,并行分支的测试时扩展(Test-Time Scaling)已得到广泛应用,但传统的独立重复采样容易生成冗余尝试,制约了推理算力增加所带来的收益。为此,研究团队提出了规划型测试时扩展(PTTS)方法,以协调的联合策略取代独立采样。该架构通过规划器为各个分支生成解答大纲,引导不同分支探索差异化的推理路径,再由执行器生成完整解答,从而提升计算效率和推理表现。

阅读原文 ↗推荐理由:针对当前大模型推理阶段算力扩展的核心瓶颈,提出了协调多分支推理路径的有效规划策略。# 测试时扩展# 大模型# 推理路径# 规划器# 并行采样
arXiv 自然语言处理✦ 精选AI 评分 65/10012:00

越南劳动法跨语言法律问答:检索、翻译与验证器引导修正

针对跨语言法律问答中跨语言法条检索及避免无依据主张的挑战,研究者推出了基于越南劳动法的双语评估基准,包含231个越英问答对,其中75个针对五类法律推理现象进行了额外标注。研究评估了一种验证器引导的流程,该流程将答案拆解为主张,检测引用可达性与蕴含关系,并纠正引用失效及事实矛盾。此外,该研究还提出了六种用于评估检索证据忠实度的自动化诊断指标。

阅读原文 ↗推荐理由:针对特定领域法律问答构建了跨语言基准与验证纠错流程,有助于解决大模型法律推理中的幻觉与引用失真问题。# 法律AI# 跨语言问答# 验证器# RAG# 忠实度评估
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

MORSE:通过反向评分优化多上下文排序以实现证据保留压缩

该研究探讨了基于似然的多上下文压缩技术对上下文输入顺序的高度敏感性问题。实验表明,相同上下文集合的不同排列顺序会导致显著不同的关键证据保留结果。论文将这种敏感性归因于“信息抢占”现象,即较早出现的部分相关上下文会提前消耗共享信息的置信度权重,从而压低后续更关键证据载体的增量评分,大幅增加强证据被错误删除的风险。研究通过受控干预实验深入分析了该机制。

阅读原文 ↗推荐理由:深入揭示了多上下文压缩中由信息抢占导致的顺序敏感问题,对长文本证据保留与压缩优化具有重要参考价值。# 上下文压缩# 长上下文# 信息抢占# 大模型# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

AraGenre 2026:基于定义指导的层级阿拉伯语文体分类评测任务

针对阿拉伯语等低资源语言标注数据稀缺的问题,AraGenre 2026 评测任务提出了一种基于定义指导的层级阿拉伯语文体分类基准。该任务要求系统为文本分配宽泛的交际文体以及细粒度的具体文体标签。其公开的训练与开发集主要包含有限的合成与受控样本,而最终测试基准则涵盖了包含现代标准阿拉伯语、古典阿拉伯语及多种方言的真实噪声文本,旨在评估模型利用自然语言定义进行文本分类的泛化能力。

阅读原文 ↗推荐理由:针对低资源语言场景推出了结合层级结构与定义指导的阿拉伯语文体分类评测基准。# 自然语言处理# 文本分类# 评测基准# 低资源语言
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

PRISM-VLM:面向紧凑型视觉语言模型的多维度判别评测基准

针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。

阅读原文 ↗推荐理由:针对轻量级多模态模型评测区分度不足的痛点,提出了涵盖多失效模式的细粒度评测体系。# 视觉语言模型# 评测# 多模态# 紧凑模型
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

DPara:结合并行草稿器与并行投机解码的高效推理框架

针对大模型推理加速,现有并行投机解码(PSD)虽能重叠草稿生成与验证过程,但往往依赖对接受前缀和额外标记的预先猜测,猜错会导致批处理回退至低效的串行起草。论文提出 DPara 框架,在复用高效并行草稿器的同时,确保目标模型验证与起草阶段在每一轮均实现重叠,彻底消除了概率性回退缺陷,保障了投机解码流水线的高效利用。注:素材末尾存在文本截断。

阅读原文 ↗推荐理由:提出 DPara 框架解决了并行投机解码中因猜测失误而退化为串行的痛点,进一步提升大模型推理吞吐与时延表现。# 投机解码# 大模型# 推理# 并行计算# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

EviStreams:面向医学系统评价的人机协同 AI 数据提取平台

针对医学系统评价中数据提取高度依赖人工且必须遵循严格协议与可审计要求的痛点,研究团队推出了开源、无代码的 Web 平台 EviStreams。该平台引入人在回路的大语言模型辅助机制,不仅契合双人独立提取、裁决仲裁的标准审查流程,还能记录完整的数据生成审计日志,使科研团队在关键阶段自主把控 AI 提取过程,显著缓解临床指南研制中的专家人力瓶颈。

阅读原文 ↗推荐理由:针对医学文献综述这一高标准流程,提出符合严格临床协议的人机协同开源 AI 提取平台。# 医学AI# 数据提取# 人在回路# 大模型# 开源
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Uncheatable Eval:基于动态压缩机制的语言模型防污染评估基准

针对现代大语言模型因海量预训练数据导致基准泄露、评估可靠性受损的问题,以及基座模型因指令遵循能力受限而难以通过任务型标准评估的挑战,研究人员提出了 Uncheatable Eval。该动态基准通过定期采集最新发布的文本来评估基座语言模型,以规避数据污染风险,并利用模型预测能力与文本压缩能力之间的关联设计评估机制。原摘要在方法细节处截断。

阅读原文 ↗推荐理由:针对大模型评测中普遍存在的数据污染痛点,提出结合动态数据与压缩理论的新评估方案,具较高学术参考价值。# 大模型# 评测# 数据污染# 文本压缩
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

ThaiTrees:多领域泰语句法依存树库与处理流水线

针对泰语缺乏用于定量句法研究的大规模自动解析语料库的问题,研究团队推出了 ThaiTrees。该语料库规模达 3.42 亿词元(tokens),涵盖新闻、维基百科、口语转录及社交媒体等多个领域。此外,研究人员在通用依存(Universal Dependencies)框架下构建了一套可复现的泰语文本清洗、预处理和句法解析流水线,为泰语的定量句法分析和语言学研究提供了有力的数据支撑。

阅读原文 ↗推荐理由:推出了包含 3.42 亿词元的多领域泰语依存句法语料库及解析流水线,填补了泰语大规模计算句法资源的空白。# 自然语言处理# 句法分析# 泰语语料库# 依存树库# 通用依存