基于措辞与选择的二维新闻标题框架审计研究(2022-2025)
该研究针对计算框架分析中常将操作简化为单一评分的问题,提出了一个分离措辞显著性框架与选择框架的二维分析体系。措辞显著性通过诱导性词汇、责任归咎、威胁框架及反问句四个维度衡量,选择框架则通过媒体层面的故事形态与高负荷分布衡量。研究利用三个大语言模型标注结合多数投票和人工仲裁,构建了包含10000条法语新闻标题的监督数据集并进行了系统验证。
该研究针对计算框架分析中常将操作简化为单一评分的问题,提出了一个分离措辞显著性框架与选择框架的二维分析体系。措辞显著性通过诱导性词汇、责任归咎、威胁框架及反问句四个维度衡量,选择框架则通过媒体层面的故事形态与高负荷分布衡量。研究利用三个大语言模型标注结合多数投票和人工仲裁,构建了包含10000条法语新闻标题的监督数据集并进行了系统验证。
针对印度语言机器翻译受限于缺乏高质量本土语料与基准的问题,研究人员推出了以印度语言为中心的平行语料库 COILD。该资源包含超过116万对经人工翻译和验证的句对,覆盖印欧、达罗毗荼及藏缅等语系的20种印度语言对。与传统依赖英语轴心的语料库不同,COILD 更好地保留了印度语言的多样性、文化特性与领域特征,为低资源语言翻译提供了重要的数据与评估支持。
该论文评估了大语言模型在社交语用学层面是否与人类的礼貌判断相符。研究人员采用包含连续评分和三分类标注的两个英语数据集,对七个主流模型进行了测试。结果显示,模型之间的一致性显著高于模型与人类之间的一致性。策略层面的分析表明,模型与人类判断的对齐主要依赖于显式的语言线索,而在涉及建立融洽关系等隐式语用策略上仍存在理解偏差。
针对以往计算方法常将情绪视为静态单句标签的局限,研究人员提出了 EMPATH 计算框架,用于在多粒度层面理解心理健康危机干预对话中的情感动态。该框架涵盖单轮标签、状态转移概率和全局对话原型三个维度。将其应用于涉及哀伤议题的危机文本对话分析后,研究揭示了求助者持续的负面情绪特征、向希望的逐步转变趋势,以及求助者与志愿者之间截然不同的情绪角色与异质的心理恢复轨迹。
该论文复现了Mohd等人在2020年提出的基于分布语义的抽取式文本摘要方法,并将其适配至印地语,在每个语言特定步骤中均替换为适配天城文的组件。研究在XL-Sum印地语部分和FIRE ILSUM 2.0 Hindi两个语料库上进行了评估,采用适配天城文的ROUGE指标进行对比。实验结果显示,在原论文发表的等权重配置下,该复现系统的表现显著劣于简单的基线方法(如选取前三句)。
该研究探讨了如何仅利用文档发表时的初始信息,前瞻性地从嵌入式主题模型的离群点中识别新兴主题的弱信号。在基于嵌入的主题建模中,部分最初被视作散乱噪声的文档未来可能会演化为新兴主题的基石,但在当时极难与普通噪声区分。研究通过追踪离群文档后续的发展轨迹构建标签体系,探索如何提前区分能够催生新主题的先兆离群点与单纯强化既有主题或作为背景噪声的文档,为趋势前瞻发现提供了新方法。
针对大语言模型在端到端事件抽取中面临的多任务协同挑战,研究人员提出了名为 EAGER 的强化学习框架。该方法将细粒度可验证奖励与基于模式对比的优势估计机制相结合,有效缓解了稀疏二元奖励导致的优势崩溃问题。其奖励设计针对结构有效性、抽取准确性、扎根性、覆盖率和跨度精度等多维度指标进行了优化,显著增强了生成式事件抽取的准确性与鲁棒性。
针对超大语料库场景下不同任务难度的本质差异,该研究提出了“语料任务复杂度”(CTC)概念,根据任务难度随语料规模增长的规律来刻画任务特性。例如,基础检索任务仅需对语料库进行单次线性扫描,而查找矛盾等深层任务则需对呈二次方增长的主张对进行比对。研究指出以往工作在此类复杂度分析上的局限,为理解和评估大规模语料下的模型任务提供了新的计算理论视角。
词汇借用是词典编纂和语料库语言学等数据密集型领域的重要研究课题,但现有标准文本处理工具库普遍缺乏该功能。本文推出了开源 Python 软件包 pylazaro,专注于从西班牙语文本中自动提取未同化的词汇借词(主要是英语借词)。该工具包整合了基于不同算法库训练的五个序列标注模型,并提供统一的调用接口,方便研究人员开展针对性的外来词检测与文本挖掘任务。
针对大语言模型在司法推理分析中的难点,该研究提出了一个句子级基准,用于评估大模型分类法律解释准则的能力。研究基于传统法学解释理论构建了分类标准,发布了经过句子级人工标注的德国联邦宪法法院判决数据集,并在专家手写提示词设定下,对来自三个模型家族的四款大语言模型进行了基线性能评测。
在法律文本摘要中,真实性至关重要,因而通常采用内容可溯源的抽取式方法。但现有方法多孤立评估段落等结构单元,忽视了长距离分散证据的有效整合。研究人员提出抽取式摘要模型 LexLattice,将法律文书的层级结构具象化为二维语义网格,并在选择文本前利用带掩码的二维神经元胞自动机对其进行跨区域特征整合,以改善证据整合能力与摘要质量。
研究人员推出了伊利诺伊社会态度综合语料库(ISAAC)及其可复现的处理流水线。该语料库汇集了2007年至2023年间超过5.27亿条英文Reddit帖子,重点围绕种族、性取向、年龄、身体能力、体重和肤色六大社会群体维度。通过多步骤的人工审计过滤流程,各分类的不相关内容比例均控制在10%以下,并且每条帖子均通过算法标注了用户的推断居住区域等元数据,为大规模分析社会群体话语提供了开放工具。
该论文探讨了联合事实核查评分提升背后的机制,分析在固定答案的前提下证据质量对综合评分的独立贡献。研究基于FEVEROUS基准数据集中的7,890条声明及4个DeBERTa模型检查点展开实验。结果显示,将DCUF证据替换为UnifEE证据后,严格核查评分显著提升9.61个百分点,而答案准确率仅提高1.96个百分点。该研究通过细粒度归因,揭示了高质量证据检索对联合事实核查评估指标的决定性影响。
在利用大语言模型评估社交媒体长文本的公众价值取向时,文本通常夹杂背景信息、引用及少数关键立场句。现有方法直接预测篇章标签易导致过度自信,而传统的句子级聚合投票则忽视了句子间置信度的差异。为此,研究团队将长文本价值测量构建为决策融合问题,并提出了无需训练的“回火证据融合”(TEF)方法,旨在更有效地聚合模型判断并提升长文本价值衡量的准确性。
现有的全双工语音对话模型评测多采用固定窗口规则,机械地通过停顿或打断重叠来判定轮换成败。研究人员指出,响应时机的合理性取决于说话人的潜在意图。为此,该研究提出了评测基准 TACT,包含来自 5 个双人对话语料库的 9,728 个片段(共 73.2 小时),整合了对话历史、说话人记忆画像以及针对 6 类意图的标注,旨在提供更符合人类自然交互习惯的意图条件化轮换评估。
针对阿拉伯语等低资源语言标注数据稀缺的问题,AraGenre 2026 评测任务提出了一种基于定义指导的层级阿拉伯语文体分类基准。该任务要求系统为文本分配宽泛的交际文体以及细粒度的具体文体标签。其公开的训练与开发集主要包含有限的合成与受控样本,而最终测试基准则涵盖了包含现代标准阿拉伯语、古典阿拉伯语及多种方言的真实噪声文本,旨在评估模型利用自然语言定义进行文本分类的泛化能力。
针对泰语缺乏用于定量句法研究的大规模自动解析语料库的问题,研究团队推出了 ThaiTrees。该语料库规模达 3.42 亿词元(tokens),涵盖新闻、维基百科、口语转录及社交媒体等多个领域。此外,研究人员在通用依存(Universal Dependencies)框架下构建了一套可复现的泰语文本清洗、预处理和句法解析流水线,为泰语的定量句法分析和语言学研究提供了有力的数据支撑。