被说服而非被告知:利益冲突陈述导致大模型智能体上下文锚定失效
该研究揭示了大语言模型智能体在处理客户关系管理(CRM)记录时的一种新型失效模式:上下文锚定易受利益相关方偏见误导。在销售线索资质审核等业务中,当输入上下文中包含具有主观乐观动机的销售代表断言时,模型往往会将其视为客观证据采纳,进而批准企业客观记录原本判定为不合格的交易。基于CRMArena-Pro基准的测试表明,即便采用更强大的模型,也难以有效规避这种将说服性言辞误当事实的缺陷。
该研究揭示了大语言模型智能体在处理客户关系管理(CRM)记录时的一种新型失效模式:上下文锚定易受利益相关方偏见误导。在销售线索资质审核等业务中,当输入上下文中包含具有主观乐观动机的销售代表断言时,模型往往会将其视为客观证据采纳,进而批准企业客观记录原本判定为不合格的交易。基于CRMArena-Pro基准的测试表明,即便采用更强大的模型,也难以有效规避这种将说服性言辞误当事实的缺陷。
词汇借用是词典编纂和语料库语言学等数据密集型领域的重要研究课题,但现有标准文本处理工具库普遍缺乏该功能。本文推出了开源 Python 软件包 pylazaro,专注于从西班牙语文本中自动提取未同化的词汇借词(主要是英语借词)。该工具包整合了基于不同算法库训练的五个序列标注模型,并提供统一的调用接口,方便研究人员开展针对性的外来词检测与文本挖掘任务。
科技与创新政策对国家竞争力至关重要,但其多样性与庞大规模使得系统化监测变得极其困难,传统人工调查成本高昂且难以跨国扩展。本研究探索了利用大语言模型从非结构化长政策文本中提取信息的能力,提出将大模型作为“AI受访者”以生成结构化调查响应。研究团队开发了基于长上下文的数据提取流程,用于自动化政策分析与追踪,显著降低了人工监测成本。
针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。
深度搜索要求大语言模型智能体分解复杂查询、检索证据并合成可靠答案。然而现有的 ReAct 架构智能体存在角色耦合(单策略兼顾规划、证据利用与合成)以及搜索历史累积导致上下文噪声增加的问题。为此,研究团队提出 IterSynth 范式,通过角色解耦与基于摘要的状态演进机制,在负责识别信息需求的规划器与负责整合证据的合成器之间交替执行,有效改善了深度搜索智能体的长程推理与信息合成能力。
针对大规模文本标注中编码规范(Codebook)构建耗时漫长的问题,该研究提出利用大语言模型(LLM)加速这一流程。方法通过在早期将编码本应用于数据,筛选出多个LLM之间存在显著分歧的疑难样本,从而精准引导专家介入并提供针对性反馈。研究探讨了多种专家反馈形式,包括直接编辑由跨模型分歧驱动生成的修改方案,以及解答模型争议问题等,有效提升了人机协同标注与规范迭代的效率。
针对大语言模型在司法推理分析中的难点,该研究提出了一个句子级基准,用于评估大模型分类法律解释准则的能力。研究基于传统法学解释理论构建了分类标准,发布了经过句子级人工标注的德国联邦宪法法院判决数据集,并在专家手写提示词设定下,对来自三个模型家族的四款大语言模型进行了基线性能评测。
针对大语言模型在复杂法律推理中面临的结构性挑战,研究人员提出了LEGO框架。传统RAG及GraphRAG往往侧重词汇或语义相似度,忽略了法律条文间的规范关系;而普通思维链提示易生成缺乏法律规范结构的推导过程。LEGO采用双模块架构,将法律专家GraphRAG与专家级思维链相结合,有效规范了法律条文检索与逻辑推理链路,旨在突破高风险法律领域的推理瓶颈。
大语言模型已被广泛应用于教育对话数据的教学构念标注与分类,但其黑盒推理特性导致难以验证模型对具体话语分类的机理依据。为此,研究团队提出了 EduBehaviors 框架。该框架是一种可解释且具扩展性的教育数据标注方案,通过利用大语言模型量化与多种构念相关的可观测重复行为,进而训练下游分类器,实现标注过程的可追溯与审计(原摘要结尾略有截断)。
针对企业数据智能体需准确保留业务特定语义的需求,研究人员提出了面向自动化“问题到报告”分析的本体驱动系统 UniDataAgent。该系统将语义获取与在线执行解耦,主要包含两个阶段:本体获取与验证阶段(OAV)利用元数据与业务知识构建版本化的企业本体,并经专家评估验证;执行阶段(QRE)则负责具体任务的检索与生成。输入摘要在执行阶段细节处存在文本截断。
本文探讨了生产级智能客服系统中的核心部署问题:针对意图分类、问答、摘要和工具调用等多项技能,究竟应采用多个专用模型,还是通过多任务微调、连续更新或模型合并训练单一模型。研究团队基于 Qwen、Gemma、Llama 和 Mistral 等 5 个模型家族的 13 款模型(涵盖 0.6B 至 32B 参数),在 4 个公开及 4 个专有客服数据集上展开了系统性评测与策略比较。
针对网页智能体在实时环境中评估存在状态漂移、难以稳定复现和开展可控训练研究的痛点,研究团队提出了离线评估基准 WebMRE。该基准基于 WebArena 的成功轨迹构建,包含 541 个任务和 5,293 个步骤,配备经过全面审计的测试标签和确定性评估协议,无需运行环境即可确保同一检查点在多次运行中输出一致评分。每个步骤将人类指导语句与具体动作配对,首次实现了对引导与动作相互强化机制的离线研究。
针对越南《个人数据保护法》等法规对机构维护数据处理活动记录(RoPA)的要求,人工准备耗时且云端大模型存在数据主权合规风险。研究团队提出了 RoPA Manager 系统,通过结合基于 tsvector 的词法检索、稠密向量检索以及倒数排名融合(RRF)的混合 RAG 技术,并采用本地部署的大语言模型,实现 RoPA 信息的自动化提取,以兼顾自动化效率与数据主权需求。
针对跨语言法律问答中跨语言法条检索及避免无依据主张的挑战,研究者推出了基于越南劳动法的双语评估基准,包含231个越英问答对,其中75个针对五类法律推理现象进行了额外标注。研究评估了一种验证器引导的流程,该流程将答案拆解为主张,检测引用可达性与蕴含关系,并纠正引用失效及事实矛盾。此外,该研究还提出了六种用于评估检索证据忠实度的自动化诊断指标。
针对医学系统评价中数据提取高度依赖人工且必须遵循严格协议与可审计要求的痛点,研究团队推出了开源、无代码的 Web 平台 EviStreams。该平台引入人在回路的大语言模型辅助机制,不仅契合双人独立提取、裁决仲裁的标准审查流程,还能记录完整的数据生成审计日志,使科研团队在关键阶段自主把控 AI 提取过程,显著缓解临床指南研制中的专家人力瓶颈。