AIDC
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 65/10012:00

结肠镜检查中假阳性AI辅助提示对医生注视行为影响的眼动追踪研究

该研究探讨了计算机辅助检测(CADe)系统在结肠镜检查中产生的假阳性提示对内窥镜医生注意力的分散效应。研究结合回顾性配对视频实验与前瞻性实时眼动追踪,分析了3名资深及2名初级医生观看60段视频的表现,并记录了9名资深医生在42例实时辅助检查中的视线变化,量化了假阳性提示对注视吸引和注意力占用的具体影响。由于摘要截断,更细致的结果未完整展示。

阅读原文 ↗推荐理由:该研究利用眼动追踪技术实证评估了医疗AI假阳性提示对临床医生注意力的人机交互影响,对优化辅助诊断工具具有参考价值。# 医疗AI# 计算机辅助检测# 眼动追踪# 人机交互# 结肠镜检查
arXiv 人工智能✦ 精选AI 评分 76/10012:00

智能体与工具交互中的“静默失败”现象:针对 ToolUniverse 的审计研究

随着智能体 AI 系统逐步采用整合多工具的自动化流程,智能体与工具间交互的可靠性日益受到关注。该研究针对生物学智能体等工作流场景,系统调查了交互过程中的“静默失败”问题。此类故障表现为工具调用表面上显示成功,但 API 或封装层返回的信息与功能实际存在缺失或残缺,且未向用户或智能体发送任何异常通知。该研究填补了此前评测仅关注任务完成率而忽视交互底层隐性故障的空白。

阅读原文 ↗推荐理由:揭示了智能体调用外部工具时“看似成功实则信息缺失”的静默失败隐患,对提升复合智能体系统的工程可靠性具参考价值。# 智能体# 工具调用# 静默失败# ToolUniverse# 系统可靠性
arXiv 人工智能✦ 精选AI 评分 72/10012:00

极简大模型智能体框架JAZ:以最小化控制架构探索最大表达能力

现代大语言模型智能体大多依托于由模型与工具调用构成的核心循环(Agent Loop)运行,但处理记忆增强与自我改进等复杂工作流时,通常依赖复杂的额外工程系统。为此,研究团队构建了极简智能体框架JAZ,旨在探索仅依靠最基础的循环机制,在多大程度上能够替代并完成此类专门系统的任务。由于原文摘要结尾存在截断,关于JAZ具体暴露的接口与机制细节仍有待全文披露。

阅读原文 ↗推荐理由:该研究尝试通过极简设计降低智能体系统的工程复杂度,对Agent系统架构与工程落地具有参考价值。# 智能体# 大模型# Agent Loop# 系统框架# 软件工程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TwinCheck:面向有状态工具智能体的反事实负孪生验证机制

针对单一局部合理的工具调用可能导致整个智能体执行轨迹失败的问题,研究人员提出了一种名为 TwinCheck 的推理期验证策略。该策略认为仅凭怀疑进行干预可能引入新错误,因此仅在轨迹满足与局部失败假设相关的证据条件时才触发替换。系统通过构建基于轨迹的反事实替代方案(即“负孪生”),仅当该方案通过结构检查且成对验证器判定其更优时,才替换智能体原有的提议调用,有效提升了执行可靠性。

阅读原文 ↗推荐理由:提出了一种创新的推理期反事实验证机制,有效解决了工具智能体在调用干预时容易误伤有效轨迹的难题。# 智能体# 工具调用# TwinCheck# 推理期验证# 轨迹验证
arXiv 人工智能✦ 精选AI 评分 68/10012:00

面向交互式多智能体模拟构建社会情感人工智能架构

该研究旨在为动态模拟世界中人类与多智能体的交互提供设计原则和软件架构。结合通用人工智能(AGI)发展、Transformer对话智能体的普及以及计算能力的提升,文章梳理了过往与当前的多智能体心智理论,重点关注具备社会与情感认知能力的智能体,探讨智能体之间及其与人类互动的综合设计方法,以增强多智能体系统的交互理解与协同模拟能力。

阅读原文 ↗推荐理由:探讨了融入社会与情感认知机制的多智能体系统架构设计,为人机协同与复杂模拟提供了新思路。# 智能体# 心智理论# 社交AI# 人机交互
arXiv 人工智能✦ 精选AI 评分 72/10012:00

PLLM+:基于混合重放与大模型修复的Python依赖解析管线

该论文针对Python生态中因版本不兼容与包缺失导致的“依赖地狱”问题,提出了混合依赖修复管线PLLM+。该方法在包含2891个报错片段的HG2.9K基准上进行了验证。PLLM+在调用大语言模型前,优先执行低成本确定性策略,包括基于AST的静态解释器推断、历史成功配置重放以及实时PyPI验证,随后结合LLM进行精准修复,有效提升了真实代码的执行成功率。

阅读原文 ↗推荐理由:提出结合确定性推断与大模型修复的混合流水线,有效化解了AI代码执行与软件工程中的依赖配置痛点。# 大模型# AI编程# 软件工程# 依赖管理
arXiv 人工智能✦ 精选AI 评分 68/10012:00

提议而不自判:面向量化因子挖掘LLM智能体的随时有效裁判机制

该研究探讨了大语言模型智能体在量化因子全流程研究中的职责划分。研究团队提出了一种“受管制的自我演化”框架:智能体仅负责提出投资因子假设,而由一个独立的固定统计裁判机制进行评估。裁判仅根据因子提交后披露的真实市场表现进行动态评分与对赌,从而确保在任意停止时间下均具备防伪发现的统计保证。该设计有效解决了智能体既当运动员又当裁判所带来的过拟合与数据窥探问题。

阅读原文 ↗推荐理由:针对LLM在量化投研中的过拟合与幻觉风险,提出了职责解耦的Agent评估与治理机制,具工程参考价值。# 智能体# 金融科技# 统计检验# 应用工程
arXiv 人工智能✦ 精选AI 评分 72/10012:00

论文提出Policy-as-Skill:面向大模型决策支持的可治理与审计模块化运行时

针对企业利用大语言模型进行合规、风险及运营决策时对证据验证、审查路由与可审计性的高要求,研究人员提出了Policy-as-Skill(PaS)模块化运行时框架。该框架将上述功能打包为可执行且具备版本控制的策略能力。在基于固定模型后端的600项开发任务评估中,PaS+Audit方案取得了53.8%的准确率、100%的引用精确度与审计完整性,在绝大多数治理与合规指标上超越了传统LLM+RAG架构。

阅读原文 ↗推荐理由:将企业合规与治理规则工程化为可执行的AI技能运行时,显著改善了大模型决策的审计追溯与确定性控制能力。# 大模型# 决策支持# 治理# 合规审计# 智能体
arXiv 人工智能✦ 精选AI 评分 75/10012:00

反思复杂拓扑:相异对等随机路由提升多智能体辩论成本效益

该研究探讨了大型语言模型多智能体辩论(MAD)中的通信拓扑问题。针对当前学术界倾向于设计复杂、自适应或动态重构交互拓扑以提升推理准确率的趋势,研究团队深入审视了稀疏通信机制。论文提出“相异对等随机路由”方法,旨在探究是否真的需要复杂的拓扑控制,证实简单的稀疏通信即可在显著降低成本的同时实现极具竞争力的推理性能,为优化多智能体交互架构提供了更具成本效益的新思路。

阅读原文 ↗推荐理由:针对多智能体协作中拓扑结构过于复杂的痛点,提出了高效低成本的稀疏交互解决方案,对大模型智能体工程落地具有实用价值。# 多智能体辩论# 大模型# 通信拓扑# 成本效益# 智能体系统
arXiv 人工智能AI 评分 55/10012:00

利用最小风险训练增强小型语言模型生成停电报告

研究人员将最小风险训练(MRT)应用于全国停电数据倡议(ODIN)的停电报告生成任务。不同于传统仅依赖词元级最大似然目标的方法,MRT使模型能够直接针对序列级评估指标进行优化。该方法将异构停电报告转化为符合CIM IEC 61968-3标准的规范XML格式,显著提升了Qwen2.5-7B等小型语言模型在垂直结构化报告生成任务中的准确性与可用性。

阅读原文 ↗推荐理由:展示了通过MRT优化算法将小型开源语言模型落地于电网结构化报告生成的垂直工程实践。# 小型语言模型# 最小风险训练# Qwen2.5# 电力系统# 应用落地
arXiv 人工智能✦ 精选AI 评分 75/10012:00

针对利益冲突环境,新基准CAVEAT评估计算机使用智能体鲁棒性

随着计算机使用智能体(CUA)日益广泛地代表用户执行在线操作,当所处环境的利益激励与用户目标不一致(如电商平台倾向于推荐特定商品而诱导智能体偏离目标)时,智能体表现面临新挑战。现有基准多局限于合作场景或显式攻击,忽略了环境自身存在利益诉求的情况。为此,研究团队推出了受控基准测试 CAVEAT,涵盖 9 个市场环境及相关分类法,专门评估智能体在利益错位环境下的目标坚守能力。

阅读原文 ↗推荐理由:针对计算机使用智能体在现实商业利益诱导下的对齐与鲁棒性问题,填补了现有评测基准的空白。# 智能体# CUA# 评测# 鲁棒性# 对齐
arXiv 人工智能✦ 精选AI 评分 75/10012:00

DRSR:基于集合级删除风险的长流程智能体高效上下文压缩框架

针对长流程大语言模型智能体积累海量交互历史带来的效率挑战,现有压缩策略通常独立评估单条记录,忽略了组合删除所引起的冗余或累积信息损失。为此,研究团队提出了直接关系集合风险修剪(DRSR)框架。该方法将智能体历史上下文压缩建模为基于删除集合的风险约束选择问题,从集合层面综合评估删除风险与保留信息,在保障决策安全与任务表现的前提下,实现了长程智能体的高效修剪。

阅读原文 ↗推荐理由:针对长流程智能体上下文膨胀痛点,提出了集合级删除风险评估的新压缩范式,实用性较强。# 智能体# 上下文压缩# 长程任务# 模型压缩# 大模型
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TimeEvo:基于故障驱动的时序数据智能体自我演化机制

该研究针对通过调用外部工具回答分析问题的时间序列智能体,指出了传统人工预设工具配置的缺陷:一是人机工具不匹配,专家挑选的工具库可能在特定任务中降低异常检测准确率;二是隐性损害,常规自我修正可能在微弱提升总体评分的同时破坏原有的正确答案。论文指出工具的有效性需在运行时根据具体问题动态决定,并提出了故障驱动的智能体自我演化方案。

阅读原文 ↗推荐理由:深入剖析了时序分析智能体在工具调用与自我修正中的失效机理,提出了自演化解决思路。# 智能体# 时间序列# 工具调用# 自我演化# TimeEvo
arXiv 人工智能✦ 精选AI 评分 75/10012:00

EnSIMem:基于实体结构化索引的智能体长期记忆架构

长期与用户交互的智能体需要准确召回事实、偏好和事件等信息,但现有记忆系统常将其压缩为通用摘要或检索无标签文本块,难以精准识别实体属性及支撑依据。研究人员提出了EnSIMem,一种面向智能体的实体结构化长期记忆架构。该系统在离线阶段将历史交互组织为主题连贯的情节片段,并构建基于对话的实体索引条目,以提升长上下文对话中智能体记忆检索与推理的准确性。

阅读原文 ↗推荐理由:针对智能体长期交互中的记忆痛点,提出了基于实体结构化索引的新型记忆检索架构。# 智能体# 长期记忆# 实体索引# 对话系统# 信息检索
arXiv 人工智能✦ 精选AI 评分 75/10012:00

StateComp:面向长程任务智能体的状态条件历史压缩机制

在执行长程任务时,智能体会持续积累交互历史,而既有上下文管理方法多依赖固定窗口或即时相关性,难以判断历史交互何时可安全替换。过早压缩易导致未来关键信息丢失,过度保留又会带来巨大的上下文开销。为此,该研究提出了状态条件压缩框架StateComp,旨在根据智能体的状态演变动态学习何时适合压缩历史,在降低上下文负载的同时保留关键信息(注:原文摘要末尾内容有所截断)。

阅读原文 ↗推荐理由:针对长程AI智能体面临的上下文开销与关键信息丢失两难问题,提出了自适应压缩时机的新方案。# 智能体# 长程任务# 上下文管理# 历史压缩# StateComp
arXiv 人工智能✦ 精选AI 评分 72/10012:00

从自身交互中学习行动:面向GUI智能体的在线自蒸馏方法

针对图形用户界面(GUI)智能体在执行复杂软件指令时所需的分步推理与长程记忆能力,研究团队探索了在线自蒸馏(OPSD)技术的应用。现有OPSD方法虽在GUI定位等基础任务上表现优异,但在向多轮交互场景扩展时受限于自教师模型的特权机制(原摘要末尾存在信息截断)。该研究旨在通过从自身交互中学习,改进自蒸馏机制以提升多轮GUI智能体的决策执行效果。

阅读原文 ↗推荐理由:聚焦GUI智能体多轮复杂交互的技术瓶颈,提出了改进的在线自蒸馏训练方案。# GUI智能体# 自蒸馏# 多轮交互# 智能体# 前沿研究
arXiv 人工智能✦ 精选AI 评分 75/10012:00

VHD-Play:基于机制求解生成可验证的智能体强化学习环境

随着大语言模型智能体处理长程任务的需求增加,扩展其强化学习训练亟需多样化环境与可靠奖励信号。针对现有生成管道在环境动态与事后评估对齐上的缺陷,研究提出VHD-Play框架。该方法颠倒了传统的构建依赖关系,首先对数学模型进行采样与求解,再通过基于语料的设置器将其决策过程渲染为具备状态的可执行工具环境,为智能体强化学习提供了低成本、可验证的交互环境生成方案。

阅读原文 ↗推荐理由:提出了一种逆向生成机制,有效解决了智能体强化学习训练中高质量、可验证交互环境稀缺的问题。# 智能体# 强化学习# 环境生成# 大模型# 合成数据
arXiv 人工智能✦ 精选AI 评分 75/10012:00

面向长程智能体高效压缩的证据感知上下文缩减方法

针对长程智能体因累积大量交互历史导致上下文和推理成本高昂的问题,该研究指出仅依据几何冗余进行压缩并不安全。实验发现,即便全局几何特征高度相似,所保留的关键任务证据也可能存在巨大差异。基于此提出的证据感知选择机制,在相同数据块保留量且质心相似度达0.98的前提下,将下一步动作Top-3保留率从0.31大幅提升至0.69,有效保障了智能体压缩后的决策性能。

阅读原文 ↗推荐理由:该研究针对长程智能体上下文爆炸与推理成本痛点,提出了兼顾几何结构与任务证据的高效压缩新策略。# 智能体# 上下文压缩# 推理# 长程任务# 模型效率
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Just-in-Time Memory:面向LLM智能体的任务自适应即时记忆整理架构

针对大模型智能体在重用历史经验时普遍采用的“写入时整理”局限,该研究分析了传统方法在任务完成时过早将轨迹蒸馏为固定形式(如反思、工作流或策略)所带来的信息不可逆丢失问题。传统做法在未知未来查询的情况下生成静态摘要,难以适配多样化的下游任务。为此,论文探索了即时自适应记忆构建机制,提升智能体记忆提取与任务匹配的灵活性。

阅读原文 ↗推荐理由:针对LLM智能体记忆系统的核心痛点提出了动态自适应整理方案,对智能体工程架构优化具有较高参考价值。# 智能体# 智能体记忆# 记忆架构
arXiv 人工智能✦ 精选AI 评分 72/10012:00

MolDesignBench:面向真实场景分子设计任务的LLM智能体评估基准

真实环境下的分子设计对大语言模型智能体提出了极高要求,需要其理解复杂上下文、满足多重约束并进行多步工具推理。针对现有基准偏向狭窄约束和单一路径的问题,研究人员提出了MolDesignBench。该基准紧密贴合实际分子设计场景,可系统评估工具增强型LLM智能体在处理多约束、不可行规范识别及多步工具调用下的综合推理与设计能力。

阅读原文 ↗推荐理由:针对AI4Science与LLM智能体落地场景,构建了更贴近真实复杂分子设计需求的评测基准。# 智能体# 大模型# 分子设计# AI for Science# 评测
arXiv 人工智能✦ 精选AI 评分 72/10012:00

Emergi-PersonaOS:支持情境适应与可控演化的人格化智能体操作系统

为解决长期人机交互中数字存在的身份连续性与个性化发展问题,研究人员提出了基于心理学理论的操作系统 Emergi-PersonaOS。该系统旨在对人格化智能体全生命周期进行管理,通过构建涵盖倾向性特质、情境适应特征和叙事认同的三层架构,实现智能体在动态情境下的自适应与可控演化,为人机共生交互提供了新型计算架构支撑。

阅读原文 ↗推荐理由:提出了一种基于心理学架构的人格化智能体操作系统,探索了长期人机交互中数字生命的连续性与演化机制。# 智能体# PersonaOS# 人机交互# 数字人# 系统架构