AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

预测智能体何时应当推理?基于行为压力测试的可靠性路由研究

该研究探讨了预测智能体在结合大模型推理、信息检索、集成与校准时,各决策行为在何时具备可靠性。研究人员在ForecastBench风格的二元预测任务上,将智能体选择检索、推理、参考市场先验或采用历史类比等策略视为可观测行为并展开压力测试。核心结论显示,机制的最优选择高度依赖于数据生成源,结构化类比在特定数据流程中占据主导,而市场群体策略与保守基线在其他情境下表现更优。

阅读原文 ↗推荐理由:系统化探索了预测智能体在多策略切换下的行为可靠性,为智能体决策路由工程提供了实用参考。# 预测智能体# 智能体# 推理# 压力测试# 可靠性
arXiv 人工智能✦ 精选AI 评分 72/10012:00

PAWS:面向政策驱动的多智能体金融世界模拟数据集发布

针对现有金融多智能体模拟数据集缺乏与历史证据时间对齐的问题,研究人员推出了 PAWS(政策驱动型智能体世界模拟)数据集。该数据集涵盖 36 个经过验证的美国金融与经济政策事件、12,727 条与政策关联的新闻记录,以及 65,291 个基于实际来源的利益相关者行为。每个行为均关联支撑新闻,并通过多层事件框架表征交互模式与金融行动类别,为金融多智能体仿真与宏观政策影响模拟提供了扎实的数据基础。

阅读原文 ↗推荐理由:提出首个系统性关联政策与历史证据的金融多智能体模拟数据集,对复杂经济系统仿真具有重要参考价值。# 智能体# 金融模拟# 世界模型# 数据集
arXiv 人工智能✦ 精选AI 评分 73/10012:00

面向DNA测序数据分析自动化的智能体框架BaseCamp

针对DNA测序流程中质控阈值选择、边界变异判定、异常诊断及复核标记等高度依赖人工经验且标准不一的问题,研究团队提出了智能体AI框架BaseCamp。尽管现有工作流系统已能规模化调度生物信息学工具,但周边决策层仍需大量繁琐的手动判断。该框架旨在利用智能体自动化这一决策层,以提升测序数据分析流程的规范性与效率。(注:输入摘要在文末截断)

阅读原文 ↗推荐理由:将智能体技术应用于基因测序全流程决策,解决了生物信息管线中人工判定标准不一的痛点。# 智能体# 生物信息学# DNA测序# 工作流# 应用工程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

AdvRole:面向角色扮演智能体的对抗性闭环课程学习框架

基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。

阅读原文 ↗推荐理由:针对角色扮演智能体强化学习中训练场景固定的分布瓶颈,创新提出了对抗式闭环课程演化方案。# 角色扮演智能体# 强化学习# 大模型# 对抗训练# 课程学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TRACER:基于行为一致性对齐的多轮用户模拟器

针对交互式AI构建与评测中模拟用户难以复现真实意图演变和交互结果的缺陷,研究人员提出了多轮用户模拟器 TRACER。该模型能够显式建模用户动态演变的意图,使模拟行为与真实交互轨迹保持一致。TRACER 采用两阶段训练策略:首先在真实用户对话上进行监督微调(SFT),随后利用融合了分层结果与轨迹奖励的多轮强化学习进行对齐训练,从而大幅提升用户模拟的真实度与行为一致性。

阅读原文 ↗推荐理由:针对交互式AI系统评测中用户模拟器缺乏多轮行为一致性的痛点,提出了结合强化学习轨迹对齐的新型模拟器方案。# 用户模拟器# 交互式AI# 强化学习# 对齐# 智能体
arXiv 人工智能✦ 精选AI 评分 70/10012:00

Epydemix Agent:基于AI智能体驱动的流行病学建模框架

针对大语言模型智能体在调用科学软件时可靠性不足的问题,研究人员推出了 Epydemix Agent 框架。该框架建立在开源随机区室流行病学建模 Python 库 Epydemix 之上,为 AI 智能体提供四大核心能力:模型与参数发现、声明式场景规范的预防性验证、通过经过测试的库代码进行执行,以及结果的可检查性,从而实现了高可靠性的自然语言驱动科学建模。

阅读原文 ↗推荐理由:展示了大模型智能体与专业科学仿真工具结合的工程实践,重点探索了 AI 调用科学计算代码的可靠性与验证机制。# 智能体# 科学计算# 流行病学# 应用工程# 开源
arXiv 人工智能✦ 精选AI 评分 75/10012:00

skilder:基于角色权限控制的LLM智能体渐进式技能发现治理框架

针对大语言模型智能体在接入海量企业工具时面临的上下文超限、工具选择退化及合规治理漏洞等问题,研究人员提出了名为 skilder 的新框架。传统通过提示词设定的安全策略缺乏硬性约束,而多智能体委托方案又分散了审计日志。skilder 将技能与工具等能力打包为特定角色,通过基于角色的范围划分与渐进式技能发现机制,实现对智能体工具调用的结构化治理与确定性访问控制。

阅读原文 ↗推荐理由:针对企业级大模型智能体调用海量工具时的治理与性能痛点,提出了结构化的访问控制框架。# 智能体# 工具调用# 访问控制# 治理# 应用工程
arXiv 人工智能✦ 精选AI 评分 74/10012:00

META:结合情景记忆检索的多智能体金融决策框架

针对现有大语言模型交易系统多侧重长期预测或缺乏状态记忆等缺陷,研究人员提出了记忆增强型交易智能体框架 META。该框架是首个引入类似检索增强生成(RAG)的情景记忆增强型多智能体金融决策系统,通过整合一系列专门的指标分析智能体,有效解决了复杂交易环境下的动态决策需求,提升了智能体在金融分析与交易推理中的实际应用能力。

阅读原文 ↗推荐理由:提出首个引入情景记忆增强机制的多智能体金融决策框架,具有明确的行业应用落地价值。# 智能体# 金融科技# 记忆# RAG
arXiv 人工智能✦ 精选AI 评分 75/10012:00

RECLAIM基准:评估AI智能体复现机器学习论文研究结果的能力

该研究提出了名为RECLAIM的新基准测试,旨在评估AI智能体能否复现机器学习论文的核心研究结论。基准选取了100篇NeurIPS 2025论文,预先设定了待复现结果、成功复现判定标准以及GPU运行时间预算。根据原作者开源内容的完整度,基准设立了不同难度层级,测试智能体在软件安装、代码调试及运行实验等完整科研工作流中的自动化复现能力。

阅读原文 ↗推荐理由:提出针对AI智能体科研复现能力的标准化评测基准,对自动化科研与Agent工程落地具有较高参考价值。# 智能体# 评测# 自动化科研# 可复现性# 机器学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Forecast-Dojo:用于大模型预测智能体评测与训练的可回放环境

研究人员推出了名为Forecast-Dojo的可回放环境,专门用于基准测试和训练大语言模型预测智能体。该环境将已公布结果的预测市场问题与带时间戳的历史新闻相结合,允许智能体在连续的历史时间节点检索事件并动态调整预测,无需等待未来事件即可完成评估、交互数据收集与结果反馈。系统包含1568个Polymarket事件及1880万篇带日期的新闻文章,并对12个模型进行了评估测试。

阅读原文 ↗推荐理由:通过融合历史新闻与预测市场真实结果构建可回放环境,有效解决了大模型预测智能体评估周期长和训练反馈滞后的难题。# 智能体# 大模型# 评测# 事件预测# Polymarket
arXiv 人工智能✦ 精选AI 评分 75/10012:00

掌控智能体框架以控制成本:企业级AI编程智能体的路由与治理

随着企业内AI编程智能体从数百人试点规模扩展至数万人,企业多直接采购Claude Code或Codex等第三方运行框架。此类框架负责决策模型路由、上下文读取、Prompt缓存使用及子智能体调用,直接决定了算力消费单价与调用总量。报告指出,企业若直接使用未加调优的专有或默认框架,将面临高昂且失控的调用成本,亟需加强路由与治理管控。

阅读原文 ↗推荐理由:探讨了企业级AI编程智能体大规模落地中的核心痛点,分析了调度框架对模型路由与调用成本的关键影响。# 智能体# AI编程# 成本治理# 应用工程# 模型路由
arXiv 人工智能✦ 精选AI 评分 72/10012:00

动作归因何时需要更新?面向工具调用型智能体的高效更新机制研究

针对工具调用型智能体在策略持续更新中动作归因(Action Credit)失效、重新计算导致昂贵工具调用与环境交互成本的问题,该研究探讨了历史归因何时真正需要更新。研究核心发现,动作价值的变化并不一定会导致最终决策的改变;只要策略诱导的漂移不足以颠覆原有决策,历史动作归因即可继续复用,从而大幅降低计算开销。(注:原始摘要文本存在部分截断)

阅读原文 ↗推荐理由:聚焦工具调用智能体策略更新中的交互成本痛点,提出了通过判断决策漂移来复用历史归因的优化思路。# 智能体# 工具调用# 动作归因# 策略优化# 强化学习
arXiv 人工智能✦ 精选AI 评分 70/10012:00

AlphaDiverse:面向阿尔法因子多样性挖掘的本地量化研究智能体框架

基于大语言模型的多智能体系统虽能自动化挖掘量化阿尔法因子,但依赖外部API带来了成本、可用性及保密性挑战,且长期运行易导致研究路径坍塌。为此,研究团队提出 AlphaDiverse 框架,整合了多智能体研究系统、多样化研究路径收集以及本地智能体后训练流程。该框架通过生成互补的研究方案组合并动态调整研究环境,旨在提升本地量化研究智能体在因子挖掘中的多样性探索能力。

阅读原文 ↗推荐理由:聚焦量化金融中智能体私有化部署与多样化探索路径坍塌问题,提出了系统性的后训练与多智能体协作方案。# 智能体# 金融科技# 阿尔法因子# 后训练# 本地部署
arXiv 人工智能✦ 精选AI 评分 75/10012:00

MeshHeal:面向去中心化LLM多智能体网络灰度失效的双时间尺度自愈框架

在去中心化的大语言模型多智能体系统中,单个智能体可能在保持响应的同时任务求解质量持续退化,引发灰度失效。针对此类问题,研究人员提出了完全去中心化的自愈框架MeshHeal。该框架在双时间尺度上结合能力匹配的同行评审机制:在快速时间尺度上,通过自适应分层机制升级不确定或低评分输出的评审层级;在提供即时任务保护的同时,收集证据以动态调整未来的路由决策,并允许恢复正常的智能体重新接入。

阅读原文 ↗推荐理由:针对多智能体网络中隐蔽的质量退化难题,提出了去中心化的双时间尺度自愈与容错机制。# 智能体# 大模型# 自愈框架# 去中心化网络# 容错机制
arXiv 人工智能✦ 精选AI 评分 70/10012:00

CRISS:基于检索增强生成的癌症登记智能辅助问答系统

针对癌症登记员及肿瘤数据专家需处理复杂且频繁更新的编码和分期标准这一痛点,研究团队开发了CRISS(癌症登记智能支持系统)。该系统采用检索增强生成(RAG)架构,构建能够快速提供引文支持的对话助手。研究评估了CRISS在提供准确且附带引用来源的解答、改善指南检索与解读、以及在保持人工最终审核的前提下支持人员培训和技术咨询等方面的实际效果。

阅读原文 ↗推荐理由:展示了RAG技术在高度专业化的医疗癌症登记垂直领域的实际落地与辅助应用。# RAG# 智能体# 医疗AI# 自然语言处理# 应用工程
arXiv 人工智能✦ 精选AI 评分 60/10012:00

欧洲电力交易市场的AI系统功能架构:监管约束下的交易设计规范

该研究针对欧洲电力交易跨日前、日内和平衡等多层级市场的复杂机制,提出了一种符合监管约束的AI辅助交易系统功能架构。该架构深度结合了欧盟市场耦合机制、跨区域电力传输物理约束,并满足REMIT、MiFID II、MiFIR和EMIR等合规要求。研究通过定义决策状态向量、残差风险敞口核算以及约束优化目标,构建了一套正规化的系统规范,为高监管环境下的电力AI交易系统开发提供了工程指导。

阅读原文 ↗推荐理由:系统性阐述了强监管与物理约束下欧洲电力交易AI系统的功能架构设计,对行业垂直AI应用落地具有参考价值。# 电力交易# AI交易系统# 系统架构# 欧洲能源市场# 治理
arXiv 人工智能✦ 精选AI 评分 72/10012:00

持久化前先划定范围:防止智能体记忆中的跨任务族干扰

该研究探讨了大语言模型智能体的持久记忆机制,旨在不更新权重的前提下持续改进提示与技能。研究发现,将检索范围与认证范围精确匹配,能有效防止跨任务族的干扰,支持在重复出现的任务族中实现可靠适应。研究人员在12轮代码修复数据流ProcStream-RSI上对冻结模型智能体进行了测试,并使用基于执行的正交回归控制门控机制,证实仅在技能生成的原始任务族内检索该技能,可显著提升轨迹效用。

阅读原文 ↗推荐理由:提出了一种通过范围约束解决智能体持久记忆跨任务干扰的方法,对智能体技能复用和持续适应具有参考价值。# 智能体# 记忆# 大模型# 技能检索# AI编程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于偏差引导的大模型智能体技能自我进化机制

该研究针对大语言模型智能体在复杂工具使用任务中的技能自我进化问题展开探索。论文指出,复杂任务通常存在多种有效解题路径,失败轨迹往往也包含前期的有效进展而非全盘皆错。因此,研究提出不应将失败轨迹强行与固定成功路径对齐或进行粗粒度反思,而应精确定位有效求解向错误偏离的转折点,通过偏差引导的方式实现智能体技能的高效自我进化与演进。

阅读原文 ↗推荐理由:提出了一种细粒度定位失败偏离点的智能体技能演进新思路,有助于提升复杂工具调用场景下的自适应能力。# 智能体# 大模型# 工具调用# 自我进化# 轨迹分析
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 65/10012:00

Lean Pool:由AI智能体自主维护与优化的形式化数学代码库

Lean Pool 是一个形式化数学代码库,其核心特色在于完全由 AI 智能体负责拓展、维护与持续优化。该项目展示了人工智能在形式化定理证明与复杂数学知识归档中的自主管理潜力,有助于提高数学形式化库的组织效率与代码质量。由于原论文摘要提供的信息极为简略,具体的智能体协作机制与工程实现细节仍有待进一步公开。

阅读原文 ↗推荐理由:展示了利用 AI 智能体自主构建与维护形式化数学库的新探索路径。# 形式化数学# Lean# 智能体# 自动定理证明# 代码库维护
arXiv 人工智能✦ 精选AI 评分 70/10012:00

AI神经科学家:面向神经影像分析的交互式智能体界面

神经影像数据分析通常需要专业的编程与统计技能,这给非计算背景的研究人员带来了门槛。为此,研究团队推出了“AI神经科学家”,这是一种用于交互式数据探索的语言智能体。该系统将大语言模型与神经影像专业工具集相结合,支持研究人员直接通过自然语言查询数据质量、执行建模与可视化并设定分析参数,为小规模数据探索提供了一种替代传统脚本处理流程的透明且交互式的解决方案。

阅读原文 ↗推荐理由:将大语言模型智能体引入神经影像学领域,有效降低了专业科研数据分析的编程门槛。# 智能体# 神经影像# AI for Science# 大模型# 交互分析
arXiv 人工智能✦ 精选AI 评分 68/10012:00

MedGate-Fusion:融合初诊文本与生理指标的脑卒中风险分层模型

针对基层医疗中早期卒中风险信号分散于常规指标与非结构化临床文本的难题,研究人员提出了多模态门控架构 MedGate-Fusion。该模型通过 Transformer 提取患者初次就诊叙述的语义嵌入,并与 10 项常规生理风险标志物进行多模态融合。研究基于加拿大基层医疗监测网络(CPCSSN)的电子病历数据,构建了包含超 10 万名患者的初诊队列,旨在实现前瞻性卒中风险分层。

阅读原文 ↗推荐理由:提出结合临床非结构化文本与生理指标的多模态架构,为基层医疗脑卒中早期风险预测提供了实用方案。# 医疗AI# 多模态# 风险预测# 深度学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大模型智能体缺乏人情世故?新研究提出关系社交推理框架ReAdapt

该论文指出当前大模型智能体在社交决策(如是否互动或联系谁)中,往往仅关注内容显著性而忽略人际间的潜在关系(如关系强度、互惠性等)。现有的智能体循环无法根据新关系证据动态调整社交假设,导致在关系与内容线索产生分歧时做出表面化选择。为此,研究团队形式化了这种失效模式,并提出了包含500个样本的关系推理基准测试及ReAdapt方法,以提升智能体的社交推理能力。

阅读原文 ↗推荐理由:针对大语言模型智能体在复杂社交关系推理上的痛点,提出了新的基准与应对方法。# 大模型# 智能体# 社交推理# ReAdapt# 人际关系
arXiv 人工智能✦ 精选AI 评分 74/10012:00

面向企业数据智能体的学习型数据理解:压缩与路由机制

在企业环境中,结构化数据智能体需要面对分布在模式、数据关联和业务规则中的复杂环境。现有系统常依赖Markdown格式的记忆或技能文件来沉淀信息以减少重复探索,但该做法模糊了合理的分工界限。研究指出,智能体更擅长语义推理,而学习型系统更适合执行预测与数据组织。论文围绕此分工探讨了针对数据智能体的数据压缩与路由方法(注:原文摘要存在截断)。

阅读原文 ↗推荐理由:聚焦企业级结构化数据智能体的落地难题,探讨了结合学习系统进行上下文压缩与路由的架构优化路线。# 数据智能体# 应用工程# 上下文压缩# 数据路由# 智能体
arXiv 人工智能✦ 精选AI 评分 78/10012:00

提升智能体一致性:研究提出通过“技能习惯化”解决重复任务的冗余与偏差

针对当前智能体在重复任务中表现不一致且极度耗费资源的缺陷,研究团队开展测试发现,智能体在重复执行中不一致率达38%至74%,且超95%的生成内容都在重复推导已知方案。为此,研究提出“技能习惯养成”(skill habit formation)机制,让智能体从历史执行记录中挖掘候选确定性技能,使其与既有方案竞争并界定适用输入空间,从而大幅改善智能体在重复任务中的一致性与计算效率。

阅读原文 ↗推荐理由:针对智能体实际落地中严重的输出不一致与重复计算痛点,提出了挖掘确定性习惯技能的有效工程优化方案。# 智能体# 一致性# 技能养成# 计算效率# 任务规划
arXiv 人工智能✦ 精选AI 评分 65/10012:00

基于Wiki LLM索引优化机器学习课程助教系统

该研究探讨大语言模型在充当特定课程导师时的落地优化。研究团队针对真实机器学习课程资料构建了多模态检索增强生成(RAG)系统,前期发现固定检索策略存在局限性,进而转向探索在数据摄入阶段对知识语料库进行结构化整理(如Wiki LLM索引)是否比查询阶段增加检索量更为重要。由于原始论文摘要文本在阐述具体实验前截断,详细结论在摘要中未完全披露。

阅读原文 ↗推荐理由:探讨了教育垂直场景下RAG助教系统在知识摄入索引与查询检索阶段的工程优化取舍。# RAG# 多模态检索# 智能助教# 索引构建# 应用工程
arXiv 人工智能✦ 精选AI 评分 70/10012:00

对话式AI分层参与度评估框架:从离线代理到在线决策

针对在线A/B测试受流量和周期限制、难以覆盖大量对话式AI迭代的问题,研究者提出了一种分层参与度评估框架。该研究构建了一套可复用的诊断清单,将离线代理指标解构为三层对齐链条:行为标签与产品结果对齐、分类器与候选助手行为对齐,以及离线聚合信号与在线实验效应相对应。配套评估协议旨在离线环境下无须真实用户暴露即可高精度预测在线实验结果,加速系统迭代。

阅读原文 ↗推荐理由:提出了一套降低对话式AI在线A/B测试成本的分层离线评估框架,对工业级模型迭代优化极具实用价值。# 对话式AI# A/B测试# 离线评估# 用户参与度# 评测
arXiv 人工智能✦ 精选AI 评分 72/10012:00

ZeroGate:面向受治理AI智能体运行时的信任保留快速路径机制

针对AI智能体提前授权可能导致载荷、权限或状态发生漂移的安全风险,研究团队提出ZeroGate架构。该方案将精确操作审批与持久本地准入解耦:签发者签署具有时效性的ActionPass凭证,受信任运行时适配器重构最终操作,再由本地网关验证绑定并消耗nonce。系统利用SQLite事务同步处理nonce注销、配额更新及准入收据生成,在维持信任边界和决策一致性的前提下优化了执行分发延迟。

阅读原文 ↗推荐理由:针对AI智能体运行时的安全管控与执行延迟平衡,提出了解耦审批与准入的实用工程架构。# 智能体# 运行时架构# 安全鉴权# 安全# 访问控制
arXiv 人工智能✦ 精选AI 评分 75/10012:00

ShowTellArena:评估智能体从业务演示中理解工作流能力的基准数据集

研究人员提出了 ShowTellArena,这是一个用于评估智能体在观看带有口述解说的业务演示后其理解能力的基准测试协议与公开数据集。该基准模拟了人类通过“边演示边讲解”指导新同事的场景。v1.0 版本涵盖财务、招聘、采购、客户决策、库存和物流等领域的 50 个业务工作流任务,包含屏幕录像、截图、旁白解说及 502 道评估试题,旨在系统性测试智能体对复杂商业流程的掌握水平。

阅读原文 ↗推荐理由:针对智能体从多模态演示与讲解中学习业务工作流的能力,提出了标准化的评测协议与多行业数据集。# 智能体# 评测# 工作流# 多模态# ShowTellArena
arXiv 人工智能✦ 精选AI 评分 65/10012:00

Spectra:用于KYC文档自动化处理的规则驱动LLM流水线

资本市场中的“了解你的客户”(KYC)审查流程通常依赖分析师手动分类文档、从异构数据源提取结构化数据并验证合规性,导致入驻流程常拖延数周。本研究分析发现该流程包含高度可重复且适合AI自动化的环节,进而提出了重构后的自动化工作流及规则驱动的大语言模型流水线Spectra,旨在整合传统繁琐步骤以大幅提升处理效率(论文原始摘要在流程细节处有所截断)。

阅读原文 ↗推荐理由:针对金融合规KYC痛点,探索利用规则与大模型结合的工作流实现文档处理自动化。# 大模型# 文档处理# 金融科技# 工作流
arXiv 人工智能✦ 精选AI 评分 75/10012:00

LLM用户模拟器特征干扰诊断:行为特征如何渗透并扭曲偏好

基于大语言模型(LLM)的用户模拟器常用于推荐系统评估,通过设定偏好属性(交互内容)与行为活跃度特征(浏览时长)来模拟真实用户。研究发现,模拟过程中这两种特征设定的独立性会失效:一是产生特征干扰,过高的活跃度会打破偏好边界,迫使模型与不匹配内容交互以维持浏览;二是导致评估失效,满意度评分会随着活跃度驱动的页面数量虚假膨胀。

阅读原文 ↗推荐理由:揭示了LLM智能体在用户仿真中行为与偏好解耦失效的机制,对推荐系统评测及多特征智能体构建具有重要参考价值。# 大模型# 用户模拟器# 智能体仿真# 推荐系统# 特征干扰