AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架

针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。

阅读原文 ↗推荐理由:提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。# 大模型# 强化学习# 思维链# 算力# 推理
arXiv 人工智能✦ 精选AI 评分 65/10012:00

硬预算重复评测中真实不确定性的理论界限研究

该研究探讨了在硬预算约束下,通过重复评测来准确估计基准测试分数并确保较低不确定性的理论极限。研究在固定任务网格和响应成本限制的框架下,推导出了在完全观察与允许遗漏两种情况下,最差纯群组的最优期望区间宽度理论界限。该理论下界同样适用于自适应硬预算策略,为机器学习模型的基准评测设计与置信度验证提供了严格的理论依据。

阅读原文 ↗推荐理由:推导了大模型基准评测在硬预算约束下的不确定性理论极限,为评测协议设计提供了理论指导。# 评测# 不确定性量化# 理论下界
arXiv 人工智能✦ 精选AI 评分 72/10012:00

持久化前先划定范围:防止智能体记忆中的跨任务族干扰

该研究探讨了大语言模型智能体的持久记忆机制,旨在不更新权重的前提下持续改进提示与技能。研究发现,将检索范围与认证范围精确匹配,能有效防止跨任务族的干扰,支持在重复出现的任务族中实现可靠适应。研究人员在12轮代码修复数据流ProcStream-RSI上对冻结模型智能体进行了测试,并使用基于执行的正交回归控制门控机制,证实仅在技能生成的原始任务族内检索该技能,可显著提升轨迹效用。

阅读原文 ↗推荐理由:提出了一种通过范围约束解决智能体持久记忆跨任务干扰的方法,对智能体技能复用和持续适应具有参考价值。# 智能体# 记忆# 大模型# 技能检索# AI编程
arXiv 人工智能✦ 精选AI 评分 65/10012:00

针对生成式搜索的主张门控来源风险审计机制

该研究针对生成式搜索中答案虽有引用却可能遗漏改变语义解释的源关系这一问题,提出了一种主张门控审计规范。该机制对“查询-来源-答案”三元组进行审计,仅在关系证据、答案采纳、实质性与披露四项要素均被观测时判定存在遗漏,避免将证据不全误判为独立无关。该规范将判定结果绑定至带版本控制的证据片段,并通过引用检查器使审计记录契约可执行,提升了生成式搜索溯源审计的可靠性。

阅读原文 ↗推荐理由:提出了一种针对生成式搜索中引用溯源风险的形式化审计机制,有助于提升AI搜索结果的可信度与合规治理。# 生成式搜索# 安全# 溯源审计# 事实性检验# 信息检索
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于偏差引导的大模型智能体技能自我进化机制

该研究针对大语言模型智能体在复杂工具使用任务中的技能自我进化问题展开探索。论文指出,复杂任务通常存在多种有效解题路径,失败轨迹往往也包含前期的有效进展而非全盘皆错。因此,研究提出不应将失败轨迹强行与固定成功路径对齐或进行粗粒度反思,而应精确定位有效求解向错误偏离的转折点,通过偏差引导的方式实现智能体技能的高效自我进化与演进。

阅读原文 ↗推荐理由:提出了一种细粒度定位失败偏离点的智能体技能演进新思路,有助于提升复杂工具调用场景下的自适应能力。# 智能体# 大模型# 工具调用# 自我进化# 轨迹分析
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 78/10012:00

虚拟人设能否预测真实受众反应?研究揭示无角色基线反超人设模拟

当前营销领域常使用大语言模型构建“虚拟人设”以预测真实受众对文案的反应。本研究基于Upworthy研究档案中数千次真实流量点击率A/B测试作为基准,开展了从模拟到真实的有效性检验。实验对比了基于真实人口统计特征构建的10人虚拟人设面板与无角色设定的基准模型,结果显示,无角色基准在文案效果模拟上的表现反而击败了基于人设的模拟,对当前AI受众模拟的有效性提出了质疑。

阅读原文 ↗推荐理由:通过大规模真实A/B测试数据实证检验,挑战了当下大模型虚拟人设在受众预测中的有效性假设。# 大模型# 虚拟人设# 受众模拟# A/B测试# 实证研究
arXiv 人工智能✦ 精选AI 评分 68/10012:00

现有预条件器能否改善生物医学表格基座学习?TabPFN优化实证研究

针对结构化生物医学数据分析,表格基座模型展现出巨大潜力,其中TabPFN在小样本表格分类任务中表现尤为突出。然而,优化和预条件策略对生物医学场景微调的影响尚缺乏研究。本文对TabPFN v2.5展开系统性实证评估,在涵盖阿尔茨海默病、乳腺癌、精神分裂症等疾病及KEEL库的59个生物医学数据集上,测试了五种基于AdamW的预条件策略,为优化生物医学表格基座模型微调提供了实验参考。

阅读原文 ↗推荐理由:系统评估了五种预条件策略在多达59个生物医学数据集上微调TabPFN的效果,填补了表格基座模型优化的研究空白。# TabPFN# 表格基座模型# 医疗AI# 微调# 优化器
arXiv 人工智能✦ 精选AI 评分 78/10012:00

4DGS-JEPA:面向动态高斯泼溅的时序组合联合嵌入预测架构

动态高斯泼溅能显式表征随时间演化的3D场景,但现有方法多针对重建、未来状态生成或渲染进行优化,缺乏对可复用预测动力学的学习。对此,研究人员提出了 4DGS-JEPA,一种用于动态高斯场景因果多时域预测的原生联合嵌入预测架构。该模型构建了涵盖场景级、运动群级及高斯级的层次化表征,并结合时域条件转移算子,能够同时支持直接预测与递归推演。

阅读原文 ↗推荐理由:将JEPA自监督预测范式引入动态高斯泼溅中,为3D动态场景表征与物理动力学预测提供了新方案。# 高斯泼溅# JEPA# 3D视觉# 世界模型# 表征学习
arXiv 人工智能✦ 精选AI 评分 62/10012:00

基于超图神经网络的胶质母细胞瘤生存期精准与可解释预测研究

针对多形性胶质母细胞瘤(GBM)生存预测对高准确度和透明度的双重需求,研究人员指出现有方法往往在性能与可解释性间妥协,且过度依赖单一成像模态,未能充分利用互补信息。该研究提出一种超图神经网络方案,认为这两者并非固有冲突,旨在利用图神经网络的结构优势,在保证强判别能力的同时提取具解释性的特征表征,以提升多模态临床预测能力(原文摘要截断)。

阅读原文 ↗推荐理由:探索利用超图神经网络化解医学影像生存预测中准确率与可解释性难以兼得的痛点。# 超图神经网络# 医疗AI# 胶质母细胞瘤# 可解释性# 生存预测
arXiv 人工智能✦ 精选AI 评分 78/10012:00

Ovis-Embedding:拓展通用全模态嵌入模型前沿

该研究推出了全模态嵌入模型家族 Ovis-Embedding,实现对文本、图像、视频和音频的原生整合。不同于将各个独立的模态塔简单组合,Ovis-Embedding 采用共享的多模态骨干网络,将不同模态编码至统一的表征空间中。该模型以预训练的 Qwen-omni 为骨干网络,通过低秩初始化的对比训练完成适配,并引入了以数据为中心的全模态训练策略。

阅读原文 ↗推荐理由:提出基于统一骨干网络的原生全模态嵌入模型,推动了音视频图文统一表征学习的发展。# 多模态嵌入# 全模态# 表征学习# Qwen-omni# 对比学习
arXiv 人工智能✦ 精选AI 评分 72/10012:00

X-Planner:面向具身智能的事件结构化任务规划框架

针对现代视觉-语言-动作(VLA)系统在长程操作中缺乏显式中间结构、现有思维链规划器依赖粗粒度标注的问题,研究团队提出了 X-Planner 规划前端。该方案同时改善具身推理的监督与表征,融合了第一人称视角、通用操作接口及遥操作等多源数据,构建了具备分层粒度和差异化标注深度的规划数据集。由于原始摘要截断,具体的下游控制效果待全文进一步阐释。

阅读原文 ↗推荐理由:针对具身智能长程任务中规划能力不足的痛点,提出了创新的事件结构化规划前端与多源分层数据集。# 具身智能# 任务规划# VLA# 机器人操作# 思维链
arXiv 人工智能✦ 精选AI 评分 65/10012:00

Lean Pool:由AI智能体自主维护与优化的形式化数学代码库

Lean Pool 是一个形式化数学代码库,其核心特色在于完全由 AI 智能体负责拓展、维护与持续优化。该项目展示了人工智能在形式化定理证明与复杂数学知识归档中的自主管理潜力,有助于提高数学形式化库的组织效率与代码质量。由于原论文摘要提供的信息极为简略,具体的智能体协作机制与工程实现细节仍有待进一步公开。

阅读原文 ↗推荐理由:展示了利用 AI 智能体自主构建与维护形式化数学库的新探索路径。# 形式化数学# Lean# 智能体# 自动定理证明# 代码库维护
arXiv 人工智能✦ 精选AI 评分 70/10012:00

AI神经科学家:面向神经影像分析的交互式智能体界面

神经影像数据分析通常需要专业的编程与统计技能,这给非计算背景的研究人员带来了门槛。为此,研究团队推出了“AI神经科学家”,这是一种用于交互式数据探索的语言智能体。该系统将大语言模型与神经影像专业工具集相结合,支持研究人员直接通过自然语言查询数据质量、执行建模与可视化并设定分析参数,为小规模数据探索提供了一种替代传统脚本处理流程的透明且交互式的解决方案。

阅读原文 ↗推荐理由:将大语言模型智能体引入神经影像学领域,有效降低了专业科研数据分析的编程门槛。# 智能体# 神经影像# AI for Science# 大模型# 交互分析
arXiv 人工智能✦ 精选AI 评分 68/10012:00

MedGate-Fusion:融合初诊文本与生理指标的脑卒中风险分层模型

针对基层医疗中早期卒中风险信号分散于常规指标与非结构化临床文本的难题,研究人员提出了多模态门控架构 MedGate-Fusion。该模型通过 Transformer 提取患者初次就诊叙述的语义嵌入,并与 10 项常规生理风险标志物进行多模态融合。研究基于加拿大基层医疗监测网络(CPCSSN)的电子病历数据,构建了包含超 10 万名患者的初诊队列,旨在实现前瞻性卒中风险分层。

阅读原文 ↗推荐理由:提出结合临床非结构化文本与生理指标的多模态架构,为基层医疗脑卒中早期风险预测提供了实用方案。# 医疗AI# 多模态# 风险预测# 深度学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大模型智能体缺乏人情世故?新研究提出关系社交推理框架ReAdapt

该论文指出当前大模型智能体在社交决策(如是否互动或联系谁)中,往往仅关注内容显著性而忽略人际间的潜在关系(如关系强度、互惠性等)。现有的智能体循环无法根据新关系证据动态调整社交假设,导致在关系与内容线索产生分歧时做出表面化选择。为此,研究团队形式化了这种失效模式,并提出了包含500个样本的关系推理基准测试及ReAdapt方法,以提升智能体的社交推理能力。

阅读原文 ↗推荐理由:针对大语言模型智能体在复杂社交关系推理上的痛点,提出了新的基准与应对方法。# 大模型# 智能体# 社交推理# ReAdapt# 人际关系
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于单次前向传播的注意力路由图实时电路提取方法

传统语言模型的可解释性电路查找通常需要进行大量复杂的干预实验。该研究提出了一种轻量化新方法,将单次前向传播中的注意力视为路由图,筛选出指向答案的关键路径。在归纳和间接宾语识别(IOI)任务中,消融该方法提取的边对模型性能的破坏显著高于随机消融。研究在GPT-2与Pythia模型上验证了该方法的有效性,为低成本理解模型内部机制提供了新路径。

阅读原文 ↗推荐理由:提出了一种仅需单次前向传播即可实时提取模型内部计算回路的高效可解释性研究方法。# 大模型可解释性# 注意力机制# 回路分析# 计算图# 前沿研究
arXiv 人工智能✦ 精选AI 评分 74/10012:00

面向企业数据智能体的学习型数据理解:压缩与路由机制

在企业环境中,结构化数据智能体需要面对分布在模式、数据关联和业务规则中的复杂环境。现有系统常依赖Markdown格式的记忆或技能文件来沉淀信息以减少重复探索,但该做法模糊了合理的分工界限。研究指出,智能体更擅长语义推理,而学习型系统更适合执行预测与数据组织。论文围绕此分工探讨了针对数据智能体的数据压缩与路由方法(注:原文摘要存在截断)。

阅读原文 ↗推荐理由:聚焦企业级结构化数据智能体的落地难题,探讨了结合学习系统进行上下文压缩与路由的架构优化路线。# 数据智能体# 应用工程# 上下文压缩# 数据路由# 智能体
arXiv 人工智能✦ 精选AI 评分 78/10012:00

提升智能体一致性:研究提出通过“技能习惯化”解决重复任务的冗余与偏差

针对当前智能体在重复任务中表现不一致且极度耗费资源的缺陷,研究团队开展测试发现,智能体在重复执行中不一致率达38%至74%,且超95%的生成内容都在重复推导已知方案。为此,研究提出“技能习惯养成”(skill habit formation)机制,让智能体从历史执行记录中挖掘候选确定性技能,使其与既有方案竞争并界定适用输入空间,从而大幅改善智能体在重复任务中的一致性与计算效率。

阅读原文 ↗推荐理由:针对智能体实际落地中严重的输出不一致与重复计算痛点,提出了挖掘确定性习惯技能的有效工程优化方案。# 智能体# 一致性# 技能养成# 计算效率# 任务规划
arXiv 人工智能✦ 精选AI 评分 65/10012:00

基于Wiki LLM索引优化机器学习课程助教系统

该研究探讨大语言模型在充当特定课程导师时的落地优化。研究团队针对真实机器学习课程资料构建了多模态检索增强生成(RAG)系统,前期发现固定检索策略存在局限性,进而转向探索在数据摄入阶段对知识语料库进行结构化整理(如Wiki LLM索引)是否比查询阶段增加检索量更为重要。由于原始论文摘要文本在阐述具体实验前截断,详细结论在摘要中未完全披露。

阅读原文 ↗推荐理由:探讨了教育垂直场景下RAG助教系统在知识摄入索引与查询检索阶段的工程优化取舍。# RAG# 多模态检索# 智能助教# 索引构建# 应用工程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

澄清并非纠错:大模型因“过早承诺”导致多轮对话失效

该研究指出大模型在多轮对话中的交互失败不仅源于上下文记忆丢失,更深层的原因在于“过早后验坍缩”。即在用户初期意图尚不明确时,模型便过早锁定了某种单一的隐藏假设,导致后续用户给出的澄清信息仅被视为对既定假设的微调,而非彻底纠错。研究团队使用 Gemini-2.5-P 在写作、规划和代码任务中设计了可控实验,系统验证了这一导致模型难以调整错误方向的固有机制。

阅读原文 ↗推荐理由:深入揭示了大模型多轮交互中意图对齐失败的深层机理,为改进对话智能体提供了新视角。# 大模型# 多轮对话# 意图对齐# 交互机制# 模型机理
arXiv 人工智能✦ 精选AI 评分 80/10012:00

任务难度决定思维链因果作用:从“装饰性”到“承重性”的转变研究

该研究探讨了大模型思维链(CoT)在生成最终答案时的因果约束力。作者提出了“基于续写的因果测试”方法,通过扰动某一推理步骤、截断链条并强迫模型基于被破坏的前缀继续生成,用以量化CoT对答案的“承重性”(load-bearingness)。在Gemma-2、Llama-3.1和DeepSeek-R1蒸馏模型上的多项基准测试表明,CoT的因果承重性与任务难度密切相关,简单任务中CoT往往流于形式,而在难任务中则切实主导推理方向。

阅读原文 ↗推荐理由:量化研究了思维链对模型答案的真实因果影响,为大模型可解释性与推理监控提供了关键评估方法。# 思维链# 因果推断# 可解释性# 大模型# 推理机制
arXiv 人工智能✦ 精选AI 评分 72/10012:00

跨模型错误中的文本知识蒸馏:鲁棒故障与保守修复

该研究探讨了基于失败案例的文本知识蒸馏方法,旨在通过分析任务错误来发现模型的知识漏洞。研究定义了在推理时注入输入的独立“规则原子”,指出其虽然能编码可迁移的任务知识,但也可能包含特定于原模型的推理补丁,从而在跨模型迁移时产生干扰;此外,注入的规则还可能被错误应用于不相关场景并引发误判。(注:原文摘要末尾未完)

阅读原文 ↗推荐理由:深入分析了通过错误反馈进行跨模型知识蒸馏的不稳定性与规则泛化风险,为大模型推理修复提供了新视角。# 蒸馏# 模型修复# 大模型# 推理机制# 错误分析
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Orthrus:面向迭代检索的异构批处理高效推理服务系统

现代信息检索系统通常同时结合嵌入模型与生成模型处理复杂查询,但现有系统往往将二者隔离部署,粗粒度分配硬件易引发计算气泡,导致 GPU 利用率低和吞吐不足。为此,研究团队提出服务系统 Orthrus。该系统在统一推理循环中引入异构批处理机制,旨在有效整合具有资源冲突特性的嵌入与生成工作负载,提升动态查询下的硬件利用效率。(注:素材摘要文末存在截断)

阅读原文 ↗推荐理由:针对检索增强等场景中嵌入与生成模型混部低效的痛点,提出了创新的异构推理批处理系统设计。# 推理# 异构计算# GPU利用率# 信息检索# 系统架构
arXiv 人工智能✦ 精选AI 评分 70/10012:00

对话式AI分层参与度评估框架:从离线代理到在线决策

针对在线A/B测试受流量和周期限制、难以覆盖大量对话式AI迭代的问题,研究者提出了一种分层参与度评估框架。该研究构建了一套可复用的诊断清单,将离线代理指标解构为三层对齐链条:行为标签与产品结果对齐、分类器与候选助手行为对齐,以及离线聚合信号与在线实验效应相对应。配套评估协议旨在离线环境下无须真实用户暴露即可高精度预测在线实验结果,加速系统迭代。

阅读原文 ↗推荐理由:提出了一套降低对话式AI在线A/B测试成本的分层离线评估框架,对工业级模型迭代优化极具实用价值。# 对话式AI# A/B测试# 离线评估# 用户参与度# 评测
arXiv 人工智能✦ 精选AI 评分 72/10012:00

ZeroGate:面向受治理AI智能体运行时的信任保留快速路径机制

针对AI智能体提前授权可能导致载荷、权限或状态发生漂移的安全风险,研究团队提出ZeroGate架构。该方案将精确操作审批与持久本地准入解耦:签发者签署具有时效性的ActionPass凭证,受信任运行时适配器重构最终操作,再由本地网关验证绑定并消耗nonce。系统利用SQLite事务同步处理nonce注销、配额更新及准入收据生成,在维持信任边界和决策一致性的前提下优化了执行分发延迟。

阅读原文 ↗推荐理由:针对AI智能体运行时的安全管控与执行延迟平衡,提出了解耦审批与准入的实用工程架构。# 智能体# 运行时架构# 安全鉴权# 安全# 访问控制
arXiv 人工智能✦ 精选AI 评分 78/10012:00

面向推理的大语言模型强化学习Rollout效率综述:技术分类与未来方向

面向推理的大语言模型强化学习能显著提升多步推理与代码能力,但轨迹生成(Rollout)阶段也承担了极高的训练计算成本。如何在保障训练数据新鲜度、一致性与统计有效性的前提下提升 Rollout 效率,已成为当前优化的核心课题。本综述对近年来面向推理的强化学习 Rollout 效率研究进行了系统梳理,从底层机制和性能瓶颈等维度对现有优化方法展开分类,并指出了未来的发展方向。

阅读原文 ↗推荐理由:聚焦长思维链大模型强化学习训练中的核心算力瓶颈,为降低 Rollout 阶段的高昂成本提供了前沿的技术全景参考。# 强化学习# 大模型# Rollout效率# 复杂推理# 系统综述
arXiv 人工智能✦ 精选AI 评分 68/10012:00

基于Transformer的OpenXR实时手势识别系统

该研究针对人机交互、虚拟现实及机器人等应用场景,提出了一种基于Transformer架构的实时手势识别系统。研究团队利用Unity中通过OpenXR标准捕获的手部追踪数据,结合手部关节位置与手腕旋转角度信息进行模型训练。依托Transformer出色的序列建模能力,该系统能够有效捕捉短手势中的时序依赖关系,从而实现高精度的实时手势识别与交互。

阅读原文 ↗推荐理由:结合OpenXR标准与Transformer序列建模技术,推进了VR与人机交互中的实时手势识别落地。# 手势识别# OpenXR# Transformer# 虚拟现实# 人机交互
arXiv 人工智能✦ 精选AI 评分 75/10012:00

ShowTellArena:评估智能体从业务演示中理解工作流能力的基准数据集

研究人员提出了 ShowTellArena,这是一个用于评估智能体在观看带有口述解说的业务演示后其理解能力的基准测试协议与公开数据集。该基准模拟了人类通过“边演示边讲解”指导新同事的场景。v1.0 版本涵盖财务、招聘、采购、客户决策、库存和物流等领域的 50 个业务工作流任务,包含屏幕录像、截图、旁白解说及 502 道评估试题,旨在系统性测试智能体对复杂商业流程的掌握水平。

阅读原文 ↗推荐理由:针对智能体从多模态演示与讲解中学习业务工作流的能力,提出了标准化的评测协议与多行业数据集。# 智能体# 评测# 工作流# 多模态# ShowTellArena
arXiv 人工智能✦ 精选AI 评分 75/10012:00

RAG-NAROK:面向检索增强生成的检索感知型知识库投毒攻击

针对检索增强生成(RAG)系统的安全漏洞,该研究指出当前架构对动态检索流水线的依赖带来了新型对抗风险。现有知识库投毒攻击大多采用静态预设注入,未考虑受害系统在面对具体查询时的实际检索内容。为此,论文探索了具有检索感知的投毒机制,分析攻击者如何利用特定源反驳等手段在竞争性检索环境中提升攻击效果,揭示了RAG系统潜在的安全隐患。

阅读原文 ↗推荐理由:揭示了RAG系统在动态检索环境下易受感知型投毒攻击的新型安全脆弱性。# RAG# 知识库投毒# 安全# 对抗攻击# 大模型
arXiv 人工智能✦ 精选AI 评分 65/10012:00

Spectra:用于KYC文档自动化处理的规则驱动LLM流水线

资本市场中的“了解你的客户”(KYC)审查流程通常依赖分析师手动分类文档、从异构数据源提取结构化数据并验证合规性,导致入驻流程常拖延数周。本研究分析发现该流程包含高度可重复且适合AI自动化的环节,进而提出了重构后的自动化工作流及规则驱动的大语言模型流水线Spectra,旨在整合传统繁琐步骤以大幅提升处理效率(论文原始摘要在流程细节处有所截断)。

阅读原文 ↗推荐理由:针对金融合规KYC痛点,探索利用规则与大模型结合的工作流实现文档处理自动化。# 大模型# 文档处理# 金融科技# 工作流