AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架

针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。

阅读原文 ↗推荐理由:提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。# 大模型# 强化学习# 思维链# 算力# 推理
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 72/10012:00

X-Planner:面向具身智能的事件结构化任务规划框架

针对现代视觉-语言-动作(VLA)系统在长程操作中缺乏显式中间结构、现有思维链规划器依赖粗粒度标注的问题,研究团队提出了 X-Planner 规划前端。该方案同时改善具身推理的监督与表征,融合了第一人称视角、通用操作接口及遥操作等多源数据,构建了具备分层粒度和差异化标注深度的规划数据集。由于原始摘要截断,具体的下游控制效果待全文进一步阐释。

阅读原文 ↗推荐理由:针对具身智能长程任务中规划能力不足的痛点,提出了创新的事件结构化规划前端与多源分层数据集。# 具身智能# 任务规划# VLA# 机器人操作# 思维链
arXiv 人工智能✦ 精选AI 评分 80/10012:00

任务难度决定思维链因果作用:从“装饰性”到“承重性”的转变研究

该研究探讨了大模型思维链(CoT)在生成最终答案时的因果约束力。作者提出了“基于续写的因果测试”方法,通过扰动某一推理步骤、截断链条并强迫模型基于被破坏的前缀继续生成,用以量化CoT对答案的“承重性”(load-bearingness)。在Gemma-2、Llama-3.1和DeepSeek-R1蒸馏模型上的多项基准测试表明,CoT的因果承重性与任务难度密切相关,简单任务中CoT往往流于形式,而在难任务中则切实主导推理方向。

阅读原文 ↗推荐理由:量化研究了思维链对模型答案的真实因果影响,为大模型可解释性与推理监控提供了关键评估方法。# 思维链# 因果推断# 可解释性# 大模型# 推理机制
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大模型陈述的推理步骤是否真正承载因果权重?

思维链(CoT)监控通常假设模型生成的推理过程真实反映了得出答案的计算机制。以往评估推理真实性的指标主要停留在行为层面,即通过修改推理文本来观察输出变化。该研究提出一种在激活层面测量自生成推理真实性的因果分析方法。与以往仅评估性能衰减的因果审计不同,该方法通过带有已知反事实目标的激活干预,验证每一次干预是否能将答案切换至特定的反事实实体,从而精确评估推理步骤的因果支撑度。

阅读原文 ↗推荐理由:该研究深入模型激活层面验证思维链推理的因果真实性,为大模型的可解释性与推理可靠性评估提供了关键方法。# 思维链# 可解释性# 因果分析# 前沿研究# 大模型