任务难度决定思维链因果作用:从“装饰性”到“承重性”的转变研究
该研究探讨了大模型思维链(CoT)在生成最终答案时的因果约束力。作者提出了“基于续写的因果测试”方法,通过扰动某一推理步骤、截断链条并强迫模型基于被破坏的前缀继续生成,用以量化CoT对答案的“承重性”(load-bearingness)。在Gemma-2、Llama-3.1和DeepSeek-R1蒸馏模型上的多项基准测试表明,CoT的因果承重性与任务难度密切相关,简单任务中CoT往往流于形式,而在难任务中则切实主导推理方向。
推荐理由量化研究了思维链对模型答案的真实因果影响,为大模型可解释性与推理监控提供了关键评估方法。
原标题:From Decorative to Load-Bearing: Task Difficulty Shapes the Causal Role of Chain-of-Thought
阅读 arXiv 人工智能 原文 ↗