研究发现大语言模型中语法“祖母神经元”罕见,提出无探针分析框架
理解大语言模型(LLM)如何编码语言结构是可解释性研究的核心难题。传统的诊断分类器(探针)方法存在引入容量混淆与校准偏差等局限,往往难以区分模型自身的内禀表征与探针本身的拟合能力。为解决这一问题,该研究提出了一个无探针(probe-free)框架,用于在单个神经元层面上定位语言选择性,探索模型内部表征机制。
推荐理由针对大模型可解释性中探针方法的固有缺陷,提出了在神经元级别分析语言表征的全新无探针框架。
原标题:Grammatical "grandmother neurons" are rare in LLMs
阅读 arXiv 自然语言处理 原文 ↗