大模型书写系统选择机制:研究揭示深层网络才最终确定输出文字
该研究利用逻辑回归探测和Logit-lens两种可解释性分析方法,探究大语言模型在各层中如何分布与处理书写系统(文字类型)知识。探测实验显示出明显的非对称性:输入文字系统与指令指定的输出文字系统在网络的极早层已被编码,但对实际输出文字系统的最终确定直到末尾深层才显现,中间大部分层级的表征仍默认倾向拉丁字母。这一两阶段机制为深入理解大模型的内部表征演进提供了重要证据。
该研究利用逻辑回归探测和Logit-lens两种可解释性分析方法,探究大语言模型在各层中如何分布与处理书写系统(文字类型)知识。探测实验显示出明显的非对称性:输入文字系统与指令指定的输出文字系统在网络的极早层已被编码,但对实际输出文字系统的最终确定直到末尾深层才显现,中间大部分层级的表征仍默认倾向拉丁字母。这一两阶段机制为深入理解大模型的内部表征演进提供了重要证据。
理解大语言模型(LLM)如何编码语言结构是可解释性研究的核心难题。传统的诊断分类器(探针)方法存在引入容量混淆与校准偏差等局限,往往难以区分模型自身的内禀表征与探针本身的拟合能力。为解决这一问题,该研究提出了一个无探针(probe-free)框架,用于在单个神经元层面上定位语言选择性,探索模型内部表征机制。
该研究探讨了稀疏自编码器(SAE)在解析语言模型内部表征时揭示的语言学结构。作者以词性(PoS)类别为受控实验案例,分析形态句法信息究竟是由单个隐特征还是结构化特征组所编码。实验表明,词性差异高度可从SAE激活中恢复,但并非简单的一对一隐变量映射,且该恢复能力无法归结为单纯的词汇记忆,同时开放类与封闭类词性在表征特性上存在显著差异。