大模型书写系统选择机制:研究揭示深层网络才最终确定输出文字
该研究利用逻辑回归探测和Logit-lens两种可解释性分析方法,探究大语言模型在各层中如何分布与处理书写系统(文字类型)知识。探测实验显示出明显的非对称性:输入文字系统与指令指定的输出文字系统在网络的极早层已被编码,但对实际输出文字系统的最终确定直到末尾深层才显现,中间大部分层级的表征仍默认倾向拉丁字母。这一两阶段机制为深入理解大模型的内部表征演进提供了重要证据。
推荐理由该研究揭示了大语言模型在多语言和书写系统转换中的内部两阶段处理机制,对模型可解释性与内部表征研究具有重要参考价值。
原标题:Script Choice in LLMs: Evidence for Late-Layer Commitment
阅读 arXiv 自然语言处理 原文 ↗