Transformer语言模型的序列计算蒸馏方法
针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。
推荐理由提出了一种动态压缩Token序列以减少Transformer自回归计算开销的高效架构优化方案。
原标题:Distilling Sequential Computation in Transformer Language Models
阅读 arXiv 自然语言处理 原文 ↗