连续扩散语言模型推理突破:ELF-REG将连续扩散架构扩展至数学与代码任务
该研究针对全连续扩散语言模型(dLM)在复杂推理任务中落后于自回归(AR)模型的难题,提出了ELF-REG架构。研究团队将嵌入语言流(ELF)拓展至GSM8K、MATH-500、HumanEval等数学与代码基准,并引入结合表征对齐与纠缠的机制(REPA+REG),通过冻结的AR教师模型监督中间去噪步骤,有效提升了连续扩散模型并行解码与复杂逻辑推理的扩展能力。
该研究针对全连续扩散语言模型(dLM)在复杂推理任务中落后于自回归(AR)模型的难题,提出了ELF-REG架构。研究团队将嵌入语言流(ELF)拓展至GSM8K、MATH-500、HumanEval等数学与代码基准,并引入结合表征对齐与纠缠的机制(REPA+REG),通过冻结的AR教师模型监督中间去噪步骤,有效提升了连续扩散模型并行解码与复杂逻辑推理的扩展能力。
扩散语言模型通过迭代去噪生成文本。研究团队发现该类模型中存在一种“稳定但错误锁定”的推理故障,即答案在去噪阶段早期便过早稳定于错误结果。置信度、熵等常规表层解码信号难以有效区分正误锁定。为此,论文将选择性推理修复建模为轻量级测试时规划任务,并提出了 LOCKR,一种基于隐状态轨迹引导的规划器,专门用于检测与修复该问题。