AIDC
← 返回全部动态
arXiv 机器学习AI 评分 75/10009月25日 12:00

LastOPD:解决隐状态同策略大模型蒸馏中的后期崩溃问题

该研究针对大模型同策略蒸馏(OPD)缺乏教师模型隐层思考过程的问题展开探索。尽管引入隐状态监督(Latent supervision)能对齐学生与教师模型的内部状态,但在将Qwen3-4B/8B蒸馏至Qwen3-1.7B-Base的实验中,研究人员发现该方法存在“早期增益、后期崩溃”的失效现象,MATH-500准确率虽迅速提升但随后崩溃。为此,论文提出了LastOPD方法以抑制此类崩溃。

推荐理由针对大语言模型同策略隐层蒸馏中性能崩溃问题提出解决方案,对模型轻量化与对齐训练具有参考价值。

原标题:LastOPD: Taming Collapse in Latent On-Policy Distillation

阅读 arXiv 机器学习 原文 ↗