AIDC
← 返回全部动态
arXiv 人工智能AI 评分 76/10009月25日 12:00

从自我蒸馏到自我练习:多轮智能体特权信息利用机制研究

该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。

推荐理由深入剖析了多轮智能体后训练中特权信息蒸馏的失效机理,为改进Agent训练范式提供了重要参考。

原标题:From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents

阅读 arXiv 人工智能 原文 ↗