CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架
针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。
推荐理由提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。
原标题:CounterRoute: Self-Routed Reasoning via Hierarchical Counterfactual Credit Assignment
阅读 arXiv 人工智能 原文 ↗