SLCA-GRPO:解决工具调用强化学习中的跨段信用分配错误
具备工具调用能力的智能体通常交替生成结构化工具调用和自然语言总结。现有同策略强化学习算法(如GRPO)由于将整条轨迹的单一优势值无差别广播至所有Token,导致总结生成中的梯度噪声泄漏至工具决策Token,引发跨段信用分配错误与优化不稳定。为此,研究者提出了SLCA-GRPO框架,通过引入分段锁定的信用分配机制,有效隔离噪声并提升了工具调用策略训练的鲁棒性。
推荐理由针对智能体工具调用在强化学习(GRPO)训练中的信用分配缺陷提出针对性改进,对提升智能体决策稳定性具有实用参考价值。
原标题:SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
阅读 arXiv 人工智能 原文 ↗