AIDC
← 返回全部动态
arXiv 人工智能AI 评分 68/10009月25日 12:00

可验证奖励强化学习在小型搜索智能体中的应用研究

该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。

推荐理由探索了端侧极小参数模型直接利用GRPO和可验证强化学习进行搜索问答训练的新路径。

原标题:Reinforcement Learning with Verifiable Rewards for Small Search Agents

阅读 arXiv 人工智能 原文 ↗