AIDC
← 返回全部动态
AITNT · AI头条(网页)AI 评分 72/10009月25日 10:07

北大等团队开源强化学习数据策略框架DataFlex-RL,简化模型后训练对比

随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。

推荐理由北大联合多家机构开源针对大模型强化学习后训练的数据策略框架,提升了后训练研究的对比规范与工程效率。

原标题:日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

阅读 AITNT · AI头条(网页) 原文 ↗