AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
AITNT · AI头条(网页)✦ 精选AI 评分 72/10010:07

北大等团队开源强化学习数据策略框架DataFlex-RL,简化模型后训练对比

随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。

阅读原文 ↗推荐理由:北大联合多家机构开源针对大模型强化学习后训练的数据策略框架,提升了后训练研究的对比规范与工程效率。# 强化学习# 大模型# 开源# 北京大学# 后训练