Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
最新研究发现,大语言模型的能力可以通过与目标任务无关的文本进行传递。传统后训练通常依赖任务特定数据,而研究团队提出了一种“主动无任务蒸馏”(ATD)方法,仅需教师模型针对每个提示生成一个词即可实现能力转移。该方法揭示了后训练会在任务无关的决策中留下可被探测的“行为阴影”,突破了此前潜意识学习研究需依赖大量生成的限制,深化了对模型后训练表征变化及知识蒸馏机制的理解。
基于大语言模型的多智能体系统虽能自动化挖掘量化阿尔法因子,但依赖外部API带来了成本、可用性及保密性挑战,且长期运行易导致研究路径坍塌。为此,研究团队提出 AlphaDiverse 框架,整合了多智能体研究系统、多样化研究路径收集以及本地智能体后训练流程。该框架通过生成互补的研究方案组合并动态调整研究环境,旨在提升本地量化研究智能体在因子挖掘中的多样性探索能力。
该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。
随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。
近期后训练已成为大模型领域备受瞩目的核心议题。有企业推出低门槛的后训练服务,旨在通过两周一次的高频迭代节奏以及1000美元起的亲民价格,推动后训练技术向更广泛的开发者普及,实现“人人可用”。由于当前所获素材信息较为有限,关于该公司的具体技术路线、优化机制以及完整商业服务形态等细节,仍有待进一步披露。