基于 Amazon EKS、EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
文章介绍了如何在 Amazon EKS 上利用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家模型(MoE)的强化学习训练。该方案构建了结合 Amazon EKS、EFA 与 Amazon S3 的技术架构,有效针对大规模 RLHF 与 GRPO 训练场景,将整体强化学习 rollout 阶段的吞吐量提升了 40%,优化了分布式集群的通信与计算效率。
文章介绍了如何在 Amazon EKS 上利用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家模型(MoE)的强化学习训练。该方案构建了结合 Amazon EKS、EFA 与 Amazon S3 的技术架构,有效针对大规模 RLHF 与 GRPO 训练场景,将整体强化学习 rollout 阶段的吞吐量提升了 40%,优化了分布式集群的通信与计算效率。
该实践指南介绍了如何在 Amazon SageMaker HyperPod 上运行开源强化学习框架 SkyRL,采用 GRPO 算法对 Qwen3-VL-8B 视觉语言大模型进行后训练。内容涵盖构建容器镜像、通过 SageMaker Studio 启动 Ray 分布式集群、提交与监控训练作业,以及最终部署和托管训练所得的 LoRA 适配器以进行推理。
语言模型对答案的置信度通常被视为其掌握事实程度的代理指标。该技术手册介绍了一个专门用于直接检验该假设的开源工具包。研究团队通过在包含81个个位数加法虚假答案的伪造语料库上微调小型因果语言模型,并在微调前后使用统一的测量流程,定量对比模型对虚假答案与真实答案的置信度演变。手册详细阐述并论证了该评估流水线的各个构建阶段。
低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0
LangSmith 宣布推出多项重要更新,包括全新架构的 Engine v2、托管深度智能体(Managed Deep Agents)功能以及模型微调(Fine-Tuning)支持等。由于素材未提供详细正文,具体技术细节与改进指标有待进一步披露,但此次更新重点聚焦于提升 LLM 应用与智能体开发的工程化落地及全生命周期管理能力。
autofinetune 项目推出了一套全自动大模型后训练研究闭环,涵盖监督微调(SFT)和基于 GRPO 的强化学习。开发者只需在单个 Markdown 文档中设定边界条件与评估指标,AI Agent 便能自主修改训练脚本、发起实验,并将验证有效的超参数优化自动提交至 Git。该项目基于 Google 的 Tunix、Gemma 和 Cloud TPU 技术栈构建,消除了繁琐的人工微调过程,已在函数调用与数学推理任务中验证了无人工干预的性能提升。
近期后训练已成为大模型领域备受瞩目的核心议题。有企业推出低门槛的后训练服务,旨在通过两周一次的高频迭代节奏以及1000美元起的亲民价格,推动后训练技术向更广泛的开发者普及,实现“人人可用”。由于当前所获素材信息较为有限,关于该公司的具体技术路线、优化机制以及完整商业服务形态等细节,仍有待进一步披露。
针对结构化生物医学数据分析,表格基座模型展现出巨大潜力,其中TabPFN在小样本表格分类任务中表现尤为突出。然而,优化和预条件策略对生物医学场景微调的影响尚缺乏研究。本文对TabPFN v2.5展开系统性实证评估,在涵盖阿尔茨海默病、乳腺癌、精神分裂症等疾病及KEEL库的59个生物医学数据集上,测试了五种基于AdamW的预条件策略,为优化生物医学表格基座模型微调提供了实验参考。
本文探讨了生产级智能客服系统中的核心部署问题:针对意图分类、问答、摘要和工具调用等多项技能,究竟应采用多个专用模型,还是通过多任务微调、连续更新或模型合并训练单一模型。研究团队基于 Qwen、Gemma、Llama 和 Mistral 等 5 个模型家族的 13 款模型(涵盖 0.6B 至 32B 参数),在 4 个公开及 4 个专有客服数据集上展开了系统性评测与策略比较。
该研究针对预训练流式生成模型的下游奖励微调问题,提出了一种名为Wasserstein倾斜流的新框架。传统方法多将其表述为基于KL散度正则化的奖励倾斜分布采样,而本研究构建了直接基于预训练漂移的最优传输正则化项。与传统的重加权基分布不同,该目标直接将单个样本输运至高奖励区域,使其等价于一种确定性过程,从而实现了免仿真的强化学习模型优化。
该论文针对自动定理证明(ATP)中微调大语言模型的对齐问题展开研究。当前大模型常作为树搜索的引导策略,而传统交叉熵损失在搜索场景下并非最优。将对齐策略拓展至树搜索具有较大挑战,因为证明发现过程高度依赖监督演示中未包含的偏离轨迹状态的探索与恢复。为此,作者拓展了相关计算对齐方法以直接优化搜索生成器。注:由于原摘要结尾截断,更多技术细节尚未完整披露。
大模型工程化与可观测平台 LangSmith 正式推出模型微调(Fine-Tuning)功能。该更新旨在帮助开发者将其应用运行中的追踪与评估数据更紧密地衔接至模型微调工作流,以优化专属模型表现并降低使用成本。由于原始素材未提供具体正文内容,关于支持的基础模型、训练流程集成及具体部署机制等详细技术细节尚待进一步公开。
文章介绍了针对Kimi-K3模型构建高效DSpark训练系统的技术实践。通过结合投机采样技术(Speculators)与Mooncake分布式架构,团队在GB300 NVL72算力集群上成功实现了多节点DSpark的高效扩展与训练,大幅提升了大模型训练中的吞吐表现与集群算力利用效率。
AI助理工具Fyxer分享了其打造高信任度AI高管助理的实践经验。该产品结合OpenAI大模型、模型微调技术、长期记忆机制以及真实用户的反馈循环,能够自动化整理用户的电子邮件收件箱,并深度模仿每位用户的独特口吻和写作风格来草拟回复邮件,从而在实际工作场景中建立用户对AI助理的信任度与实用性。
vime与RL-Kernel在AMD Instinct MI300X及ROCm软件栈上,实现了Megatron训练端与vLLM推理端(Rollout)选定Token对数概率的按位(bit-for-bit)完全一致。该技术解决了大模型强化学习微调过程中,因训练与采样引擎底层算子实现差异导致的数值偏差痛点,达成测试零误差,大幅提升了AMD算力生态在RLHF等强化学习工作流中的稳定性和可用性。