vLLM 基于 GB300 NVL72 实现超大模型 Prefill-Decode 分离推理
该内容介绍了如何使用 vLLM 推理框架在英伟达 GB300 NVL72 硬件系统上,通过 Prefill-Decode(PD)分离架构运行超大规模模型 Qwen3.8-2.4T。该优化方案实现了 5K 吞吐量和 180 交互度指标,文章同时提供了供开发者复现这一推理性能测试结果的具体方法与指引。
该内容介绍了如何使用 vLLM 推理框架在英伟达 GB300 NVL72 硬件系统上,通过 Prefill-Decode(PD)分离架构运行超大规模模型 Qwen3.8-2.4T。该优化方案实现了 5K 吞吐量和 180 交互度指标,文章同时提供了供开发者复现这一推理性能测试结果的具体方法与指引。
本文介绍了如何结合使用英伟达硬件视频解码库 PyNvVideoCodec 与大模型推理引擎 vLLM,在多 GPU 环境下实现视频字幕生成与视频描述任务的高效扩展。该方案通过硬件级视频解码加速数据预处理流程,有效解决了多模态视频理解任务中的数据吞吐瓶颈,提升了多卡并行推理的整体效率与性能表现。
文章介绍了针对Kimi-K3模型构建高效DSpark训练系统的技术实践。通过结合投机采样技术(Speculators)与Mooncake分布式架构,团队在GB300 NVL72算力集群上成功实现了多节点DSpark的高效扩展与训练,大幅提升了大模型训练中的吞吐表现与集群算力利用效率。
Novita AI 与 vLLM 社区合作开源了高性能 W4A16 MoE CUDA 算子 Chord。该算子专为 Kimi K2.x 等混合专家模型的推理服务架构优化,支持与 Humming 兼容的索引路径及 SM90 分组。基准测试显示,Chord 在英伟达 H200 芯片上可实现最高 1.3 倍的加速,在未调优的 B300 芯片上加速比达 2.15 倍,显著优化了 MoE 架构的推理性能。
vime与RL-Kernel在AMD Instinct MI300X及ROCm软件栈上,实现了Megatron训练端与vLLM推理端(Rollout)选定Token对数概率的按位(bit-for-bit)完全一致。该技术解决了大模型强化学习微调过程中,因训练与采样引擎底层算子实现差异导致的数值偏差痛点,达成测试零误差,大幅提升了AMD算力生态在RLHF等强化学习工作流中的稳定性和可用性。
文章介绍了针对 Kimi K3 模型在开源推理框架 vLLM 中的全栈服务优化方案,最终实现了 2.8 倍的吞吐量提升。优化措施覆盖调度机制、KDA 前缀缓存、ReplaySSM 状态恢复、预填充与解码(PD)分离及状态卸载,并对并行策略、混合专家(MoE)结构以及 GPU 底层算子进行了深度调优。