vllm-metal 发布:为苹果芯片带来高并发大模型推理服务支持
vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。
vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。
该内容介绍了如何使用 vLLM 推理框架在英伟达 GB300 NVL72 硬件系统上,通过 Prefill-Decode(PD)分离架构运行超大规模模型 Qwen3.8-2.4T。该优化方案实现了 5K 吞吐量和 180 交互度指标,文章同时提供了供开发者复现这一推理性能测试结果的具体方法与指引。
Novita AI 与 vLLM 社区合作开源了高性能 W4A16 MoE CUDA 算子 Chord。该算子专为 Kimi K2.x 等混合专家模型的推理服务架构优化,支持与 Humming 兼容的索引路径及 SM90 分组。基准测试显示,Chord 在英伟达 H200 芯片上可实现最高 1.3 倍的加速,在未调优的 B300 芯片上加速比达 2.15 倍,显著优化了 MoE 架构的推理性能。