AIDC
DC AI 热点

全部 AI 动态

9月22日2026-09-22
vLLM 官方博客(网页)✦ 精选AI 评分 68/10000:00

vllm-metal 发布:为苹果芯片带来高并发大模型推理服务支持

vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。

阅读原文 ↗推荐理由:知名大模型推理框架 vLLM 拓展至苹果芯片生态,提升了本地及端侧并发推理效率。# 推理# 端侧AI# 开源# 智能体# 芯片
9月21日2026-09-21
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

vLLM 基于 GB300 NVL72 实现超大模型 Prefill-Decode 分离推理

该内容介绍了如何使用 vLLM 推理框架在英伟达 GB300 NVL72 硬件系统上,通过 Prefill-Decode(PD)分离架构运行超大规模模型 Qwen3.8-2.4T。该优化方案实现了 5K 吞吐量和 180 交互度指标,文章同时提供了供开发者复现这一推理性能测试结果的具体方法与指引。

阅读原文 ↗推荐理由:展示了在英伟达下一代 GB300 架构上通过 vLLM 实现超大模型高吞吐 PD 分离推理的技术实践。# 推理# 算力# 英伟达# 大模型# 开源
9月15日2026-09-15
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

Novita AI 开源 Chord:面向 Kimi K2.x 的高效 INT4 MoE 算子,推理提速最高达 2.15 倍

Novita AI 与 vLLM 社区合作开源了高性能 W4A16 MoE CUDA 算子 Chord。该算子专为 Kimi K2.x 等混合专家模型的推理服务架构优化,支持与 Humming 兼容的索引路径及 SM90 分组。基准测试显示,Chord 在英伟达 H200 芯片上可实现最高 1.3 倍的加速,在未调优的 B300 芯片上加速比达 2.15 倍,显著优化了 MoE 架构的推理性能。

阅读原文 ↗推荐理由:开源了针对热门 MoE 架构的高性能量化算子,显著提升主流及下一代 GPU 的推理效率。# 推理# 开源# 大模型# 算力# 芯片