Google Cloud 在 vLLM 中原生支持 TPU,优化长上下文多模态嵌入推理
Google Cloud 已将 TPU 原生支持集成至开源推理框架 vLLM,开发者可通过 GKE 弹性扩展嵌入模型流水线。针对 Qwen3-Embedding-8B 等模型的 15K+ 超长上下文推理,工程团队引入了硬件安全张量对齐、JAX/XLA 编译预热及分块预填充的混合 StepPool 架构等专项优化,在实现与 GPU 基线近乎一致的数值精度的同时提升吞吐,相关配置方案已在 GitHub 开源。
Google Cloud 已将 TPU 原生支持集成至开源推理框架 vLLM,开发者可通过 GKE 弹性扩展嵌入模型流水线。针对 Qwen3-Embedding-8B 等模型的 15K+ 超长上下文推理,工程团队引入了硬件安全张量对齐、JAX/XLA 编译预热及分块预填充的混合 StepPool 架构等专项优化,在实现与 GPU 基线近乎一致的数值精度的同时提升吞吐,相关配置方案已在 GitHub 开源。
本文主要探讨在 AMD GPU 硬件平台上利用 vLLM 推理框架实现投机解码(Speculative Decoding)的技术探索与优化。投机解码是一种有效降低大语言模型推理延迟的高级加速技术。结合 vLLM 与 AMD 算力生态,旨在提升大模型的生成吞吐量。由于原始素材仅提供标题,具体的实现细节、支持的硬件型号及性能评测数据等信息暂未披露。
开源大模型推理框架 vLLM 介绍了其内置的文本水印实现方案。该方案采用保持分布特性的 Gumbel-max 文本水印技术,结合高效的 GPU 内核优化与统计学检测方法,并支持推测解码(speculative decoding)等高级推理加速特性。通过系统级工程优化,vLLM 在保障模型生成质量与推理吞吐效率的同时,为 AI 生成内容提供了可靠的水印嵌入与溯源能力。
开源大模型推理引擎 vLLM 的关联组件库 vllm-proto 正式发布 0.3.0 版本。由于发布页面目前仅包含版本更新标签,未提供详细的更新日志、特性列表或功能改进说明,具体变更细节有待官方进一步补充披露。该库通常用于定义 vLLM 相关的协议缓冲区与接口规范,为推理系统服务化提供基础通信支持。
文章介绍了针对 Kimi K3 模型在开源推理框架 vLLM 中的全栈服务优化方案,最终实现了 2.8 倍的吞吐量提升。优化措施覆盖调度机制、KDA 前缀缓存、ReplaySSM 状态恢复、预填充与解码(PD)分离及状态卸载,并对并行策略、混合专家(MoE)结构以及 GPU 底层算子进行了深度调优。