Google Cloud 在 vLLM 中原生支持 TPU,优化长上下文多模态嵌入推理
Google Cloud 已将 TPU 原生支持集成至开源推理框架 vLLM,开发者可通过 GKE 弹性扩展嵌入模型流水线。针对 Qwen3-Embedding-8B 等模型的 15K+ 超长上下文推理,工程团队引入了硬件安全张量对齐、JAX/XLA 编译预热及分块预填充的混合 StepPool 架构等专项优化,在实现与 GPU 基线近乎一致的数值精度的同时提升吞吐,相关配置方案已在 GitHub 开源。
推荐理由vLLM 原生集成 Google Cloud TPU 并在超长上下文嵌入推理上实现硬件级深度优化,对异构算力基础设施生态建设具有重要参考价值。
原标题:Enterprise-Grade Precision for Long-Context Multimodal Embedding Inference on Cloud TPU
阅读 Google Developers · AI 筛选 原文 ↗