AIDC
← 返回全部动态
vLLM 官方博客(网页)规则精选09月08日 00:00

GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM

vLLM integrates HiSparse as a pressure-driven memory tier that composes with the Hybrid Memory Allocator and KV offloading, letting GLM 5.3 requests keep decodi

阅读 vLLM 官方博客(网页) 原文 ↗