AIDC
← 返回全部动态
vLLM 官方博客(网页)规则精选09月13日 00:00

Kimi K3 Performance Optimizations in vLLM: The Road to 2.8× Throughput

Kimi K3 serving optimizations across scheduling, KDA prefix caching, ReplaySSM state recovery, PD disaggregation and state offload, parallelism, MoE, and GPU ke

阅读 vLLM 官方博客(网页) 原文 ↗