高并发推理引擎 vLLM 迎来 0.28.0 重磅更新,汇总 270 位开发者的 584 项提交。全面优化 Kimi-K3 与 DeepSeek-V4 稀疏 MLA(覆盖 Decode、MTP 与 DSpark 推测解码),Model Runner V2 支持 E/P/D 分离与权重卸载,KV Cache 新增磁盘分层存储。
核心要点速览 (Key Takeaways)
- ✓引入自适应推测 Token 预算机制,将端到端首字延迟(TTFT)大幅降低 55–65%;
- ✓DeepSeek-V4 稀疏 MLA 实现全链路打通,Kimi-K3 共享专家分片技术使单卡节省约 17 GiB 显存;
- ✓KV Cache 引入内存-磁盘分层架构,默认批处理 Token 限制倍增至 16384,全面支持跨硬件平台(NVIDIA、AMD、Intel XPU、CPU)。