vLLM 发布 v0.29.0,Model Runner V2 成为所有模型的默认运行器。本版累计 594 次提交、277 名贡献者。亮点包括:Kimi-K3 再优化、DeepSeek-V4 共享专家并入 MegaMoE、Mamba 前缀缓存保留内部 prefill 检查点(TTFT 约提升 9–25%)、投机解码经 API 报告每请求接受率,以及面向 RL 权重同步的 sharded_rdt P2P 后端;并新增 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、NemotronH Omni Reasoning V3 等模型支持。

核心要点速览 (Key Takeaways)

  • Model Runner V2 成为所有模型的默认 runner。
  • Mamba 前缀缓存使 TTFT 约提升 9–25%;投机解码可经 API 查看接受率。
  • DeepSeek-V4 MegaMoE 融合与 RL sharded_rdt P2P 权重同步,并扩展多款新模型。
ADSponsored