vLLM 发布 v0.29.0,Model Runner V2 成为所有模型的默认运行器。本版累计 594 次提交、277 名贡献者。亮点包括:Kimi-K3 再优化、DeepSeek-V4 共享专家并入 MegaMoE、Mamba 前缀缓存保留内部 prefill 检查点(TTFT 约提升 9–25%)、投机解码经 API 报告每请求接受率,以及面向 RL 权重同步的 sharded_rdt P2P 后端;并新增 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、NemotronH Omni Reasoning V3 等模型支持。
核心要点速览 (Key Takeaways)
- ✓Model Runner V2 成为所有模型的默认 runner。
- ✓Mamba 前缀缓存使 TTFT 约提升 9–25%;投机解码可经 API 查看接受率。
- ✓DeepSeek-V4 MegaMoE 融合与 RL sharded_rdt P2P 权重同步,并扩展多款新模型。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察