vLLM 于 10 月 5 日发布 v0.31.0(717 提交、307 位贡献者,其中 96 位新人)。新增 vllm preload 权重缓存守护进程让量化后权重跨引擎重启常驻显存,实验性 CRIU 快照可恢复已初始化引擎;DeepSeek-V4.1-Flash 在 SM100 上默认启用 FlashMLA mega attention + NVFP4 压缩 KV;Model Runner V2 支持草稿模型推测解码;安全上默认拒绝请求级多模态 kwargs,并修复 LoRA 名与 cache_salt 的前缀缓存碰撞。升级前需注意多项破坏性变更。
核心要点速览
- ✓规模:717 次提交、307 位贡献者(96 位新人),见 Release 说明。
- ✓秒级重启:
vllm preload让量化后权重跨重启常驻 GPU,已支持 DP、MTP 草稿模型与/health就绪探针;vllm snapshot create/restore用 CRIU 恢复 TP1 引擎(实验)。 - ✓安全默认收紧:请求级
mm_processor_kwargs/media_io_kwargs默认拒绝,需显式--trust-request-mm-kwargs;LoRA 路径纳入块哈希,防止前缀缓存串数据。 - ✓破坏性变更:移除
tokenizer_mode="slow",quantization="fp8"在线量化改为fp8_per_tensor,--enforce-eager还会关闭 JIT 预热。 - ✓模型热路径:GLM-5.3-Flash 元数据操作快 1.6–4.8 倍、索引器省 3 GiB;KimiViT QK RoPE 融合最高 29 倍;Qwen3.8-Flash-Next 在 DGX Spark 上加载省约 25 秒。
开发者 3 秒速决决策指标
本地显存不够?先比较云端 API 与自部署的实际成本
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
自托管大模型推理的两大痛点是重启慢和升级踩坑:百 B 级 MoE 量化权重每次重启都要重新加载、预热,线上扩缩容和热修复代价很高;而多租户服务里,请求级参数与前缀缓存又可能带来串数据风险。vLLM v0.31.0 汇集 717 次提交(307 位贡献者),正面处理这些问题。
架构亮点与底层机制
- 快速重启:新增
vllm preload权重缓存守护进程,把量化后的权重常驻 GPU 显存,引擎重启时直接复用,已支持数据并行、MTP 草稿模型、/health端点与就绪等待;实验性的vllm snapshot create/restore借助 CRIU 恢复一个已完全初始化的 TP1 引擎。 - DeepSeek-V4.1-Flash:SM100 上默认启用 FlashMLA mega attention + NVFP4 压缩 KV,并加入 DeepGEMM 稀疏 MQA logits、Mega-Gate 等融合。
- Model Runner V2:支持草稿模型推测解码与自定义 logits processor,新增 LiLiCorr drafter。
- 调度:
--max-num-active-seqs独立限制运行中请求数;已持有 KV 块的请求优先调度。
权威 Benchmark 与实测跑分对比
官方未给出端到端吞吐总分,只公布了组件级数字:GLM-5.3-Flash 元数据操作快 1.6–4.8 倍、索引器解码工作区省 3 GiB;KimiViT QK RoPE 融合最高 29 倍;MiniMax-M3 的 Conv3d patch embedding 约 62 倍;Qwen3.8-Flash-Next 在 DGX Spark 上权重加载省约 25 秒。实际收益请以自己的负载压测为准。
开发者实战落地与开箱指南
安装:pip install vllm 或 docker pull vllm/vllm-openai:v0.31.0(默认 CUDA 13.0,另有 cu129、ROCm、CPU、XPU 镜像)。升级前务必核对破坏性变更:请求级 mm_processor_kwargs/media_io_kwargs 默认被拒(需 --trust-request-mm-kwargs);tokenizer_mode="slow" 已移除;在线 FP8 量化改用 fp8_per_tensor;--enable-mamba-fine-grained-prefix-cache 更名为 --enable-mamba-shared-prefix-checkpoint。频繁滚动发布的团队可优先试 vllm preload。详见 vLLM 文档。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察