vLLM 团队联合 Inferact、Red Hat 与 NVIDIA 于 10 月 9 日发布 Rubin 早期支持:基于 CUDA 13.4 的每日镜像已可在 Vera Rubin NVL72 上服务 DeepSeek、Kimi、GLM、MiniMax。官方口径下,SemiAnalysis AgentX 上 MiniMax M3 同等交互性单卡吞吐最高为 GB200 的 7.84 倍;MLPerf Inference v6.1 的 VLM 项上 Qwen3-VL-235B-A22B 相对 GB300 NVL72 最高 3.7 倍。

核心要点速览

  • ✓硬件对比 GB200 NVL72:NVFP4 算力 5 倍、HBM4 带宽约 2.4 倍、NVLink 双向带宽 1.7 倍,softmax 指数运算快 2–4 倍(vLLM 博文)
  • ✓AgentX + MiniMax M3:同等交互性单卡吞吐最高 7.84 倍,150 TPS 约束下 5.18 倍(官方口径,早期结果)
  • ✓MLPerf Inference v6.1:Qwen3-VL-235B-A22B 经 vLLM + Dynamo,相对 GB300 NVL72 最高 3.7 倍
  • ✓CUDA 13.4 locality domain 拆分 MoE 权重,小 token decode 场景 MoE 层平均提速约 1.2 倍
  • ✓开箱镜像:vllm/vllm-openai:cu134-nightly(CUDA 13.4 + PyTorch 2.15)
vLLM 正式支持 NVIDIA Vera Rubin NVL72:AgentX 上 MiniMax M3 单卡吞吐达 GB200 的 7.84 倍
🖼️要闻配图
点击全屏高清查看
🧭

本地显存不够?先比较云端 API 与自部署的实际成本

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

Agent 场景下,长上下文、多轮工具调用让推理服务同时被吞吐和交互延迟卡住。GB200 上 MoE 模型 decode 主要受 HBM 读权重速度限制,专家并行的 all-to-all 又挤占 NVLink。NVIDIA 下一代 Vera Rubin 平台发布后,开源推理引擎能否第一时间跑起来、跑出多少提升,是部署方最关心的问题。

架构亮点与底层机制

据 vLLM 官方博文,Rubin 沿用 Blackwell 架构家族(新编译目标 sm107,sm100f 内核可直接运行),因此 vLLM 的 Blackwell 内核“Day-0”可用。关键优化有三点:一是借 CUDA 13.4 的 locality domain,把 MoE 权重按列拆到两个内存域,让每个域的 SM 只读近端 HBM,小 token decode 下 MoE 层平均提速约 1.2 倍;二是通过 FlashInfer 0.7.0 引入 Rubin 调优的 attention、GEMM、MoE 内核;三是为 MiniMax Sparse Attention 预填充做了 FP8 适配。

权威 Benchmark 与实测跑分对比

以下均为官方/厂商口径的早期结果:SemiAnalysis AgentX 上运行 MiniMax M3,同等交互性下单卡吞吐最高为 GB200 的 7.84 倍,150 TPS 约束下为 5.18 倍;MLPerf Inference v6.1 VLM 项中,Qwen3-VL-235B-A22B 以 vLLM 为后端、Dynamo 为路由,相对 GB300 NVL72 最高 3.7 倍。硬件层面 Rubin 的 NVFP4 算力为 GB200 的 5 倍,HBM4 带宽约 2.4 倍。

开发者实战落地与开箱指南

拿到 Rubin 机器后可直接拉取 vllm/vllm-openai:cu134-nightly。NVFP4 MoE 可加 --moe-backend flashinfer_cutedsl;FP8 注意力需 --kv-cache-dtype fp8 并设置 --attention-backend FLASHINFER。后续路线包括 MegaMoE、Kimi K3 的 MLA/KDA 内核和 DeepSeek-V4.1-Flash 的 Rubin 内核,代码见 vLLM GitHub。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。