上海 AI Lab 开源推理栈 LMDeploy 于 2026-09-28 发布 v0.18.0:支持输出 input logprobs、扩展 SM90 量化 GEMM 并统一 TurboMind linear 执行路径;Ascend 侧支持 GLM-5.2;为 Qwen3.5 接入 dflash;MoE 将 shared expert 并入 FFN 并在节点内切分 dense FFN。PyTorch 路径原型化 TurboMind W4A16(AWQ)、piecewise CUDA Graph prefill、XTuner TileLang sparse MLA,并支持 checkpoint-engine 权重热更新与 request-only KV cache 用量指标。

核心要点速览 (Key Takeaways)

  • ✓发版:v0.18.0(2026-09-28);PyPI lmdeploy==0.18.0
  • ✓模型/硬件:Qwen3.5 dflash;Ascend GLM-5.2;SM90 量化 GEMM 扩展(#4943)
  • ✓推理内核:TurboMind W4A16 AWQ 原型(#4897);piecewise CUDA Graph prefill(#4895);TileLang sparse MLA(#4904)
  • ✓运维:checkpoint-engine 权重更新(#4913);request-only cache 用量指标(#4940);input logprobs(#4793)
  • ✓安装:pip install -U "lmdeploy>=0.18.0";文档见 lmdeploy.readthedocs.io
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点

本地与私有化 LLM 服务要在 Hopper(SM90)、Ascend 与 MoE 稠密混合架构之间同时压榨吞吐与成本。行业痛点很具体:Qwen3.5、GLM-5.2 等新模型推理路径常滞后发版;量化 GEMM 与 linear 内核碎片化导致同卡不同后端行为不一致;AWQ W4A16 与 CUDA Graph prefill 难以组合;权重热更新与按请求的 KV 用量可观测不足,上线回滚和容量规划只能靠经验猜。

架构亮点与底层机制

v0.18.0 支持输出 input logprobs(#4793),扩展 SM90 量化 GEMM 并统一 TurboMind linear 执行路径(#4943)。Ascend 侧接入 GLM-5.2(#4928);为 Qwen3.5 启用 dflash(#4789)。MoE 将 shared expert 并入 FFN,并在节点内切分 dense FFN(#4973)。PyTorch 路径原型化 TurboMind W4A16 AWQ backend(#4897)、piecewise CUDA Graph prefill(#4895)、XTuner TileLang sparse MLA(#4904),同时支持 checkpoint-engine 权重热更新(#4913)与 request-only KV cache 用量指标(#4940)。TurboMind 迁至 C++20,工具参数可增量流式下发。

权威 Benchmark 与实测跑分对比

发行说明未附统一 tokens/s 总表;文档仅有 A100 FP16 标签勘误,并非新跑分。请在目标卡(H100/SM90、Ascend)上对 Qwen3.5 dflash、W4A16 与 piecewise CUDA Graph 组合做对照,记录 TTFT、吞吐与 KV 占用。勿把单个 PR 描述外推为跨模型通用加速比。

开发者实战落地与开箱指南

升级:pip install -U "lmdeploy>=0.18.0"。按 官方文档 选择 TurboMind 或 PyTorch 后端;启用 dflash、W4A16、CUDA Graph 前先在小流量验证数值与工具调用(本版修复 tool_choice='required' 等)。需要热更新权重时接入 checkpoint-engine;容量面板可读 request-only cache 指标。完整变更见 Release v0.18.0 与 仓库。