大语言模型(LLM)的预填充(Prefill)与解码(Decode)阶段对底层硬件提出截然相反的要求:Prefill 是典型的计算密集型,依赖超低精度算术核心(如 FP4/INT4)快速吞吐长 Prompt;而 Decode 是典型的显存带宽受限型,需要紧凑的超低比特权重(如 2-3 bit Weight-Only)减少每次访存延迟。然而传统的全流程统一量化方案迫使两者相互妥协,导致性能与精度双重折损。来自顶尖系统团队与 IST Austria 的重磅研究《Disaggregated Quantization: Specializing LLM Prefill and Decode》(arXiv:2609.26333)开创了“分离量化(DQ)”体系:为 Prefill 与 Decode 定制各自独立的计算格式、量化权重与物理存储布局。针对单卡显存受限场景,创新推出卸载式分离预填充(ODP),通过 NVMe SSD 异步流式加载 NVFP4 预填充权重,在 llama.cpp 与 8K 长文本上将 Qwen3.8-27B 首 Token 生成延迟(TTFT)暴降 1.78 倍,并在 vLLM 分布式环境中验证了高达 2.8T 参数超大规模模型的完美兼容性。

核心要点速览

  • ✓首创打破统一量化妥协的分离量化架构(Disaggregated Quantization),分别针对 Prefill 算力与 Decode 带宽定制
  • ✓提出 ODP 异步 SSD 流式权重加载,在 8K Prompt 下推动 Qwen3.8-27B 首 Token 延迟缩短 1.78 倍(TTFT 加速 78%)
  • ✓结合 NVFP4 Prefiller 在保持 2-3 bit Decode 极小显存占用的同时,MMLU-Pro 准确率暴涨 32.5 分,适配达 2.8T 模型
🧭

本地显存不够?先比较云端 API 与自部署的实际成本

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

在工业级大模型部署与本地端侧推理中,预填充(Prefill,处理用户输入的超长提示词)与解码(Decode,自回归逐字生成回答)两个阶段展现出根本对立的计算瓶颈:Prefill 属于纯粹的计算密集型(Compute-Bound),算力张量核心全速运转,核心瓶颈在于矩阵乘法 FLOPS;而 Decode 属于极致的内存带宽受限型(Memory-Bound),算力利用率通常不足 10%,显存带宽搬运速度才是决定吐词每秒 Token 数的唯一瓶颈。现行主流的量化方法(如 AWQ、GPTQ、SmoothQuant)均采用全流程统一量化格式,这种“一刀切”设计逼迫系统做出痛苦妥协:若采用超低精度激进量化(如 2~3 bit),Decode 固然极快但 Prefill 阶段精度断崖式崩塌;若保留高精度,Decode 又受制于显存容量与吞吐瓶颈。

架构亮点与底层机制

针对两阶段在硬件特征上的本质分裂,IST Austria 顶级系统团队联合产业界提出了创新的“分离量化(Disaggregated Quantization, DQ)”范式:

  1. 两阶段量化格式与权重彻底解耦:彻底摒弃统一量化权重的束缚,分别为 Prefill 与 Decode 定制专属权重矩阵与张量存储格式。Decode 阶段移除激活量化(Activation Quantization)并精简至 2~3 bit 极致紧凑权重以榨干显存带宽;Prefill 阶段则采用原生计算格式(Compute-Native Weights,如 NVFP4)以全力释放张量核心吞吐;
  2. 卸载式异步流式预填充机制(Offloaded Disaggregated Prefill, ODP):针对单卡或端侧显存无法同时容纳两套权重的难题,团队设计了 ODP 架构——将体积更大的 NVFP4 Prefill 权重放置在高速 NVMe SSD 中,当超长输入 Prompt 进入系统时,利用 DMA 异步流式加载权重至 SRAM/HBM,将传输开销完美分摊平摊在长 Prompt 算力计算的生命周期内;
  3. 跨多模态与超大架构普适验证:在 Qwen3、Gemma 3 等新一代开源模型上全面落地,并验证了针对高达 2.8T 参数万亿 MoE 架构的后训练量化兼容性;
  4. 零破坏即插即用接入主流推理引擎:完整打通了 vLLM 分布式解耦集群与 llama.cpp 本地端侧运行时的双向原生集成。

权威 Benchmark 与实测跑分对比

在跨越标准基准测试 MMLU-Pro、多模态复杂理解 MMMU-Pro 以及真实的本地与云端推理压测中,DQ 展现了颠覆性的提速与保真表现:

  1. 首 Token 延迟(TTFT)暴减 78%(1.78 倍加速):在本地 llama.cpp 运行时下,针对 Qwen3.8-27B 在 8K 超长提示词评测中,结合 ODP 机制的模型较传统纯权重优化方案实现了 1.78 倍的端到端 TTFT 极速跃迁;
  2. 极端低比特解码下精度挽救 35 分:在 2~3 bit 极致轻量化解码环境下,搭配 NVFP4 专用预填充权重后,模型在权威 MMLU-Pro 评测中准确率暴增 32.5 分,在多模态 MMMU-Pro 评测中更是飙升 35.3 分,彻底消除了低比特模型的幻觉崩塌;
  3. 端到端显存占用零增加:得益于 ODP 的异步流式分摊机制,系统在获得翻倍推理加速的同时,峰值显存占用未发生任何膨胀。

开发者实战落地与开箱指南

分离量化(DQ)为当前狂飙突进的大模型长上下文推理、端侧 AI PC 部署以及私有化高并发推理集群架构提供了划时代的系统级破局利器。对于正在优化 vLLM 线上吞吐的中台架构师,可以直接开启 PD 分离集群的 DQ 量化策略;而对于本地部署 Coding Agent(如通过 Ollama 或 llama.cpp 运行本地大模型)的个人开发者,引入 ODP 机制可以在不升级高昂显卡的前提下,以普通 NVMe 固态硬盘轻松驾驭 27B~70B 级别的超长上下文代码解析与闪电级交互。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。