针对大语言模型在 Prefill(计算受限)与 Decode(显存带宽受限)阶段对量化格式需求迥异的本质矛盾,ISTA 与 Neural Magic 等团队提出解耦量化(Disaggregated Quantization, DQ)。通过为 Prefill 阶段训练计算原生的 NVFP4 权重,同时为 Decode 阶段保留 2-3 比特超紧凑权重,并结合从 SSD 流式加载的卸载解耦预填充(ODP)技术,在 8K 上下文下将首字时延(TTFT)加速 1.78 倍,1 比特解码在 MMLU-Pro 上准确率跃升 32.5 分。
- ✓Prefill 与 Decode 阶段特化:彻底打破全流程采用统一样式量化的传统做法,Prefill 阶段专供低精度原生算术格式(NVFP4)释放 Tensor Core 算力,Decode 阶段则专攻紧凑极低比特压缩以极致削减访存带宽。
- ✓ODP 单卡无缝流式卸载:针对显存无法同时容纳两套权重的限制,设计 Offloaded Disaggregated Prefill(ODP),在处理 Prompt 期间通过 NVMe SSD 异步流式预加载 Prefill 权重,开销被长 Prompt 完美均摊摊销。
- ✓端到端实测暴涨与万亿参数验证:在 Qwen3.8-27B 与 llama.cpp 测试中,8K 序列长度下 TTFT 提速 1.78 倍,MMLU-Pro 评测相比统一样式提升 32.5 分,并在 vLLM 分离式服务引擎及高达 2.8T 参数模型上完成跨架构验证。
🧭阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 在大语言模型推理中,预填充阶段(Prefill)与生成解码阶段(Decode)具有完全相反的硬件瓶颈:Prefill 处理成百上千个 Prompt Token,高度依赖 GPU 浮点计算吞吐(Compute-Bound);而 Decode 则是自回归逐步吐字,批次受限,极度受限于 GPU 显存带宽(Memory-Bound)。然而,当前工业界的量化体系(如 AWQ、GPTQ、SmoothQuant)均采用一刀切的统一量化权重,导致要么为了迎合 Decode 选用了难以被 Tensor Core 硬件高效加速的格式,要么为了 Prefill 算力妥协了 Decode 时的显存占用与带宽吞吐。 ### 架构亮点与底层机制 来自 ISTA、Neural Magic 等机构的研究者提出了 解耦量化(Disaggregated Quantization, DQ) 体系: 1. 计算格式与权重双重分离:在 Prefill 阶段采用硬件原生的 NVFP4 格式进行低精度张量运算,释放 Hopper/Blackwell 架构的全部算力潜力;在 Decode 阶段则专为访存优化,采用 2~3 比特极度紧凑的压缩权重; 2. Decode 激活量化解绑:团队实证发现在 Decode 阶段取消激活量化、仅保留权重量化,能以微乎其微的计算代价换取极高精度恢复; 3. 卸载解耦预填充(Offloaded Disaggregated Prefill, ODP):对于单卡或显存紧张的本地工作站,ODP 机制将专用的 Prefill 权重常驻于高速 NVMe SSD,在接收到用户请求时异步流式搬运进 GPU,数据搬运时间完全被 Prompt 的注意力计算时间均摊掩盖,计算完成后即刻释放显存给 Decode 使用。 ### 权威 Benchmark 与实测跑分对比 在 Qwen 3 和 Gemma 3 系列模型以及 llama.cpp / vLLM 的严格实测表明: - 首字时延(TTFT)大幅缩减:在 Qwen3.8-27B 模型与 8K Prompt 长度实测中,ODP 相比统一样式纯权重量化基线实现了 1.78 倍的首字加速比; - 极低比特精度逆天修复:在发布的原生 GGUF 1 比特极限解码测试中,叠加特化 NVFP4 Prefiller 后,MMLU-Pro 评测得分暴涨 +32.5 分,MMMU-Pro 暴涨 +35.3 分,完全逆转了解码崩溃现象; - 超大模型超强泛化:团队在高达 2.8 万亿(2.8T)参数 的超大模型后训练量化(PTQ)上验证了共享权重格式解耦的稳定性。 ### 开发者实战落地与开箱指南 - 研究预印本:完整算法与精度理论推导收录于 arXiv:2609.26333; - 推理引擎集成:该方案已无缝对齐 vLLM 的 Prefill-Decode 分离式部署架构(Disaggregated Serving),分布式集群可将 P 节点配置为 NVFP4,D 节点配置为 2-bit/3-bit; - 本地单机部署:llama.cpp 社区已开始合入 ODP 流式权重算子,普通 16G 显存个人电脑即将流畅运行 27B~70B 级别大模型的长文本推理。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察