在千亿参数大模型与端侧推理场景中,低比特权重量化与 KV Cache 压缩(如 W4A4KV4)是降低显存门槛与大幅提升吞吐的核心命脉。然而学术界长期存在一个认知误区:盲目追求削减激活值中的离群异常值(Outliers),而忽视了异常值与量化器本身的几何对齐关系。高通与苏黎世联邦理工学院等机构联合团队推出突破性量化框架 PrismQuant:首次揭示离群点绝对数值较小并不意味着低比特误差小,真正决定量化保真度的是异常值主特征空间与非对称分组量化器(Grouped INT4)常数子空间的最优几何对齐。团队将旋转矩阵设计巧妙构建为 Ky Fan 迹最大化问题,推导出了严格最优的闭式数学解析解。在 Llama、Qwen 与 Mistral 等涵盖 70B 密集模型与 30B MoE 模型的广泛评测中,W4A4KV4 配置下的 PrismQuant 刷新了业界 SOTA:在 Llama-3.1-70B 上零样本准确率仅比未量化的 FP16 全精度低 0.22 个百分点;在 8B 部署实测中实现 1.51 倍 Prefill 加速、解码显存峰值狂降 56.34%,代码已全面开源。

核心要点速览 (Key Takeaways)

  • ✓颠覆离群值抑制固有直觉:首次证明激活离群值幅度小不等于量化误差低,关键在于异常值能量空间与 INT4 分组量化器几何子空间的最优对齐。
  • ✓闭式最优解与无梯度构建:基于 Ky Fan 迹最大化与紧凑 Householder 变换,实现完全免梯度微调的秒级闭式解析旋转构建,极大简化部署流程。
  • ✓70B 仅降 0.22% 且显存立减 56%:在 Llama-3.1-70B 上 W4A4KV4 量化准确率达 72.46%(仅较 FP16 损耗 0.22%),8B 模型解码峰值显存缩减 56.34%,Prefill 提速 1.51 倍。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 将 70B 甚至更大规模的基础大模型部署在有限显存的云端单卡或边缘终端上,极限 4 比特量化(如权重、激活值与 KV Cache 全量 INT4,即 W4A4KV4)是唯一能够在大幅削减硬件成本的同时实现吞吐数倍爆发的路径。然而,当前业界在推进 4 比特量化时面临严重的理论与工程瓶颈: 1. 盲目压制离群值的认知误区:以 QuaRot、SpinQuant 为代表的传统旋转量化技术,均将目标聚焦在利用随机或优化旋转矩阵将异常离群值“拍平”打散。然而实验发现,更小的激活离群值并不能稳定带来更低的量化困惑度(Perplexity),盲目压制甚至破坏了关键特征; 2. 缺乏针对分组非对称量化的专用解析方案:工业界 GPU 算子为了兼顾速度普遍采用分组量化(Group Size 32/64/128),但现有旋转算法要么依赖极耗算力的大规模反向梯度搜索,要么只能拟合全局量化,在细粒度分组上精度崩溃。 ### 架构亮点与底层机制 来自高通 AI 研究院与苏黎世联邦理工学院等机构的学者提出了 PrismQuant,建立了量化感知旋转的严密数学理论: 1. 主特征空间与零空间对齐(Null-Space Alignment):首次揭示决定低比特精度的不是离群值的绝对大小,而是激活值的主特征空间是否与非对称分组 INT4 量化器的“常数子空间”严格对齐。利用仿射偏移量(Affine Offsets)天然吸收子空间能量,从而在不拓宽组内动态范围的前提下消除量化噪声; 2. Ky Fan 迹最大化闭式解析解:将高维对齐旋转目标形式化为 Ky Fan 范数优化问题,推导出了无需任何迭代训练的闭式全局最优数学解,在秒级即可完成全部层的旋转参数计算; 3. 紧凑 Householder 变换与在线融合:利用紧凑的 compact-WY 表达形式,在可折叠层直接离线融合进模型权重,在在线动态层实现极低开销的矩阵变换,CUDA Graph 解码附加延迟仅为 2.35%。 ### 权威 Benchmark 与实测跑分对比 研究团队在 Llama-3.1/3.2、Qwen-2.5 与 Mistral 系列上展开了详尽的准确率与硬件部署实测: - 70B 旗舰模型极限逼近全精度:在超大规模的 Llama-3.1-70B 上,实施极具挑战性的 W4A4KV4(全 4 比特) 量化后,语言建模困惑度(Perplexity)达到惊人的 3.85,多任务平均零样本准确率高达 72.46%,相比未经量化的 FP16 原版模型仅低 0.22 个百分点; - 小尺寸模型刷新业界 SOTA:在轻量化的 Llama-3.2-3B 模型上,全面碾压 QuaRot、SmoothQuant 与 SpinQuant 等基线,困惑度与准确率均登顶第一; - 生产端推理实测暴涨:在 Llama-3.1-8B 的真实 CUDA 部署实测中,PrismQuant 实现 1.51 倍 Prefill 加速 与 1.22 倍 CUDA Graph 解码加速,解码峰值显存暴降 56.34%。 ### 开发者实战落地与开箱指南 - 开源代码与模型权重:完整 CUDA 算子与一键量化工具已开源至 GitHub(ForeverBlue816/PrismQuant); - 推理加速落地建议:对于正在使用 vLLM、TensorRT-LLM 或 SGLang 部署 70B 级别模型的工程师,建议优先采用 PrismQuant 进行离线旋转矩阵吸收,随后直接导出为 INT4 权重并在 Serving 时开启 INT4 KV Cache,可直接在一张单卡上跑起过去需要 4 卡并行的 70B 旗舰模型; - MoE 混合专家模型支持:论文验证了该方法在 30B MoE 架构上的完美泛化,为后续深度适配 DeepSeek-V3/R1 稀疏架构提供了成熟的数学范式。