开发者 3 秒速决决策指标
在千亿参数大模型与端侧推理场景中,低比特权重量化与 KV Cache 压缩(如 W4A4KV4)是降低显存门槛与大幅提升吞吐的核心命脉。然而学术界长期存在一个认知误区:盲目追求削减激活值中的离群异常值(Outliers),而忽视了异常值与量化器本身的几何对齐关系。高通与苏黎世联邦理工学院等机构联合团队推出突破性量化框架 PrismQuant:首次揭示离群点绝对数值较小并不意味着低比特误差小,真正决定量化保真度的是异常值主特征空间与非对称分组量化器(Grouped INT4)常数子空间的最优几何对齐。团队将旋转矩阵设计巧妙构建为 Ky Fan 迹最大化问题,推导出了严格最优的闭式数学解析解。在 Llama、Qwen 与 Mistral 等涵盖 70B 密集模型与 30B MoE 模型的广泛评测中,W4A4KV4 配置下的 PrismQuant 刷新了业界 SOTA:在 Llama-3.1-70B 上零样本准确率仅比未量化的 FP16 全精度低 0.22 个百分点;在 8B 部署实测中实现 1.51 倍 Prefill 加速、解码显存峰值狂降 56.34%,代码已全面开源。
核心要点速览 (Key Takeaways)
- ✓颠覆离群值抑制固有直觉:首次证明激活离群值幅度小不等于量化误差低,关键在于异常值能量空间与 INT4 分组量化器几何子空间的最优对齐。
- ✓闭式最优解与无梯度构建:基于 Ky Fan 迹最大化与紧凑 Householder 变换,实现完全免梯度微调的秒级闭式解析旋转构建,极大简化部署流程。
- ✓70B 仅降 0.22% 且显存立减 56%:在 Llama-3.1-70B 上 W4A4KV4 量化准确率达 72.46%(仅较 FP16 损耗 0.22%),8B 模型解码峰值显存缩减 56.34%,Prefill 提速 1.51 倍。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察