HuggingPapers 转发:NVIDIA 在 Hugging Face 发布 Qwen3.8-Flash-Next 的 NVFP4 量化权重(125B MoE、混合注意力),称体积约减少 63% 且精度损失很小。官方仓库为 nvidia/Qwen3.8-Flash-Next-NVFP4,便于在 NVIDIA 硬件上做更高吞吐的本地/边缘推理,降低部署显存门槛。
核心要点速览 (Key Takeaways)
- ✓权重:nvidia/Qwen3.8-Flash-Next-NVFP4 已在 Hugging Face 可下。
- ✓压缩:NVFP4 约减 63% 体积,面向本地高吞吐推理。
- ✓定位:125B MoE + 混合注意力,适合在 NVIDIA GPU 上部署编码/对话工作负载。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察