HuggingPapers 转发:NVIDIA 在 Hugging Face 发布 Qwen3.8-Flash-Next 的 NVFP4 量化权重(125B MoE、混合注意力),称体积约减少 63% 且精度损失很小。官方仓库为 nvidia/Qwen3.8-Flash-Next-NVFP4,便于在 NVIDIA 硬件上做更高吞吐的本地/边缘推理,降低部署显存门槛。

核心要点速览 (Key Takeaways)

  • 权重:nvidia/Qwen3.8-Flash-Next-NVFP4 已在 Hugging Face 可下。
  • 压缩:NVFP4 约减 63% 体积,面向本地高吞吐推理。
  • 定位:125B MoE + 混合注意力,适合在 NVIDIA GPU 上部署编码/对话工作负载。
ADSponsored