通义千问官方确认,125B 多模态 MoE 模型 Qwen3.8-Flash-Next 已可通过 Unsloth GGUF 在约 75GB 内存上本地运行,并支持把 N-gram 嵌入放到 CPU/统一内存以接近显存速度。这是 Qwen4 架构预览权重的首日本地部署路径。

核心要点速览 (Key Takeaways)

  • 125B MoE(每 token 激活 6B,另有 51B N-gram 嵌入)可在约 75GB RAM 上本地推理,无需整模装进 GPU 显存
  • Unsloth 提供 Day-0 GGUF 与 Qwen3.8-Flash-Next 指南,CPU RAM / 统一内存路径可接近显存吞吐
  • 官方权重同步在 Hugging Face / ModelScope;vLLM 与 SGLang 已提供 NVIDIA 与 AMD Day-0 服务支持