阿里通义千问开源多模态 MoE 模型 Qwen3.8-Flash,作为 Qwen4 架构早期预览。总参 125B 另加 51B N-gram 嵌入,每 Token 仅激活 6B;采用 GDN+QSA 混合注意力、Gated Residual 与 Muon 优化器。训练成本约为 Qwen3.7-Plus 的 1/9,却全面领先:DeepSWE 1.1 达 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、AndroidWorld 84.5、MathVision(含 CI)95.7。原生 262K 上下文,YaRN 可扩至 1M;1M 长度下 QSA 预填充最高 7.6 倍、解码 4.9 倍加速。QwenCloud 报价约 $0.15/$0.47 每百万 Token,权重已上线 Hugging Face,并获 NVIDIA NeMo、SGLang、Unsloth 与 OpenCode 的 Day-0 支持。

核心要点速览 (Key Takeaways)

  • 125B 总参、6B 激活,SWE-bench Pro 62.5、DeepSWE 1.1 58.7,训练成本约为上一代 Plus 的 1/9。
  • GDN+QSA 混合注意力在 1M 上下文下最高 7.6 倍预填充、4.9 倍解码加速。
  • 开源权重同步登陆 Hugging Face,QwenCloud / OpenRouter / OpenCode 与 NeMo、SGLang、Unsloth 提供 Day-0 接入。
ADSponsored