阿里通义千问正式开源 Qwen3.8-Flash 多模态 MoE 模型,总参 125B 激活仅 6B,采用 GDN、稀疏注意力与 Muon 优化器等 Qwen4 预研技术,训练成本仅为前代 1/9 且代码能力超越 Qwen3.7-Plus,官方 API 定价低至 $0.15 / $0.47。

核心要点速览 (Key Takeaways)

  • 全新底层架构:融合 GDN 门控残差、Qwen 稀疏注意力、N-gram 嵌入与 Muon 优化器,系 Qwen4 架构技术先行预览;
  • 编程与自动化基准出色:DeepSWE 1.1 获 58.7 分、SWE-bench Pro 62.5 分、CoWorkBench 73.9 分;
  • QwenCloud、OpenRouter、vLLM、SGLang 与 Unsloth 均已首日支持,本地仅需约 75GB 内存即可运行 GGUF。