阿里云通义千问发布多模态 MoE 模型 Qwen3.8-Flash 并开源权重,仅 6B 激活参数即在 DeepSWE 1.1 拿到 58.7、SWE-bench Pro 拿到 62.5,训练成本仅为 Qwen3.7-Plus 的 1/9,同时放出 Qwen3.8-Flash-Next 作为 Qwen4 架构先行预览。
核心要点速览 (Key Takeaways)
- ✓DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9,编程与办公任务相对 Qwen3.7-Plus 全面领先
- ✓GDN+QSA 混合注意力、Gated Residual、N-gram Embedding 与 Muon 优化器,1M 上下文 QSA 预填充最高提速 7.6 倍
- ✓权重已上 Hugging Face / ModelScope,vLLM 与 SGLang 提供 Day-0 支持;QwenCloud 定价 $0.16/$0.47 每百万 Token