阿里通义千问开源发布多模态 MoE 架构模型 Qwen3.8-Flash 作为 Qwen4 架构的早期预览。模型总参 125B,每个 Token 仅激活 6B;在 SWE-bench Pro 取得 62.5 分,DeepSWE 1.1 达到 58.7 分。训练成本仅为上一代 Plus 的 1/9,在 QwenCloud 上报价低至 $0.16/$0.47 per 1M tokens。
核心要点速览 (Key Takeaways)
- ✓采用 GDN+QSA 混合注意力与 Muon 优化器,SWE-bench Pro 得分达到 62.5。
- ✓125B 总参每次仅激活 6B,推理极速且 API 成本较上一代大幅压降。
- ✓原生 262k 上下文,支持通过 YaRN 扩展至 100 万 Token。