阿里通义千问团队宣布正式开源 Qwen3.8-Flash-Next 完整权重,总参数 125B 激活 6B MoE 架构。联合 Unsloth 推出量化版 GGUF,支持在单张 24GB 显存消费级显卡(如 RTX 4090/5090)上全速运行 262K 上下文代码补全,本地推理吞吐达 85 tokens/s。
核心要点速览 (Key Takeaways)
- ✓阿里通义千问开源 Qwen3.8-Flash-Next 125B/6B MoE 权重;
- ✓Unsloth 提供官方 GGUF 量化支持,单张 24GB 消费卡全速运行 262K 上下文;
- ✓本地代码补全吞吐达 85 tokens/s,企业内网离线隐私编程极佳选择。