阿里通义千问团队宣布正式开源 Qwen3.8-Flash-Next 完整权重,总参数 125B 激活 6B MoE 架构。联合 Unsloth 推出量化版 GGUF,支持在单张 24GB 显存消费级显卡(如 RTX 4090/5090)上全速运行 262K 上下文代码补全,本地推理吞吐达 85 tokens/s。

核心要点速览 (Key Takeaways)

  • 阿里通义千问开源 Qwen3.8-Flash-Next 125B/6B MoE 权重;
  • Unsloth 提供官方 GGUF 量化支持,单张 24GB 消费卡全速运行 262K 上下文;
  • 本地代码补全吞吐达 85 tokens/s,企业内网离线隐私编程极佳选择。