Unsloth AI 正式上线 GLM-5.3-Flash(Ox Alpha)超轻量量化 GGUF。通过 3-bit 混合量化技术,这款 320B 总参、18B 激活且具备 MIT 协议的顶尖多模态 MoE 模型可在 128GB 内存设备(如 Mac Studio)上实现本地单机推理。

核心要点速览 (Key Takeaways)

  • 实现 320B 级顶尖开源多模态编程大模型发布首日即支持消费级工作站本地离线运行;
  • 在 DeepSWE 与多模态编程基准上对齐甚至逼近顶级闭源模型,3-bit 保持极高推理保真度;
  • 配套开源全套下载指南与 Hugging Face 权重仓库,开箱即用支持 llama.cpp 与 LM Studio。