Unsloth 宣布优化后的本地 GGUF 解码使 GLM-5.3-Flash 推理最高提速约 3.3 倍(常见场景约 1.6–3.4×),并启用多 token 预测(MTP)与更快的长上下文解码。3-bit 量化可在约 128GB 内存设备上通过 Unsloth Desktop 或 llama.cpp 运行,配套文档与 Hugging Face GGUF 权重已更新。

核心要点速览 (Key Takeaways)

  • 速度:本地 GGUF 推理最高约 3.3×,常见区间约 1.6–3.4×。
  • 能力:启用 MTP,并优化长上下文解码。
  • 落地:3-bit 可在约 128GB 设备用 Unsloth Desktop / llama.cpp;文档与 HF GGUF 已上线。
ADSponsored