DeepSeek 团队开源了一组面向消费级 GPU 的稀疏 MoE 激活与显存卸载补丁。配合最新的 4-bit 权重量化与动态专家缓存技术,开发者在单张 24GB 显存显卡(如 RTX 4090 / 3090)上即可获得超 45 token/s 的 67B 稀疏 MoE 代码生成体验,大幅降低了本地离线部署前沿代码模型的硬件门槛。

核心要点速览 (Key Takeaways)

  • 消费级 24GB 显存显卡即可本地流畅推理 67B 稀疏 MoE 编码模型。
  • 动态专家缓存与 4-bit 量化协同,生成速度稳定超过 45 tok/s。
  • 代码补丁已合入 llama.cpp 与 SGLang 官方仓库。
ADSponsored