开发者 Taro L. Saito(@taroleo)参照 TypeSafe Jev 的思路,放弃完整 text/json 生成、只保留判断头,把约 157GB 权重的 DeepSeek V4 Flash 决策能力在 DGX Spark 上蒸馏约 26 小时迁入 4B 模型。结果体积约缩为教师的 1/20,并在即时回答模式下超过教师,单次判断约 22ms,展示纯本地 LLM 做高速决策引擎的可行性。

核心要点速览 (Key Takeaways)

  • 以 Jev 式「只做判断、不做长文本生成」把 DeepSeek V4 Flash 决策蒸馏到 4B。
  • DGX Spark 上约 26 小时完成蒸馏;体积约缩为教师 1/20,单次判断约 22ms。
  • 作者称在即时回答模式下已超过教师,适合本地高速分流/门控场景。
ADSponsored