开发者 Taro L. Saito(@taroleo)参照 TypeSafe Jev 的思路,放弃完整 text/json 生成、只保留判断头,把约 157GB 权重的 DeepSeek V4 Flash 决策能力在 DGX Spark 上蒸馏约 26 小时迁入 4B 模型。结果体积约缩为教师的 1/20,并在即时回答模式下超过教师,单次判断约 22ms,展示纯本地 LLM 做高速决策引擎的可行性。
核心要点速览 (Key Takeaways)
- ✓以 Jev 式「只做判断、不做长文本生成」把 DeepSeek V4 Flash 决策蒸馏到 4B。
- ✓DGX Spark 上约 26 小时完成蒸馏;体积约缩为教师 1/20,单次判断约 22ms。
- ✓作者称在即时回答模式下已超过教师,适合本地高速分流/门控场景。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察