DeepSeek 正式发布 DeepSeek-V4.1-Flash:同系列最小、带原生视觉理解的新架构模型;552B MoE,输入仅 8B、输出 16B 激活参数,称多项基准领先含 V4-Pro;KV 缓存相对上代约需 1/4 HBM 与 1/8 SSD,并开放 Hugging Face 权重与技术报告。
核心要点速览 (Key Takeaways)
- ✓正式发布 DeepSeek-V4.1-Flash:新架构族最小型号,原生视觉理解。
- ✓552B MoE + Causal Encoder–Decoder(输入 8B / 输出 16B 激活);称基准领先含 V4-Pro。
- ✓KV 缓存约 1/4 HBM、1/8 SSD;HF 开源权重与技术报告已上线。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察