DeepSeek 正式发布 DeepSeek-V4.1-Flash:同系列最小、带原生视觉理解的新架构模型;552B MoE,输入仅 8B、输出 16B 激活参数,称多项基准领先含 V4-Pro;KV 缓存相对上代约需 1/4 HBM 与 1/8 SSD,并开放 Hugging Face 权重与技术报告。

核心要点速览 (Key Takeaways)

  • 正式发布 DeepSeek-V4.1-Flash:新架构族最小型号,原生视觉理解。
  • 552B MoE + Causal Encoder–Decoder(输入 8B / 输出 16B 激活);称基准领先含 V4-Pro。
  • KV 缓存约 1/4 HBM、1/8 SSD;HF 开源权重与技术报告已上线。
ADSponsored