LightSeek Foundation 发布面向 Kimi K3 的草稿模型合集(EAGLE-3、DFlash2、DSpark),在 40 张 NVIDIA GB200 上用 TorchSpec 解耦训练,并公开数据配方。博客给出 10 项基准的接受长度与 SPEED-Bench 端到端吞吐;DFlash2 平均接受长度约 4.02,低并发吞吐优于 EAGLE-3。
核心要点速览 (Key Takeaways)
- ✓三款草稿架构齐发:EAGLE-3、DFlash2、DSpark,面向 Kimi K3 投机解码加速。
- ✓40×GB200 + TorchSpec 解耦训练;公开 kimi-mtp-dataset 配方与 Docker/CI。
- ✓HumanEval 等编码基准上 DFlash2 接受长度约 5.08,显著高于 EAGLE-3 的 3.29。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察