DeepSeek 团队发布了专门针对复杂算法与系统级软件工程对齐的 DeepSeek-R1-Code 强化学习权重。在 LiveCodeBench 2026 最新困难题集与 Codeforces 竞赛评测中,该模型取得了 74.2% 的通过率,超越了多数闭源前沿推理模型,并延续了开源权重全量免费商用的策略。
核心要点速览 (Key Takeaways)
- ✓在 LiveCodeBench 困难题集取得 74.2% 的顶尖解题率,强化长推理链算法纠错。
- ✓针对真实编译器报错与多轮单元测试验证进行了大规模强化学习对齐(RL)。
- ✓全量权重已上传 Hugging Face 与国内镜像站,支持 Ollama 与 vLLM 纯本地量化部署。