阿里通义千问团队开源发布了针对长程软件工程强化的 Qwen2.5-Coder-32B-Instruct 增量权重。通过引入高质量代码执行反馈与多轮合成排错轨迹,该模型在 SWE-bench Verified 上取得了 48.9% 的解决率,刷新了 32B 参数量级开源模型的全球最高纪录,并在单张 RTX 4090 / A10G 上支持长达 128k 上下文推理。
核心要点速览 (Key Takeaways)
- ✓32B 体量在 SWE-bench Verified 达到 48.9%,逼近早前闭源前沿旗舰水平。
- ✓针对真实仓库环境的测试执行反馈循环进行了针对性对齐强化。
- ✓全权重已上线 Hugging Face 与 ModelScope,支持 vLLM 和 Ollama 开箱即用。