SWE-bench 评测团队联合顶尖研究机构推出了全新的 SWE-bench Pro 基准测试。新基准将测试用例从单纯的 Python 扩展到 Rust、Go、C++ 与 TypeScript 等 5 大工业级系统语言,包含 1,200 个来自顶级开源项目的真实 Issue 修复场景,更真实地衡量 AI 智能体在多语言混合微服务体系中的工程解决能力。

核心要点速览 (Key Takeaways)

  • 涵盖 Rust、Go、C++ 与 TypeScript 四大系统级语言的 1,200 个真实工程修复用例。
  • 引入编译期类型检查与集成测试通过率双重校验标准,杜绝虚假通过(False Positives)。
  • 首批排行榜已公布,Claude 3.7 Sonnet 与 DeepSeek-R1 领跑多语言综合解决率榜首。
ADSponsored