Specific Labs(@janaksunil)发布 Real-SWE:用真实公司私有、分布外生产代码库上的工程任务评测编码智能体(含 20 万+ 用户应用、金融对账、企业销售工具等)。公开榜单(8 次独立运行均值)显示 Claude Fable 5.1 + Claude Code 38.8%、GPT-6 Astra + Codex CLI 33.8%、Gemini 3.8 Flash + Gemini CLI 31.2%,领先者仍未达 40%。站点 realswe.withspecific.com。
核心要点速览 (Key Takeaways)
- ✓任务来自真实公司私有代码库,评测智能体能否在无公开解法的系统上改账单、权限与客户数据等业务逻辑。
- ✓8 次独立运行均值:Fable 5.1 + Claude Code 38.8%,Astra + Codex CLI 33.8%,Gemini 3.8 Flash + Gemini CLI 31.2%。
- ✓强调与公开仓库榜单不同:测的是公司会真正部署智能体的私有系统,站点 realswe.withspecific.com。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察