针对既有编码基准(如 SWE-bench)仅局限于单一代码库、无法评估真实软件生态中跨多个关联仓库协同修改与联调能力的短板,浙江大学 ACES-ISE 团队推出首个跨仓库编码智能体评测基准 WideSWE。从 103 个真实开源软件生态中挖掘提炼 120 个复杂任务(60 个跨库 Bug 修复与 60 个跨库新特性),涵盖隐蔽回归测试用例。实测七大主流智能体配置,完整任务成功率最高仅为 42.50%,揭示多库协同开发中接口遗漏与联合测试断层的严峻瓶颈。
核心要点速览 (Key Takeaways)
- ✓从单仓库迈向真实跨库生态:软件工程中大量依赖升级、协议变更与重构需要跨越多个代码库同时协作;WideSWE 覆盖 103 个真实生态、120 项跨库开发任务,打破单库信息茧房。
- ✓顶尖智能体天花板仅 42.5%:在测试的 7 种主流 Agent 架构中,任务完成率处于 10.83% 至 42.50% 的极低区间;其中 Codex CLI 搭配 GPT-5.6-sol 取得最高分 42.50%,普遍暴露跨库未竟修改与联合测试缺失。
- ✓独立执行 vs 联合协同对比:实验揭示独立逐库处理容易丢失跨库接口约束上下文,而联合工作区(Joint Execution)能有效利用关联仓库信息引导实现与双向验证。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察