针对既有编码基准(如 SWE-bench)仅局限于单一代码库、无法评估真实软件生态中跨多个关联仓库协同修改与联调能力的短板,浙江大学 ACES-ISE 团队推出首个跨仓库编码智能体评测基准 WideSWE。从 103 个真实开源软件生态中挖掘提炼 120 个复杂任务(60 个跨库 Bug 修复与 60 个跨库新特性),涵盖隐蔽回归测试用例。实测七大主流智能体配置,完整任务成功率最高仅为 42.50%,揭示多库协同开发中接口遗漏与联合测试断层的严峻瓶颈。

核心要点速览 (Key Takeaways)

  • ✓从单仓库迈向真实跨库生态:软件工程中大量依赖升级、协议变更与重构需要跨越多个代码库同时协作;WideSWE 覆盖 103 个真实生态、120 项跨库开发任务,打破单库信息茧房。
  • ✓顶尖智能体天花板仅 42.5%:在测试的 7 种主流 Agent 架构中,任务完成率处于 10.83% 至 42.50% 的极低区间;其中 Codex CLI 搭配 GPT-5.6-sol 取得最高分 42.50%,普遍暴露跨库未竟修改与联合测试缺失。
  • ✓独立执行 vs 联合协同对比:实验揭示独立逐库处理容易丢失跨库接口约束上下文,而联合工作区(Joint Execution)能有效利用关联仓库信息引导实现与双向验证。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 当前业界评测编码智能体(Coding Agent)的黄金标准几乎全部由 SWE-bench 系列统治。然而,现代企业级软件开发极少是“单体单库”的——一个核心特性的上线或严重 Bug 的修复,往往需要同步修改 SDK 库、后端服务仓、API 接口定义仓以及配套文档,多仓库之间的契约变更是开发者日常最耗费精力的部分。既有的 SWE-bench 仅评估智能体在单个独立 Git 仓库内的局部改动,完全无法检验智能体在面对复杂的跨仓库代码依赖与联合构建(Multi-Repository Coordination)时的系统化能力。 ### 架构亮点与底层机制 浙江大学计算机学院 ACES-ISE 团队推出了专为跨仓库评测打造的基准 WideSWE: 1. 真实生态挖掘与任务精选:从 GitHub 上 103 个知名开源生态圈(如前端框架与插件生态、后端微服务组件组)中深度挖掘,精选出 120 个真实跨库开发任务(严格平衡为 60 个 Bug 修复与 60 个新特性开发); 2. 系统化联合测试适配:解决跨库测试环境联调难题,对隐藏测试集进行了系统化重构,确保在支持多种不同合法实现的同时,严格校验跨库行为一致性与回归安全性; 3. 执行模式深度对照:设计了“独立逐库推进”(One repository at a time)与“全局联合执行”(Joint Execution)两种范式,用于探究智能体在面对多库上下文时的信息交换机制。 ### 权威 Benchmark 与实测跑分对比 团队在 7 种主流前沿智能体配置(包括 Codex CLI、OpenHands 及多家前沿大模型)上展开评测: - 极具挑战性的成功率上限:全任务成功率仅在 10.83% 至 42.50% 之间徘徊,即便表现最好的 Codex CLI + GPT-5.6-sol 组合也仅达到 42.50%,充分证明了跨仓库协同开发对当前 Agent 的巨大挑战; - 核心失败归因分析:实验捕获了三大高频失效模式——未能识别出依赖仓库需要同步变更(漏改)、识别出了相关仓库但在跨库修改时中途半途而废(未竟)、以及修改了代码但未满足跨库接口的严格契约; - 联合协同模式的碾压优势:全局联合执行能够让智能体跨库交叉参考类型定义与调用测试,显著降低接口破坏率。 ### 开发者实战落地与开箱指南 - 开源代码与评测套件:完整基准已开源至 https://github.com/ZJU-ACES-ISE/WideSWE; - 技术预印本:详见 arXiv:2609.33382; - Agent 工具链升级启示:企业在设计下一代 IDE 插件(如 Cursor、Cline)时,应当支持同时打开与监听多个关联工作区(Multi-Workspace Roots),并赋予智能体跨项目的统一符号索引与联合测试运行权限。