针对合成环境局限于孤立单工具、无法泛化到真实世界多服务跨界协同长程流程的根本痛点,南京大学等研究团队推出 CompoWorld。通过构建包含 448 个独立服务与 10,130 个工具的组合式环境,借助随机游走依赖图生成跨服务信息流动任务,并配套以完成度为核心的细则奖励机制(Completion-Focused Rubric Reward),在仅用 3K SFT 轨迹和 1K RL 任务训练的 Qwen3.6-35B-A3B 上,八项基准平均提升 9.17 分,并在 AutomationBench 上全面超越 Claude Opus 4.6。

核心要点速览 (Key Takeaways)

  • ✓10,130 个跨服务工具的组合式扩展:打破以往合成环境单一孤岛限制,通过自动化 Coding Agent 生成具备类型化状态与统一接口的 448 个微服务,并利用世界模型模拟无法硬编码的外部工具。
  • ✓依赖图随机游走与真实跨界信息流:利用随机游走算法串联异构服务的依赖拓扑,生成必须跨越多个异构 API 传递上下文与执行回执的复杂高保真长程任务。
  • ✓35B 小基座全面击败前沿旗舰:在 8 项主流智能体基准上平均大涨 9.17 分;在权威自动化工作流基准 AutomationBench 上,35B-A3B 稀疏架构击败 Claude Opus 4.6,领跑所有同量级智能体特化模型。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 当前自主通用智能体(General Agents)在处理简单单步工具调用(如查天气、简单计算)时已表现优异,但面对真实工业级日常业务(如跨 CRM、财务对账、云资源编排与多平台发版)时故障率飙升。核心瓶颈在于现有的 Agent 训练环境多为孤立单体玩具环境(Single-environment Isolation),缺乏不同系统之间真实的数据管道与状态依赖;而依赖人工标注编写多系统联动数据的成本极度高昂,难以形成可扩展的“合成数据飞轮”。 ### 架构亮点与底层机制 南京大学等团队提出了全新的组合式环境缩放架构 CompoWorld: 1. 448 个独立微服务与 10,130 个工具拓扑:利用 Coding Agent 将工具描述自动编写为具备强类型状态(Typed States)和规范接口的微服务代码,对于不可直接用代码落地的外部非确定性工具,引入世界模型(World Model)进行高保真状态模拟; 2. 随机游走依赖图与跨服务任务合成:通过在服务依赖拓扑图上执行随机游走,自动编织出信息流必须跨越多个异构微服务的数据流向链路,并生成配套的环境校验探针; 3. 聚焦完成度的细则奖励机制(Completion-Focused Rubric Reward):在强化学习(RL)阶段,不仅评测单步准确性,更在每个 Rollout 组内加权强化那些在多步长程中“通过率最低的核心卡点”,迫使模型攻克长链路末端执行瓶颈。 ### 权威 Benchmark 与实测跑分对比 研究团队仅使用 3K 条 SFT 轨迹和 1K 个 RL 任务,在 Qwen3.6-35B-A3B 基础模型上展开后训练: - 八大智能体基准全线暴涨:在涵盖复杂工具调用的 8 项综合测试中,模型整体平均得分相比纯基座提升高达 +9.17 分; - 权威 AutomationBench 夺冠:在极其严苛的跨应用端到端评测基准 AutomationBench 上,35B 规模的 CompoWorld 模型超越了 Claude Opus 4.6,并大幅拉开与其他 35B~70B 专属智能体模型的差距; - 泛化样本效率:证明了组合式服务依赖网络能够在千级小样本训练下,激活模型对未知多工具组合的长程推理直觉。 ### 开发者实战落地与开箱指南 - 论文与规范:完整框架已收录于 arXiv:2609.33665; - 数据与环境资产:团队开源了 448 个微服务描述、工具调用解析器及对应的依赖拓扑图生成脚本; - 工程启示:企业在训练垂直领域代码/运维 Agent 时,应当构建服务间契约依赖图(Service Dependency Graph)来合成跨系统训练集,而非盲目堆叠单接口问答对。