近期推动大模型工具调用能力后训练(Post-Training)的研究大多局限于可执行环境的孤立合成(如 Agent-World)。然而,环境只是由“环境、任务、智能体外壳(Harness)与评估器”构成的完整智能体交互系统中的单一组件,孤立扩展环境无法产生可靠且协调的强化学习训练信号。复旦大学邱锡鹏团队联合多家机构提出了全系统自进化后训练体系 WEFT(Whole-system Evolution For Tool-use Post-training,arXiv:2609.36887):框架在环境广度、任务复杂性与交互多样性三层维度联合构建交互生态;通过执行驱动的自进化(Execution-driven self-evolution)解析交互轨迹与环境状态证据,对失效根因组件进行定点定向修订并生成全新 Rollout 迭代进化;针对后训练阶段的大规模并发不稳定性,WEFT 创新设计了保留前缀的动态采样、原子交互轮次信用分配,并打造了基于模型上下文协议的 MegaMCP 运行时,在共享工具服务上保障完全隔离且可恢复的会话状态。评测显示,WEFT-14B 在 BFCL V4、tau^2-Bench 和 Claw-Eval 上全面超越同等规模基线,相较 Agent-World-14B 提升高达 6.41、2.23 和 12.27 个百分点,并在 Toolathlon-Verified 等长程复杂工作流上展现出极强的工业级工具调用泛化力。
核心要点速览
- ✓提出 WEFT 全系统协同后训练架构,打破孤立合成环境的传统局限,实现环境、任务、外壳与评测器四位一体闭环进化
- ✓集成保留前缀采样、原子轮次信用分配与 MegaMCP 隔离运行时,保障长程工具强化学习的极高训练稳定性
- ✓WEFT-14B 在 BFCL V4 提升 6.41 pp、tau^2-Bench 提升 2.23 pp,在 Claw-Eval 上相较 Agent-World 暴涨 12.27 pp

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
大模型智能体在实际软件工程、数据库运维与工作流自动化中能否稳定落地,高度取决于其工具调用(Tool-Use)能力的成熟度。为了通过后训练(Post-Training / RL)大幅提升模型的工具使用水准,近期研究大多聚焦于自动合成可执行的模拟代码与 API 环境(如 Agent-World)。然而,这种单点突破暴露了严重的系统性缺陷:在真实的智能体交互闭环中,环境仅仅是整个生态的一角,完整的系统同时包含复杂的任务设定、智能体调度外壳(Harness)以及验证评估器(Evaluator)。如果脱离任务与评估器孤立扩展环境规模,不同组件之间的语义不一致与状态泄露将导致训练奖励极其嘈杂,模型不仅难以学到可靠的调用策略,反而会在过拟合合成环境的过程中丧失通用泛化能力。
架构亮点与底层机制
针对工具调用后训练中的碎片化瓶颈,复旦大学邱锡鹏团队联合多家顶尖机构打造了全系统协同自进化体系 WEFT(Whole-system Evolution For Tool-use Post-training,arXiv:2609.36887):
- 全系统四位一体联合构建(Whole-System Co-Construction):超越单纯合成环境的传统思路,在环境广度(覆盖上百类复杂 API)、任务逻辑深度以及交互模式多样性三大维度同步扩展环境、任务、外壳与评测器;
- 执行驱动的闭环自进化(Execution-Driven Self-Evolution):在 Rollout 探索阶段,系统细致追踪执行轨迹与底层状态证据。一旦检测到交互异常或逻辑断层,自进化引擎自动归因判定究竟是任务描述模糊、外壳参数错误还是环境配置缺陷,并定向修复故障组件,随后在空白沙箱中通过全新 Rollout 验证修正效果;
- 保留前缀采样与原子轮次信用分配(Prefix-Preserving Sampling & Atomic Credit):在强化学习优化层面,WEFT 锁定已经验证正确的历史交互前缀,避免重采样中的灾难性回退;同时将标量奖励精准分配至具体的工具调用原子轮次,实现高信噪比的梯度回传;
- MegaMCP 工业级状态隔离中间件:深度结合 Model Context Protocol(MCP)生态,针对多线程高并发强化学习 Rollout 开发了 MegaMCP 运行时,在共享底层服务的前提下为每个智能体实例提供强隔离、具备即时快照与状态恢复能力的沙箱空间。
权威 Benchmark 与实测跑分对比
在跨越多个不同规模模型参数与业界公认高难度工具调用基准的全面测试中,WEFT 实现了同参数规模的绝对统治:
- 全线斩获最高基准得分:WEFT-8B 与 WEFT-14B 在权威基准 Berkeley Function Calling Leaderboard(BFCL V4)、tau^2-Bench 以及 Claw-Eval 上全面超越了所有同等体量的环境扩展基线;
- 大幅超越 Agent-World-14B 达 12 个百分点:在相同 14B 参数级别对比中,WEFT-14B 相较当前 SOTA 基准 Agent-World-14B,在 BFCL V4 上提升 6.41 pp,在 tau^2-Bench 上提升 2.23 pp,在极具挑战的 Claw-Eval 上更实现了高达 12.27 个百分点的巨大突破;
- 超长程工业级工作流突破:参数规模更大的 WEFT-35B-A3B 在高难度长程真实流程基准 Toolathlon-Verified 以及企业级自动化评测 AutomationBench 上保持了显著优势,验证了全系统进化的泛化韧性。
开发者实战落地与开箱指南
WEFT 的研究成果为企业与开源社区进行大模型工具调用能力的后训练提供了一套极为成熟的工程蓝图。对于正在开发企业级智能体、工作流编排 Copilot 以及 MCP 工具中枢的技术团队,WEFT 证明了“全系统协同进化+MegaMCP 隔离”是超越粗暴堆砌合成环境的正确道路。开发者应重点借鉴其原子轮次信用分配逻辑与 MCP 沙箱隔离方案,以极低的环境维护开销保障强化学习训练回路的确定性与数据高信噪比,真正让智能体具备工业级的稳健工具调用能力。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察