现实中能够独立阅读多格式文档、调度复杂工具并交付可运行产物的“工作智能体(Working Agents)”,高度依赖基于海量真实代码与办公文件的训练任务。然而现有的合成方案要么依赖模型纯人工生成虚假文件(缺乏真实复杂性与多样性),要么在真实文件上出题却无法提供确定性结果校验器(无法自动化验证答案对错)。来自复旦大学与中国科学技术大学等机构的联合研发团队推出了 GraphForge 框架:首创“证据图(Evidence Graph)”驱动的真实工作区合成机制,将职业真实种子文件关系提炼为证据图,并据此自动化生成任务说明与细粒度评分规则(Rubrics)。仅用 2,169 条 GraphForge 轨迹微调 Qwen3.6-27B,便在 OpenHands 框架下将 GDPVal 跑分推高至 1445.7(大涨 65.7 分),并在 Claude Code 下将电子表格与工作区基准推升超过 13.7 分。

核心要点速览 (Key Takeaways)

  • ✓首创基于证据图(Evidence Graph)的真实多文件工作区合成与自动化可验证评分标尺体系
  • ✓仅需 2,169 条 GraphForge 高质量轨迹微调,驱动 OpenHands GDPVal 跑分跃升至 1445.7(净增 65.7 分)
  • ✓在 Claude Code 环境下助力 Workspace-Bench-Lite 达到 63.7 分,SpreadsheetBench II 飙升 13.7 分
🧭

Claude Code 高频使用:比较订阅额度与 API 账单

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

随着 Devin、OpenHands、Claude Code 以及各类 Copilot 的演进,AI 智能体正从单一的代码续写工具跃升为能够端到端交付复杂工程成果的“工作智能体(Working Agents)”。这类智能体必须具备在数十个真实代码仓库、办公电子表格、配置文件与业务文档中游刃有余穿梭、定位依赖并生成最终交付物的高阶能力。然而,训练此类高级智能体面临着严重的“高质量合成数据荒”:若使用大模型全合成虚拟文件,往往逻辑简单且严重脱离工业级项目的真实多样性;若直接爬取真实的 GitHub 仓库或企业工作区,又因为缺乏任务专属的自动化验证器(Task-Specific Verifiers),无法自动判定智能体交付成果的正确性,导致强化学习与微调数据缺乏可信的监督信号。

架构亮点与底层机制

针对工作智能体真实性与可验证性难以兼顾的痛点,复旦大学与中科大联合团队提出了 GraphForge 框架,将多文件工作区合成建立在严密的“证据图(Evidence Graph)”之上:

  1. 职业种子驱动的真实文件拓扑组织(Occupation-Grounded Seeds):以真实专业岗位需求为锚点,收集并组织跨代码、数据表、文档的异构真实工作区,避免了模型臆造文件的空洞性;
  2. 构建细粒度证据图(Evidence Graph Construction):深度分析工作区内各个文件之间的引用、依赖、函数调用及跨表数据关联,将离散文件编织为带有明确因果与推导链条的证据图结构;
  3. 任务目标与判定标尺双向锚定(Dual-Anchored Tasks & Rubrics):任务说明(Task Statements)与评分标尺(Evaluation Rubrics)完全直接由证据图拓扑派生。每一条判定指标均严格锚定到验证所需的具体文件与数据节点上,实现了高精度的自动化确定性校验;
  4. 执行预检与修补智能体(Revision Agent Pipeline):在正式收集轨迹前,先启动初始 Rollout 检验任务的可执行性,并通过专门的修订智能体对照原始文件修复任务歧义与标尺漏洞,确保合成数据 100% 具备工业可验证性。

权威 Benchmark 与实测跑分对比

在覆盖主流智能体框架与多领域办公实战评测中,GraphForge 展现出了强大的实战赋能效果:

  1. OpenHands 框架下 GDPVal 跑分狂飙 65.7 分:仅基于 2,169 条 GraphForge 合成轨迹对开源 Qwen3.6-27B 进行监督微调,其在主流智能体开源运行框架 OpenHands 下的 GDPVal 成绩达到 1445.7 分(净增 65.7 分);
  2. Claude Code 真实工作区基准大幅提升:在 Claude Code 评测体系下,Workspace-Bench-Lite 得分达到 63.7 分(提升 7.7 分),在极其复杂的电子表格深度分析基准 SpreadsheetBench II 上更是飙升至 24.0 分(净增 13.7 分);
  3. 拒绝微调(RFT)自进化收益显著:利用证据图锚定的评分标尺对微调模型自采样的候选轨迹进行过滤与拒绝微调,各大基准表现持续单调上扬,证实了评分标尺作为自动化奖励信号的高度有效性。

开发者实战落地与开箱指南

GraphForge 完整的数据集、生成流水线代码以及微调模型权重已全面公开发布。对于正在开发企业级全自动化办公 Agent、数据分析智能体以及复杂项目交付 Copilot 的团队,GraphForge 提供了一套标准化的“工作区数字孪生”数据生成蓝图。开发者可以基于企业自有的项目文件或行业代码库,利用 GraphForge 自动构筑证据图并派生带确定性测试断言的训练任务流,以极高的数据纯度低成本训练出能够独立胜任多文件交付的顶级自主工作智能体。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。