随着 Anthropic Computer Use 与各种操作系统智能体(OS Agents)进入桌面工作流,如何在多应用层叠、分辨率各异以及同质化按钮混淆的复杂真实桌面场景中精准定位可操作控件,成为制约智能体长程作业的核心瓶颈。现有 GUI 训练数据缺乏受控的环境状态演化与细粒度像素级密集标注。为此,苏黎世联邦理工学院(ETH Zurich)与 IBM Research 联合推出可控桌面数据生成系统 DeskForge(arXiv:2610.02320)。该系统通过在可控沙盒中动态编排真实桌面应用,实时融合系统截图、无障碍辅助树(Accessibility Tree)与窗口几何坐标,构建了涵盖 120 万密集桌面交互观测与 1.597 亿控件实例的超大规模数据集 DeskForge-1M。在仅使用其中 20 万样本微调后,Qwen3.5-4B 等视觉语言模型在 ScreenSpot-Pro 上的定位准确率暴涨 11.51 个百分点,在 OSWorld-G 上提升 10.11 个百分点;在长流程真实任务测试中,WebArena-Infinity 通关数由 31 跃升至 50,OpenApps 成功率翻了 5 倍。项目主页与数据集已全面开放(saidgurbuz.github.io/deskforge)。

核心要点速览

  • ✓ETH Zurich 与 IBM 推出可控桌面数据生成系统 DeskForge,融合截图、辅助树与窗口几何生成 1.2M 观测与 1.597 亿控件实例
  • ✓仅用 20 万样本微调即让 Qwen3.5-4B 在 ScreenSpot-Pro 准确率暴涨 11.51%、OSWorld-G 攀升 10.11%,5 大基准全面超越基线
  • ✓长程任务完成能力翻倍突破:WebArena-Infinity 通关数由 31 升至 50,企业级 OpenApps 任务成功率暴涨 5 倍,权重与数据全开源
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

大模型操作系统操作智能体(Computer-Use Agents)被视为通用人工智能接管日常劳动的关键载体。然而,与相对规范干净的移动端 App 或 Web 单页面不同,真实桌面操作环境(Windows/macOS/Linux)堪称视觉定位的“噩梦地带”:多屏幕分辨率混杂、多个应用程序窗口任意重叠遮挡、深浅色主题切换、以及数十个图标几乎一致的微小功能按钮挤压在菜单栏。现有的图形界面数据集多为静态无序抓取,缺乏精确的“动作-前后状态-像素坐标”密集绑定数据,导致大模型在实际点击时频繁“看走眼”、误触背景窗口或无法识别悬浮窗,长程自动化任务在第 2~3 步便彻底卡死。

架构亮点与底层机制

针对这一制约智能体工业落地的视觉根基问题,苏黎世联邦理工学院(ETH Zurich)与 IBM Research 联手研发了可控桌面数据合成引擎 DeskForge(arXiv:2610.02320):

  1. 多层级真实应用可控合成沙盒(Controllable Desktop Synthesis):DeskForge 运行在真实操作系统沙盒中,能够程序化操纵各类主流办公与专业软件,动态控制窗口层叠次序、尺寸缩放、界面主题和渲染分辨率,全自动生成覆盖各种极端边界工况的交互场景;
  2. 三源密集几何融合标注(Tri-Source Dense Grounding Fusion):系统在每次动作前后,毫秒级同步捕获原生像素截图、底层无障碍辅助树(Accessibility Tree/DOM)以及窗口管理器几何拓扑数据,将原本需要人工标注的控件边界框(Bounding Box)、可点击属性与层级所属关系全自动映射为 100% 准确的密集标注;
  3. DeskForge-1M 超大规模基石语料:团队以此合成了涵盖 120 万高分辨率观测帧、总计包含 1.597 亿个精准标注控件实例的开源数据集 DeskForge-1M,并记录了每一次动作引发的完整系统状态演化轨迹。

权威 Benchmark 与实测跑分对比

基于 DeskForge-1M 中抽取的 20 万样本对开源多模态基座进行微调后,模型在业界各大严苛基准上实现了全方位的跨越式升级:

  1. 五大外部 GUI 定位基准全线飘红:在涵盖极端复杂桌面场景的 ScreenSpot-Pro 基准上,以 Qwen3.5-4B 为例,定位准确率直接飙升 11.51 个百分点;在 OSWorld-G 上亦大幅攀升 10.11 个百分点,显著反超诸多体积数倍的闭源巨无霸模型;
  2. 长程全流程任务完成率成倍爆发:在由固定任务规划器驱动的完整长程评测中,微调后的模型展现出老练的桌面驾驭能力:在 WebArena-Infinity 复杂长任务基准上,成功完成任务数从基线的 31 项猛增至 50 项(共 119 项);在企业级多桌面应用基准 OpenApps 上,任务成功数直接从 3 项暴增至 15 项,成功率翻了整整 5 倍;
  3. 零样本跨应用泛化无死角:测试表明,在完全未见过的专有生产力软件和非标准自定义 UI 控件上,经过 DeskForge 训练的智能体同样能准确推断交互锚点,展现出真正的通识性视觉指引能力。

开发者实战落地与开箱指南

DeskForge 的沙盒引擎源码、DeskForge-1M 数据集以及微调后的 Qwen3.5-4B 检查点已在项目官方主页(https://saidgurbuz.github.io/deskforge/)全面开放。对于正在开发下一代桌面 RPA 自动化、办公 Copilot、智能测试机器人以及无障碍辅助工具的工程师而言,DeskForge 解决了长期以来缺乏工业级桌面 Grounding 训练数据的燃眉之急。开发者可以直接下载预训练权重作为 Computer-Use 系统的底层视觉眼球,亦可利用 DeskForge 沙盒根据企业私有 ERP 软件自动化生成专有的密集标注微调集,彻底打通桌面智能体落地的“最后一公里”。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。