随着 Anthropic Computer Use 与各类桌面自动化智能体(Computer-Use Agents, CUAs)加速接管操作系统操作,如何科学评估多步骤 GUI 交互的真实能力成为业界最急迫的命题。现有的代表性基准(如 OSWorld)主要依赖最终结果判定(Outcome-based Verification),即在 Agent 执行了数百步鼠标键盘操作后,仅检测最终文件或系统状态是否发生改变。这种“黑盒终态评估”完全掩盖了智能体在中间步骤中“如何犯错”与“为何失败”——例如因键盘输入打字错误失败,与因视觉定位不准导致鼠标误点失败,所需要的工程修复路径完全风马牛不相及。NVIDIA 研究团队推出了首个基于全流程过程解构的桌面智能体评测系统 OSWorld-Pro(arXiv:2609.24890):包含 300 多个真实系统级生产任务,将其细粒度拆解为 2,800 多个连续依赖的子目标(Subgoals),并依托 67,000 多条高质量人类专家操作注释作为基准。通过人类对齐的 LLM-Judge 对各阶段子目标达成度展开逐层量化,评测揭示即便是业界最前沿模型如 Claude Opus 5 在 OSWorld-Pro 上的得分也仅为 75.7%(低于标准 OSWorld 的 83.4%),并精准捕获了无效漫游动作与点击像素级偏移两大核心故障模式。
核心要点速览
- ✓NVIDIA 推出首个基于全流程解构的桌面智能体评测系统 OSWorld-Pro,拆解 300+ 任务为 2,800+ 细粒度子目标
- ✓依托 67,000+ 人类专家密集注释,揭露顶尖模型 Claude Opus 5 得分仅 75.7%(低于标准 OSWorld 的 83.4%)
- ✓精确定位无效漫游与鼠标像素级点击偏移两大核心死穴,彻底终结桌面智能体盲盒式终态测试

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
随着 Computer-Use Agent(CUA,如 Anthropic Computer Use、OpenAI Operator 及各类开源桌面助理)的井喷式发展,智能体开始像人类白领一样直接面对复杂的桌面图形操作系统(Windows、Ubuntu、macOS),通过视觉感知屏幕截图并发出精确的鼠标点击、拖拽与键盘输入。然而,现有的桌面智能体评测生态(以知名基准 OSWorld 为代表)普遍存在严重的“唯结果论黑盒弊端”:评测仅在 Agent 执行完长达数百步复杂交互后的最后一刻,通过系统探针检查最终生成的文件内容或数据库记录。这种终态校验完全无法透视长程操作中各个阶段的健康状况——当一个 Agent 最终失败时,开发者根本无法得知它是由于在第一步搜索时打错了快捷键,还是在最后一步确认保存时发生了几像素的鼠标点偏,导致整个优化诊断链路陷入盲人摸象的窘境。
架构亮点与底层机制
针对这一黑盒评估瓶颈,NVIDIA 研究团队(Jan Kautz 领衔)联合打造了业界首个全流程过程解构评测基准 OSWorld-Pro(arXiv:2609.24890):
- 2,800+ 连续因果子目标拓扑网(Process-Centric Subgoal Decomposition):精心遴选了跨越办公文档、浏览器检索、多媒体剪辑与系统级配置的 300 多个真实生产级复杂任务,将每个百步长程任务精细拆解为平均包含近 10 个按时序因果强依赖的子目标(Subgoals);
- 67,000+ 人类专家密集交互基准标注库:全面采集并标注了超过 67,000 条人类资深用户在各步骤上的屏幕轨迹、意图转移与视觉焦点热力图,为过程评估确立了绝对客观的标尺;
- 多模态对齐的高保真 LLM-Judge 过程裁判器:在每个连续子目标的关键动作转折点,调用与人类严苛对齐的多模态裁判模型实时审计智能体的桌面状态转移,实现精准的阶段性完成度渐进打分(Progress Scoring);
- 核心故障模式深度归因分析(Failure Mode Attribution):首次从数据层面将 CUA 的崩溃归因归类为“子目标无关的冗余漫游(Subgoal-Irrelevant Actions)”、“GUI 像素级点击偏移(Click-based Misalignment)”以及“状态回传不同步(State-Sync Latency)”三大硬核失效模式。
权威 Benchmark 与实测跑分对比
在对包括 Claude Opus 5、GPT-4o、Qwen-VL 系列等全球顶尖 CUA 智能体展开的全面压力测试中,OSWorld-Pro 展现出了极强的诊断穿透力:
- 前沿模型得分遭遇严重滑铁卢:在标准 OSWorld 上能够轻松斩获 83.4% 高分的最强商业模型 Claude Opus 5,在引入全过程子目标严密审查的 OSWorld-Pro 上,综合得分骤跌至仅 75.7%,暴露出端到端侥幸过关背后的诸多不合规漏洞;
- 过程渐进得分揭示不同模型的韧性差异:评测表明,开源小参数智能体往往在长程任务的前 30% 步骤即发生严重的偏航漫游,而旗舰模型虽能推进至 80% 以上的子目标,却频频在最后的多应用跨屏切换中功亏一篑;
- 量化揭示点击精度是制约 CUA 的核心工程死穴:实验统计显示,超过 40% 的非意图失败均来自于视觉 Grounding 在高分辨率屏幕上的亚像素偏差,为下一代端侧小模型提供了最清晰的攻坚方向。
开发者实战落地与开箱指南
OSWorld-Pro 的完整子目标测试套件、人类标注数据集以及过程裁判器代码已依托开源社区(xlang-ai/OSWorld)全面开放。对于正在研发桌面操作 Agent、端侧 GUI 自动化助手、自动化测试 RPA 工具的技术团队,OSWorld-Pro 是一座前所未有的“诊断级 CT 扫描仪”。开发者切勿再满足于粗放的终态单点测试,而应在内部 CI/CD 流程中引入 OSWorld-Pro 的子目标阶段性评估,精确定位模型在键盘响应与鼠标空间定位上的微观 Bug,打造真正抗扰、稳健、可解释的工业级桌面智能体。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察