现有多模态计算机使用智能体(CUA)在处理复杂桌面任务时面临严峻两难:完全依赖图形界面(GUI)点击输入容易受动态渲染和窗口遮挡影响,不仅推理极为缓慢且极易出错;而依赖特定应用程序的专有 API 又需耗费巨大的定制工程,根本无法泛化至数以万计的日常软件。浙江大学联合研究团队推出首个软硬兼施的跨平台计算机使用智能体框架 HybridCUA。通过构建包含 5,000 条混合轨迹与 3,000 个强化学习可验证任务的 HybridCUA-8K 基准,提出两阶段训练机制:先通过多模态 SFT 学习图文与命令行的交替调用,再通过命令行感知强化学习(CLI-Aware RL)激励模型在关键节点自适应决策使用 Shell 脚本。在主流真实操作系统基准 OSWorld 上,HybridCUA-9B 达到 53.6% 成功率,相比基础模型暴涨 14.8 个百分点,并在 WindowsAgentArena 获得 4.0 个百分点跨平台增益。
核心要点速览 (Key Takeaways)
- ✓GUI 与 CLI 双流深度融合:打破以往 CUA 仅靠视觉截屏模拟鼠标键盘点击的单一范式,将 Bash/PowerShell 脚本的高效确定性与图形界面的广泛通用性无缝打通。
- ✓HybridCUA-8K 混合轨迹基准:开源首个包含 5,000 条高质量 GUI+CLI 混合执行轨迹与 3,000 个基于环境结果反馈的可验证强化学习任务(RLVR),填补跨模态桌面决策数据空白。
- ✓OSWorld 53.6% 与跨平台实证:HybridCUA-9B 在 Linux 桌面 OSWorld 评测中准确率达到 53.6%(绝对提升 +14.8%),在 WindowsAgentArena 提升 4.0%,展现出卓越的操作系统级跨生态泛化力。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察