阿里巴巴通义实验室(Tongyi-MAI,@Alibaba_Qwen)与多所高校联合开源了新一代面向真实手机操作系统的规划智能体 Qwen-Planner-Agent(arXiv: 2609.29892,项目主页: tongyi-mai.github.io/Qwen-Planner-Agent/)。面对手机端长程多步骤任务在真实物理设备上交互昂贵、训练数据难以扩展以及 Agent 运行时执行不可靠等行业痛点,团队构建了开创性的“AI-for-AI 自闭环演进体系”:通过专门的 Agent 飞轮自动生成海量手机操作轨迹并引入 CARE 在线强化学习算法,在权威基准 MobilePA-Bench 上斩获综合表现第一。
- ✓构建首个闭环 AI-for-AI 手机智能体开发流水线,实现数据生成、模型训练与运行时部署的三位一体迭代。
- ✓提出 CARE(能力感知奖励与优势工程)在线强化学习算法,大幅削减大模型长程思考与工具调用开销。
- ✓运行时引入模型与 Harness 协同演化机制,动态调度记忆、子 Agent 协同与 App 页面动作纠偏。
- ✓在权威手机规划基准 MobilePA-Bench 上登顶综合性能第一,在保持通用能力的同时显著提升复杂任务成功率。
- ✓项目主页、多设备评测考卷与交互协议已全面在 GitHub 与 Hugging Face 开放。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 随着智能体从桌面终端走向个人智能手机(Mobile OS),让大模型直接操控外卖下单、多 App 比价与跨软件日程编排已成为端侧 AI 的兵家必争之地。然而,手机端任务具备极高的不可逆风险与动态复杂性(如弹窗遮挡、页面异步刷新、步骤长达数十步)。更为严峻的是,真机操作无法像虚拟仿真器那样以千倍速并行运行,数据采集成本极度高昂,且现有模型在跨步骤调用时经常发生记忆丢失、工具死循环或操作偏离意图。 ### 架构亮点与底层机制 阿里通义团队提出了“以 AI 进化 AI(AI-for-AI)”的自进化闭环体系: 1. 数据飞轮(AI for Data):由专门的任务构造 Agent、轨迹采集 Agent 与质量平衡 Agent 协同工作,利用真机交互的执行反馈自适应引导后续更复杂的边缘案例生成,完全摆脱昂贵的人工手机标注; 2. CARE 在线强化学习(AI for Training):提出“能力感知奖励与优势工程(CARE)”,动态权衡智能体思考 Token 长度与工具调用代价,在奖励模型中对冗余无效的点击与重复滑屏施加软约束,引导模型以最精简的操作步数完成目标; 3. 执行证据驱动的 Harness 协同演化:在系统底层建立行动-反馈-验证契约,当遇到未知界面报错时,系统自动持久化失败轨迹并动态调度技能库(Skills)或拉起轻量子 Agent 进行局部修正。 ### 权威 Benchmark 与实测跑分对比 在跨越 100+ 款主流安卓 App 与复杂日常任务的 MobilePA-Bench 实测中: - Qwen-Planner-Agent 在任务达成率上稳居全场第一,全面压倒包括商业端侧助手与开源移动 Agent 在内的基线; - 借助 CARE 强化学习优化,长程任务执行所需的平均思考 Token 消耗削减了 34.2%,单任务平均操作步数减少 21.6%; - 在通用非手机智能体评测(如 Web 检索与综合逻辑规划)中,模型在强化手机操作能力的同时,通用自然语言推理基准损失小于 0.6%。 ### 开发者实战落地与开箱指南 移动端智能体开发者与端侧系统工程师可按以下建议实践: - 访问官方项目主页 https://tongyi-mai.github.io/Qwen-Planner-Agent/ 查阅各类 App 端到端操作录屏与动作语法规范; - 借鉴其 CARE 强化学习奖励设计,优化私有自动化测试与 RPA 流程; - 国内开发者可直接在 Hugging Face 论文专区查阅架构细节与 MobilePA-Bench 评测集。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察