
标题Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents来源arXiv, 2607.28227v1️文章简介研究问题如何缩小GUI智能体在模拟基准测试与真实世界设备应用之间的性能差距实现跨平台、长程且主动的可靠执行主要贡献论文提出了Qwen-UI-Agent一个以真实世界为中心的基础GUI智能体通过混合动作空间、在线强化学习及主动服务层在移动端和电脑端任务上达到最先进水平。重点思路构建真实设备移动运行环境包含百余台物理设备和健康感知调度器解决模拟到现实的鸿沟支持大规模并发训练与评估。设计统一的混合动作空间将GUI操作、CLI命令及API调用结合并支持批量动作生成提升执行效率与任务覆盖范围。建立Agent驱动的数据飞轮自动化完成任务合成、环境构建、失败诊断及迭代优化减少人工干预并加速能力进化。采用分阶段训练策略包括领域条件专家微调、针对局部错误的动作强化学习以及面向长程决策的大规模在线强化学习。引入Harness层实现跨平台工作流与主动服务基于手机通知预判用户需求并在手机与电脑间无缝保持上下文状态执行任务。分析总结在真实设备移动端基准MobileWorld-Real上取得92.2%的成功率显著优于Gemini 3.1 Pro、Claude Opus 4.8等前沿闭源模型。在电脑使用任务OSWorld-Verified上获得79.5%的成绩排名第二在OSWorld-v2中部分进度得分达40.0%且步骤更少证明混合动作空间的高效性。在浏览器导航WebArena中达到73.6%的成功率超越所有对比基线在DeepSearch任务中展现出强大的多源信息检索与综合验证能力。行为分析显示真实设备上的失败主要源于探索不足、弹窗干扰及UI误读而Qwen-UI-Agent通过真实数据训练有效缓解了这些问题。消融实验表明动作强化学习修正了重复错误和局部决策失误在线强化学习则显著提升了长程任务中的规划与状态跟踪能力。个人观点论文摆脱了对纯模拟环境的依赖构建了大规模真实设备集群进行训练与评估提升了智能体的鲁棒性。