Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent
Qwen-CUA,一款由 Qwen 团队携手 XLang Lab 倾力打造的性计算机使用代理(Computer Use Agent),正以其独特的纯视觉感知能力和原生输入模拟技术,重新定义人机交互的边界。这款基于 397B-A17B 混合专家(MoE)架构的智能体,无需依赖复杂的 DOM 树或辅助功能元数据,仅凭对屏幕截图的深度理解,便能娴熟地运用键盘与鼠标,在浏览器、桌面应用乃至专业软件中游刃有余地执行各项操作。
Qwen-CUA 的核心特质
- 独步的视觉洞察力:Qwen-CUA 的核心优势在于其“纯视觉感知”能力。它仅通过捕捉屏幕画面,便能精准洞悉界面状态,这种不依赖 HTML 结构或辅助功能信息的特性,赋予了它超乎寻常的跨平台兼容性与通用性。
- 直抵本质的输入模拟:区别于传统依赖 API 的方式,Qwen-CUA 直接生成键盘和鼠标,这意味着它能够如同真人用户一般,在各类应用环境中进行操作,无论是浏览网页、操作桌面软件,还是驾驭复杂的专业工具。
- 强大的 MoE 架构基石:其卓越性能源于 397B-A17B 混合专家模型。这种架构在保证强大表达能力的同时,有效控制了推理成本。而更大规模的 Qwen-CUA-Max 版本,参数量更是突破万亿,在 OSWorld-Verified 基准测试中分别斩获 86.2 分和 87.6 分的高分,展现出强大的实力。
- 开放的探索空间:为了促进社区的研究与创新,Qwen-CUA 的技术报告和参考演示(Demo)已在 GitHub 上公开发布,为研究者和开发者提供了宝贵的复现与二次开发资源。
Qwen-CUA 的技术精髓
- 先进的 MoE 底座:Qwen-CUA 建立在 Qwen3.5-397B-A17B 混合专家架构之上。该架构拥有 397B 的总参数量,但每次前向计算仅激活 17B 参数,巧妙地平衡了模型性能与推理开销。
- 高效的混合注意力机制:为了处理超长序列,Qwen-CUA 采用了 GatedDeltaNet 线性注意力和 Gated Full Attention 交替排列的策略。这种设计将计算复杂度从传统的 O(n²) 降至接近线性,使得 256K 上下文的吞吐量相较于传统架构提升了惊人的 19 倍。
- 精密的专家路由系统:模型在每层都配备了 512 个精细化的路由专家,通过 Top-10 选择和权重重归一化进行激活。此外,一个共享专家与 sigmoid 门控的协同作用,能够自适应地调节通用知识的贡献度,从而有效避免信息损失。
- 纯粹的视觉感知原理:Qwen-CUA 的核心在于其对屏幕截图的依赖。它完全摒弃了对 HTML DOM 树、辅助功能元数据或操作系统 API 的依赖,从而实现了对任何具有图形界面的应用进行跨平台、无差别的感知与操控。
- 精准的视觉编码与定位:在视觉编码方面,Qwen-CUA 沿用了 Qwen-VL 系列的 ViT 架构,支持动态分辨率输入。配合 MRoPE(多模态旋转位置编码),它能够同时编码时间、高度和宽度这三个维度信息,实现对界面元素坐标的精准识别与定位。
如何驾驭 Qwen-CUA
- 探访项目仓库:前往 GitHub 搜索
xlang-ai/Qwen-CUA,即可访问该项目的官方主页。 - 研读技术报告:下载并仔细阅读项目内的技术报告,深入了解其模型架构、训练细节及核心技术。
- 体验参考 Demo:按照 README 文件中的指引配置好运行环境,即可启动官方提供的参考 Demo,亲身体验截图驱动的自动化操作。
- 融入自有工作流:将 Qwen-CUA 模型集成到您本地或云端的桌面/浏览器环境中,通过截图输入与键盘鼠标输出的闭环,高效执行各种自动化任务。
Qwen-CUA 的突出优势
- 卓越的基准表现:在 OSWorld-Verified 测试中,Qwen-CUA 取得了 86.2 分的优异成绩,Max 版本更是达到了 87.6 分,在开源 CUA 领域处于领先地位。
- 真正的端到端 CUA:与依赖 API 组合或多 Agent 协同的方案不同,Qwen-CUA 是一个端到端训练的视觉-动作模型,其稳定性和可靠性得到了显著提升。
- 限的跨平台兼容性:不受限于操作系统或特定的应用类型,任何带有图形界面的软件,Qwen-CUA 均可实现操控。
- 开放共享的生态系统:遵循 Apache 2.0 协议,其技术报告与 Demo 已公开,极大地鼓励了社区的探索和功能扩展。
Qwen-CUA 的项目链接
- GitHub 仓库:https://github.com/xlang-ai/Qwen-CUA
- 技术论文:https://github.com/xlang-ai/Qwen-CUA/blob/main/paper/Qwen-CUA.pdf
Qwen-CUA 与同类竞品的比较
| 维度 | Qwen-CUA | OpenAI CUA / Operator |
|---|---|---|
| 感知方式 | 纯截图视觉感知,无需 DOM 依赖 | 截图与结构化辅助信息混合感知 |
| 架构 | 397B-A17B MoE,开源 | GPT-4o 特化版本,闭源 |
| OSWorld-Verified 分数 | 86.2 分(Max 版本 87.6 分) | 约 38.1% 的成功率(历史数据) |
| 开放性 | 技术报告与 Demo 开源(Apache 2.0 协议) | API 商业化调用,模型本身闭源 |
| 输入模拟 | 原生键盘鼠标模拟 | 原生键盘鼠标模拟 |
| 适用平台 | 浏览器、桌面应用及专业软件 | 主要面向浏览器与桌面应用 |
Qwen-CUA 的广阔应用前景
- 软件自动化测试的利器:通过直观的截图识别界面元素,并执行点击、输入、滚动等操作,Qwen-CUA 无需编写复杂的脚本,即可实现跨平台的 UI 回归测试自动化。
- RPA 流程自动化的新选择:它能够替代人工执行大量重复性的桌面办公任务,如数据录入、报表生成、ERP 系统操作等,并且无需对企业现有的 IT 系统进行改造。
- 赋能无障碍辅助工具:对于视障用户或老年群体,Qwen-CUA 能够自动识别软件界面元素,并代为执行精确操作,显著降低了专业软件的使用门槛。
- 专业软件操控的破局者:对于 MATLAB、SPSS 等缺乏 API 接口的专业软件,Qwen-CUA 能够实现自动化操控,批量处理实验数据、生成图表等耗时任务。
- 云端 Agent 托管服务的理想方案:部署在云桌面环境中,Qwen-CUA 可实现 7×24 小时的高效运行,执行网站巡检、数据抓取、定时报表下载等后台自动化任务。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


