Qwen-CUA

Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent

Qwen-CUA,一款由 Qwen 团队携手 XLang Lab 倾力打造的性计算机使用代理(Computer Use Agent),正以其独特的纯视觉感知能力和原生输入模拟技术,重新定义人机交互的边界。这款基于 397B-A17B 混合专家(MoE)架构的智能体,无需依赖复杂的 DOM 树或辅助功能元数据,仅凭对屏幕截图的深度理解,便能娴熟地运用键盘与鼠标,在浏览器、桌面应用乃至专业软件中游刃有余地执行各项操作。

Qwen-CUA 的核心特质

  • 独步的视觉洞察力:Qwen-CUA 的核心优势在于其“纯视觉感知”能力。它仅通过捕捉屏幕画面,便能精准洞悉界面状态,这种不依赖 HTML 结构或辅助功能信息的特性,赋予了它超乎寻常的跨平台兼容性与通用性。
  • 直抵本质的输入模拟:区别于传统依赖 API 的方式,Qwen-CUA 直接生成键盘和鼠标,这意味着它能够如同真人用户一般,在各类应用环境中进行操作,无论是浏览网页、操作桌面软件,还是驾驭复杂的专业工具。
  • 强大的 MoE 架构基石:其卓越性能源于 397B-A17B 混合专家模型。这种架构在保证强大表达能力的同时,有效控制了推理成本。而更大规模的 Qwen-CUA-Max 版本,参数量更是突破万亿,在 OSWorld-Verified 基准测试中分别斩获 86.2 分和 87.6 分的高分,展现出强大的实力。
  • 开放的探索空间:为了促进社区的研究与创新,Qwen-CUA 的技术报告和参考演示(Demo)已在 GitHub 上公开发布,为研究者和开发者提供了宝贵的复现与二次开发资源。

Qwen-CUA 的技术精髓

  • 先进的 MoE 底座:Qwen-CUA 建立在 Qwen3.5-397B-A17B 混合专家架构之上。该架构拥有 397B 的总参数量,但每次前向计算仅激活 17B 参数,巧妙地平衡了模型性能与推理开销。
  • 高效的混合注意力机制:为了处理超长序列,Qwen-CUA 采用了 GatedDeltaNet 线性注意力和 Gated Full Attention 交替排列的策略。这种设计将计算复杂度从传统的 O(n²) 降至接近线性,使得 256K 上下文的吞吐量相较于传统架构提升了惊人的 19 倍。
  • 精密的专家路由系统:模型在每层都配备了 512 个精细化的路由专家,通过 Top-10 选择和权重重归一化进行激活。此外,一个共享专家与 sigmoid 门控的协同作用,能够自适应地调节通用知识的贡献度,从而有效避免信息损失。
  • 纯粹的视觉感知原理:Qwen-CUA 的核心在于其对屏幕截图的依赖。它完全摒弃了对 HTML DOM 树、辅助功能元数据或操作系统 API 的依赖,从而实现了对任何具有图形界面的应用进行跨平台、无差别的感知与操控。
  • 精准的视觉编码与定位:在视觉编码方面,Qwen-CUA 沿用了 Qwen-VL 系列的 ViT 架构,支持动态分辨率输入。配合 MRoPE(多模态旋转位置编码),它能够同时编码时间、高度和宽度这三个维度信息,实现对界面元素坐标的精准识别与定位。

如何驾驭 Qwen-CUA

  • 探访项目仓库:前往 GitHub 搜索 xlang-ai/Qwen-CUA,即可访问该项目的官方主页。
  • 研读技术报告:下载并仔细阅读项目内的技术报告,深入了解其模型架构、训练细节及核心技术。
  • 体验参考 Demo:按照 README 文件中的指引配置好运行环境,即可启动官方提供的参考 Demo,亲身体验截图驱动的自动化操作。
  • 融入自有工作流:将 Qwen-CUA 模型集成到您本地或云端的桌面/浏览器环境中,通过截图输入与键盘鼠标输出的闭环,高效执行各种自动化任务。

Qwen-CUA 的突出优势

  • 卓越的基准表现:在 OSWorld-Verified 测试中,Qwen-CUA 取得了 86.2 分的优异成绩,Max 版本更是达到了 87.6 分,在开源 CUA 领域处于领先地位。
  • 真正的端到端 CUA:与依赖 API 组合或多 Agent 协同的方案不同,Qwen-CUA 是一个端到端训练的视觉-动作模型,其稳定性和可靠性得到了显著提升。
  • 限的跨平台兼容性:不受限于操作系统或特定的应用类型,任何带有图形界面的软件,Qwen-CUA 均可实现操控。
  • 开放共享的生态系统:遵循 Apache 2.0 协议,其技术报告与 Demo 已公开,极大地鼓励了社区的探索和功能扩展。

Qwen-CUA 的项目链接

  • GitHub 仓库:https://github.com/xlang-ai/Qwen-CUA
  • 技术论文:https://github.com/xlang-ai/Qwen-CUA/blob/main/paper/Qwen-CUA.pdf

Qwen-CUA 与同类竞品的比较

维度Qwen-CUAOpenAI CUA / Operator
感知方式纯截图视觉感知,无需 DOM 依赖截图与结构化辅助信息混合感知
架构397B-A17B MoE,开源GPT-4o 特化版本,闭源
OSWorld-Verified 分数86.2 分(Max 版本 87.6 分)约 38.1% 的成功率(历史数据)
开放性技术报告与 Demo 开源(Apache 2.0 协议)API 商业化调用,模型本身闭源
输入模拟原生键盘鼠标模拟原生键盘鼠标模拟
适用平台浏览器、桌面应用及专业软件主要面向浏览器与桌面应用

Qwen-CUA 的广阔应用前景

  • 软件自动化测试的利器:通过直观的截图识别界面元素,并执行点击、输入、滚动等操作,Qwen-CUA 无需编写复杂的脚本,即可实现跨平台的 UI 回归测试自动化。
  • RPA 流程自动化的新选择:它能够替代人工执行大量重复性的桌面办公任务,如数据录入、报表生成、ERP 系统操作等,并且无需对企业现有的 IT 系统进行改造。
  • 赋能无障碍辅助工具:对于视障用户或老年群体,Qwen-CUA 能够自动识别软件界面元素,并代为执行精确操作,显著降低了专业软件的使用门槛。
  • 专业软件操控的破局者:对于 MATLAB、SPSS 等缺乏 API 接口的专业软件,Qwen-CUA 能够实现自动化操控,批量处理实验数据、生成图表等耗时任务。
  • 云端 Agent 托管服务的理想方案:部署在云桌面环境中,Qwen-CUA 可实现 7×24 小时的高效运行,执行网站巡检、数据抓取、定时报表下载等后台自动化任务。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...