Qwen-CUA官网
Qwen-CUA 是 Qwen 团队与 XLang Lab 联合推出的原生 Computer Use Agent,基于 397B-A17B 混合专家(MoE)架构。它只通过截图感知界面状态,不依赖 DOM 树或辅助功能元数据,直接用键盘和鼠标操控浏览器、桌面应用以及专业软件。在 OSWorld-Verified 基准上它拿到 86.2 分,更大的 Qwen-CUA-Max 版本参数量超过万亿,达到 87.6 分,处于开源 CUA 领域的领先位置。
和”给模型喂结构化页面信息”的做法不同,Qwen-CUA 走的是纯视觉路线:屏幕长什么样,它就认什么样。这意味着任何带图形界面的软件——不管有没有标准 API、有没有无障碍支持——它都能碰,跨平台通用性天然更强。

主要功能
- 纯视觉感知:仅通过截图理解界面状态,不依赖 HTML 结构或无障碍元数据,跨平台通用性更强。
- 原生输入模拟:直接输出键盘和鼠标,可在浏览器、桌面应用、专业软件中执行操作。
- MoE 架构底座:基于 397B-A17B 混合专家模型,平衡性能与推理成本;Max 版本超万亿参数,性能再提升。
- 开放技术报告:GitHub 已发布技术报告与参考 Demo,便于研究者复现与二次开发。
技术上,Qwen-CUA 基于 Qwen3.5-397B-A17B 混合专家架构,总参数 397B、每次前向只激活 17B,在保持强表达能力的同时压住推理成本。注意力部分用 GatedDeltaNet 线性注意力与 Gated Full Attention 按 75:25 交替排列,把长序列计算复杂度从 O(n²) 降到接近线性,256K 上下文吞吐量较传统架构提升约 19 倍。每层配 512 个细粒度路由专家,通过 Top-10 选择加权重重归一化激活,再配 1 个共享专家与 sigmoid 门控自适应调节通用知识贡献。视觉侧继承自 Qwen-VL 的 ViT 架构,支持动态分辨率输入,配合 MRoPE 多模态旋转位置编码同时编码时间、高度、宽度三维信息,精准定位界面元素坐标。
如何使用Qwen-CUA
- 访问仓库:在 GitHub 搜索 xlang-ai/Qwen-CUA,进入项目主页。
- 阅读技术报告:下载并阅读项目内的技术报告,了解模型架构与训练细节。
- 运行参考 Demo:按 README 配置环境,运行官方提供的参考 Demo,体验截图驱动的自动化操作。
- 接入自有环境:把模型接到本地或云端的桌面/浏览器环境,通过截图输入与键盘鼠标输出闭环执行任务。
使用场景
- 自动化软件测试:通过截图识别界面元素并执行点击、输入、滚动等操作,无需写特定脚本即可完成跨平台 UI 回归测试。
- RPA 流程自动化:替代人工完成数据录入、报表生成、ERP 操作等重复性桌面办公任务,无需改造企业原有 IT 系统。
- 无障碍辅助工具:为视障用户或老年人自动识别软件界面元素并代为执行精确操作,降低专业软件使用门槛。
- 科研与专业软件操控:自动操控 MATLAB、SPSS 等无 API 接口的专业软件,批量执行实验数据处理与图表生成等长周期任务。
- 云端 Agent 托管服务:部署于云桌面环境 7×24 小时执行网站巡检、数据抓取、定时报表下载等后台任务。
产品价格与版本
Qwen-CUA 采用 Apache 2.0 协议开源,技术报告与参考 Demo 已公开,社区可以扩展与二次开发。和 OpenAI 的 CUA / Operator 相比,后者是闭源、走 API 商用路线(历史数据 OSWorld-Verified 约 38.1% 成功率),感知上混合了截图与结构化辅助信息;Qwen-CUA 是纯截图视觉感知、零 DOM 依赖,开源且 OSWorld-Verified 达 86.2 分(Max 87.6)。当前发布包含 397B-A17B 标准版与超万亿参数的 Max 版,选型时主要看你是想要闭源托管的省心,还是想要开源可改的灵活。
常见问题解答
- Qwen-CUA 和普通 RPA 工具有什么区别?
- 传统 RPA 大多靠选择器、API 或固定坐标去定位界面元素,换一套没接好接口的软件就跑不动。Qwen-CUA 只认截图,靠视觉理解界面,任何带 GUI 的软件都能碰,而且是用端到端训练的视觉-动作模型在决策,不是多 Agent 拼出来的,稳定性更高。
- 它依赖 DOM 或者无障碍树吗?
- 不依赖。它完全通过屏幕截图感知界面状态,不读 HTML DOM 树、不用操作系统辅助功能元数据、不调系统 API,所以理论上跨操作系统、跨应用类型都能通用。
- 可以商用吗?
- 可以。采用 Apache 2.0 协议,技术报告和 Demo 已开源。上生产前建议先在自己的真实界面样本上跑一轮评测,确认定位精度和长任务成功率满足要求。
官网网址
GitHub 仓库:https://github.com/xlang-ai/Qwen-CUA
技术论文:https://github.com/xlang-ai/Qwen-CUA/blob/main/paper/Qwen-CUA.pdf
OpenI AI时代点评
Computer Use Agent 的路线分两派:一派给模型喂 DOM、辅助功能树这类结构化信息,学起来快,但换个没有标准界面的专业软件就傻了;另一派像 Qwen-CUA 只信截图,靠纯视觉感知去认界面。后者的好处是真正跨平台——任何带 GUI 的软件都能碰,代价是定位精度和长序列注意力要自己硬啃。Qwen-CUA 用 GatedDeltaNet 线性注意力去压长上下文的计算量,再把 256K 吞吐拉到传统架构的 19 倍,说明团队清楚 CUA 的瓶颈在哪儿。
OSWorld-Verified 86.2 分的成绩在开源里是头部。它和 coding agent 是互补的两条路——一个管”操作界面”,一个管”写代码”。如果你想找能直接干活的智能体,可以看看 QoderWork 这类 coding agent,把”改界面”和”写逻辑”配合起来用,覆盖度会高很多。
数据评估
本站OpenI提供的Qwen-CUA都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 8月 6日 上午11:10收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

