资讯详情

全网刷屏的 AI 操作电脑混战:trycua/cua、Qwen-CUA、UI-TARS-1.5、Operator,到底谁更能干活

📅 2026/10/9 23:57:06 | 华诺云谱 👁 阅读
全网刷屏的 AI 操作电脑混战:trycua/cua、Qwen-CUA、UI-TARS-1.5、Operator,到底谁更能干活
全网刷屏的 AI 操作电脑混战trycua/cua、Qwen-CUA、UI-TARS-1.5、Operator到底谁更能干活【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua从 2025 年 OpenAI 发布 Operator、Anthropic 跟进 Computer Use到 2026 年阿里开源 397B 参数的 Qwen-CUA、字节开源 UI-TARS-1.5、微软开源自己的 CUA再到 MIT 科技评论报道四人团队用 1100 万小时屏幕录像训练通用计算机行为模型——AI 操作电脑已经从演示视频变成了全行业最拥挤的赛道。但热闹归热闹一个关键问题始终没有统一答案这四类玩家到底谁更能干活本文不堆概念而是把四条技术路线拆开对比并用开源仓库 trycua/cua 中真实可运行的驱动层、评测套件与安全机制回答能干活的评判标准到底是什么。四条路线四种哲学原生模型派把看屏—动手焊进权重里这一派的核心做法是模型只接收屏幕截图只输出鼠标键盘动作中间不再依赖任何 API、选择器或 DOM。Qwen-CUA基于 397B 参数的混合专家模型交互接口被压缩到最小——屏幕截图进、键鼠操作出。社区报道称它在 OSWorld 等八大基准上显著超越 Qwen3.7并用长程视觉上下文分块折叠和迭代式强化学习SAPO解决长任务漂移问题安全性也有明显提升且支持与 Bash 等工具混合执行。UI-TARS-1.5字节 Seed 团队开源官方宣称在多项 Benchmark 上取得 SOTA属于同一视觉—动作范式的开源实现可本地部署。OperatorOpenAI CUA首个 L3 级智能体方向一致但闭源、运行在云端浏览器沙箱里普通用户零门槛但能力边界受限于产品环境。这一派共同的技术赌注是GUI 理解能力必须内化到模型里。代价是参数规模巨大Qwen-CUA 397B 意味着高昂的推理成本且面对从未见过的专业软件界面时表现仍不稳定。开源基础设施派把电脑交给任何模型与训练模型相反trycua/cua 走的是另一条路不训练大脑只提供能让任何模型真正操作电脑的四肢、眼睛和评测场。仓库 README.md 的定位写得非常直白Give AI agents computers they can use——把完整的桌面、无障碍树、输入通道和评测工具开源出来模型换成谁都行。架构图左侧是 Python / Node / Swift / Kotlin / WASM 的多语言 SDK中间是 Rust 核心cua-sdk、cua-vmm、cua-image、cua-fleet右侧是运行在沙箱内部的 cua-spacesd 守护进程。整套体系里谁来做决策和谁来碰电脑被彻底切开决策层可以接 Claude Code、Codex、Cursor、OpenClaw甚至 GPT-6 Astra、Gemini 3.5 Flash执行层统一由 Cua Driver 负责。这个仓库本身就是 Computer-Use 混战的最好观察样本——它不是参战方之一而是给所有参战方提供同一个考场和驾驶舱。谁更能干活三个实测维度维度一任务成功率——先看看考试是怎么设计的成功率最容易变成营销数字因为 demo 极易过拟合。开源仓库给出了一个更严谨的回答方式Cua Benchcb命令把任务做成可验证的桌面考试每个任务模块由tasks_config变体、setup_task环境准备、solve_task参考答案、evaluate_task评分四个函数构成同一套评分逻辑同时打 oracle、人类和 agent 的分数见 docs/content/docs/cua-bench/index.mdx。考试题库分两层自研任务集cua-bench-basic13 个任务、68 个变体覆盖点击、输入、拖拽、表单填写、cua-bench-kicad25 个真实 EDA 原理图编辑任务按网表计分、cua-bench-workflows52 个 OpenShot/Unity 多步骤工作流变体详见 docs/content/docs/cua-bench/guides/benchmarks.mdx。业界标准适配器通过cb run dataset一行命令即可跑 OSWorld-Verified369 个桌面任务、MiniWoB130、WebVoyager643、Online-Mind2Web300、WebGym1167以及 OSWorld-G564 项点击定位和 ScreenSpot-Pro约 1581 张高分辨率专业软件截图见 docs/content/docs/cua-bench/guides/adapter-benchmarks.mdx。这意味着社区任何 agent 都能在同一套试卷上横向比较。仓库还记录了真实评测结果。在 Cua-Bench 的 KiCad EDA 套件上25 个真实电路设计任务、统一 200 步预算没有任何前沿模型能完整通关Gemini 3.5 Flash 平均奖励最高0.2675 个完整解决 3 个部分解决GPT-5.5 完整解决最多6 个但因无部分得分而以 0.240 居次见 blog/evaluating-gemini-3.5-flash-on-computer-use.md。失败模式高度一致从零设计类任务在 200 步预算内超时、截图两次后模型幻觉出并不存在的界面状态。这组数据透露的真相是原生模型强在看屏就点的通用性弱在需要边思考边操作的专业任务。Qwen-CUA 在 OSWorld 类基准上的提升是真实的但基准提升和CAD 里完成一次原理图修改之间还隔着漫长的工程距离。维度二跨软件通用性——看懂屏幕和够得着软件是两回事Qwen-CUA、UI-TARS-1.5 的通用性来自只吃截图、只吐键鼠的最小接口——理论上任何界面都能操作。但纯截图路线有一个隐蔽的短板像素不代表可操作性。一个按钮在截图里是像素在无障碍树里才是带element_token的可点击对象。Cua Driver 恰恰把这两条通道合二为一get_window_state一次调用同时返回窗口的无障碍树和截图——树告诉你什么可操作像素告诉你是哪一个见 docs/content/docs/cua-driver/concepts/how-cua-driver-works.mdx。更重要的是它的动作阶梯action ladder元素级后台操作按element_token调用平台无障碍动作Windows UIA / macOS AX / Linux AT-SPI这是唯一能自我验证的一档像素级后台操作按同一张截图的坐标点击页面级浏览器标签页走 CDP 直接操作 DOM无需焦点前台操作仅在必要时抬升窗口游戏、Blender 等画布类应用。每一档执行后都会返回confirmed / unverifiable / suspected_noop / partial / refused等效果判定未确认就建议升档重试。这套阶梯直接回答了跨软件通用性的工程难题不是能不能模拟点击而是每档操作能不能验证、验证不了时怎么降级。与之对照的边界同样清晰Linux Wayland 上组合器不保证把原始输入送到指定窗口驱动会直接拒绝并返回结构化的background_unavailable而不是冒险把键鼠敲进错误的应用——宁可拒答也不误操作这正是能干活和敢乱干的分水岭。维度三上手门槛——从安装到授权三分钟和三天是两种体验Operator 对普通用户门槛最低订阅即用但环境受限在浏览器沙箱Qwen-CUA 与 UI-TARS-1.5 需要自持大规模权重与 GPU且要让模型在本地桌面真正动起来仍需自己接一套输入执行层——这正是社区大量教程的痛点所在截图拿到了、模型回复了动作但坐标怎么映射、DPI 怎么适配、点击怎么不抢焦点全部要自己踩坑。Cua 的上手路径是另一套设计哲学。快速开始只需三行命令见 docs/content/docs/cua-driver/quickstart.mdx/bin/bash -c $(curl -fsSL https://cua.ai/driver/install.sh) open -n -g -a CuaDriver --args serve # macOSWindows 用 autostart kick cua-driver permissions grant然后cua-driver mcp暴露给任意 MCP 智能体cua-driver call list_apps验证可见性即可让 agent 打开计算器完成6 × 7 42并验证结果。对开发者还有 Python / TypeScript 原生 SDKCuaDriver.create()直接嵌进进程以及cua sb create一行拉起 gVisor 沙箱、cua sb screenshot dev截图检查见 libs/cua/README.md。安全性也不是事后补丁而是内建的分层授权每个调用在触碰桌面之前都必须依次通过硬性不变量如自我保护、宿主保护、内置工具风险映射、管理员策略、用户策略、权限模式、能力清单和启动授权共七层检查见 docs/content/docs/cua-driver/guides/permissions.mdx。三种模式各司其职standard无提示跑本地自动化、bounded面向无人值守 agent 默认全拒只放行清单内工具、unrestricted必须显式--dangerously-bypass-approvals且失败即关闭fail closed。能力清单是默认拒绝的 YAML——不在allow.tools里的工具一概不给且任何模式都只能收窄不能放宽version: 3 allow: tools: - start_session - get_window_state - click - type_text选型结论没有单一赢家只有分工回到标题的问题——到底谁更能干活仓库里的源码给出的答案不是某一家而是一个清晰的分工模型普通用户想让 AI 代购、订票、填表Operator 这类闭源产品最省事浏览器内任务是其舒适区但一旦任务落到原生桌面专业软件它和所有模型一样会受限于执行层的能力。想自建 Agent 的开发者决策层大脑选 Qwen-CUA、UI-TARS-1.5 或任意闭源模型均可——它们决定会不会干活执行层手脚接 Cua Driver 这样的开源驱动——它决定能不能干、干得干不干净不抢焦点、可验证、可降级。想低成本跑垂直场景的团队Cua 的 CUA-S1 系列展示了第三条路——不做通才做专用小模型 外部执行cua-s1-4b-0.2是基于 Qwen3.5-4B 冻结权重加 LoRA 的微调模型最小的tinyx表单检查点仅 70 万参数在分布内表单决策上准确率达 97.5%但一旦标签词汇超出训练集准确率骤降到 29.3%见 libs/cua-s1/MODEL_CARD.md。模型卡毫不讳言这份局限——高置信度的 skip 不代表表单已完成。这种诚实恰恰是当前 Computer-Use 生态最稀缺的品质。做评测与数据生产的团队cb run taskset --agent agent --model model一行命令即可让任何 agent 在统一试卷上出分输出 ATIF 轨迹并导出训练数据——混战越激烈这套统一考场的价值越大。回看这场混战原生模型派在卷看得懂基础设施派在卷碰得准、验得真、退得稳评测体系在卷怎么公正地打分。谁更能干活取决于你把手里的任务交给哪个环节——而真正能确定答案的永远不是宣传稿而是像cua-bench-kicad这样一份 25 道、按网表判分的真实考卷。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑