资讯详情

如何创建第一个 Cua-Bench 模拟任务并用 oracle 解法验证评估奖励?

📅 2026/9/13 17:14:32 | 华诺云谱 👁 阅读
如何创建第一个 Cua-Bench 模拟任务并用 oracle 解法验证评估奖励?
如何创建第一个 Cua-Bench 模拟任务并用 oracle 解法验证评估奖励【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua第一次用 Cua-Bench 编写 computer-use 任务时需要确认两件事任务定义能否被 CLI 正确发现以及评估器evaluator给出的奖励是否可靠。这篇文章给出官方教程的完整操作路径用cbCLI 创建一个运行在模拟桌面simulated provider上的小任务先用cb task info检查任务定义再用 oracle参考解法跑一遍确认评估器输出预期的奖励值。模拟任务通过 Playwright 渲染轻量桌面不需要 Docker、虚拟机或 API key。准备条件Python 与 uv官方教程要求的环境是Python 3.12 或 3.13uvPython 包管理器。安装 Cua-Bench 并确认 CLI 可用安装 CLI 以及模拟任务所需的浏览器支持uv tool install cua-bench[browser] uv tool run --from cua-bench[browser] playwright install chromium第一条命令安装cua-bench的[browser]附加依赖第二条命令在同一个 uv tool 环境中安装 Chromium——模拟任务就是靠它渲染桌面窗口的。确认 CLI 已就位cb --help输出中应能看到run、interact、task、trace、dataset等命令组。用cb task create生成任务脚手架创建一个专门的工作目录并进入它再启动脚手架mkdir cua-bench-tutorial cd cua-bench-tutorial cb task create first-taskcb task create会依次发起交互式提问按教程建议填入这些值Author name: Your name Author email: youexample.com License [MIT]: Task description: Click the Submit button Task difficulty (easy|medium|hard) [easy]: Task category (e.g., grounding, software-engineering) [grounding]: Tags (comma-separated): button,simulated作者姓名、邮箱和标签由你自己决定Task description是任务要呈现给 agent 的自然语言目标脚手架里的 oracle 和评估器围绕这个“点击 Submit 按钮”的目标实现。注意目标目录必须为空非空目录会直接报错退出。生成的first-task/目录包含任务定义、元数据和一个小型 HTML 界面first-task/ ├── main.py ├── pyproject.toml └── gui/ └── index.htmlmain.py中按 split 装饰了配置、setup、solveoracle、evaluate 四类生命周期函数仓库里的示例任务 basic_gui_env/main.py 展示了这些函数如何用session.launch_window、session.click_element、session.execute_javascript等接口工作可与脚手架生成的代码对照阅读。用cb task info确认任务可被加载在启动任何环境之前先让 Cua-Bench 加载任务定义cb task info first-task输出应报告simulated provider、一个 macOS 主题的 variant以及 setup、solve、evaluate 三个函数旁的勾号。这一步确认 CLI 能发现完整的任务生命周期如果某个函数没有勾号说明main.py中该函数缺失或装饰器 split 不匹配可参考 任务定义参考 核对装饰器签名。运行 oracle 并核对评估奖励用参考解法运行第 0 个 variant并在评估结束后自动关闭cb interact first-task --variant-id 0 --oracle --no-wait运行过程中会打开一个桌面窗口Cua-Bench 依次完成界面初始化、由 oracle 点击按钮、对最终状态做评估。终端最后几行应包含教程给出的预期输出✓ Solution complete ✓ Evaluation result: [1.0] ✓ Task completed successfully!奖励1.0表示评估器观察到了 oracle 产生的状态。理解这里的分工很重要oracle 只是到达目标的一条路径而评估器定义了什么才算到达目标。因此同一个评估器既可以给 oracle 打分也可以给人工操作或 agent 轨迹打分oracle 分数低于预期时通常意味着任务本身或环境有问题而不是“agent 能力”的问题——任务生命周期文档明确建议不要把失败的 oracle 结果当成 agent 分数使用。可选不用 oracle 手动操作一次想验证评估器同样适用于人工操作可以去掉--oracle再跑一遍cb interact first-task --variant-id 0在任务窗口中点击Submit然后回到终端按 Enter 触发评估并关闭任务。教程用这次手动操作演示同一个评估器能对人工尝试给出同样的打分依据。排查问题Playwright 提示找不到浏览器可执行文件模拟任务需要 Chromium 与 Cua-Bench 位于同一环境。重新执行安装命令uv tool run --from cua-bench[browser] playwright install chromium生命周期函数缺失cb task info中没有勾号确认任务的main.py中每个函数都用同一个 split 装饰。支持的装饰器与函数签名见 任务定义参考。适用边界与下一步本文只覆盖 simulated provider 的路径它用 Playwright 渲染 HTML/CSS 桌面适合本地快速验证任务与评估逻辑。native provider 任务需要真实的操作系统环境容器或虚拟机平台不在本教程范围内其运行与校验方式见 Run and validate a Cua-Bench task。完成第一个任务后可以继续理解 Cua-Bench 任务生命周期中 variant、setup、solve、evaluate 各自的作用查阅 CLI 参考 了解cb run、cb dataset等命令返回 原始教程 对照本文检查操作细节。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。