资讯详情

Web Agent Token消耗怎么比?Webwright轨迹对比查看器完全指南

📅 2026/10/9 23:39:03 | 华诺云谱 👁 阅读
Web Agent Token消耗怎么比?Webwright轨迹对比查看器完全指南
Web Agent Token消耗怎么比Webwright轨迹对比查看器完全指南【免费下载链接】CUAWrightA simple SWE style browserdesktop agent framework that achieves SOTA results on long horizon web tasks.项目地址: https://gitcode.com/gh_mirrors/web/CUAWrightWebwright是一个 SWE 风格的浏览器 桌面 Web Agent 框架在长周期网页任务上取得了 SOTA 表现。每次运行 Webwright 都会落盘raw_responses.jsonl与trajectory.json两份轨迹文件配合仓库内置的轨迹对比查看器Trajectory Comparison Viewer你可以把不同框架、不同模型的 Web Agent 执行轨迹放进同一个页面快速比对 Token 消耗与完整执行步骤——无需写任何解析脚本。 3 步启动轨迹对比查看器一键开启查看器位于 assets/compare_trajectory/由 index.html 与 app.js 构成纯前端实现、零依赖只需一个静态服务器在仓库根目录执行cd assets/compare_trajectory/ python3 -m http.server用浏览器打开http://localhost:8000左右两个上传区各拖入一条 trace 文件页面自动解析并渲染对比结果整个页面由两个核心视图组成Summary View摘要对比与Detailed Trace详细轨迹顶部标签页随时切换。 支持哪 4 种轨迹格式trace 文件从哪里来格式文件来源Token 模式Webwright Responses JSONLraw_responses.jsonlWebwright 运行产物记录 thought / bash / final_response 帧估算可升级为精确Webwright trajectory.jsontrajectory.jsonWebwright 运行产物含 usage 快照精确Codex 会话 JSONL~/.codex/sessions/…/SESSION_ID.jsonlCodex CLI 本地会话记录精确含 token_count 快照Copilot 会话 Markdownsession.md对话中执行/export file session导出估算 Webwright 侧的两个文件由 base.yaml 中的output_path: outputs/default/trajectory.json指定输出位置raw_responses.jsonl则由模型层自动写入 models/base.py运行结束后直接取用即可。关键技巧上传 Webwright 的raw_responses.jsonl后页面会提供一个附加位——把同一次运行的trajectory.json挂上去Token 统计就会从估算estimate自动切换为精确exact。 精确 vs 估算看懂 Token 统计的两种模式查看器对 Token 的统计严格区分数据来源这是它比肉眼数日志可靠的核心精确模式exact直接读取 trace 中的 usage 快照。trajectory.json取messages[].extra.usage.cumulative_response解析逻辑见 app.jsCodex JSONL 取token_count事件快照app.js。估算模式estimate当 trace 不携带 token 信息时页面用浏览器端 tiktoken 分词器对提取出的文本按模型编码如o200k_base、cl100k_base映射表见 app.js重新计数并在界面上标注estimated。统计口径统一为 5 个维度input / output / reasoning / cached / totalapp.js因此不同框架的数字可以直接横向比较。 双视图详解对比矩阵与逐步执行轨迹Summary View一张矩阵看全 Token 差异加载两条 trace 后Summary 视图依次给出三块内容Comparison Matrix对比矩阵所有格式被归一化为 task hints、thoughts、commands、outputs、token provenance 行左右逐行对齐Per-Trace Summary单条摘要事件数、思考条数、命令数、最终响应数外加 Token 来源说明与 token 构成条形图Pattern Breakdown模式分解按命令家族如 python、curl、printf与事件类别聚合出 Top 条形图一眼看出两个 Agent 的行为偏好。Detailed Trace逐步回放每一步动作切到 Detailed Trace可按四个标签逐条翻阅标签展示内容Python提取出的 Python 脚本片段含 Playwright 代码Thoughts模型的思考/推理文字Commands每条 shell 命令、执行通道、退出码与输出Timeline上述内容合并后的完整时间线右侧界面即下图所示效果同屏展示左右两条 trace 的 STEP、REASONING 与 COMMAND便于逐条核对同一个网页操作两边各花了多少步、多少 Token。 实战案例同一任务Token 差了近 8 倍README 用一个真实任务做了基准对比Find the cheapest used 8-cylinder bmw made between 2005-2015, priced $25,000–$50,000, mileage 50,000 miles案例原文见 README.mdTokensWebwright HarnessCodex Webwright SkillInput420,4333,271,143Output3,59320,040Reasoning04,410Cached217,216—Total424,0263,291,183同一任务、同一模型能力档位下不同 harness 的总消耗差距接近 8 倍——这正是轨迹对比查看器最有说服力的地方把感觉更省变成可核查的数字。 常见坑位与排查清单Token 显示 estimate 而非 exact说明该 trace 无 usage 快照。Webwright 侧请附加trajectory.json只加载一条 tracePer-Trace Summary 仍可用但 Comparison Matrix 需要两条 trace 才会出现文件解析失败上传区会直接显示错误徽标确认文件属于上述 4 种格式之一支持.jsonl/.json/.md/.txt后缀识别逻辑见 app.jsCodex trace 找不到会话记录保存在~/.codex/sessions/YYYY/MM/DD/SESSION_ID.jsonl按日期目录查找。总结把 Token 账算明白Webwright 轨迹对比查看器用一次拖拽上传就解决了三个问题Token 消耗是否可信exact/estimate 双模式标注、执行路径是否高效逐步命令与思考回放、框架之间差距多大归一化对比矩阵。如果你正在评测 Web Agent 框架或优化长周期任务成本建议把它作为标准验收工具——相关功能说明可查阅 README.md 的 Trajectory Comparison Viewer 章节。【免费下载链接】CUAWrightA simple SWE style browserdesktop agent framework that achieves SOTA results on long horizon web tasks.项目地址: https://gitcode.com/gh_mirrors/web/CUAWright创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑