资讯详情

字节跳动UIC TraceDance:25.2万部署轨迹自动生成Agent不良行为基准

📅 2026/10/9 16:18:13 | 华诺云谱 👁 阅读
字节跳动UIC TraceDance:25.2万部署轨迹自动生成Agent不良行为基准
TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces作者Dehai Min, Daoan Zhang, Yiming Zeng, Huayi Zhang, Ziyi Chen, Yan Zhang, Qinbo Bai, Mengyuan Chao, Jing Ning, Qiyue Hua, Huiyi Chen, Hanrong Zhang, Henry Peng Zou, Jie Yang, Wei Xu, Philip S. Yu核心发表机构ByteDance Inc.、University of Illinois at Chicago论文链接arXiv:2609.33295v1发布于arXiv 预印本cs.AI|——————| Claude Opus 4.8 | 33.5 | 31.5 | 37.3 | 30.6 | 36.1 | 27.6 || DeepSeek-V4-Pro | 29.3 | 30.8 | 32.1 | 21.2 | 31.8 | 23.6 || GLM-5.2 | 28.6 | 30.0 | 32.1 | 19.3 | 29.8 | 25.8 || DeepSeek-V4-Flash | 28.5 | 29.0 | 32.1 | 21.9 | 30.8 | 23.4 || GPT-5.6-Sol | 27.2 | 27.8 | 23.2 | 32.3 | 30.2 | 20.5 || Doubao-Seed-2.1-Pro | 23.5 | 26.5 | 25.5 | 14.5 | 24.3 | 21.6 || MiniMax-M3 | 23.3 | 25.5 | 25.8 | 15.1 | 23.8 | 22.4 || Kimi-K3 | 23.3 | 26.5 | 25.3 | 14.0 | 24.6 | 20.4 || Qwen3.7-Max | 22.9 | 24.9 | 26.3 | 13.4 | 23.9 | 20.6 || Mean | 26.7 | 28.0 | 28.9 | 20.3 | 28.3 | 22.9 |九个 LLM 总体平均 pass rate 仅 26.7%。Frame 均值为 Action 28.0、Failure 28.9、Claim 20.3setting 均值为 CC 28.3、OC 22.9。值得注意的是尽管 GPT-5.6-Sol 在 SWE-bench Pro 和 Terminal-Bench 2.1 等 task-oriented benchmarks 上 reported scores 高于 DeepSeek-V4-Pro 和 GLM-5.2但在 TraceDance 的 behavior-focused benchmarks 上没有超过这两者。这突出 TraceDance 提供超越 task completion 的额外视角。排名不确定性方面对 107 个 benchmark 做有放回重采样 5,000 次九款 LLM 分成三组Claude Opus 4.8 独占第一在 99.9% 的重采样中排名第 1领先第二名单 4.2 个百分点95% CI 为[ 1.7 , 6.6 ] [1.7,6.6][1.7,6.6]DeepSeek-V4-Pro、GLM-5.2、DeepSeek-V4-Flash、GPT-5.6-Sol 排名区间落在 2–5 内其余四款排名在 6–9 之间。两个较低组之间也有分离GPT-5.6-Sol 领先 Doubao-Seed-2.1-Pro 3.7 个百分点95% CI 为[ 0.9 , 6.4 ] [0.9,6.4][0.9,6.4]。组内相邻模型之间差异不显著。若在 benchmark 内再对实例重采样区间会略宽但组间差异仍然显著。4.3 消融实验 / Ablation StudyTraceDance 的稳健性分析覆盖通过规则、评判者组成、行为分组、源模型族与评委自偏好等维度。通过规则的影响。默认规则为响应必须在评判者平均分≥ 4 \ge 4≥4时才算通过因此“避免了不良行为但没有满足完整 rubric”的响应仍可能判为不通过。系统比较了五种规则平均分≥ 4 \ge 4≥4、平均分≥ 3.5 \ge 3.5≥3.5、平均分≥ 3 \ge 3≥3、三位评判者均≥ 4 \ge 4≥4、至少两位评判者≥ 4 \ge 4≥4。结果显示绝对通过率随规则变化很大例如把“平均分≥ 3 \ge 3≥3”视为通过会把 Check first 从 8.1% 拉到 26.8%。但在每一种规则下四个行为组的顺序不变Valid call 最高、Check first 最低两者差距在 52.4 到 64.4 个百分点之间Claude Opus 4.8 在所有规则下总体均排第 1。因此通过阈值只改变绝对通过率不改变支撑作者结论的排序。评判者去除与分评判者结果。对 Claude Opus 4.8 与 GPT-5.6-Sol比较“三位评判者全部使用”“去掉 GPT 评判者”“去掉 Opus 评判者”三种评分设置。结果基于 102 个单行为 benchmark。去掉任一评判者都会抬高绝对通过率例如 Opus 从 32.4 到 42.1 或 35.7GPT-5.6-Sol 从 27.0 到 32.8 或 29.5但排名完全不变Opus 恒为第 1GPT-5.6-Sol 恒为第 5。用单个评判者的分数单独计算四组通过率时单个评判者给出的通过率高于评判者面板但每个单独评判者都把 Valid call 排最高、Check first 排最低差距为 49.3 到 65.0 个百分点。GPT 与 Opus 评判者保留了面板的完整顺序Gemini-3.5-Flash 例外给 Honest claim 的通过率 53.8% 略高于 Handle failure 的 51.5%。替代行为分组的稳健性。系统检验了把 Delivery recovery 从 Handle failure 移到 Check first然后在两种分组下分别只用 predefined 规格重算。在全部四种变体中Check first 的通过率保持在 7.7% 到 9.4% 之间比 Valid call 低约 60 个百分点。具体地Predefined query-specific 且 Delivery recovery 属于 Handle failure 时Valid call 67.9、Handle failure 33.5、Honest claim 28.9、Check first 8.1Delivery recovery 移到 Check first 时Check first 为 7.7仅 Predefined 且 Delivery recovery 属于 Handle failure 时Valid call 69.1、Handle failure 33.3、Honest claim 28.9、Check first 9.4仅 Predefined 且 Delivery recovery 属于 Check first 时Check first 为 8.7。排序结论稳定。源模型族检验。部署 trace 主要来自由 Doubao Seed 模型驱动的 agent而 Doubao-Seed-2.1-Pro 本身是被评模型之一。风险假设是由于每个实例都截取自源 LLM 表现出该请求行为的上下文同一模型族产生的上下文对同族的后续模型可能格外困难。系统分析 102 个单行为 benchmark 的 3,966 个实例其中 2,717 个来自 Doubao Seed 源模型1,249 个来自其他源模型。度量设计为 offset是否通过减去同实例上另外 8 款 LLM 的平均通过率再比较 Doubao 来源与其他来源的差异。结果显示Doubao-Seed-2.1-Pro 没有表现出自族特有的劣势其在 Doubao 来源实例上的 offset 仅低 0.9 个百分点与 GLM-5.2、Qwen3.7-Max、MiniMax-M3 相近九款 LLM 的置信区间全部包含 0。这些区间可以排除“大于约 3 个百分点”的族别劣势但不能排除更小的效应。二次检验限定 Doubao Seed 2.0 来源后结论不变Doubao-Seed-2.1-Pro 的差异变为九款中最低的− 1.2 -1.2−1.2个百分点实例级 95% CI 为[ − 3.3 , 0.9 ] [-3.3,0.9][−3.3,0.9]但与 Qwen3.7-Max 的− 1.0 -1.0−1.0和 GLM-5.2 的− 0.9 -0.9−0.9接近。评委自偏好检验。动机是 GPT-5.6-Sol 与 Claude Opus 4.8 同时充当评委与被评测模型。系统使用来自 102 个 single-behavior benchmark 的 3,945 个实例且三个评委对全部九个模型都给出有效分数。对每个响应计算某评委分数减去另外两个评委均分的偏移量再比较“自己模型的响应”与“其他模型的响应”的偏移差异。结果为GPT-5.6-Sol 存在小的正向差异它总体上比其他评委更严格但对自家响应没那么严相对偏好为 0.22 分0–5 量表两个置信区间都排除 0Claude Opus 4.8 的差异接近 0两个区间都不排除 0在该比较中没有明确的自偏好证据。稳健性检查表明去掉每个模型自己的评委后其排名不变Opus 仍第一GPT 仍第五。4.4 行为级发现与失败模式 / Behavior-Level Findings and Failure Modes按 rubric 要求将 single-behavior benchmarks 分组为四个行为组Valid call发出 well-formed tool callHandle failure响应 errors、feedback 或 explicit user constraintsHonest claim做出有证据支持的 claimCheck first继续前执行 required check。默认通过规则下九个 LLM 平均 pass rate 为Valid call 67.9%、Check first 仅 8.1%、Handle failure 33.5%、Honest claim 28.9%。这说明当前 LLM 往往能产生 well-formed tool calls但难以执行继续前所需的检查。结果如图进一步按 28 个行为族分析结果如图图中通过率高表示更适当的响应而不是不良行为更频繁或严重。模型对 Command validity 和 Argument validity 相对较好平均 pass rate 分别为 72.0% 和 65.1%但 required checks 和 safety-related behaviors 表现特别差Secret protection 平均 pass rate 仅 6.9%Commit hygiene 仅 0.9%Failure-log inspection 最低仅 0.6%。其他低通过率行为还包括 Delivery recovery 2.4%、Post-edit verification 9.4%、Safeguard compliance 10.4%、Security preservation 11.3%、Partial-failure reporting 11.9%、Software source checks 13.0%、Pending-request awareness 13.3%、Conflict-aware editing 14.2%、False reassurance 17.7%、Scope control 18.5% 等。这些行为即使 agent 最终完成任务也很重要成功操作仍可能暴露 credentials完成 commit 仍可能包含 unwanted files未先检查 failure log 就重试可能重复未解决故障并延迟任务完成。这些发现说明 TraceDance 能构建基准暴露仅关注 task completion 的评估会忽略的行为弱点并可指导 recursive self-improvement测试后续模型修订是否解决这些弱点。首动作与通过率的关联。系统比较同一 recorded context 下不同 LLM 的响应并按 first action 分组。每个比较仅包含有些 LLM 选择该 action、而其他 LLM 不选的 instances。First 表示选择该动作的响应Other 表示在同一批实例上选择其他动作的响应First/Other 通过率均为百分比Δ First − Other \Delta \text{First} - \text{Other}ΔFirst−Other。以规划相关工具开头包括 TodoWrite 和 EnterPlanModepass rates 低于同一 instances 上采取其他 first actions 的响应。例如以 TodoWrite 开头 pass rate 为 4.6%同一 instances 其他响应平均为 30.8%差异− 26.2 -26.2−26.2个百分点EnterPlanMode 为 9.2% 对 28.1%差异− 18.9 -18.9−18.9Skill 为 13.4% 对 29.7%差异− 16.3 -16.3−16.3Text only 为 11.9% 对 24.7%差异− 12.8 -12.8−12.8。相反以 direct action 开头例如编辑文件或启动 subagent或以请求用户额外信息开头pass rates 高于同一 instances 上其他 first actionsAskUserQuestion 为 46.3% 对 25.1%差异 21.2 21.221.2Agentsubagent为 55.3% 对 31.5%差异 23.8 23.823.8Edit 为 42.9% 对 21.0%差异 21.9 21.921.9Grep 为 38.1% 对 21.8%差异 16.3 16.316.3Write 为 29.2% 对 22.0%差异 7.2 7.27.2sessions_spawn 为 69.4% 对 15.9%差异 53.6 53.653.6但实例数仅 43且两侧响应数不对称。在该比较中以 TodoWrite 开头的 457 个响应中416 个91.0%不含任何其他工具调用其余 41 个带有后续非规划类调用其通过率仅 7.3%。这些比较描述的是 associations不是 causal effects。总体排名掩盖行为特定弱点。Claude Opus 4.8 overall 排名第一比 Kimi-K3 高超过 10 个百分点但在 Error-guided correction即要求应用 error message 中指定 fix 的行为上Kimi-K3 显著更好pass rate 为 57.8%而 Opus 为 27.8%。这种 reversal 说明模型在不同 agent behaviors 上可有不同优势即使一个模型 overall 更好。类似 mismatch 还包括GPT-5.6-Sol overall 排名第五但在 28 个 families 中它在 8 个上领先包括 Test-claim groundingpass rate 为 60.2%其他 LLM 至多 39.5%。这些结果强调 behavior-specific evaluation 对 model selection 和 recursive self-improvement 的必要性。构建失败模式。五条 build-target queries 未产生所需 benchmark。失败点分布为Respect for rejection during unattended continuation 失败在规格检查query 要求“用户拒绝 随后无人值守继续”但规格排除了所有含用户手写输入的 sessionHard-coded home-directory paths 失败在 Anchor Synthesis Loop合成规格无法可靠区分“不当硬编码路径”与“可接受的硬编码路径”Error-information use in unattended sessions 失败在 Anchor Synthesis Loop合成规格无法区分“忽略已有信息”与“合法地重新检查该信息”Error-guided correction OR Retry adaptation 失败在规格匹配Error-guided correction 产出 50 个实例但 Retry adaptation 的规格匹配失败第二个基准未建成Regression recognition OR Conflict-aware editing 失败在基准构建Regression recognition 产出 6 个实例但 Conflict-aware editing 未建成任何基准。这些失败集中在规格检查、Anchor Synthesis Loop、规格匹配与基准构建四个环节其中两条源于合成规格难以区分合规与不合规的相近情形。五、相关工作 / Related WorkAgent 评测可以分为 outcome-level 与 process-level。任务结果类 benchmark 以目标完成度评估例如 Terminal-Bench 的 final-state checks、RE-Bench 与 MLE-bench 的性能指标、PaperBench 的 rubric-based LLM judging以及 WildClawBench 等。安全与过程级 benchmark 考察执行过程中的行为例如 ToolEmu、AgentHarm、SHADE-Arena、ClawTrack、ProcCtrlBench部分工作让 LLM 评判“提议的动作”或“记录下来的 trace”例如 ToolPRMBench、AgentProcessBench、OpenClawBench。与 TraceDance 最接近的是让被评 LLM 从交互历史续写的工作从 interaction histories 续写使用合成的、会触发风险的决策点快照保存的执行状态Prefix-GRPO 用 teacher prefix 用于训练OpenAI 生产评测在发布前于部署对话上重新生成候选模型响应。TraceDance 的区别在于它在观察到的undesirable行为之前切断部署 trace并对被评 LLM 的下一轮进行评分评测不执行该轮动作也不继续 trace。它不走环境回放也不需要参考答案因此可以覆盖依赖非公开工具或 MCP 服务器的真实环境 trace。Agent 审计与自动化 benchmark 构建是另一条相关线索。审计方向分析执行 trace 以识别失败及成因例如 CatchBench、Model-or-Harness、WhoWhenPro、LongRCA也有工具跨大量 session 总结行为模式或定位用户指定的违规例如 Insights、ProcGrep、Docent、InspectScout、Detecting。BenchTrace 让 agent 以“带标注的失败”为条件在固定任务环境中测试失败规避能力。自动化 benchmark 构建方面已有工作生成问题、生成行为定向交互或可执行安全场景或从记录 session 重建可执行任务例如 REAP、SWE-Together、RealClawBench、EnterpriseClawBench、EvotraceWildToolBench 用真实日志播种合成对话。TraceDance 的区别在于它把 trace 分析与 benchmark 构建连接起来把观察到的行为转成可复用测试测试输入就是记录下来的“决策前上下文”而不是重建整个可执行任务环境。与 OpenHands、Inspect 的关系是TraceDance 沿用其“区分输入来源与消息角色”的事件表示约定即user角色不一定等于人类输入但 TraceDance 的目标是从真实部署轨迹构建定向 benchmark而非提供通用 agent 运行或评测框架。与 Clio 的关系是TraceDance 沿用其“LLM 生成描述 语义聚类”的分析范式用于刻画部署轨迹的域与任务分布。与 LLM-as-judge 和 checklist evaluation 的关系是TraceDance 使用三 LLM judge panel、行为专属 rubric 和平均分阈值但明确禁止把源 LLM 动作当作 ground truth并通过信息隔离防止未来事件泄露给评分者。与人工标注的关系是TraceDance 用人工验证实例中请求行为是否出现、rubric 质量以及 judge panel 与人类 pass/fail 的一致性自动 judge 与人类一致性为 81.0%与人类 annotators 之间一致性 comparable。六、局限性与展望 / Limitations Future WorkTraceDance 的局限性首先体现在查询理解与构建成功率的边界上。在 100 个 annotated queries 上annotators 认为 78% 的系统解释准确17% 部分正确五条 build-target queries 未产生所需 benchmark查询可组合至多两个行为支持 AND/OR但不支持否定与嵌套组合需要跨会话信息、缺少必需参数、行为不在轨迹内或本身不是 agent 行为的请求应被拒绝。系统适用范围限定于具备可观察信号、可编程检索的行为需要 LLM 或人工逐 session 检查的行为不在范围内因为部署规模下成本不可承受。评测质量方面rubric 的主要问题是相邻分数等级边界不清标注反馈中提及 21 次此外还有措辞歧义 5 次、与行为定义不匹配 5 次、分数等级不可达 4 次。评委团虽然与人类在 pass/fail 判定上较吻合但打分更宽松三个评委的均分都高于人类评委团均分 2.46人类均分 1.68人类评分更集中于 0 分档39.3%评委团仅 11.9%。原始一致率还受到类别不平衡污染人类只对 16.7% 的响应判 pass因此把所有响应都判为 fail 也能达到 83.3% 的原始一致率因此一致性结论必须依赖随机校正指标评委团κ 0.40 \kappa0.40κ0.40高于标注者之间的κ 0.31 \kappa0.31κ0.31。GPT-5.6-Sol 存在小的正向自偏好相对偏好为 0.22 分且置信区间排除 0虽然去掉自家评委后排名不变但该偏差本身不可忽略。统计与因果解释方面首动作与 pass rate 的关系是 association不是 causality不同首动作比较的实例集可以不同两侧模型构成也可能不同。总体 rankings 会隐藏 behavior-specific weaknesses例如 Claude Opus 4.8 overall 第一但在 Error-guided correction 上低于 Kimi-K3。源模型族检验只能排除“大于约 3 个百分点”的族别劣势不能排除更小的效应源模型完整构成属商业机密只能二分为 Doubao Seed 与其他。不同 behavior family 的证据量差异大87 个目录 benchmark 中单个 family 的 benchmark 数从 1 到 5实例数从 16 到 243宏平均是对此的一种处理但未覆盖所有潜在偏差。复现性与数据发布方面由于 deployment traces 不能发布exact benchmarks 不能从公开数据重建但 pipeline 可应用于其他 trace collections。伦理上8 个 annotators 按当地劳动法规获得报酬所有 agent sessions 在研究使用前 de-identified 和 sanitizedannotator identities 不披露deployment traces 来自 production agent sessions遵守相应产品服务条款不发布 agent traces。AI use 方面研究使用 generative AI tools 辅助写作、文献检索、代码开发与调试、数据分析TraceDance 本身使用 LLM 做 behavior discovery、specification synthesis、candidate confirmation、rubric generation、automated gradingLLM 还起草 test queries、生成用于 domain/task clustering 的 session descriptions、命名 clusters作者审查和修订 AI-assisted code 与 test queries并对研究方法和报告结果负责。展望上TraceDance 可支持 agent data flywheel作为 recursive self-improvement 中的关键 evaluation component用于评估后续模型修订是否解决了这些弱点在 RSI loop 中评估 TraceDance 留作 future work。未来工作还可以围绕降低评委宽松性、改进 rubric 边界清晰度、扩展行为覆盖与组合形式、以及把 pipeline 应用到更多 trace collections 展开。七、总结 / ConclusionTraceDance 将用户指定的部署问题转化为 decision-point continuation benchmarks。它通过 Anchor-and-Confirm 把可编程检索与 Flash LLM 候选级确认结合通过 Anchor Synthesis Loop 为自定义行为生成、验证与修订行为规格并在记录决策点之前切断 trace让被评 LLM 生成下一轮再用行为专属 rubric 自动评分。系统不需要参考答案也不需要环境重放因此可以覆盖依赖非公开工具或 MCP 服务器的真实环境 trace。实验在 coding 与 general tool use 场景中分析 252,557 个 session产出 107 个 benchmark、4,125 个实例满足 95.3% 的 build-target 请求两名人类标注者在 84% 的抽样实例中确认目标行为自动 grader 与人类 pass/fail 判断的一致性达到与人类标注者之间 comparable 的水平。九个前沿 LLM 平均 pass rate 仅 26.7%说明它们在这些决策点上仍难以表现适当跨 behavior-specific benchmarks 的分析进一步揭示了总体排名掩盖的弱点为 agent 改进提供了具体目标。TraceDance 可支持 agent data flywheel并作为 recursive self-improvement 循环中的关键评测组件。原文摘要:An agent can complete a task while exhibiting undesirable behavior during execution. Developers need tests for the specific behaviors encountered in deployment, beyond fixed benchmark suites. We present TraceDance, an agent system that constructs targeted benchmarks from deployment traces for user-specified undesirable behaviors. For efficient construction, Anchor-and-Confirm combines programmable retrieval with candidate-level confirmation by a Flash large language model (LLM), while the Anchor Synthesis Loop generates and revises specifications for custom behaviors. The benchmarks use decision-point continuation to evaluate an LLM’s next turn at a recorded decision point with a behavior-specific rubric, without a reference answer or environment replay. Experiments in coding and general tool use draw on 252,557 sessions and produce 107 benchmarks with 4,125 instances, fulfilling 95.3% of build-target requests. Both human annotators confirm the requested behavior in 84% of sampled instances, and the automated grader’s agreement with human pass/fail judgments is comparable to that between the annotators. Nine frontier LLMs achieve a mean pass rate of only 26.7%, showing that they still struggle to respond appropriately at the evaluated decision points. Analysis across behavior-specific benchmarks further reveals weaknesses in how current LLMs behave as agents. By turning deployment problems into targeted benchmarks, TraceDance could serve as a key component of the recursive self-improvement (RSI) loop.PDF链接:https://arxiv.org/pdf/2609.33295v1部分平台可能图片显示异常请以我的博客内容为准
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑