AgentMonBench:面向长视界智能体的证据驱动监督评测基准
AgentMonBench面向长视界智能体的证据驱动监督评测基准原文网页https://arxiv.org/html/2610.06406v1PDF链接https://arxiv.org/pdf/2610.06406v1arXiv编号arXiv:2610.06406v1 [cs.AI]提交日期2026‑10‑05开源代码仓库https://github.com/zhk‑lab/EBG数据集HuggingFacehttps://huggingface.co/datasets/ZhaoHongKang/AgentMonBench项目主页https://zhk‑lab.github.io/agentmonbench‑ebg/摘要当智能体执行长视界复杂任务时人类用户从亲自做每一步决策转变为监督智能体自主执行。但智能体产生的行为体量庞大、支撑证据碎片化用户很难识别哪些关键决策需要人工复核。本文面向智能体监控器开展研究识别具备重大影响的决策并定位支撑证据辅助用户评估决策带来的后果。本文提出AgentMonBench软件工程领域评测基准包含3个子集覆盖两大互补维度需求‑行为一致性、重大自主决策识别与复核。为支撑上述判断提出EBG证据驱动行为图Evidence‑Grounded Behavior Graph一套无需训练的方法将带来源溯源的证据聚合为行为单元并构建行为之间的显式关系图同时生成面向任务的视图辅助监控器在上下文语境下解析智能体行为。在8个大模型上的实验表明相比于直接读取原始上下文EBG在绝大多数设置下可以提升关键决策识别与证据定位能力。进一步实验证明EBG带来的证据定位增益在不同输入规模、不同超参数下均可稳定保持真实业务用例验证该方案在人类监督场景的实用价值。数据集与代码全部开源。关键词长视界智能体智能体监督证据溯源行为图评测基准软件工程智能体人工复核目录引言相关工作AgentMonBench基准构建3.1 SpecGAP任务需求约束被隐式省略3.2 SilentSwap可运行但语义改变的代码替换3.3 FeedbackTrace来自用户滞后反馈的复核检测点3.4 质量校验与人工复核EBG证据驱动行为图4.1 整体概述4.2 结构化行为图构建4.3 面向任务的证据阅读与视图渲染实验5.1 实验设置5.2 主实验结果5.3 不同输入规模下性能表现5.4 集成至Codex Harness真实用例结论附录简要说明1 引言大模型编码智能体已经可以完成长视界复杂任务修改代码仓库、复现科研实验、数据分析报告生成。当用户把工作流委托给智能体角色从执行者转变为监督者但责任不会随着委托而消失用户依然需要判断智能体决策是否符合自身目标。长视界智能体监督存在巨大现实挑战智能体产生行为数量巨大远超人类阅读、评估的能力上限。有效的监督需要态势感知察觉发生了什么行为、理解行为的重要性、预判后续带来的影响。监督需要关注两大维度①智能体执行行为与用户需求之间的一致性②识别出需要人工确认的重大自主决策。典型示例智能体做数据分析时选择直接丢弃缺失值该决策会改变分析样本总体但该选择不会主动告知用户相关证据分散在消息、工具返回结果、中间产出物用户很难定位需要监控器自动识别这类待复核决策并定位支撑证据。现有研究大多聚焦轨迹质量评估、问题发现、主动澄清交互本工作研究监控器识别影响任务目标、约束、结果解读的关键决策并把决策关联到上下文证据。本文贡献形式化定义长视界智能体中需要人工复核的重大决策监控问题。构建AgentMonBench软件工程评测基准包含3个子集覆盖需求‑行为对齐、重大决策识别复核两类监督场景。提出EBG证据驱动行为图无需训练将溯源证据组织为行为与关系图生成任务导向视图辅助监控器完成判断。实验在8个大模型上开展EBG相比基线普遍提升决策识别与证据定位效果增益在大输入上下文下依然稳定5个真实科研任务案例验证了该方法的落地价值。2 相关工作人在回路监督自动化人因工程研究自动化带来的“出环问题”强调态势感知、人对自动化系统合理信任可控学习方向研究终端用户可审计、可 steering 的AI系统。本工作聚焦智能体重大决策与证据的自动定位降低人类监督负担。智能体澄清与主动交互Ambig‑SWE、Ask or Assume等研究让编码智能体识别需求歧义并主动提问7T‑Bench、KnowU‑Bench侧重隐式意图解析、偏好获取。上述工作侧重智能体执行过程主动获取缺失信息AgentMonBench侧重事后监控器识别智能体已经做出、但未向用户披露的关键选择。3 AgentMonBench基准构建AgentMonBench用于评测监控器识别重大决策、定位支撑证据的能力。包含3个子集两大维度需求‑行为对齐维度SpecGAP识别任务文档未写明、但代码实现中生效的约束SilentSwap识别代码发生语义变更但原有测试用例依旧全部通过。重大决策感知复核维度FeedbackTrace从真实交互轨迹识别应当交由用户确认的自主决策真值来自后续用户反馈。数据集底层基于DeNovoSWE、SWE‑chat公开资源构建。3.1 SpecGAP任务需求约束被隐式省略SpecGAP实例来自DeNovoSWE任务人为从任务文档中删除若干关键约束条件。测试目标监控器能否识别代码仓库中已经实现、但任务文档没有写明的关键行为与约束。构建流程条件移除在原始任务文档指定位置删除选定条件保证剩余文本不会泄露被删除内容文档整体保持通顺。仓库证据映射两种独立映射策略①逐条条件映射②整体上下文映射使用完整原始文档做参考。人工审核两种映射结果选择正确映射或者重写解释文本。数据集人工双审一致性92.4%。3.2 SilentSwap可运行但语义改变的代码替换任务文档保持不变在仓库中做5处语义替换全部替换之后原有测试套件依然可以全部通过但内部行为语义已经改变。测试目标监控器识别这些实现语义发生变化的关键行为。构建三阶段流水线行为选择器Selector挑选具备对应代码实现、可以用具体输入做测试的文档描述行为。构建器Builder修改目标代码记录变更构造专门的语义区分测试用例。质量校验器Quality Checker确认修改不会破坏无关功能。验证流程单独验证每一处替换单独运行修改前后原有测试全部通过专属语义测试由通过变为失败。组合验证语义测试在没有对应替换时通过存在替换则失败无论其它替换是否同时生效。人工双审一致性93.6%。3.3 FeedbackTrace来自用户滞后反馈的复核检测点样本取自SWE‑chat真实Python软件工程会话。真值来自用户后续反馈监控器输入只能拿到反馈发生之前的交互轨迹。构建流程样本筛选选取存在用户反对反馈事件的会话每个会话最多保留一条样本。证据单元切分将轨迹切分为两类单元智能体回复段落、工具调用对应返回结果。人工标注内容复核点描述、决策带来的影响、需要用户确认的选择、最小充分证据单元、关键性标签。人工双审一致性93.0%。3.4 质量校验与人工复核三个子集全部执行双人独立评审流程校验真值标注、证据、解释文本过滤歧义、错误样本。4 EBG证据驱动行为图4.1 整体概述长视界智能体任务中分析行为需要的证据分散在超长上下文。EBGEvidence‑Grounded Behavior Graph证据驱动行为图无需调用大模型完全确定性执行。输入智能体上下文X XX代码仓库 / 交互轨迹任务需求Q QQ。完整流水线KaTeX parse error: Cant use function \( in math mode at position 25: …}(X), \mathcal{\̲(̲\mathcal V\)}P…F τ F_\tauFτ图构建器输入原始上下文X XX输出结构化行为图G ( E , B , S , R ~ ) G(E,B,S,\tilde R)G(E,B,S,R~)E EE证据单元B BB行为单元S SS作用域R ~ \tilde RR~显式关系边。P τ P_\tauPτ展示器将图G GG转换为面向任务的证据视图KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal \̲(̲\mathcal V\)。监控器M MM读取任务需求Q QQ与视图KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal \̲(̲\mathcal V\)输出检测结果。4.2 结构化行为图构建全部步骤为确定性规则处理不调用LLM。证据提取Evidence Extraction每个证据单元保存ID、原始内容、来源位置支持多个行为引用同一份原始证据。行为形成Behavior Formation将同源证据按照角色组织为行为单元。仓库模式行为(条件‑操作‑结果)轨迹模式行为(需求‑动作‑响应)。图组织Graph Organization行为作用域Scope将语义相关行为聚合到同一个作用域显式关系边带证据支撑的有向边描述不同Scope之间依赖、触发、修改等关系。4.3 面向任务的证据阅读与视图渲染EBG根据输入类型仓库 / 交互轨迹生成不同视图方便监控器阅读。仓库Repository视图文件筛选基于任务需求对目录做优先级排序种子节点扩展匹配任务文档的节点作为种子一跳扩展关联子图组件划分与根节点选择组装视图关联代码片段、文档原文输出可阅读证据视图。轨迹Trajectory视图行为单元按照任务Scope分组保留原始时序最后一次行为标记为Current其余标记为History每个行为携带原始证据ID完整复现任务推进过程。监控器基于任务需求 EBG输出视图识别需要人工复核的重大决策并且输出溯源到原始来源的支撑证据。5 实验5.1 实验设置被测监控基座模型8个GPT‑5.6 Luna、GPT‑5.6 Terra、GPT‑5.6 Sol、Claude Sonnet 5、DeepSeek‑(\mathcal V)4.1‑Flash、DeepSeek‑(\mathcal V)4‑Pro、Kimi K3、GLM‑5.3。对比基线Base基线直接输入原始仓库内容 / 原始交互轨迹RepoGraph仓库级代码图检索方案适配版本EBG本文证据驱动行为图方案。评测指标全部指标取值0‑1数值越高效果越好。规则类指标SpecGAPLF1定位F1衡量支撑代码证据定位SilentSwapLS定位分数衡量代码行匹配重叠FeedbackTraceEHR证据命中率是否命中至少一条正确证据ID。LLM‑as‑Judge裁判指标双裁判取均值SpecGAPSF1语义F1识别缺失约束、QQ澄清问题质量SilentSwapLC定位正确性、CC变更理解正确性FeedbackTrace(\mathcal V)PA复核点语义对齐、ESS证据支撑完备度。5.2 主实验结果完整表格参考论文Table1关键结论总结当前大模型做智能体监控任务依然存在明显短板即便使用结构化上下文识别重大决策、证据溯源依旧难度很高。在绝大多数模型、绝大多数任务子集上EBG优于Base原始上下文基线多数场景优于RepoGraph基线。证明以行为‑证据为核心的上下文组织方式具备价值但不同模型、不同任务收益幅度存在差异。证据检索成功 ≠ 决策语义理解成功监控任务不仅需要找到证据还需要理解决策含义与带来的后果。5.3 不同输入规模下性能表现把样本按照输入token分为Low/Medium/High三档。Base基线随着输入token增大规则指标普遍下降长上下文下证据容易被海量无关信息淹没。EBG在低、中、高全部输入规模下相比基线均获得正向增益高token规模下依然保持可观提升SpecGAP LF1提升0.078SilentSwap LS提升0.115FeedbackTrace EHR提升0.108。说明EBG的证据组织能力在超长上下文场景收益尤其突出。5.4 集成至Codex Harness真实用例将EBG集成到Codex Harness实现三类复核钩子歧义复核检查计划、用户提示中缺失、会显著影响执行效果的选择调整复核检查执行策略变更判断是否需要用户确认、对外披露结果复核检查证据是否可以支撑最终输出结论。5个取自真实科研自动化工作流的案例全部生效原生Codex Harness不会主动披露关键问题接入EBG之后成功识别并向用户披露待复核决策。案例任务场景监控器行为与结果优化目标歧义指标包含准确率、召回率计划未写明优化优先级检查计划识别缺失优先级向用户提问用户选定准确率优先随机协议变更失败后串行回退改变每个问题的随机种子在回退代码发现随机逻辑变更向用户披露恢复每个问题独立种子验证集数据泄露验证样本混入训练集造成虚假指标提升追踪样本来源识别泄露保留基线方案API连通性未验证复用缓存返回没有执行真实API调用发现记录仅为缓存结果披露API连通性没有得到真实验证搜索预算不对等搜索预算不一致候选模型得分高于基线识别搜索记录预算差异披露得分提升不能完全归功优化器本身6 结论长视界智能体的监督任务要求把重大决策和可供人工复核的支撑证据建立关联。本文提出AgentMonBench软件工程监督评测基准包含SpecGAP、SilentSwap、FeedbackTrace三个子集分别评测需求‑行为对齐、重大自主决策识别复核两大监督能力。EBG证据驱动行为图无需训练将分散的溯源证据组织为行为单元、构建显式关系图输出面向任务的证据视图。实验表明现有大模型在智能体监控任务仍存在明显短板EBG在绝大多数设置下提升决策识别与证据定位性能增益在大输入上下文下稳定真实科研任务用例验证该方案的工程价值。附录简要说明附录A拓展相关工作与其它基准详细对比表。附录BAgentMonBench数据集完整统计、三套子集详细构建流程、人工评审协议。附录C完整评测协议、指标定义、裁判Prompt、基线配置。附录DEBG图构建算法伪代码、视图渲染规则、实验超参数、预测输出Schema。附录E消融实验、输入规模细分结果、假阳性/漏检分析。附录FCodex Harness集成完整实现、5个真实案例完整记录。附录G失败样例归因分析、未来研究方向。