资讯详情

【CVPR 2026】Graph2Eval:以知识图谱为任务空间的多模态 Agent 任务自动生成|从智能体自动评测视角

📅 2026/10/10 3:00:29 | 华诺云谱 👁 阅读
【CVPR 2026】Graph2Eval:以知识图谱为任务空间的多模态 Agent 任务自动生成|从智能体自动评测视角
摘要本文解读 CVPR 2026 论文《Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs》。该论文提出以知识图谱作为任务空间的多模态智能体评测任务自动生成框架通过融合统一图抽象、任务模板与meta-path 策略把「人工写题」换成「在图上采样子图再实例化」其特别之处在于题目的语义一致性与可解性由结构本身保证而不是靠大模型事后复核。实验表明Graph2Eval 相对无图基线把任务语义一致性提升 20%、可解性提升 17%并用 1,319 道题的 Graph2Eval-Bench 清晰区分不同规模的智能体为自动化基准构建提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现延伸视角历史脉络与创新模式局限性常见问题FAQGraph2Eval 和直接用大模型生成评测题有什么区别Graph2Eval-Bench 到底有多少题、覆盖什么场景为什么 Agent S 2.5 和 SoM Agent 的差距这么大生成一道题需要多少钱和时间没有知识图谱的版本差在哪里这个方法有什么已知局限参考链接论文基本信息项目内容标题英文Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs标题中文以知识图谱为任务空间的多模态 Agent 任务自动生成作者Yurun Chen, Xueyu Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang机构浙江大学 · 厦门大学 · 俄亥俄州立大学 · 蚂蚁集团会议CVPR 2026arXivhttps://arxiv.org/abs/2510.00507项目网站https://github.com/YurunChen/Graph2Eval背景与动机大模型智能体的能力评估长期依赖静态数据集而静态数据集有一个结构性缺陷它分不清「真的会做」和「在训练里见过」。论文用一个类比说明这一点——反复给人做同一套固定习题他可能背下答案、看起来表现完美但真实适应能力从未被检验。对多模态 LLM 智能体而言同样的担忧成立预训练与领域微调已经把智能体性能推得很高静态数据却无法把「泛化」与「记忆检索」分开。更麻烦的是扩展成本。现有基准大体分两类人工标注基准GAIA、Mind2Web、OSWorld、WebArena 等提供了真实环境与任务但任务规格仍由人定义扩充需要持续投入人力与工程。合成任务方法Self-Instruct、MetaMath 用大模型扩写指令或做规则式复杂化面向智能体的 TaskCraft 先由 LLM 遍历文档生成原子任务再把原子任务组合成复杂任务。两类方法的共同问题是缺少显式的实体-关系建模。大模型直接读预处理后的文本与图像来造题题目的一致性只能靠提示词与事后检查于是出现两个典型失败题目与源数据语义不一致以及题目在给定上下文下根本无法完成。TaskCraft 已经是其中最有代表性的工作但它自底向上的组合方式仍然依赖 LLM 自行判断任务之间的依赖关系。对比维度TaskCraftGraph2Eval生成范式自底向上先生成原子任务再组合自顶向下先建图再采样子图任务空间处理后的文档知识图谱任务复杂度来源原子任务的组合数据内在关系的挖掘任务类型多工具使用文档理解 网页交互OSWorld 依赖人工与脚本构建任务、MMBench 使用整理好的问答对两者的语义一致性都很高但时间成本显著Graph2Eval 走合成路线把时间成本压到最低同时保持同样的高一致性——这是论文附录给出的横向定位。研究主线从问题到结论图 6Graph2Eval 研究主线——静态基准扩展成本高改用知识图谱作为任务空间后自动出题并以无图对照验证一致性 20%、可解性 17%。基准/方法设计Graph2Eval 的核心主张是把知识图谱当作任务空间而不是把图当作辅助检索工具。整条数据集生成流水线由五个阶段组成数据接入、KG 构建、子图采样、任务生成、覆盖度优化。数据接入对文档做三件事语义分块把文档切成最小语义单元并映射为图节点嵌入计算用嵌入函数把节点编码到向量空间以捕获上下文依赖元数据标注为节点补充文件路径、标题、作者等来源与位置信息。对网页则通过自动 URL 爬取收集页面抽取 DOM 结构与截图并用模拟的类人交互处理复杂的现代网页设计收集质量由规则启发式与大模型评估共同过滤低质量链接被剔除、信息密度被提高同时施加安全约束避免采集敏感信息。KG 构建把非结构化与半结构化内容变成可计算、可推理的语义空间形式上定义为 $G(V,E,R)$其中 $V$ 是节点集合、$E$ 是边集合、$R$ 是关系类型集合。节点由解析文档或网页得到段落、标题、超链接、表单、按钮、表格单元各映射为一个节点并保留上下文路径以维持 DOM 层级或文档结构。节点的表示同时包含文本内容与视觉内容视觉部分先由函数转成文字描述再拼接即 $c_i^{TV} c_i^T \,|\, \phi_{\text{visual}}(c_i^V)$然后嵌入为 $h_i f_{\text{embed}}(c_i^{TV})$维度 $d384$all-MiniLM-L6-v2并存入向量数据库供语义检索与相似度匹配使用。边分为文本边与网页边两类文本边编码结构关系顺序、包含、语义关联实体关系、语义相似、上下文关系图表上下文与引用关系共指、跨文档链接网页边编码导航关系页面跳转、表单提交、交互关系点击触发与布局关系视觉布局、数据流。正是这层显式的关系建模让后续生成的题目天然携带实体依赖。图 1Graph2Eval-Bench 支持在不同基座模型之间区分 agent 能力。分类全景图 7Graph2Eval-Bench 分类全景——1319 道题由 1002 道文档理解题16 篇论文、12 类任务与 317 道网页交互题8 个网站、7 类任务构成。方法细节子图采样是可控性的来源。给定任务目标 $g$框架从图中抽取满足目标约束的局部子图。文档模式下节点集合包含文档元素节点、实体节点与语义分块节点采样同时考虑语义相关性与结构一致性只有余弦相似度高于阈值 $\tau$即满足 $\cos(h_i,h_g) \tau$或通过结构匹配的节点才会被纳入并且只保留属于规定节点类型集合的节点。网页模式走种子驱动策略先解析页面识别按钮、输入框、表单、导航链接等关键操作节点作为「任务种子」再收集每个种子节点的 $k$ 跳邻居从而把局部交互上下文完整捕获。任务生成针对文档理解定义四步维护覆盖问答、对比、分析、推理等基本类别的任务模板库从图中采样满足模板硬性约束的子图所需的节点与边类型、节点数量区间、最大跳数从子图中抽取节点内容、边关系、上下文与元数据等模板变量最后由 LLM 把子图结构与模板上下文合成为具体任务实例。通过调整子图规模、边类型与采样策略任务复杂度与推理深度可以被灵活控制。网页交互采用种子驱动的四步识别任务种子、围绕种子采样上下文子图、用 meta-path 匹配并扩展子图形成任务链、再由 LLM 结合子图结构、meta-path 与页面上下文生成任务实例。meta-path 由模式与实例两级构成模式定义任务的结构模板实例是模式在具体子图上的匹配结果。系统内置图正则引擎支持节点与边类型匹配、量词以及「Toast|Modal」这类替代构造变量通过槽位绑定机制落到具体节点 ID。例如页面上只有搜索框、提交按钮与结果项时任务链是「搜索 详情」若还存在筛选器任务链自动变成「搜索 筛选 详情」。这种组合式机制避免了「全有或全无」的刚性约束。图 2Graph2Eval 数据集生成工作流——摄入 → 建图 → 子图采样 → 任务生成 → 覆盖优化。覆盖度优化保证质量、多样性与代表性。网页任务先用基于大模型或规则的质量分数过滤候选再在节点类型、边类型、模式、页面级、网站类型与难度六个维度上量化覆盖度新颖性用多层相似度衡量最后用最大边际相关性MMR策略迭代选择。文档任务则强调语义多样性在任务类型、难度、模板、变量与内容长度五个维度上计算覆盖度新颖性用基于大模型的语义相似度评估同样由 MMR 指导选择。任务的连通性与可达性在采样阶段就已约束因此可解性由构造保证。实验设计与结果评测协议文档理解任务用 F1、ROUGE-L 与 LLM-as-a-Judge 三项指标其中 F1 是精确率 $P$ 与召回率 $R$ 的调和平均即 $\text{F1} 2PR/(PR)$网页交互任务用成功率 $\text{SR} N_{\text{success}} / N_{\text{total}}$由大模型根据执行动作序列、最终页面状态与错误信息判定该判定与人工标注的一致率为 88%。任务质量另用一致性Consistency与可解性Solvability衡量。生成与优化基于 GPT-4o评测覆盖 GPT、Deepseek、Qwen、Gemini 四个系列以及 UI-TARS智能体包括单智能体与多智能体 RAG、SoM Agent 与 Agent S 2.5温度统一为 0.1。主结果单智能体设置摘自论文主表模型F1ROUGE-LLLM JudgeAvg TokenGPT-4o0.57660.48740.78541631.82Deepseek-V30.53760.45180.83511710.65Qwen2.5-VL-72B0.57300.48370.70942394.19Qwen2.5-VL-32B0.36770.33000.48112275.01Qwen2.5-VL-7B0.20930.19390.54272455.17图 3Graph2Eval-Bench 中各任务类型的题目数量分布。网页侧的分化更极端在 Gemini 2.5 Flash 上Agent S 2.5 的整体成功率达到 69.20%而只做视觉定位的 SoM Agent 只有 14.51%开源模型 Qwen2.5-VL-72B 在两类智能体下都排第二SoM 13.88%、Agent S 38.80%。Qwen2.5-VL 从 7B 到 72B 的单调爬升说明题目对模型规模敏感、具备区分度。多智能体协作在文档任务上并没有带来显著提升平均 token 却从 1631.82 涨到 3560.92。图 4Graph2Eval 在文档与网页数据上的处理时间对比。消融实验用同一数据集、同一生成模型GPT-4o各生成 500 道文档题与 500 道网页题对比「去掉知识图谱」的变体指标无 KG文档无 KG网页Graph2Eval文档Graph2Eval网页Qwen2.5-VL-72B0.680.120.850.24一致性0.740.620.950.78可解性0.730.600.930.72去掉图之后网页任务大多退化成单页交互多页工作流因为缺少页间关系而无法完成题目歧义还需要大模型或人工二次排查而 Graph2Eval 生成的题目既揭示了不同规模模型之间更清晰的差距也通过图结构把语义一致性与可解性一并锁定。图 5Graph2Eval 生成任务的案例研究——从子图到可执行的多跳任务链。结果对比总结图 8结果对比总结——加入知识图谱后一致性从 0.74 升到 0.95、可解性从 0.73 升到 0.93同基座下 Agent S 2.5 成功率 69.20% 远高于 SoM Agent 的 14.51%。关键发现一致性从 0.74 升到 0.95、可解性从 0.73 升到 0.93增益来自图结构约束而不是提示词技巧或生成后的二次复核。1,319 道题1,002 道文档理解题16 篇论文平均每篇 83.5 题加 317 道网页交互题8 个网站平均每站 48.4 题覆盖 12 类与 7 类任务。生成效率 34.87 秒 / 文档题、95.51 秒 / 网页题且处理时间随任务量近似常数增长而不是线性的人力投入因此基准可以持续扩增。KG 边精度 88%随机抽取 100 对节点由人工校验节点与关系的正确性确认图结构可靠。判别力被放大到 4.8 倍同一基座模型下Agent S 2.5 的 69.20% 成功率对比 SoM Agent 的 14.51%说明题目考察的是多步推理、反思与记忆而不是简单的视觉接地。多智能体并不加分平均 token 从 1631.82 涨到 3560.92但 F1 与 ROUGE-L 未见显著提升成本与收益不成正比。延伸视角历史脉络与创新模式把这篇工作放回研究脉络看它完成的是从图表示到评测构建的迁移。2016 至 2017 年Visual Genome 与 GCN 把「实体 关系」的图结构变成表示的一等公民2024 年 GraphRAG 把图用于语料级检索与社区摘要图成为检索基础设施2025 年 TaskCraft 让大模型自动生成智能体任务但仍是自底向上的原子任务组合2026 年 Graph2Eval 把图升级为任务空间题目自带可解性。它的下游价值在于可扩增、可解性内建以及错误能够定位到节点与边。用大规模语料归纳出的创新模式框架回看本文命中三条统一异构输入到同一空间把文档与网页映射到同一张 $G(V,E,R)$社区引用偏好为正、重新表述为可解对象把「大模型读文本造题」重写为「在图上采样子图并实例化」属于 PC 与社区双赢的模式、通过构造编码结构可达性与 meta-path 把结构写进生成过程而不是依赖大模型的后验判断。三条同时成立解释了它为什么既有结构性洞察、又能沉淀为可复用基础设施。写作层面还值得记一笔论文通篇用可核对的秒数与比例代替形容词证据框架是它最大的修辞加分项同时它自称 novel 却没有用“Unlike ...”的对照与前人拉开距离范围框架也略宽——从 16 篇文档与 8 个网站推出「跨多样场景」的结论。此外原文有两处笔误机构名“Xiameng University”应为 Xiamen作者名“Yuxi qian”的姓氏未大写。局限性依赖知识图谱质量如果图不完整或包含错误生成任务的质量会直接受影响——上游建图是单点风险。偏结构化知识方法聚焦预定义关系难以生成图之外的非结构化或全新信息任务可能限制任务的多样性与覆盖。来源规模有限16 篇文档与 8 个网站支撑 12 类与 7 类任务覆盖面的上限来自数据源而非生成机制。网页安全任务尚未离线化论文主要在受控沙箱隔离的 Docker 环境或受控浏览器会话中做威胁建模安全任务生成仍处于原型阶段。常见问题FAQGraph2Eval 和直接用大模型生成评测题有什么区别关键区别在于是否有显式的实体-关系建模。直接让大模型读文本造题题目质量只能靠提示词与事后复核保证容易出现语义不一致与不可解Graph2Eval 先把多源数据建成 $G(V,E,R)$再按模板约束采样子图并实例化任务题目结构与数据关系一一对应一致性与可解性由构造保证实测一致性 0.95、可解性 0.93。Graph2Eval-Bench 到底有多少题、覆盖什么场景共 1,319 道题1,002 道文档理解题来自 16 篇高质量论文317 道网页交互题来自 8 个真实网站。文档侧覆盖信息抽取、摘要、多跳推理、对比分析与事实核查等 12 类任务网页侧覆盖 7 类交互任务可以同时评测 RAG Agent 与 Web Agent。为什么 Agent S 2.5 和 SoM Agent 的差距这么大因为题目考的不是视觉定位。SoM Agent 依靠 Set-of-Marks 标注做元素定位在多数子任务上得分接近零Agent S 2.5 具备四层架构与反射机制能分析执行轨迹并修正策略因此在同一基座模型上整体成功率达到 69.20%而 SoM Agent 只有 14.51%。这说明基准有效区分了「能看」与「会做」。生成一道题需要多少钱和时间论文报告的平均生成时间是每个文档理解任务 34.87 秒、每个网页交互任务 95.51 秒并指出处理时间随任务量近似常数增长而不是线性的人力投入。相比人工标注基准需要设计环境与内容这种自动化方式让评测集可以随数据源持续刷新。没有知识图谱的版本差在哪里无 KG 变体直接从处理后的文档与网页数据出题实测一致性只有 0.74文档/ 0.62网页可解性只有 0.73 / 0.60网页题大多被困在单页交互跨页工作流因缺少页间关系而不可解。同一模型 Qwen2.5-VL-72B 在两个版本上的分数是 0.68 / 0.12 对 0.85 / 0.24差距清楚地指向图结构本身。这个方法有什么已知局限三条一是强依赖知识图谱的正确性与完整性二是只利用预定义关系难以覆盖图外的非结构化或全新信息三是数据源规模有限任务多样性的上限由源数据决定。作者给出的下一步方向是引入形式化安全策略生成对抗任务并利用图的结构性质把错误定位到节点与边形成细粒度的弱点诊断。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2510.00507项目主页与代码https://github.com/YurunChen/Graph2Eval基准数据集https://huggingface.co/datasets/yurun-chen/Graph2Eval-BenchTaskCraft最接近的合成任务基线https://arxiv.org/abs/2506.10055OSWorld真实环境网页基准https://arxiv.org/abs/2404.07972GAIA通用 AI 助手基准https://arxiv.org/abs/2311.12983WebArena真实网页环境https://arxiv.org/abs/2307.13854给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑