WikiSkill:将智能体经验编译为持久化知识以实现技能演化
WikiSkill:将智能体经验编译为持久化知识以实现技能演化论文来源:arXiv:2608.27454v1摘要智能体技能(Agent skills)将专业知识与工作流封装成可复用资源,以此拓展AI智能体的能力。现有研究可以从智能体交互经验中自动挖掘技能,让智能体在交互过程中逐步自适应迭代。但是,用于指导技能迭代的经验洞察往往零散分布在优化历史中,无法在多轮迭代之间实现系统化复用。本文提出WikiSkill框架,让智能体技能与一套持久化知识库(Wiki)协同演化。WikiSkill 将原始执行经验、沉淀的结构化知识、可执行技能三者解耦;持续把交互经验汇总编译进入Wiki知识库,后续的技能更新迭代就可以基于这套积累的知识开展。在5个不同基准数据集、5款大模型上开展实验:WikiSkill 稳定超越现有SOTA技能演化方法,在绝大多数模型(S_{k‑1})数据集组合上优于无技能基线。实验发现:技能演化与模型缩放是互补关系。更大的模型通常能从演化得到的技能中获得更多收益;而配备演化技能的小模型,性能可以超过没有技能的更大规模模型。同时,演化得到的技能可以跨模型、跨模型家族有效迁移;其他模型演化出的技能,性能甚至可以优于模型自身演化的技能。消融实验证实,Wiki知识库的持久化知识积累,是实现高质量技能演化的关键。上述结果证明:系统化积累、精炼智能体交互经验,对开发可复用、可迁移的智能体技能具备显著价值。图1:WikiSkill对比无技能基线、现有技能演化方法。模型能力越强,WikiSkill带来的性能增益越明显;图中为各个模型在全部评测基准上的平均准确率。目录引言问题定义方法3.1 三层知识架构原始层(raw/)Wiki层(wiki/)技能层(skills/)3.2 演化智能体与Wiki调度逻辑3.2.1 推理智能体的技能供给3.2.2 Wiki维护器:模式整合归纳3.2.3 基于Wiki的技能提案器3.2.4 门控校验与回滚机制实验与结果4.1 实验设置数据集对比基线方法实验所用模型4.2 主要实验结果4.2.1 跨模型、跨任务的技能演化效果4.2.2 WikiSkill跨模型技能迁移实验分析与讨论5.1 持久化知识在技能演化中的作用5.2 定性分析:技能与Wiki的动态变化5.3 案例研究:Wiki引导技能演化完整过程相关工作6.1 基于经验的智能体技能演化6.2 技能增强智能体与智能体自我改进结论局限性AI生成声明参考文献附录A 方法细节A.1 完整算法伪代码A.2 被接受的技能更新分布统计B 数据集细节与数据划分小验证集下的评估鲁棒性C 实现细节统计显著性检验D 基线方法细节、优化器API调用分析D.1 各个基线方法介绍D.2 优化器API调用复杂度E 系统提示词与智能体提示词E.1 任务推理智能体系统提示E.2 Wiki维护器智能体系统提示E.3 技能提案器智能体系统提示((\mathcal{R})eAct模式)1 引言通用AI智能体越来越擅长跨领域完成复杂任务。但是,真实世界任务往往高度依赖领域专属的过程性知识、工作流。智能体技能提供一套轻量、开放格式来封装这类专业知识,不需要修改模型权重。技能把指令、脚本、资源打包为基于文件系统的模块化目录,具备一致性、可审计、可跨智能体复用;同时支持渐进式加载,智能体只在需要的时候加载对应内容,节省上下文窗口;技能让知识积累独立于模型参数之外。但人工编写智能体技能成本很高,需要提前预判智能体需要哪些过程知识。因此,大量最新工作迭代式开发技能:让智能体在训练集执行任务,分析成功、失败轨迹,基于交互经验迭代优化技能。现有方案(EvoSkill、Trace2Skill、SkillOpt)可以迭代更新技能,但不会把学到的经验沉淀为一套独立、持续演化的知识表示。借鉴Karpathy提出的LLM(S_{k‑1})Wiki思想:把交互经验编译成可持久、可不断累加的知识库。本文提出问题:能否把智能体的交互经验编译为持久化知识,支撑长期的技能演化?WikiSkill把智能体工作区划分为三层:原始层存储不可修改的执行轨迹、Wiki层维护结构化持久知识、技能层存放迭代更新的过程性技能。整个迭代循环包含4个组件:推理智能体:使用当前技能执行任务,生成执行轨迹;Wiki维护器:把轨迹信息整合沉淀进入Wiki知识库;技能提案器:结合Wiki知识库、最新轨迹,生成技能更新提案;门控与回滚机制:在验证集评估候选更新,只保留可以提升验证性能的改动。关键点:技能更新可以回滚,但是Wiki知识库永不回滚;后续每一轮迭代都可以复用全部历史沉淀知识。评测数据集覆盖五大领域:数学推理LiveMathematicanBench、网页检索问答SealQA、电子表格操作SpreadSheetBench、长文档问答OfficeQA、交互式具身任务ALFWorld;实验模型包含Qwen、Gemma、Gemini三大模型家族共5个模型。实验关键发现:WikiSkill在绝大多数场景超越基线;技能演化与模型缩放互补,Qwen系列中,4B、9B、27B模型使用WikiSkill后平均性能分别提升12.3%、17.5%、23.9%;技能可以弥补模型规模差距:Qwen(S_{k‑1})3.5(S_{k‑1})9B + WikiSkill(47.4%) Qwen(S_{k‑1})3.6(S_{k‑1})27B无技能(39.4%);技能支持跨模型家族迁移,部分场景迁移过来的技能比模型自己演化得到的技能效果更好;消融证实:Wiki持久知识库是获得性能增益的核心条件。主要贡献提出WikiSkill框架:智能体技能与持久化知识库协同演化,持续整理、精炼来自智能体交互的经验;在5套基准、5个模型完成验证,WikiSkill稳定优于现有技能演化方法;消融实验验证持久知识积累的必要性;系统研究演化技能与模型能力之间的相互作用:技能演化与模型缩放互补;技能可以跨模型有效迁移,部分场景迁移技能优于自演化技能。2 问题定义将任务数据集记为D=(xi,yi)∗i=1N\mathcal{D}={(x_{i},y_{i})}*{i=1}^{N}D=(xi,yi)∗i=1N,xix_ixi为任务实例,yiy_iyi为标准答案。数据集切分为互斥三部分:训练集D∗train\mathcal{D}*{\text{train}}D∗train、验证集D∗val\mathcal{D}*{\text{val}}D∗val、测试集D∗test\mathcal{D}*{\text{test}}D∗test。智能体π\piπ是基于大模型的系统,配备工具集合(U)\mathcal{(\mathcal{U})}(U)(bash、搜索API、文件读取器等),以及一套生效技能集合S=s1,s2,…,sMS={s_{1},s_{2},\dots,s_{M}}S=s1,s2,…,sM。技能定义:模块化、基于文件系统的目录,封装领域过程知识,包含带元数据头的SKILL.md,记录名称、简短描述、完整过程指令、适用条件。技能集合初始化S0=∅S_{0}=\emptysetS0=∅,在数据集上通过演化过程迭代开发。当执行任务xix_ixi,智能体接收任务上下文,读取可用技能集合SSS,多步调用工具生成执行轨迹:τi∼π(xi;S)\tau_{i}\sim\pi(x_{i};S)τi∼π(xi;S)轨迹τi=(o1,a1,o2,a2,…,oT,aT)\tau_{i}=(o_{1},a_{1},o_{2},a_{2},\dots,o_{T},a_{T})τi=(o1,a1,o2,a2,…,oT,aT),oto_tot为观测,ata_tat为动作(工具调用等),最终动作输出预测答案y^i\hat y_iy^i。领域打分函数f(y^i,yi)∈[0,1]f(\hat y_i,y_i)\in[0,1]f(y^i,yi)∈[0,1]评估预测正确性。在数据集切片上跑完整智能体,得到一批轨迹集合T∗split\mathcal{T}*{\text{split}}T∗split,切片性能(R)(T∗split)\mathcal{(\mathcal{R})}(\mathcal{T}*{\text{split}})(R)(T∗split)为样本平均分。WikiSkill在第kkk轮迭代,系统状态为元组(Sk,Wk)(S_{k},W_{k})(Sk,Wk):SkS_{k}Sk:当前生效的过程技能集合;WkW_{k}Wk:持久化Wiki知识库。重要区别:候选技能更新会经过验证门控,性能下降时会回滚技能集合;但是Wiki知识库WkW_kWk永远保留,不会回滚,知识可以跨迭代不断累加。初始状态(S0,W0)=(∅,∅)(S_{0},W_{0})=(\emptyset,\emptyset)(S0,W0)