资讯详情

SPARKLE(ACL 2026)

📅 2026/9/12 19:57:21 | 华诺云谱 👁 阅读
SPARKLE(ACL 2026)
什么是Adaptive RAGAdaptive RAG是“会根据当前推理状态动态决定是否继续检索”的 RAG。普通 RAG 的基本流程通常是Question→Retrieve→Retrieved Docs→LLM→Answer也就是问题一来先检索一次然后把检索结果塞给 LLM最后生成答案。这种流程里的 retrieval 往往是预先固定的不管问题简单还是复杂基本都“先搜再答”。而 Adaptive RAG 的核心是把“检索”变成一个动态决策过程。模型在推理过程中会不断判断现在需不需要检索如果需要还要进一步决定 应该检索什么以及 检索到的信息应该怎么加入当前推理​动机现有 Adaptive RAG 的两类主流做法第一类直接让冻结的 LLM 自己决定要不要检索。所谓 frozen LLM就是主模型参数不更新。系统通常根据 LLM 的 uncertainty、置信度、特殊 token或者直接通过 prompt 让它判断“我现在是否需要外部信息”缺点这种“什么时候搜、搜什么”的能力没有经过专门训练也没有明确的监督信号告诉模型“这里应该检索”“这里不应该检索”。第二类直接训练 LLM 学会检索。这类方法会通过 SFT 或 RL 去训练主 LLM让它真正学会When to retrieveWhat to retrieve缺点训练成本很高创新因此需要一种在不修改LLM本身的情况下自适应检索理想情况下这种方法应该将检索控制从LLM中分离出来实现独立学习同时保持模型的泛化能力。基于这一思想作者提出了一种结构化的、即插即用的智能体检索策略SPALKE用于改进RAG中的自适应检索和知识集成。SPALKE 使用 the proxy model 逐步决定何时检索、检索什么以及如何合并检索到的信息。在这个过程中代理模型利用结构化知识图谱来更好地表达检索查询并将相关信息整合到推理上下文中。SPARKLE中的代理模型以代理的方式运行承担不同的功能角色每个角色都由有针对性的指令指导。这些角色充当专门的代理人协同工作以支持适应性RAG过程。SPARKLE定义了三个agents(1)用于确定何时需要外部知识的检索决策代理(2)用于识别知识差距并生成目标搜索查询的查询形成代理(3)用于选择和集成相关信息的知识集成代理。具体地说在每个LLM的推理步骤中检索决策代理根据当前上下文和 LLM 的中间思想来决定是否需要额外的知识。如果需要检索则调用查询公式和知识集成代理以获得用于下一步推理的更新的上下文。受先前采用基于知识图谱(KG)的推理链从噪声内容中识别有用信息的工作的启发SPLICE从LLM的中间思想中提取了一个基于KG的推理链提供了其推理轨迹的结构化和信息性表示。这种结构帮助查询公式代理更准确地识别用于定向检索的知识差距。此外检索到的文档被分解成知识三元组允许知识集成代理执行相关内容的细粒度选择以并入上下文中。作者利用近端策略优化 proximal policy optimisation(PPO)来训练代理模型同时保持检索器和LLM冻结。为了便于在训练过程中更有效地探索我们提出了一种带有剪枝机制的 binary tree-structured rollout strategy二叉树结构卷出策略该策略允许代理模型在探索多条推理路径的同时丢弃不被看好的分支。定义形式上给定问题 q 和语料库目标是通过一系列推理步骤生成答案 y。形式上我们将multi-agent Markov Decision Process (MDP) 过程定义为一个元组其中 I {1, 2, 3} 表示代理集合Si 和 Ai 分别表示第 i 个智能体的状态空间和动作空间。 每个代理遵循其策略 πi : Si → Ai 根据其状态选择操作。直观上状态可以被视为代理的输入而动作对应于代理的输出。轨迹是代理随着时间与环境交互而生成的一系列状态和动作。R是系统级奖励函数它提供反馈来指导代理之间的合作行为。Agent Roles and Collaborative StrategyRetrieval Decision Agent解决When to retrieve该代理确定每个推理步骤是否需要外部知识。在第 t 步智能体观察到状态其中ct表示由先前步骤中检索到的文档组成的当前上下文r≤t是 LLM 在步骤t之前生成的中间思想。 根据这个状态代理选择一个动作其中“是”表示后续推理需要检索而“否”表示不需要外部知识。Query Formulation Agent解决What to retrieve如果在步骤t需要检索则激活查询制定代理以基于状态获得查询qt。 虽然可以直接根据 LLM 的想法生成查询但由于 LLM 的想法中存在分散注意力或推测性内容因此这种策略通常会导致性能不佳例如这个例子说明了LLM的想法如何包含不确定性和推测性内容从而很难直接提取准确的搜索查询。 为了解决这个问题作者的查询公式代理首先构建了一个基于 KG 的推理链 gt 它将 LLM 的思想抽象为一种结构化的形式捕获基本的推理步骤例如这种结构化的表示可以过滤掉干扰从原始想法中提取、推测或不相关的信息仅保留任务所需的核心推理步骤。 通过这样做它使潜在的知识差距更加明确使代理能够清楚地识别需要哪些附加信息来推进推理过程并相应地制定有针对性的搜索查询 qt。Knowledge Integration Agent.给定查询 qt检索器返回文档列表 Dt ⊂ C其中通常包含不相关的内容。 为了便于更细粒度地识别有用信息SPARKLE 将每个文档分解为一组知识三元组。这种结构化表示通过减少文本噪声可以对检索到的内容进行更精确的推理。知识集成代理观察状态其中 Kt 是从 Dt 中提取的知识三元组的集合。 然后它选择最能填补当前推理链中最重要空白的三元组。 给定选定的三元组SPARKLE 将提取该三元组的源文档添加到上下文 ct从而生成更新的上下文 ct1 以供后续推理。Collaborative Strategy解决How to integrate retrieved knowledge最后我们介绍这些代理如何与LLM协作以支持自适应检索和推理。 给定问题 q 和初始上下文 c0LLM 会生成第一个想法 。 然后检索决策代理确定是否需要外部知识。 如果是则激活查询制定和知识集成代理以获得更新的上下文c1以用于后续推理。 否则上下文保持不变。 这个过程会迭代执行直到法学硕士生成最终答案。举例QuestionWhat is the 2010 population of the village where Smith Haven Mall was located?Step 0LLM 初始推理LLM 已经知道Smith Haven Mall→Lake GroveSmith。但是缺少 Lake Grove→population in 2010Step 1Retrieval Decision Agent输入RD Agent 判断当前回答是否需要外部知识输出表示 需要检索如果输出 No直接让 LLM 继续推理。Step 2Query Formulation Agent目标根据当前推理缺口生成精准搜索 query。所以先构建 KG-based reasoning chain。原始 thought 转换为unknown表示当前知识缺口。根据 KG chain生成qt​Lake Grove population 2010Step 3Retriever 检索文档返回Document 1Document 2Document 3Step 4Knowledge Integration Agent目标从检索结果中选择真正能够填补 reasoning gap 的知识。首先把 documents 转换成 knowledge triples输入① Question② 当前 reasoning chain③ Candidate triplesAgent 判断哪个 triple 最能补充Lake Grove,population in 2010,unknown选择Document 3的 knowledge triplesStep 5更新 ContextSPARKLE不是直接把 triple 给 LLM。而是找到 triple 来源 document。加入C得到新的Ct1Agentic Retrieval Policy作者将训练过程构建为 RL 问题。 作者采用 PPO来训练代理模型以学习提高答案生成性能的检索策略。问题普通 PPO 只按照当前 policy 采样容易陷入错误 retrieval 策略探索不足。方法训练阶段在每个 Retrieval Decision 处强制展开两个动作Retrieve vs No Retrieve形成二叉决策树收集多条 trajectory并根据最终 reward 优化 proxy policy。优化pruning 删除重复分支的其中一个限制前 L 步展开避免指数增长。作用提高 retrieval policy 的探索能力使模型学会“什么时候检索比不检索更好”。Monte Carlo Reward Assignment主要解决一个强化学习中的问题SPARKLE 有三个 AgentRD、QF、KI但是最终只有一个系统级奖励answer 对不对如何把这个最终奖励合理分配给三个 Agent 的每一步决策核心思想不直接平均分配最终 reward而是通过 Monte Carlo 估计每个 action 对最终结果的贡献。简单理解来说它会问如果某个 Agent 的这个决策改变了未来结果会怎样Monte Carlo 方法估计在这个状态下采取这个动作对最终 reward 的期望贡献然后形成用于训练。总结让 Proxy Model 自己尝试不同的检索策略Binary Tree Rollout看最终答案是否正确然后通过 Monte Carlo 方法判断“哪一步决策贡献最大”把奖励分给对应 Agent最后用 PPO 让模型以后更倾向选择高奖励的检索行为。公式理解SPARKLE 有三个 Agentπ1​πRDπ2πQF π3​πKI​。三个 Agent 共享一个 proxy model 参数θ。所以表示在状态下proxy model 选择动作的概率。Binary Tree Rollout 生成轨迹SPARKLE形成 binary tree每条 trajectory 最终经过 LLMRetriever 得到答案yτ​对于每条 trajectory得到最终 rewardMonte Carlo Reward Assignment对于 agent i 的 action估计在当前状态采取这个动作对最终 reward 的期望贡献。最终得到训练数据RL 样本计算 AdvantagePPO 不直接使用 reward而使用 advantage表示这个动作比平均水平好PPO 更新 Proxy ModelPPO 优化目标
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。