资讯详情

【ICRA 2026】EPoG:边探索边操作,把「部分已知环境」写进一张可增量修正的场景图|从探索与操作联合规划视角

📅 2026/10/9 5:44:15 | 华诺云谱 👁 阅读
【ICRA 2026】EPoG:边探索边操作,把「部分已知环境」写进一张可增量修正的场景图|从探索与操作联合规划视角
摘要本文解读 ICRA 2026 论文《Integrated Exploration and Sequential Manipulation on Scene Graph with LLM-based Situated Replanning》。该论文提出EPoG通过融合一张可增量修正的信念图、图编辑距离导出的动作集合与大模型就地重规划让机器人在部分已知环境里一边探索一边完成长程序贯操作其特别之处在于探索与操作不再是两个阶段而是同一张图上的编辑操作。实验表明在 46 个真实家居场景、5 类长程搬运任务上EPoG 取得91.3% 的总成功率并把探索节点降低40.0%、移动距离降低36.1%相对规则式基线 ExplorationPoG为部分可观测环境下的移动操作提供了可直接借鉴的规划范式。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么「部分已知」逼着机器人改变规划方式研究主线从问题到结论方法设计信念图 图编辑距离分类全景双层规划器的分工方法细节GED、拓扑排序与例外处理实验设计与结果结果对比总结关键发现局限性常见问题FAQEPoG 一句话是什么它为什么不用大模型直接规划探索和操作是怎么统一的成功率是不是被规则式基线反超了剩下的 8.7% 失败出在哪真机实验验证到了什么程度参考链接论文基本信息项目内容标题英文Integrated Exploration and Sequential Manipulation on Scene Graph with LLM-based Situated Replanning标题中文边探索边操作把「部分已知环境」写进一张可增量修正的场景图作者Heqing Yang, Ziyuan Jiao, Shu Wang, Yida Niu, Si Liu, Hangxin Liu机构北京航空航天大学 · 北京通用人工智能研究院BIGAI通用人工智能国家重点实验室 · 加州大学洛杉矶分校 · 北京大学 · ICRA 2026会议ICRA 2026arXivhttps://arxiv.org/abs/2602.04419项目网站https://github.com/buaa-colalab/EPoG背景与动机为什么「部分已知」逼着机器人改变规划方式真实家庭环境里机器人对物体位置的了解天然是部分的房间与大型容器很少移动小物件却会被人类随手改变位置。论文把这个矛盾写得很直接——序贯操作类方法often assume a fully known, static environment而探索类方法typically involve limited physical interaction with the scene。真实部署会同时打破这两个前提。论文把困难拆成三条相互耦合的挑战一是部分可观测下定位任务相关物体需要优先探索二是权衡探索与操作把总执行代价压下来三是在不确定性下产出真正可执行的计划。既有缓解手段依赖手工启发式长程任务里既不够鲁棒也不够可扩展。四条规划路线的假设差异决定了它们的成败这张表说明了 EPoG 的位置路线环境假设是否需要手工规则代表工作纯大模型规划无显式环境建模否靠自纠错LLM-Planner / ReAct 式规划探索 大模型先探索、后执行否但探索策略固定主动探索 零样本规划探索 规则式规划需预定义时空约束是Sequential Manipulation Planning on Scene GraphIROS 2022场景图 大模型锚定图已建好部分SayPlanCoRL 2023EPoG本文信念图随执行生长否ICRA 2026从问题链看动机是这样一步步收敛的观察到家庭物体位置会被改变先验图必然过期诊断出既有工作要么不建模环境、要么假设环境已知方案是用一张信念图同时承载已知信息与大模型估计的未知系统化是把规划重述为图上编辑距离加拓扑排序验证是在 46 个场景、5 类任务上做受控对比并补两个真机案例。这条线并非凭空出现。把视野拉长到五年团队自己的工作轨迹是2021 年用虚拟运动链把机器人与场景运动学放进同一约束2022 年在场景图上做规则式序贯操作规划2024 年让大模型参与运动失败推理LLM3到本文大模型同时承担信念估计与例外重规划探索第一次被并入规划。图 1论文的动机示意——(a) 机器人必须对潜在探索位置排序并在探索与操作之间取得平衡(b) 面对执行中的意外情况需要 situated 即时重规划研究主线从问题到结论图 7EPoG 的研究主线——从「部分已知」到「信念图随执行生长」Mermaid 流程图方法设计信念图 图编辑距离EPoG 的表示沿用图式场景表示场景图 $G_b(V,E,A)$ 由场景节点 $V$、支撑关系边 $E$ 与任务相关属性 $A$ 组成室内场景按House → Room → Receptacle → Object四层组织。初始信念图只含房子、房间与容器这些不常移动的节点缺失的任务相关物体由大模型分两步估计先估所在房间再估所在容器。这里有一处克制得很好的设计大模型只补结构不预测几何变换。每个缺失节点只问两个粗粒度问题几何细节留给底层运动规划器——因为几何是否可行直接决定动作能否执行不能让语言模型的幻觉介入。分类全景双层规划器的分工图 8EPoG 的双层分工——几何与最优性交给图算法常识与例外交给大模型Mermaid 分类图方法细节GED、拓扑排序与例外处理方法的核心可以压成一句话把「把信念图变成目标图」的最小代价编辑集合直接当作动作集合。图编辑距离给出形式化定义$\mathrm{GED}(G_1,G_2)\min\sum cost(a_i)$其中求和遍历把 $G_1$ 变成 $G_2$ 的编辑操作序列。四类编辑操作与机器人动作一一对应删除边 $e_{i,j}$ 对应抓取 $\texttt{Pick}(v_i,v_j)$插入边对应放置 $\texttt{Place}(v_i,v_j)$把容器属性 $A_i^c$ 改成打开或关闭分别对应开门与关门——开关门在这里的意义是直接改变「被包含物体是否可观测」。动作之间存在时间依赖构成偏序约束 $C{(a_i,a_j)\mid i\neq j,\ a_ia_j}$例如同一容器上的抓取必须先于放置。于是任务规划被表述成 $(K,C)$ 上的拓扑排序搜索节点记为剩余动作、剩余约束与当前子序列深度优先展开无约束的动作用 $A^\star$ 启发式估计移动距离一旦当前代价超过已知上界就剪枝最终得到带移动代价的最优序列 $\pi^\star$。四个设计要点决定了它的工程可用性一是估计与观测进同一张图二是用图编辑距离统一探索与操作——行走动作由启发式插入到父容器附近所以探索不是独立阶段而是代价函数的一部分三是$A^\star$ 加剪枝保证最优性给定图时全局规划器完备四是例外分类驱动大模型把运动失败归为阻挡、不可达、碰撞与不稳定四类用思维链提示加临时停车场机制让大模型只在受限动作空间里产出修正序列。图 2EPoG 框架总览——全局层在信念图与目标图之间求编辑操作并排序局部层用大模型处理执行例外图 3场景图的分层语义表示——HouseLevel 0→ RoomLevel 1→ ReceptacleLevel 2→ ObjectLevel 3执行层的另一处关键机制是信号补全如果某个物体的估计位置 $e_{err}$ 没有出现在观测 $\mathcal{O}(V_{obs},E_{obs})$ 里规划器用新估计替换旧的位置而不是直接判定失败——「苹果不在桌上」会触发一次位置重估。局部规划器要处理的四类例外如下图 4四类运动规划例外——(a) 遮挡/阻挡(b) 不可达需先开门(c) 碰撞(d) 不稳定抽出杯下书本会让堆叠失稳实验设计与结果评测数据来自 ProcTHOR-10k筛出46 个含任务相关物体的真实家居场景设计了 5 类长程日常搬运任务每个场景在物体附近随机注入 4 类例外中的2 个。No.任务场景数目标条件1早餐准备10{apple, bread, fork} → plateplate → diningtable2卧室办公10{alarmclock, CD, laptop, pencil} → desk3观影零食10remote → sofabread → plateplate → diningtable4泡茶放松10kettle → countertopcup → diningtableremote → sofa5洗漱准备6{soapbottle, cloth} → faucet三个指标%SR 是成功完成任务的场景占比%EN 衡量多走了多少不必要的探索%TD 衡量路径效率后两者论文原文写作 percentage difference未写明参照基准。三条基线分别是纯大模型规划器不做显式环境建模每场景最多重试 20 次、探索加大模型用优化的路径主动探索后再规划、探索加规则式规划器 PoG预定义时空约束 显式例外处理。主结果是五类任务各自的成功率任务场景数纯 LLM探索LLM探索PoGEPoG早餐准备1010.040.0100100卧室办公1010.040.0100100观影零食1010.040.010080.0泡茶放松1040.060.010090.0洗漱准备616.716.710083.3总计17.441.310091.3聚合口径下的三项指标更能说明取舍EPoG 的总成功率91.3%探索节点51.9%、移动距离37.8%而保住 100% 成功率的规则式基线两个代价指标分别是73.2%与75.6%。论文据此报告探索节点降40.0%、移动距离降36.2%摘要中移动距离写作 36.1%。真机部分用移动操作平台底层是虚拟运动链规划加 cuRobo 生成全身轨迹论文明确说明刻意抽象掉感知实现专注验证任务规划层图 5真机实验设置——(a) 把三个物体其中一个位置未知放到咖啡桌上(b) 从柜中取出纸巾盒放到杯垫上需先移开挡路的杯子与茶叶罐两个真机案例的完整链条如下。第一个案例要求把篮子搬到咖啡桌上并把玩具白菜与杯子放进去杯子位置初始未知大模型推理杯子可能在咖啡桌上桌上没找到时观测不在可见集合里于是更新信念图、重新估计位置最后在别处找到并完成放置。第二个案例里大模型正确估计纸巾盒在关闭的柜子里开柜后发现杯子挡住纸巾盒于是临时把它移到架上茶叶罐挡住杯垫时先放下纸巾盒、移开茶叶罐、再放回——三个例外不可达、遮挡、碰撞被局部规划器逐个化解。图 6两个任务的机器人路径仅显示跨 Room/Receptacle 的移动——EPoG 把盘子当作搬运工具先归拢再整体转移对照的 LLM 方法逐件搬运动作序列更长结果对比总结图 9EPoG 的关键对比——成功率与执行代价之间的取舍Mermaid 对比图关键发现纯大模型规划器几乎不可用。总成功率只有17.4%移动距离超支93.9%它经常走到错误的位置抓取或放置找不到全部任务相关物体即便成功计划也更低效。把探索还给规划器是用代价换信息。探索加大模型把成功率抬到41.3%代价是探索节点89.4%、移动距离120%——探索本身没有错错在它与操作各自独立。效率是 EPoG 的胜负手。相对规则式基线探索节点降40.0%、移动距离降36.2%总成功率仍达91.3%在早餐准备与卧室办公两类任务上同样是100%。探索节点最低的数字是个陷阱。纯大模型规划器的 %EN 只有2.05看似最优其实是低成功率带来的假优势——它往往根本没走到该去的地方。真正的对照是规则式基线。失败集中在复合例外。剩余8.7%的失败全部出现在复合例外场景全局规划在图上完备瓶颈是局部规划器面对组合式物体配置时的认知歧义。创新模式上命中的是结构洞察。用 15 种创新模式框架审视这篇论文同时命中「审计并扭转负载假设」假设是序贯操作要求环境完全已知且静态、「重新表述为可解对象」把探索加操作重述为图编辑距离加拓扑排序与「分解并委托求解器」几何交图算法、例外交大模型属于典型的程序委员会偏好组合。局限性局部规划器是唯一短板8.7% 的失败全部来自复合例外论文没有给出失败模式的量化分类。观测假设偏强假设机器人进入一个房间即可看到除封闭容器之外的所有物体及其关系真机又刻意抽象掉感知实现感知噪声下的退化没有被验证。问题设定受限假设确定性状态转移、动作集只有抓取/放置/开关门/行走、物体状态被离散化未覆盖连续空间中的部分可观测。评测规模与口径46 个场景、每类任务每场景只执行一次没有报告多种随机子下的方差而且 %EN 与 %TD 未写明参照基准正文声称的 40.0% 与 36.2% 无法从表格数字直接复算$51.9/73.2$ 对应 29.1%。写作层面的小瑕正文把数据集写成 ProcThor-10k与官方名称 ProcTHOR 不一致另有一处介词用法生硬且全文没有致谢与资助声明段落。作者展望接入三维场景图感知模块并结合任务与运动规划方法把几何可行性的判断从运动规划器前移到任务层。常见问题FAQEPoG 一句话是什么它把「已知信息」与「大模型估计的未知」放进同一张信念图于是探索与操作不再是两个阶段而是同一组图编辑操作全局层用图编辑距离与拓扑排序求最优序列局部层用大模型化解执行例外。它为什么不用大模型直接规划因为长程问题上大模型缺乏空间接地。消融里纯大模型规划器的总成功率只有17.4%移动距离超支93.9%而几何与代价交给确定性的图算法后EPoG 达到91.3%。工程上的分界是大模型补常识结构、化解例外几何与最优性交确定性算法。探索和操作是怎么统一的行走动作由 $A^\star$ 启发式插入到父 $\texttt{Receptacle}$ 附近因此探索不是独立阶段而是代价函数的一部分。规划器会在顺路看一眼与直接执行之间做代价权衡这正是它与先探索后规划的根本区别。成功率是不是被规则式基线反超了是的而且论文如实报告了规则式的 ExplorationPoG 在五类任务上都保持100%EPoG 是91.3%。EPoG 赢的是效率——探索节点从73.2%降到51.9%移动距离从75.6%降到37.8%。这也是本文最容易被误读的一点。剩下的 8.7% 失败出在哪全部出在复合例外场景。全局规划在图上完备问题在局部大模型规划器面对组合式物体配置时的认知歧义——它需要同时处理多个例外而论文没有给出失败模式的量化分类。真机实验验证到了什么程度两例真机任务均完成一例靠信念图更新纠正桌上没找到杯子的误估另一例靠局部规划器移开挡路的杯子与茶叶罐。但底层动力学用虚拟运动链与 cuRobo 生成感知被刻意抽象——所以它验证的是任务规划层不是完整系统。参考链接论文arXiv 摘要页https://arxiv.org/abs/2602.04419官方代码仓库BUAA COLA Labhttps://github.com/buaa-colalab/EPoG场景图 LLM 规划基础工作Rana et al., SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning, CoRL 2023规则式基线与方法前身Jiao et al., Sequential Manipulation Planning on Scene Graph, IROS 2022同一条线的移动操作基础Jiao et al., Efficient Task Planning for Mobile Manipulation: A Virtual Kinematic Chain Perspective, IROS 2021让大模型参与运动失败推理Jiao et al., LLM3: Large Language Model-based Task and Motion Planning with Motion Failure Reasoning, IROS 2024家居场景数据集Deitke et al., ProcTHOR: Large-Scale Embodied AI Using Procedural Generation, NeurIPS 2022真机运动生成Sundaralingam et al., cuRobo: Parallelized Collision-Free Robot Motion Generation, ICRA 2023给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑