资讯详情

自演化代码智能体:从数字程序到物理世界智能

📅 2026/10/5 2:30:52 | 华诺云谱 👁 阅读
自演化代码智能体:从数字程序到物理世界智能
26年9月来自六角未来 HexaFuture AI公司的论文“Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence”。这是一篇有价值的系统框架与初步实证论文。它较有说服力地展示了“显式状态管理验证恢复”能改善机器人任务执行但对“持续自主进化”和“物理智能内化”的证明仍不充分。一、论文的核心要点作者关注的问题是机器人即使具备不错的抓取、放置能力也可能在多步骤任务中忘记子目标、错误判断完成状态或在失败后反复执行无效动作。论文提出 Physical Coding用两类相互关联的程序组织物理任务闭环是观察 → 更新世界状态 → 调用动作工具 → 根据新证据验证 → 继续、恢复或停止。VLA/WAM 在其中仍然重要但主要充当动作工具。上层框架管理任务逻辑并把执行经验保存为可复用程序、记忆或训练数据。“自进化”发生在下一层依据失败记录修改工具和流程或利用验证过的轨迹训练新模型候选更新经过独立评估后才被保留。如图 1 所示“物理编码”Physical Coding通过一种显式的可执行接口将人工智能引入物理世界。“代码即世界”Code as World表征了与任务相关的对象、关系、观测、约束及进度谓词而“代码即策略”Code as Policy则统筹规划、工具调用、动作执行、验证及恢复等环节。二者共同构成了智能体与物理环境交互的核心接口并积累了可复用的产物从而实现持续改进。二、方法贡献哪些地方真正有价值将状态、动作和证据放进同一套可检查接口。“让语言模型写机器人代码”已有明确先例例如 Code as Policies。因此本文的主要新意应落在把世界状态、验证条件、恢复流程和跨回合更新系统地连接起来。尤其有价值的是记录“这个判断依据哪次观察、发生在什么条件下”。这让失败有机会被定位到感知、状态更新、工具执行或任务规划而不仅是得到一个最终失败标签。但这里的 Code as World 主要是任务相关状态与证据的表示还不能等同于能预测任意物理过程的动力学世界模型。把“动作结束”与“任务完成”明确分开。系统允许验证器返回通过、失败、证据不足、受阻、安全停止等状态。低层工具返回“执行完毕”并不意味着食材确实放进了容器。这种设计适合多步骤任务尽早发现局部失败通常比在最后重新开始整项任务更有效。为不同层面的改进提供归因框架。论文明确区分工具或流程变好数据积累更多模型权重更新后能力变强换到真实环境仍然有效。这一点很重要。作者也承认更好的运行框架不能直接被算作模型学习更换评估器后的高分不能直接算作泛化。将机器人操作扩展到有测量依据的实验任务。PhyBench 要求机器人操作装置、记录读数、拟合参数并提交结论。其价值在于把“动作是否完成”扩展为“结论是否有证据支持”。不过这些任务是已知物理规律下的参数估计尚未涉及未知机制发现。如图 3 所示物理编码Physical Coding将世界状态、策略执行与证据相互关联。物理观测和工具输出被转化为“代码即世界”Code as World形式用以表征与任务相关的对象、关系、度量、约束及进度谓词。“代码即策略”Code as Policy利用这一表征来组织规划、工具调用、动作执行、验证及恢复流程。执行过程产生新的观测结果以更新世界表征同时基于最新证据进行的验证则决定了后续是继续执行、重新观测、执行恢复操作还是终止任务。如图 4 所示物理层面的自我演化。“代码即世界”与“代码即策略”理念提供一个跨越四大目标即控制框架、数据与环境、模型与算法、具身形态与算力的共享且可演化的接口。执行过程中的实证数据指导候选修改方案的生成独立的评估机制决定采纳或回滚而经由验证的记录则为后续的学习与优化提供支撑。如图 5 所示任务输入引导一个物理世界模型该模型生成用于 Harness “观察-规划-行动-验证-恢复”Observer–Plan–Act–Verify–Recover循环的世界代码与策略代码。动作与模拟或物理环境进行交互而经由验证的执行轨迹则提供训练数据并推动模型、Harness 及环境的后续改进。三、实验结果实际支持到什么程度这里有一个容易误读的地方PhyBench 的“有效运行”不等于“达到精度门槛的成功运行”。论文允许误差超标但流程有效的运行进入误差统计而且平均误差只统计有效运行。因此不能把“30/30 有效”直接理解成“30/30 全部达标”。见第22页、表6。四、主要不足与值得质疑之处对 VLA 局限的诊断强于实验所能证明的范围。论文发现在 LIBERO 中去掉语言指令后成功率仍有92.3%有指令时为96.2%。这很好地说明该评测可能允许模型通过场景猜任务。但由此还不能直接推出“VLA 架构本身无法理解指令”或“增加数据和规模无法解决问题”。要检验这一点应固定初始场景只改变相互冲突的指令观察动作是否随语言正确改变。缺少组件消融尚不清楚增益来自哪里。当前整体对比同时引入了任务分解、状态记忆、验证、重试、恢复和更强规划器。缺少以下关键拆分仅增加任务分解能提高多少在分解基础上增加验证能提高多少用自然语言状态记录替代代码表示效果是否下降简单状态机加相同工具是否也能获得接近的结果所以现有结果支持整套系统有效却还不足以说明其关键表示方式具有不可替代性。可执行表示并不自动保证物理事实正确。如果感知把烤箱外的食物误记为“在烤箱内”代码中的条件判断仍可能顺利通过。这里必须区分程序逻辑是否一致状态记录是否符合真实世界。论文强调独立验证但没有充分量化验证器的误报率、漏报率以及它与规划器是否会产生相关错误。把错误写成结构化状态可以让错误更容易检查却不会自动消除错误。模型“内化能力”的证据仍弱。HexaModel 的训练混合了执行轨迹、具身问答、场景描述以及数学、代码和指令数据Harness 返回的数据约占训练 token 的38.8%。因此总体提升1.2个百分点尚不能单独归因于验证和恢复轨迹。论文也没有充分展示等量通用数据微调的对照去除恢复轨迹或验证信息后的变化减少 Harness 辅助后是否仍保持优势训练轨迹与评估任务、场景、种子的具体隔离方式。缺少多训练种子及配对统计也使小幅优势的稳定性难以判断。“自主进化”实际包含显著人工参与。工具进化中独立编程代理修改工具操作员选择抓取像素折衣服的早期开发还使用过与评估同源的关键点信息。作者随后补做无特权信息复评这种披露值得肯定但最终留出测试也只有五个种子。真实机器人投掷工具的迭代还包含人工示范和人工判断。因此更准确的定位是人参与的代理辅助工具迭代以及初步的数据—模型反馈。尚未展示长期、多轮、低人工干预且持续改善的完整闭环。真实部署与科学实验的外推空间有限。真实机器人每项仅三次试验速度对比来自不同硬件和运行约束首个拧瓶盖试验还排除了初始诊断修复阶段。因此不能将这些数字直接解释为同条件效率优势。PhyBench 只有三个仿真实验也缺少其他框架的同条件基线。它证明了端到端流程可行尚未证明对真实仪器噪声、模型失配和开放科学问题的适应能力。此外软件版本可以回滚已经造成的物理后果通常不能回滚。真实部署还需要独立于高层代码的动作约束与恢复机制。五、下一步方向作者提出的远期方向包括模型权重、表示语言、架构、环境乃至硬件共同进化。先收紧问题将下面三件事做扎实。其中最值得单独发展成下一篇方法论文的切口是“带不确定性和证据时效性的 Code as World”世界状态不只保存“真假”还保存置信程度、观察时间、适用条件和矛盾证据验证器据此决定是否必须补充观察策略进一步选择最能消除不确定性的相机视角或测量动作。这样就能把当前偏工程组织的框架推进到一个明确的研究问题在部分可观测的物理环境中机器人应何时相信已有状态何时花成本重新获取证据
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑