资讯详情

不依赖任何外部模型!Puffin-World:一个世界模型统一物理、几何、外观三种原生状态

📅 2026/9/11 22:01:52 | 华诺云谱 👁 阅读
不依赖任何外部模型!Puffin-World:一个世界模型统一物理、几何、外观三种原生状态
「实现原生3D世界生成与重建」目录01 为什么只生成像素还不够02 三种原生 3D 世界状态03 Omni-Camera用一套“相机语言”连接理解与生成04 一个框架完成三层统一05 从一张图感知物理状态并传播到未来视角06 一个模型可以完成哪些任务07 代表性结果1. 从单张图像理解物理世界2. 自由视点空间模拟3. 三维世界生成与重建08 Puffin-16M为复杂相机运动扩展数据规模09 多任务协同从单项能力走向闭环10 当前边界与下一步世界模型正在成为空间智能和物理AI的重要技术主线。真正的世界模型不应只是逐帧生成逼真的像素还需要理解当前视角所处的物理世界朝向、场景的几何结构并支持对世界的建模与连贯模拟。在这一方向上来自南洋理工大学S-Lab和大晓机器人等机构的研究团队近期发布了 Puffin-World。它让同一个模型同时理解物理方向、空间几何和视觉外观进一步完成三维世界生成和重建不依赖于任何外部模型。01 为什么只生成像素还不够现在的世界模型已经能够生成非常逼真的图像和视频但“看起来真实”并不等于“理解世界”。当相机发生大幅旋转、沿着较长轨迹运动或参考视角存在重力不对齐时模型可能并不知道真实世界中的“上方”在哪里也无法显式掌握画面背后的三维结构。这会带来一些常见问题地平线逐渐漂移、物体方向发生变化不同视角之间看似连贯却没有共享同一个稳定的物理和几何坐标系。Puffin-World 的出发点就是让世界模型从一开始便拥有这些信息而不是事后再借助额外模型进行修正因此可以在一套架构内原生构建可交互的真实世界。02 三种原生 3D 世界状态Puffin-World 将世界表示为三种彼此关联的原生状态物理状态由重力场和纬度图组成用来描述场景的直立方向、地平线位置以及每条观察射线相对水平面的仰俯关系。它回答的是“相机或观测视角在真实世界中朝向哪里”。几何状态以深度为核心显式表达可见画面背后的三维空间结构并为多视角生成结果转换成三维重建提供桥梁。外观状态即 RGB 图像和连续视觉序列描述观察者在不同位置和方向真正看到的内容。这三种状态不是由多个独立系统分别处理而是在同一个统一模型中共同学习和生成。因此模型在生成新视角时不仅要让画面自然还要同时考虑相机绝对方向、空间结构和跨视角一致性。从单张图像或文字提示出发Puffin-World 可以生成受灵活相机控制的多视角外观同时预测对应的几何信息再把这些结果整合为可交互的三维场景。图 | Puffin-World 的物理、几何和外观世界状态03 Omni-Camera用一套“相机语言”连接理解与生成视觉模型中的相机表示通常可以分为两类。相对相机表示擅长描述两个视角之间如何移动适合多视图几何与连续轨迹但它缺少真实世界中的全局参照绝对相机表示能够表达重力、直立方向和地平线却不容易从单张图像中获得也不便直接描述复杂的跨视角运动。Puffin-World 提出的 Omni-Camera 将两者结合起来一部分描述每个像素对应的绝对物理方向另一部分描述射线起点和方向所构成的相对几何信息同时告诉模型“当前视角在真实世界中如何朝向”以及“它在连续轨迹中的位置和运动关系”。因此同一套相机表示可以支持单目 camera-to-world 理解、带相机控制的文生图、多视角图像生成、大尺度旋转、相机平移与复合运动以及外观和几何的联合生成。图 | Puffin-World 统一模型框架04 一个框架完成三层统一Puffin-World 的“统一”并不只意味着把多个任务放进同一个模型而是体现在三个层面表征统一RGB 图像与深度图共享统一的潜在空间Omni-Camera 则同时描述绝对相机、相对运动、旋转和平移。模型仅需通过输入标记区分参考视角、目标视角、图像条件与几何视角。模态统一几何对齐的视觉编码器与大语言模型负责自回归理解语言模型中的隐藏状态经过轻量连接模块后又可以继续为扩散生成过程提供条件。理解与生成因此成为同一模型的两种输出而不是两条互不相关的流水线。任务统一文本、目标相机、参考图像和输入标记的不同组合对应不同任务。改变输入组合同一框架就可以在物理世界感知、自由视点生成、三维世界生成和联合重建之间自由切换。这种设计的关键价值是减少任务之间的信息断层。相机理解得到的物理信息可以直接用于后续生成生成出的外观与深度也可以继续服务于三维重建和交互探索。05 从一张图感知物理状态并传播到未来视角面对一张参考图像Puffin-World 不只描述其中有什么还会结合地平线、垂直结构、前景布局等整体线索推断相机的 roll、pitch、垂直视场角以及场景语义。模型还能输出稠密的重力场和纬度图为这张图建立一个相对于真实世界的绝对坐标参照。但只在初始图像中理解重力还不够。当相机沿轨迹运动时参考视角的物理状态也必须同步转换到每个新视角。为此Puffin-World 根据已知的相对旋转传播初始重力方向再为目标视角生成对应的重力场与纬度图。直观地说相对运动只告诉模型“相机怎样移动了”而物理传播进一步告诉模型“移动后的相机在真实世界中朝向哪里”。因此即使面对长轨迹、极端旋转或复合运动整个生成序列也能保持在同一套重力和地平线参照下。06 一个模型可以完成哪些任务Puffin-World 将过去通常由不同系统完成的能力紧密结合到了一个框架中从单张图像估计相机的 roll、pitch 和视场角理解观测视角相对真实世界的方向。根据文字与指定相机参数从任意视角生成图像。从图像或文字出发沿长轨迹、极端旋转和复合运动生成连贯的多视角世界。联合生成外观与深度并将多视角结果直接重建为三维场景。在感知、动作和生成之间形成闭环支持模仿式探索与自校准世界探索。07 代表性结果1. 从单张图像理解物理世界在 Stanford2D3D、MegaDepth、TartanAir 和 LaMAR 四个基准上Puffin-World 在 12/12 项相机参数中取得最佳中位误差结果并在包含并列结果的 36 项 AUC 指标中领先 33 项。这说明随着统一多模态训练规模的扩大单图相机估计可以从一个独立视觉任务转化为可靠的多模态物理世界感知能力。更重要的是模型输出的不只是三个相机数字。稠密透视场会在整张图像上表达重力和纬度使后续生成与空间建模都拥有明确的 camera-to-world 参照。图 | 从单张图像理解相机与物理世界的关系2. 自由视点空间模拟给定文字提示和任意视角方向Puffin-World 可以生成对应视点下的图像。与仅使用“俯拍”“向左移动”等文字控制的方法相比显式相机条件能够更精确地指定视场角、相机方向和连续运动同时尽量保持场景保真度与视觉质量。当目标视角发生较大变化时模型依然会遵循给定的相机姿态并利用绝对物理状态避免画面在生成过程中失去方向感。与现有的专业级图像生成模型如GPT Image2和Nano Banana2相比Puffin-World在空间模拟精度等指标上大幅领先。3. 三维世界生成与重建Puffin-World 同时支持 image-to-3D 与 text-to-3D也能处理长轨迹、极端旋转和旋转加平移的复合运动。由于外观和深度在一个生成过程中协同产生每个新视角既有 RGB 内容也有对应的几何状态可以进一步整合成三维点云。这一过程不依赖额外的离线深度估计或重建模块。模型原生生成相互对齐的外观、物理与几何世界状态从而把“生成看起来合理的新画面”和“构建能够被三维观察的可交互世界”连接起来。图 | 三维世界生成图 | 三维世界建模08 Puffin-16M为复杂相机运动扩展数据规模现有相机和三维数据集往往偏向水平拍摄、较小的俯仰变化以及以平移为主的采集方式。这种分布适合传统视觉任务却不足以训练一个能够从任意方向探索世界的智能体。为此团队构建了 Puffin-16M其中包括两个互补部分Puffin-Cam-15M包含 1,500 万组视觉—语言—相机数据覆盖多种画幅比例、较大范围的 roll/pitch 和垂直视场角。文本标注不仅描述场景语义也包含结构化的空间与物理推理信息。Puffin-Traj-1M包含 100 万条连续相机轨迹覆盖向上/向下观察、顺时针/逆时针旋转以及完整 360° 探索重点补充传统数据中较少出现的长程和高难度运动。团队还使用 Puffin-World 精准的物理世界感知能力为 28 个公开数据集ImageNet, CC12M, GPIC, DL3DV, ScanNet等补充绝对 roll、pitch 和垂直视场角标注覆盖约 4,450 万张图像。这些数据跨越识别、检测、分割、姿态估计、生成式预训练和连续三维场景可用于分析视角偏差、筛选相机多样的数据并为现有数据引入空间和物理感知能力。09 多任务协同从单项能力走向闭环当感知、推理、生成和重建需要连续交互时统一模型的优势会更加明显。在“模仿式世界探索”中模型可以从共享的初始视角出发让不同的三维世界沿同一条指定轨迹向外扩展。这要求模型先理解相机与物理世界的关系再持续生成一致的新视角。在“自校准世界探索”中输入图像可能处于重力不对齐状态。Puffin-World 会先判断当前物理朝向预测用于纠正姿态的相机动作再生成校准后的目标观察。也就是说感知、动作决策与生成在同一个模型中构成了早期闭环而不需要额外串联校准器和生成器。这类能力为交互式三维环境、虚拟现实、具身智能以及进一步的 World-Action Model 提供了想象空间。10 当前边界与下一步Puffin-World 目前主要面向静态场景物理世界状态也集中在重力和纬度。未来仍需要进一步扩展到动态环境、更长时间范围、更复杂的物体交互以及更加丰富的物理属性。值得一提的是Puffin-World与World Labs 近期发布的 Atlas 共享一套“不谋而合”的技术路线将文本、图像、相机位姿和深度纳入统一的多模态自回归扩散框架让同一个模型覆盖可控生成、空间重建和世界模拟。两者都把显式相机控制与三维几何从外部工具提升为世界模型的原生组成体现了世界模型从“生成外观”走向“建模物理可信空间”的重要趋势。目前Puffin-World的论文、代码、模型和数据集均已公开。欢迎关注、体验和分享也期待它为多模态空间智能与物理 AI 的研究带来更多可能。项目资源项目主页https://kangliao929.github.io/projects/puffin-world/Hugging Face Bloghttps://huggingface.co/blog/KangLiao/puffin-world代码https://github.com/KangLiao929/Puffin模型https://huggingface.co/ACERobotics/Puffin-WorldPuffin-16M数据集https://kangliao929.github.io/projects/puffin-16m/
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。