世界模型正在成为空间智能和物理AI的重要技术主线。真正的世界模型不应只是逐帧生成逼真的像素,还需要理解当前视角所处的物理世界朝向、场景的几何结构,并支持对世界的建模与连贯模拟。
在这一方向上,来自南洋理工大学S-Lab和大晓机器人等机构的研究团队近期发布了 Puffin-World。它让同一个模型同时理解物理方向、空间几何和视觉外观,进一步完成三维世界生成和重建,不依赖于任何外部模型。

项目主页:https://kangliao929.github.io/projects/puffin-world/
Hugging Face Blog:https://huggingface.co/blog/KangLiao/puffin-world
代码:https://github.com/KangLiao929/Puffin
模型:https://huggingface.co/ACERobotics/Puffin-World
Puffin-16M数据集:https://kangliao929.github.io/projects/puffin-16m/
为什么只生成像素还不够?
现在的世界模型已经能够生成非常逼真的图像和视频,但“看起来真实”并不等于“理解世界”。当相机发生大幅旋转、沿着较长轨迹运动,或参考视角存在重力不对齐时,模型可能并不知道真实世界中的“上方”在哪里,也无法显式掌握画面背后的三维结构。
这会带来一些常见问题:地平线逐渐漂移、物体方向发生变化,不同视角之间看似连贯,却没有共享同一个稳定的物理和几何坐标系。Puffin-World 的出发点,就是让世界模型从一开始便拥有这些信息,而不是事后再借助额外模型进行修正,因此可以在一套架构内原生构建可交互的真实世界。
三种原生 3D 世界状态
Puffin-World 将世界表示为三种彼此关联的原生状态:
- 物理状态:由重力场和纬度图组成,用来描述场景的直立方向、地平线位置,以及每条观察射线相对水平面的仰俯关系。它回答的是“相机或观测视角在真实世界中朝向哪里”。
- 几何状态:以深度为核心,显式表达可见画面背后的三维空间结构,并为多视角生成结果转换成三维重建提供桥梁。
- 外观状态:即 RGB 图像和连续视觉序列,描述观察者在不同位置和方向真正看到的内容。
这三种状态不是由多个独立系统分别处理,而是在同一个统一模型中共同学习和生成。因此,模型在生成新视角时,不仅要让画面自然,还要同时考虑相机绝对方向、空间结构和跨视角一致性。
从单张图像或文字提示出发,Puffin-World 可以生成受灵活相机控制的多视角外观,同时预测对应的几何信息,再把这些结果整合为可交互的三维场景。

Omni-Camera:用一套“相机语言”连接理解与生成
视觉模型中的相机表示通常可以分为两类。相对相机表示擅长描述两个视角之间如何移动,适合多视图几何与连续轨迹,但它缺少真实世界中的全局参照;绝对相机表示能够表达重力、直立方向和地平线,却不容易从单张图像中获得,也不便直接描述复杂的跨视角运动。
Puffin-World 提出的 Omni-Camera 将两者结合起来:一部分描述每个像素对应的绝对物理方向,另一部分描述射线起点和方向所构成的相对几何信息,同时告诉模型“当前视角在真实世界中如何朝向”,以及“它在连续轨迹中的位置和运动关系”。
因此,同一套相机表示可以支持单目 camera-to-world 理解、带相机控制的文生图、多视角图像生成、大尺度旋转、相机平移与复合运动,以及外观和几何的联合生成。

一个框架,完成三层统一
Puffin-World 的“统一”并不只意味着把多个任务放进同一个模型,而是体现在三个层面:
- 表征统一:RGB 图像与深度图共享统一的潜在空间,Omni-Camera 则同时描述绝对相机、相对运动、旋转和平移。模型仅需通过输入标记区分参考视角、目标视角、图像条件与几何视角。
- 模态统一:几何对齐的视觉编码器与大语言模型负责自回归理解;语言模型中的隐藏状态经过轻量连接模块后,又可以继续为扩散生成过程提供条件。理解与生成因此成为同一模型的两种输出,而不是两条互不相关的流水线。
- 任务统一:文本、目标相机、参考图像和输入标记的不同组合,对应不同任务。改变输入组合,同一框架就可以在物理世界感知、自由视点生成、三维世界生成和联合重建之间自由切换。
这种设计的关键价值是减少任务之间的信息断层。相机理解得到的物理信息可以直接用于后续生成,生成出的外观与深度也可以继续服务于三维重建和交互探索。
从一张图感知物理状态,并传播到未来视角
面对一张参考图像,Puffin-World 不只描述其中有什么,还会结合地平线、垂直结构、前景布局等整体线索,推断相机的 roll、pitch、垂直视场角以及场景语义。模型还能输出稠密的重力场和纬度图,为这张图建立一个相对于真实世界的绝对坐标参照。
但只在初始图像中理解重力还不够。当相机沿轨迹运动时,参考视角的物理状态也必须同步转换到每个新视角。为此,Puffin-World 根据已知的相对旋转传播初始重力方向,再为目标视角生成对应的重力场与纬度图。
直观地说,相对运动只告诉模型“相机怎样移动了”,而物理传播进一步告诉模型“移动后的相机在真实世界中朝向哪里”。因此,即使面对长轨迹、极端旋转或复合运动,整个生成序列也能保持在同一套重力和地平线参照下。
一个模型,可以完成哪些任务?
Puffin-World 将过去通常由不同系统完成的能力紧密结合到了一个框架中:
- 从单张图像估计相机的 roll、pitch 和视场角,理解观测视角相对真实世界的方向。
- 根据文字与指定相机参数,从任意视角生成图像。
- 从图像或文字出发,沿长轨迹、极端旋转和复合运动生成连贯的多视角世界。
- 联合生成外观与深度,并将多视角结果直接重建为三维场景。
- 在感知、动作和生成之间形成闭环,支持模仿式探索与自校准世界探索。
代表性结果
1. 从单张图像理解物理世界
在 Stanford2D3D、MegaDepth、TartanAir 和 LaMAR 四个基准上,Puffin-World 在 12/12 项相机参数中取得最佳中位误差结果,并在包含并列结果的 36 项 AUC 指标中领先 33 项。这说明随着统一多模态训练规模的扩大,单图相机估计可以从一个独立视觉任务,转化为可靠的多模态物理世界感知能力。
更重要的是,模型输出的不只是三个相机数字。稠密透视场会在整张图像上表达重力和纬度,使后续生成与空间建模都拥有明确的 camera-to-world 参照。

2. 自由视点空间模拟
给定文字提示和任意视角方向,Puffin-World 可以生成对应视点下的图像。与仅使用“俯拍”“向左移动”等文字控制的方法相比,显式相机条件能够更精确地指定视场角、相机方向和连续运动,同时尽量保持场景保真度与视觉质量。
当目标视角发生较大变化时,模型依然会遵循给定的相机姿态,并利用绝对物理状态避免画面在生成过程中失去方向感。与现有的专业级图像生成模型如GPT Image2和Nano Banana2相比,Puffin-World在空间模拟精度等指标上大幅领先。
3. 三维世界生成与重建
Puffin-World 同时支持 image-to-3D 与 text-to-3D,也能处理长轨迹、极端旋转和旋转加平移的复合运动。由于外观和深度在一个生成过程中协同产生,每个新视角既有 RGB 内容,也有对应的几何状态,可以进一步整合成三维点云。
这一过程不依赖额外的离线深度估计或重建模块。模型原生生成相互对齐的外观、物理与几何世界状态,从而把“生成看起来合理的新画面”和“构建能够被三维观察的可交互世界”连接起来。


Puffin-16M:为复杂相机运动扩展数据规模
现有相机和三维数据集往往偏向水平拍摄、较小的俯仰变化,以及以平移为主的采集方式。这种分布适合传统视觉任务,却不足以训练一个能够从任意方向探索世界的智能体。
为此,团队构建了 Puffin-16M,其中包括两个互补部分:
- Puffin-Cam-15M:包含 1,500 万组视觉—语言—相机数据,覆盖多种画幅比例、较大范围的 roll/pitch 和垂直视场角。文本标注不仅描述场景语义,也包含结构化的空间与物理推理信息。
- Puffin-Traj-1M:包含 100 万条连续相机轨迹,覆盖向上/向下观察、顺时针/逆时针旋转以及完整 360° 探索,重点补充传统数据中较少出现的长程和高难度运动。
团队还使用 Puffin-World 精准的物理世界感知能力为 28 个公开数据集(ImageNet, CC12M, GPIC, DL3DV, ScanNet等)补充绝对 roll、pitch 和垂直视场角标注,覆盖约 4,450 万张图像。这些数据跨越识别、检测、分割、姿态估计、生成式预训练和连续三维场景,可用于分析视角偏差、筛选相机多样的数据,并为现有数据引入空间和物理感知能力。
多任务协同:从单项能力走向闭环
当感知、推理、生成和重建需要连续交互时,统一模型的优势会更加明显。
在“模仿式世界探索”中,模型可以从共享的初始视角出发,让不同的三维世界沿同一条指定轨迹向外扩展。这要求模型先理解相机与物理世界的关系,再持续生成一致的新视角。
在“自校准世界探索”中,输入图像可能处于重力不对齐状态。Puffin-World 会先判断当前物理朝向,预测用于纠正姿态的相机动作,再生成校准后的目标观察。也就是说,感知、动作决策与生成在同一个模型中构成了早期闭环,而不需要额外串联校准器和生成器。
这类能力为交互式三维环境、虚拟现实、具身智能以及进一步的 World-Action Model 提供了想象空间。
当前边界与下一步
Puffin-World 目前主要面向静态场景,物理世界状态也集中在重力和纬度。未来仍需要进一步扩展到动态环境、更长时间范围、更复杂的物体交互,以及更加丰富的物理属性。
值得一提的是,Puffin-World与World Labs 近期发布的 Atlas 共享一套“不谋而合”的技术路线:将文本、图像、相机位姿和深度纳入统一的多模态自回归扩散框架,让同一个模型覆盖可控生成、空间重建和世界模拟。两者都把显式相机控制与三维几何从外部工具提升为世界模型的原生组成,体现了世界模型从“生成外观”走向“建模物理可信空间”的重要趋势。
目前,Puffin-World的论文、代码、模型和数据集均已公开。欢迎关注、体验和分享,也期待它为多模态空间智能与物理 AI 的研究带来更多可能。