1. 首页
  2. 精选文章
  3. 谈论 World Model,请先对齐你的坐标!World Model 的四个象限

谈论 World Model,请先对齐你的坐标!World Model 的四个象限

  • 发布于 2026-08-02
  • ·
  • 25 次阅读
  • ·
  • ·

作者:Naiyan Wang
https://zhuanlan.zhihu.com/p/2066565953501009575

Gemini_Generated_Image_6cfcw16cfcw16cfc.png

上一篇文章中,我们探讨了 Physical AI(物理世界 AI)想要在真实环境中运转,必须具备三大核心能力:理解世界(表征)、预测世界(世界模型)以及改造世界(强化学习决策)。

文章发出后,我收到了很多同行的反馈,其中大家火力最集中、讨论最激烈的就是中间那层——世界模型(World Model)

现在市面上的名词极其混乱:有讲文生视频 Sora 的,有讲 Google Genie 的,有讲 Model-based RL 的。

热闹归热闹,但在交流中我发现了一个致命的问题:大家嘴里的 “World Model” 指的根本不是同一个东西。 讨论常常陷入概念错位的泥沼,最后变成无效沟通。

在内部团队的技术推演中,我一直使用一个 2×2 的坐标系框架来切分这件事。今天把这套思考框架写出来,作为上一篇文章在“预测世界”这一板块的深度延续。希望能帮大家理清当前繁杂的技术术语,顺带聊聊我在这套框架里留下的几个 Open Question。

一、 先把探讨的底座讲清楚:POMDP 循环

只要你的系统要跟真实物理世界打交道,就绝对绕不开最经典的 POMDP(部分可观测马尔可夫决策过程)闭环:

Agent 从环境中获取 Observation(观测),内部维护对 State(状态)的估计,输出 Action(动作) 反作用于环境;环境按照物理规律演化到下一个 State,再产生新的 Observation。

在这个回路里,严格意义上的 “World Model” 必须是能够建模 State × Action → Next State 映射关系的引擎。

注意,这里的变量 Action 是生死攸关的门槛。如果一个模型只建模 State → Next State,它顶多叫“视频演化预测器”。没有干预变量(Action)的模型,是无法指导智能体去“改造世界”的。 有了这个底座,我们就可以拉出我们的 2×2 坐标轴了。

二、 两个正交轴:到底切开了什么本质?

对于 World Model 的用法,我用两个维度进行切分:

轴一:离线 (Offline) vs 在线 (Online)

这个轴切的核心是:“模型究竟是在训练端(Training)还是推理端(Inference)发挥作用?” 这直接决定了系统的算力预算与架构约束:

  • 离线(属于训练端): WM 仅作为训练期的数据供给方或仿真底座。Agent 在真车/真机部署(推理阶段)时并不携带它。在这个不与现实秒针赛跑的后方,算力可以尽情堆叠。
  • 在线(属于推理端): WM 随车/随端侧部署,直接被嵌入 Agent 极速运转的实战决策循环里。伴随每次 Inference被实时调用,受制于毫秒级的 Latency(延迟)和极度受限的端侧算力约束。

轴二:开环 (Open-loop) vs 闭环 (Closed-loop)

这个轴切开的是更底层的问题:策略或智能体(Policy/Agent)与环境(或充当环境的WM)之间,是否建立了连续的交互反馈?

  • 开环 (Open-loop): 交互链路是断裂的。WM 要么直接生成未来,要么只基于一个固定的Action生成一次。Policy 和 WM 之间没有形成完整的反馈闭环。
  • 闭环 (Closed-loop): 交互形成了咬合的齿轮。Policy 输出动作 -> WM 反馈下一个状态 -> Policy 基于该新状态再次输出动作。这种 State->Action->Next State->Action’ 的连贯循环,构成了真正的互动体系。

三、 从 L1 到 L4 的象限分野

两个维度交叉,我们得到了 Physical AI 语境下世界模型应用的四个象限(从 L1 到 L4):

开环 (Open-loop) 无多步交互反馈 闭环 (Closed-loop) 形成多步互动反馈
离线 (Offline) L1 传感器数据合成 (Sora, Seedance)
在线 (Online) L3 在线辅助作为动作条件 (DreamZero, LingBot-VA)

我们逐一拆解这四个象限在实际工程中的意义:

L1 (离线开环):感知模型的 Corner Case 提词器

代表是纯文生/图生视频大模型。它们的致命缺陷是不吃 Action,开环单向输出。这意味着L1 生成的数据无法用于策略动作的训练——你没法教 Agent “视频里这辆车究竟打了多少度方向盘才转的弯”。

因此,它在整个工程链路里最大的价值,仅仅是用于生成极端光影、罕见天气等视觉 Corner Case(长尾场景),专门用来做感知网络的数据增广。

L2 (离线闭环):Agent 的虚拟练兵场与评测基准

代表是 GAIA、Genie等 Action-conditioned 模型或强仿真环境。

由于引入了 Action 并能在训练端即时反馈,它成为了高并发的“闭环宇宙”。在这里无惧真车碰擦成本,Agent 可以进行海量动作探索。

更重要的一点是,像 Genesis 这样出色的通用物理仿真平台,除了用于策略预训练,它更为我们提供了一个极为关键的仿真验证与标准化评测(Benchmark)空间。在真机部署前,Agent 到底掌握了多少物理常识与复杂的交互能力?L2 就是我们检验真理的虚拟考场。

L3 (在线开环):被动接收信号的“系统1”

典型做法是将 WM 的推演结果,作为一个额外的条件接进 Policy 网络里。WM 在车端也在跑,但它不过是扮演了一个“高级的预测传感器”。

在在线范畴内,开环(L3)意味着 Policy 仍然没有脱离“系统1”的肌肉记忆。 它只是带着 WM 给出的关于未来的隐式 Hint(提示),然后直接“由条件出动作”。

模型并没有在脑海里完成多步假设与反馈,这属于一种没走到底的过渡形态。

L4 (在线闭环):激活“系统2”深度思考的终极形态

当交互闭环发生在线上推理期(Inference),整个系统便迎来了向“系统2(深入思考)”的跃迁。面对前所未见的复杂物理博弈,Policy 不再盲目直出,而是结合当前 State,利用在线 WM 快速展开多条假设性的 Action 轨迹(Rollouts)。

这就好比在极短的推理时间里,打通了一个微秒级的虚拟沙盒:系统不断前瞻推演不同动作的后果,并利用评估网络筛出价值最优的路线,最后才在现实中予以执行。

四、 在线闭环的两大命门:为什么大家都知道,却很难做?

在线闭环的蓝图宏伟,但要想走通这条路,必须同时跨越两座大山:

第一层壁垒

必须拥有极精准的 Value Function(价值函数)或 Progress Model Test-time Scaling 的核心是在脑海里“推演未来”

但即便你的 WM 精确预演了 10 种逼真的未来走势,你怎么知道哪一种是“最好的”? 这就必须依赖一个符合第一性原理、甚至比 WM 更犀利的打分裁判(Value Function 或进度评估模型)去对每一个结局给出严苛的分数。

没有这层精准的引导,你在微秒间算出来的闭环推演,只不过是陷入指数爆炸的无效算力而已。而这样的Value/Critic,恰恰是强化学习的自然产物,无需像模仿学习一样单独监督训练。

第二层壁垒

缺少 4D 时空表征基座(Semantic × 3D × Temporal),推演必然脱靶 如果底层不具备包含几何与连续动态帧的时序解构能力,送进 L4 引擎的初始状态就是不足的。

基于信息不足的表征去推演闭环的未来,注定是无法产出有意义的结果。

五、与李飞飞“三分类框架”的映射对比

最近,李飞飞教授提出了WM的 Renderer / Simulator / Planner 宏观架构。

如果将这套纯靠“输出模态”划分的框架,投射到这套讲究实战落地的 2×2 坐标系中,你会发现它们有着极其工整的完美映射关系:

  • Renderer(渲染器): 对应我的 L1 (离线开环)。它负责输出像素,不接收 Action 形成闭环,本质就是训练端的高维感知数据生成。
  • Simulator(模拟器): 对应我的 L2 (离线闭环)。它接收动作、演化物理状态,作为一个离线虚拟沙盒,是验证模型和策略在训练端拔高的“完美闭环练兵场”。
  • Planner(规划器): 贯穿了整个在线推理端(L3 & L4)。如果它仅仅是 Reflexive(本能反射型)直出动作,对应的便是 L3;如果它走向 Deliberating(深思发散型),在脑海中充分利用 WM 展开多步反事实推演,那就是通向终局的 L4 (在线闭环推演)。

这套体系在高度一致的同时,我们的 2×2 矩阵更加体系化地展现了WM在应用中的两个垂直维度。最后总结一句:谈论 World Model,请先对齐你的坐标

目录