1. 首页
  2. 精选文章
  3. 世界生成模型不仅仅是未来模拟器!上海交通大学最新提出 Enfold:把世界模型的“未来计算”折叠进当下

世界生成模型不仅仅是未来模拟器!上海交通大学最新提出 Enfold:把世界模型的“未来计算”折叠进当下

  • 发布于 2026-08-06
  • ·
  • 27 次阅读
  • ·
  • ·

作者:曾伟力,上海交通大学博士生

无需在每次决策时生成视频,也能让未来建模持续影响机器人的实时控制

世界模型让机器人拥有“想象未来”的能力,但如果每次动作预测都要完整运行一次视频生成,想象本身就会成为实时控制的负担。

来自上海交通大学和齐鲁工业大学(山东省科学院)的研究团队提出 Enfold:不再把世界生成模型仅仅当作一个需要反复调用的未来模拟器,而是把生成器构造未来时形成的多层内部计算,转化为一个能够从当前场景直接预测、同时服务控制与生成的表示。

由此,未来信息在训练阶段被“折叠”进当下,部署时则无需让生成器进入动作回路。

论文:Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control 
链接:https://arxiv.org/html/2607.26657v2
主页:https://zwl666666.github.io/enfold/
代码:https://github.com/zwl666666/enfold
作者:曾伟力、行义通(共同第一作者),刘福龙、杨成群、香安涛、田丰、高景南、蔡极松、王鑫、吴晓敏、穆尧、杨小康、晏轶超(通讯作者)。  
单位:上海交通大学、齐鲁工业大学(山东省科学院)。 
日期:2026 年 8 月
一图速览 结果
LIBERO 平均成功率 97.8%
Enfold 动作块延迟 134 ms(Fast-WAM 的 3.7× 速度)
Enfold-Flash 动作块延迟 49 ms(Fast-WAM 的 10.1× 速度)
真机 ID / OOD 平均完成分数 89.7% / 76.6%

一个被忽视的瓶颈:想象越频繁,控制越昂贵

具身智能面对的并不是静态识别问题。机器人需要判断:抓取之后物体会怎样移动,接触关系会怎样变化,一项长程任务接下来应当进入哪个阶段。

世界生成模型能够合成视觉未来,因此逐渐被引入“先想象、再行动”的控制流程;另一些方法则把视频预测与动作学习放进统一架构,或者复用生成分支的隐藏状态与缓存。

这些路线共同证明了未来建模的价值,但也留下了一个实际矛盾:视频生成器擅长组织长时序变化,却通常比动作头昂贵得多。

一旦它位于在线控制路径中,生成步数、缓存维护和模型规模都会直接转化为响应延迟。即使不输出最终视频,只要动作仍依赖正在运行的生成分支,生成式计算便没有真正离开控制回路。

不同世界模型控制接口的比较

图 1 世界模型与控制策略的几种典型接口。Enfold 的关键不是简单省去视频解码,而是把未来条件下的生成器计算迁移到一个只读取当前观测的独立表示中。

从接口角度看,现有方法大致可以分成以下几类:

路线 未来信息如何进入策略 部署时是否运行生成路径 主要特点或限制
未来像素/视频监督 编码器或策略预测未来画面 不一定 目标直观,但像素包含大量与动作无关的纹理和随机细节
Imagine-then-Act 先生成视觉未来,再据此预测动作 未来显式可解释,但生成成本进入每次决策
生成缓存或隐藏状态 动作头读取生成分支的中间结果 避免完整视频解码,但仍依赖在线生成计算
Fast-WAM 类联合架构 联合学习视频与动作,可跳过显式未来生成 已证明无需输出视频也能行动,但视频与动作仍在耦合架构中共同塑造特征
Enfold 当前编码器预测真实未来诱发的多层生成器状态 把生成器变成训练时教师,并形成与动作学习解耦、又可反馈给生成器的表示接口

因此,Enfold 关注的并不是“能否不生成视频”这一已经被部分工作回答的问题,而是一个更具体的问题:由真实未来诱发的生成器内部计算,能否监督一个只从当下推断、不会被动作损失重新塑造、并且仍能被生成器利用的预测表示?

核心洞见:不只学习未来“长什么样”,还要学习它是“如何被构造的”

为什么不直接预测未来像素、动作,或某个冻结图像编码器的未来特征?

动作标签只描述机器人做了什么,对物体状态、接触变化和场景演化提供的是间接监督。未来像素虽然信息完整,却把任务相关变化与光照、纹理、采样噪声混在一起。冻结图像编码器的特征更紧凑,但它首先为静态视觉语义而设计,不一定会主动组织长时域交互变化。

世界生成模型的内部状态处于两者之间:它们不是最终渲染出的像素,却参与了未来从噪声逐渐变成连贯轨迹的全过程。浅层状态更容易保留外观与局部几何,中间层逐步建立对象关系和运动结构,深层状态则更接近全局布局与交互结果。不同层级、不同生成扰动阶段的状态,因而提供了一组互补的预测目标。

生成器状态的任务信息与稳定性分析

图 2 生成器内部状态并非处处等价。任务可检索性、噪声敏感性和表示质量都会随网络深度与生成扰动阶段变化,不存在一个在所有条件下始终最优的单层。

预实验揭示了两个现象。

第一,生成器状态确实包含任务和未来变化信息;

第二,这些信息的有效性与稳定性会随深度和扰动水平迁移。

固定取某一层会丢失这种互补性。Enfold 因而预测多个生成器层级,并让预测头显式感知生成时间步,从而在同一表示中吸收局部外观、空间关系与长程交互结构。

这里还有一个更关键的学习机制:教师能看到真实发生的未来和生成噪声,学生却只能看到当前视觉上下文与语言指令。学生不可能逐项复制教师中的所有变化,只能学习在给定当前条件时稳定可预测的部分。

换言之,这种信息不对称并不是缺陷,而是一种筛选机制——由未来和噪声造成、却无法从当前判断的偶然成分会被压低;由当前状态和任务决定的转移结构则更容易保留下来。

在平方误差的理想化视角下,学生趋向于预测“给定当前上下文后,教师表示的条件期望”。论文采用的 Smooth L1 目标可理解为更稳健的条件中心估计。这一视角解释了为什么 Enfold 并不追求还原某一次随机生成,而是试图提取跨可能未来共享、又与当前决策有关的结构。

Enfold 如何把未来折叠进当前表示

Enfold 框架

图 3 Enfold 的双向耦合框架。训练时,真实未来诱发的多层生成器状态监督当前编码器;同一表示又可反向条件化生成器。部署时,动作路径只保留预测编码器和动作头。

Enfold 的训练过程可以概括为四个相互配合的环节:

  1. Generator-to-Representation(G2R)。 世界生成模型在教师强制条件下处理真实未来,并暴露多个层级的隐藏状态;只观察当前场景与指令的编码器学习预测这些状态。
  2. Representation-to-Generator(R2G)。 预测表示经过梯度隔离后重新输入生成器,帮助其按需展开未来。这要求表示不仅对动作有用,也必须保留生成器能够理解的预测结构。
  3. 与任务梯度解耦。 动作头读取经过停止梯度处理的表示,任务损失不会反向把编码器改造成只迎合某一动作数据集的特征。表示由生成式预测目标塑造,控制则学习如何读取它。
  4. 部署时移除生成器。 在线控制只运行当前编码器和动作头。生成器仍参与训练,也可以在分析或可视化时按需调用,但不再为每一个动作块支付生成成本。

这也钉死了 Enfold 与 Fast-WAM 的区别。Fast-WAM 已经能够在推理时跳过显式未来视频,Enfold 的贡献并非再次证明这一点;二者真正不同的是表示从哪里来、由什么梯度塑造,以及它能否作为生成与控制之间的独立接口

比较维度 Fast-WAM Enfold
训练组织 视频预测与动作学习位于耦合的世界—动作架构中 教师生成器定义多层监督,独立编码器从当前上下文预测
表示接口 服务联合世界—动作学习 同一表示可被动作头读取,也可反馈给生成器
动作梯度是否塑造预测表示 与联合训练目标耦合 否,任务读出与表示学习通过停止梯度隔离
控制时是否生成视频
控制时是否执行世界生成器
方法核心 高效的联合视频—动作建模 将未来条件的生成器计算迁移为当前可推断的预测表示

结果一:不运行生成器,控制性能仍然成立

论文从单臂模拟、双臂模拟扩展到真实双臂操作。LIBERO 覆盖 4 个标准套件和 40 项任务;RoboTwin2.0 包含 50 项双臂任务,并同时测试干净场景与结构化随机场景;真机实验则在 AgileX 双臂平台上评估 4 项桌面操作。所有方法的延迟统一在 NVIDIA A100 40GB GPU 上测量。

LIBERO:主要收益不是再挤出零点几分,而是把延迟从生成尺度降到控制尺度

方法 参数量 动作块延迟 LIBERO 平均成功率 相对 Fast-WAM 速度
Fast-WAM 6B 基准 97.6% 1.0×
Enfold 3B 134 ms 97.8% 3.7×
Enfold-Flash 3B 49 ms 97.5% 10.1×

LIBERO 主结果

图 4 LIBERO 主结果。Enfold 在不使用具身预训练的设置下达到 97.8%,工程优化版本 Enfold-Flash 在 49 毫秒延迟下保持 97.5%。

LIBERO 上的强方法已经接近饱和,因此 97.8% 相对 97.6% 的差异不应被夸大。更重要的结果是:Enfold 用约一半参数量将延迟降至 134 毫秒,达到 Fast-WAM 的 3.7 倍速度;采用 TensorRT 算子优化的 Enfold-Flash 进一步降至 49 毫秒,达到 10.1 倍速度,而平均成功率仅比标准版低 0.3 个百分点。

在更强调长程、多阶段交互的 LIBERO-10 上,Enfold 达到 97.4%,比 Fast-WAM 高 2.2 个百分点。

标准版与 Flash 版分别说明了两层效率来源:前者来自表示接口本身——生成器不在控制路径中;后者来自部署层面的算子优化。低延迟并非孤立的工程数字,而意味着策略可以在相同时间预算内更频繁地重新读取环境、更新动作块。

RoboTwin2.0:跨越机器人形态后,表示接口仍然有效

方法 Clean Randomized 平均
Fast-WAM 91.88% 91.78% 91.83%
LingBot-VA 92.90% 91.50% 92.20%
Enfold 91.60% 91.94% 91.77%
Enfold-Flash 91.96% 92.08% 92.02%

RoboTwin2.0 主结果

图 5 RoboTwin2.0 主结果。Enfold-Flash 在随机化场景中达到 92.08%,综合平均为 92.02%。

Enfold-Flash 在随机化条件下取得 92.08%,平均为 92.02%。它与 Fast-WAM、LingBot-VA 的总体差距都很小,因此这组实验更适合支持“高效接口可以跨越单臂与双臂形态而不损失整体能力”,而不是作绝对排名声明。

尤其是 LingBot-VA 使用了具身预训练,而 Enfold 与 Fast-WAM 在该表设置中没有使用具身预训练,两类结果需要结合训练条件理解。

真实双臂:低延迟之外,还要看场景变化后的闭环表现

真机实验包括叠毛巾、整理桌面、舀取粉末和收纳盘子四项任务。训练集由 400 段示范构成;每个方法在每个任务和评估条件下执行 30 次独立 rollout,并以分阶段完成度计算归一化分数。OOD 设置改变物体外观、材料、对象集合或环境条件。

方法 ID 平均 OOD 平均
Motus 50.8% 38.0%
π0.5 86.1% 83.3%
Fast-WAM 77.8% 70.0%
Enfold 89.7% 76.6%
Enfold-Flash 85.0% 73.3%

真机任务与对应的 OOD 条件

图 6 四项真机任务及其对应的分布外变化。项目主页提供了常规、OOD 与执行中干预条件下的完整视频。

真机归一化完成分数

相较 Fast-WAM,Enfold 的 ID 平均分提高 11.9 个百分点,OOD 平均分提高 6.6 个百分点。其中,叠毛巾、舀取粉末和收纳盘子分别提高 18.9、15.5 和 13.3 个百分点,整理桌面持平。这说明效率改造没有把模型退化为只在模拟基准上有效的轻量策略。

与此同时,OOD 结果也给出了清晰边界:Enfold 的 76.6% 仍低于 π0.5 的 83.3%。换言之,Enfold 在当前训练协议下显著改善了世界模型路线的真实场景迁移,但更大规模具身预训练在强分布偏移下仍有优势。

结果二:场景被改变后,想象与动作会一起改变

成功率只能说明策略能完成任务,却不能判断它是在根据当前状态重规划,还是在近似复现训练轨迹。为此,研究人员在收纳盘子和叠毛巾的执行过程中人为改变环境,同时保持原始语言指令不变。

人工干预后的想象与动作

图 7 盘子位置或毛巾几何状态被人为改变后,模型重新编码当前场景;随后展开的视觉未来与实际动作同时转向新的有效操作。

在收纳盘子任务中,目标盘子被移动后,模型不再延续原来的末端轨迹,而是把夹爪重新引向盘子的新位置;在叠毛巾任务中,布料几何状态被打乱后,策略会重新建立接触并继续折叠。

更值得注意的是,按需生成的未来和真实执行的动作发生了协调变化:模型“想象”的后续场景并没有停留在干预前的世界,动作也没有沿旧轨迹强行推进。

这组现象支持一种克制但重要的判断:Enfold 学到的不是固定轨迹回放,而是以当前状态为条件的重规划。它体现了干预条件下的反事实一致性——当“现在”被替换为另一种可能状态时,模型会给出与新状态相容的未来和行动。但由于当前证据是定性的、干预类型也有限,它还不能等同于对一般因果反事实推理能力的完整证明。

结果三:双向耦合不是附加模块,而是表示成立的关键证据

多层生成器状态比动作、像素和单层状态更完整

研究团队保持后续动作学习协议不变,仅替换预测表示所使用的训练信号:

表示监督 Spatial Object Goal LIBERO-10 平均
未来像素 98.0 99.8 91.8 94.2 96.0
仅动作 97.6 99.6 92.8 89.6 94.9
单层生成器状态 96.8 99.8 94.0 94.6 96.3
多层生成器状态 97.0 100.0 96.8 97.4 97.8

未来像素在 Spatial 上仍领先 1.0 个百分点,说明细粒度空间外观并非在所有任务上都应被彻底舍弃。但多层状态在 Goal 与 LIBERO-10 上均比单层状态提高 2.8 个百分点,并取得最高平均分。

这与方法动机吻合:长程目标和多阶段操作需要同时保留局部几何、对象关系与任务进展,单一生成深度难以覆盖全部信息。

表示监督目标消融

同一个表示还能反向帮助生成未来

如果 Enfold 表示只是动作头的专用摘要,它未必能帮助世界生成模型。R2G 实验将该表示重新反馈给生成器,在相同视觉与语言条件下比较未来视频质量:

生成条件 PSNR ↑ SSIM ↑ LPIPS ↓
原始条件 25.92 0.885 0.0550
加入 Enfold 表示 27.27 0.902 0.0483

未来视频预测指标

PSNR 提高 1.35 dB,SSIM 提高 0.017,LPIPS 降低 12.2%。由于模型没有获得额外观测,这一提升不能归因于新增视觉信息;更合理的解释是,Enfold 将当前上下文重组为生成器更容易读取的预测结构。G2R 证明生成器能够教会当前编码器,R2G 则证明学生学到的表示仍与生成器的未来空间兼容。

表示里到底留下了什么

稳定并不等于坍缩:它过滤随机性,同时提高有效维度

任务性能并不能排除两个平凡解释:学生可能只是复制教师的随机扰动;或者它仍然只是一个静态视觉表示,未来监督并未真正改变其组织方式。论文通过噪声敏感性、任务检索与有效秩进行诊断。

表示稳定性、任务信息与有效秩

图 8 Enfold 对生成噪声更不敏感,却具有更高的有效秩和更强的任务可检索性;稳定性并非来自把所有输入压缩成相似特征。

诊断量 生成器内部状态 Enfold 表示 观察
对随机扰动的敏感度 0.157–0.208 0.020 低 7.9–10.4 倍
最高有效秩 10.7 31.8 Enfold 更高,而非坍缩
任务检索 mAP 0.486 表示保留可区分的任务结构

如果学生只是照搬教师,它应继承相近的噪声敏感性;如果稳定性来自特征坍缩,它的有效秩又应明显降低。实际结果恰好相反:表示对随机变化更稳定,同时覆盖更丰富的有效方向。这与前述“条件过滤”机制一致——不可从当前预测的教师扰动被抑制,可跨未来复用的结构被重新组织。

优势随时间增长,集中在真正发生变化的区域

论文进一步训练轻量探针,从当前表示预测未来图像特征,并与冻结 DINO 特征进行比较:

预测位置 未来时间 t=1 t=16 t=32
变化最明显的局部区域:余弦残差相对降低 4.6% 18.1% 18.2%
全局特征:余弦残差相对降低 略低于 DINO 14.0% 15.2%

未来变化探针

图 9 未来变化探针。Enfold 的优势主要落在机械臂、被操作物体和接触区域,并随着预测时间拉长而增强。

这一结果很有辨识力:如果 Enfold 只是一个普遍更强的当前图像编码器,它在最近一帧和全局区域也应全面占优;

事实上,对几乎尚未发生变化的 t=1 全局特征,它略逊于冻结 DINO。到 t=16 和 t=32,优势才明显扩大,并集中于场景中真正发生交互的区域。这个短时例外反而说明,表示被定向组织用于未来变化,而不是简单提升静态视觉描述。

从“看起来相似”转向“将要发生交互”

查询点交互相似性

图 10 查询点相似性可视化。冻结 DINO 更容易连接外观相近的区域;Enfold 除了关联机械臂自身,还会突出即将接触的物体与交互部位。

在真实场景和 LIBERO 中,以夹爪附近的特征作为查询,冻结 DINO 主要响应机械臂上外观相似的区域;Enfold 的高相似区域则进一步延伸到被操作物体和接触位置。这并不意味着单张可视化可以证明因果关系,但它与未来探针的定量结果相互印证:表示的相似性结构已经从纯外观邻近,部分转向了交互相关性。

为什么这不只是一项“加速工作”

Enfold 的效率结果很醒目,但它更深层的改变是重新定义了世界生成模型在具身系统中的角色:

  • 传统接口把生成器当作动作时模拟器,每次决策都要运行它;
  • Enfold 把生成器变成训练时的结构化教师,让它构造未来的方式沉淀到当前表示;
  • 这个表示既能被动作头低成本读取,也能在需要解释或分析时重新展开为视觉未来。

由此,模型不必在“具有未来意识”和“满足实时控制”之间二选一。未来建模仍然影响每次动作,但昂贵的生成过程不必在每次动作前重复发生。对于需要频繁闭环重规划的机器人而言,这种接口变化往往比单次前向的参数压缩更重要。

这一思路也可能超出机器人控制本身:当一个高成本生成模型已经学会如何组织复杂输出,下游任务未必需要不断请求完整生成结果,也可以学习其内部计算中可由当前条件预测的部分,再通过轻量接口服务检索、规划或交互。

实现与训练概览

论文将主要实现细节放在附录中。下表给出理解计算规模所需的关键信息:

项目 LIBERO 真机 RoboTwin2.0
预测视觉编码器 DINOv3 ViT-H+/16 DINOv3 ViT-H+/16 DINOv3 ViT-H+/16
世界生成模型 Cosmos-Predict 2.5 2B Cosmos-Predict 2.5 2B Cosmos-Predict 2.5 2B
视觉视角数 2 1 3
动作头层数 10 10 16
动作块长度 32 32 32
执行多少步后重规划 10 10 24
训练硬件 8× A100 40GB 8× A100 40GB 32× A100 40GB
训练时间 23 小时 44 小时 108 小时

所有模型使用 bf16 和 AdamW 训练。生成器只在训练与按需可视化时使用;控制延迟统计对应部署路径中的预测编码器与动作头。

边界与下一步

Enfold 给出了一条把生成式未来知识迁移到实时控制的可行路径,但论文也保留了几项明确边界:

1、 训练成本并未消失。 世界生成模型仍需要在训练阶段运行,Enfold 优化的是部署时的控制路径,而不是完全摆脱生成器。

2、 干预证据仍以定性为主。 想象与动作会随当前状态共同更新,但要声称一般性的反事实推理,还需要更系统的干预集合、可量化指标和因果对照。

3、 部分基准已接近饱和。 RoboTwin2.0 上多个强方法的平均差距不到半个百分点,后续应报告更多重复训练、置信区间,并使用更具区分度的长程任务。

4、 强 OOD 泛化仍有空间。 真机 OOD 中,Enfold 超过 Fast-WAM,但仍落后于使用更强具身预训练的 π0.5。扩大训练分布、结合大规模预训练和显式不确定性建模,是自然的下一步。

结语

世界模型的价值,未必只存在于它最终生成的那段视频里。生成器在构造未来时形成的内部计算,本身就是一种关于“接下来会怎样”的丰富监督。Enfold 将这种监督压缩进一个由当下直接推断的表示,让机器人在不反复运行生成器的前提下,仍能依据未来结构行动,并在场景改变后重新组织想象与控制。

这项工作的核心可以归结为一句话:不是让机器人每一步都重新生成未来,而是让未来的生成过程改变它理解当下的方式。

目录