1. 首页
  2. 精选文章
  3. VLA的OOD困境:不是模型不够大

VLA的OOD困境:不是模型不够大

  • 发布于 2026-07-19
  • ·
  • 67 次阅读
  • ·
  • ·

作者:原来ID可以这么长
https://zhuanlan.zhihu.com/p/2060361643851256385

核心要点速览

Vision-Language-Action(VLA)模型虽然在机器人操控任务中展现出强大的能力,但在面对分布外(Out-of-Distribution, OOD)场景时普遍存在性能崩溃问题。

这一问题源于VLA模型过度依赖训练数据中的虚假相关性(spurious correlations),而非真正理解物理因果机制,导致在未见物体、新环境背景、光照变化或不同机器人本体下性能急剧下降。

2024-2026年间,学术界和产业界从六大技术路线出发攻克这一难题:

(1)强化学习后训练(RL Post-Training),如RobustVLA、LaST-R1、TGRPO等,通过在线交互提升策略鲁棒性;
(2)World Action Model(WAM),如Cosmos-Policy、LingBot-VA,利用视频预测能力增强时空理解;
(3)分层架构与注意力机制优化,如Pelican-VLA的Bottleneck Tokens、PosA-VLA的姿态条件锚点注意力;
(4)失败感知学习,如AFIL框架从失败轨迹中自适应学习;
(5)Sim2Real迁移技术,包括域随机化、域自适应与RL微调的组合;
(6)预训练策略优化,如Qwen-VLA通过大规模视觉-语言预训练显著提升OOD泛化。

1. VLA模型OOD崩溃问题的本质与表现

1.1 什么是OOD崩溃

VLA(Vision-Language-Action)模型是近年来机器人领域最重要的技术范式之一,它将大规模视觉-语言模型(VLM)的语义理解与机器人动作生成能力相结合,实现了从视觉观测和自然语言指令到连续 motor actions 的端到端映射。

代表性模型包括Google的RT-1/RT-2、Physical Intelligence的π0/π0.5、Berkeley的OpenVLA、NVIDIA的GR00T系列等。这些模型在训练分布内(In-Distribution, ID)的任务上表现出色,能够完成多样化的操控任务。

然而,当部署到与训练环境存在差异的真实世界场景时,VLA模型常常出现灾难性的性能下降,这种现象被称为OOD崩溃

OOD崩溃的具体表现形式多样。视觉层面的分布偏移是最常见的情况,包括光照条件变化(如从明亮实验室到昏暗家庭环境)、背景纹理改变(如从纯色桌面到复杂花纹台面)、摄像头视角或参数变化(如焦距、角度改变)、以及传感器噪声引入的图像质量下降。

例如,研究表明,即使在LIBERO这样的标准化仿真基准上,当引入光照扰动时,经典VLA模型π0的成功率从94.2%骤降至85.0%,而当同时引入多种扰动时,总体成功率仅为53.6%。

语义层面的分布偏移涉及未见过的物体类别、新奇的物体几何形状或纹理、以及未曾遇到的语言指令变体。Physical Intelligence的评估显示,π0.5在处理OOD物体时的成功率从ID的98%下降到约50%,而未经多样化数据训练的基线模型甚至更低。

执行层面的分布偏移包括物体位置的显著变化、机器人初始姿态的改变、以及动作空间的扰动(如电机校准误差、通信干扰)。在华为与多伦多大学联合进行的鲁棒性研究中,π0在机器人初始姿态扰动下的成功率仅为6.0%,暴露了VLA模型对执行条件变化的极端敏感性。

1.2 OOD崩溃的根本原因分析

VLA模型OOD崩溃的根本原因在于其训练范式和行为机制存在结构性缺陷。当

前主流VLA模型的训练主要依赖于模仿学习(Imitation Learning),即通过**行为克隆(Behavioral Cloning)**从人类演示数据中学习从观测到动作的映射。这种训练方式虽然高效,但存在几个根本性问题。

虚假相关性依赖(Spurious Correlation Dependency)是最核心的机制性缺陷。由于行为克隆仅仅拟合了训练数据中的统计关联,VLA模型往往会学习到与任务成功相关但非因果的表面特征,而非真正理解操控任务的物理机制

例如,模型可能将特定背景颜色与抓取动作关联,而非真正理解物体的形状和 affordance。

当测试环境中的背景发生变化时,模型就会失效。这种机制被Xing et al.(2025)和Shi et al.(2025)等研究者明确指出:VLA模型依赖的是无关观测特征与动作之间的虚假相关性,而非实现鲁棒泛化所需的真正因果关系

数据覆盖不足(Inadequate Data Coverage) 是另一个根本约束。机器人演示数据的收集成本极高,任何数据集都无法覆盖真实世界中所有可能的物体、环境、光照和任务组合。

Open X-Embodiment数据集虽然包含了数百万条轨迹,但主要集中在实验室桌面环境中,环境多样性仍然有限。

DROID数据集虽然跨越564个场景,但绝大多数仍是标准化的桌面设置。这种数据分布的偏斜导致VLA模型在训练时就没有接触到足够的多样性,泛化能力自然受限。

训练目标函数的局限性也制约了泛化能力。标准的行为克隆目标函数(如均方误差或交叉熵)仅仅要求模型在训练数据上预测准确的actions,并没有显式地鼓励模型学习鲁棒的、因果的特征表示。

相比之下,强化学习(RL)通过与环境的交互和试错,能够学习到更鲁棒的策略,因为RL的优化目标直接关联到任务成功与否,而非仅仅是模仿演示动作。

1.3 OOD评估基准与指标体系

为了系统性地评估VLA模型的OOD鲁棒性,学术界近年来开发了多个标准化基准测试。

LIBERO-Plus由上海创智学院OpenMOSS团队发布,是单臂7自由度机器人的桌面操作基准,包含40项任务,覆盖7大扰动维度(物体摆放、相机视角、机器人初始姿态、语言指令、光照条件、背景贴图、传感器噪声)、21项子类和5个难度等级。

RoboTwin 2.0-Plus由华为开发,针对双臂Aloha-Agilex机器人设置,采用类似的扰动协议评估VLA在双臂协作任务中的鲁棒性。这些基准使得不同模型之间的鲁棒性比较成为可能。

评估指标通常包括:ID成功率(训练分布内的任务完成率)、OOD成功率(特定扰动条件下的任务完成率)、总体成功率(所有扰动条件下的平均完成率)、性能下降率(OOD与ID成功率的相对差异)。

此外,一些研究还引入了更细粒度的指标,如视觉泛化(Vision)、语义泛化(Semantic)和执行泛化(Execution)的分离评估。

在Physical Intelligence的π0.5评估中,研究者特别关注了语言跟随率(Language Following Rate),即机器人行为正确遵循用户指令的比例,以及OOD成功率,即在未见过的物体和场景下的任务完成率。

这些多维度的评估体系为全面理解VLA模型的泛化能力提供了框架。

基准测试 机器人平台 任务数量 扰动维度 主要评估指标
LIBERO-Plus 单臂Franka (7-DoF) 40项桌面任务 7维:物体摆放、相机视角、机器人姿态、语言、光照、背景、噪声 ID/OOD成功率、总体成功率
RoboTwin 2.0-Plus 双臂Aloha-Agilex 50项双臂任务 7维:相机、机器人、语言、光照、背景、噪声、布局 ID/OOD成功率、性能下降率
COLOSSEUM RLBench扩展 多项任务 12维:纹理、颜色、大小、背景、光照、干扰物、相机姿态等 平均成功率、逐维度成功率
SimplerEnv 仿真环境 多种任务 任务类型、颜色推理、空间关系 平均成功率、指令跟随率
DOMINO 动态操作 动态任务 动态物体、物理交互 成功率、操控得分
AGNOSTOS 跨任务评估 23项未见任务 任务组合、新物体、新动作基元 零样本成功率

表1:主要VLA OOD评估基准对比

2. 学术界的解决方案:六大技术路线

2.1 强化学习后训练(RL Post-Training)

2.1.1 RobustVLA:鲁棒性感知的轻量RL方法

RobustVLA是专门针对VLA模型OOD脆弱性提出的轻量级在线RL后训练方法。该方法的核心洞见是:现有的RL后训练方法主要强调奖励最大化,而忽视了对环境不确定性的鲁棒性

RobustVLA通过系统的鲁棒性分析,识别出两个关键的正则化项:Jacobian正则化和**平滑性正则化,**如下:

  • Jacobian正则化通过约束策略输出对观测输入的敏感度,降低模型对观测噪声的敏感性。具体而言,该方法惩罚策略Jacobian矩阵的Frobenius范数,使得输入的微小变化不会导致输出的剧烈变化。
  • 平滑性正则化则通过在动作扰动下稳定策略,确保动作序列的连贯性和稳定性。

在ManiSkill3和LIBERO基准上的广泛实验表明,RobustVLA在多种OOD视觉偏移(未见干扰物、纹理变化、目标姿态变化、视角偏移、光照条件变化)下,相较于标准PPO微调,在π0.5上平均提升16.62%的成功率,在OpenVLA上平均提升9.1%。

在真实世界实验中,RobustVLA在Franka Research 3机器人上超出最佳基线65.6%的成功率,展示了在稀缺演示数据下的强大鲁棒性。

2.1.2 LaST-R1:自适应物理潜推理增强

LaST-R1提出了一种通过自适应物理潜推理(Adaptive Physical Latent Reasoning)来增强VLA模型的方法。该

方法的核心创新在于引入了潜推理空间,使VLA模型能够在动作预测之前进行多步物理推理。与标准的Action-Only + PPO基线相比,LaST-R1在LIBERO的四个任务套件上均展现出持续的OOD性能提升,而基线的OOD性能则停滞甚至退化。

在真实世界评估中,当面对未见物体时,完整的SFT基线π0.5遭受了高达45%的性能下降,而LaST-R1(Few-shot SFT → RL)将性能下降控制在15%以内,对于背景和光照变化则实现了接近零的性能退化。

这一结果表明,通过环境反馈优化潜推理能力,能够从根本上增强VLA对环境不确定性的抵御能力。

2.1.3 TGRPO:轨迹级组相对策略优化

TGRPO(Trajectory-based Group Relative Policy Optimization)是为VLA模型设计的在线RL训练框架,专门针对长程机器人任务中的稀疏奖励、高方差和不稳定优化问题。

TGRPO的核心创新包括:LLM自动生成密集奖励函数,利用大语言模型的任务分析能力自动构建细粒度的奖励函数,提供逐步反馈以加速收敛和改善信用分配;

基于组的轨迹采样与归一化策略,并行采样多条轨迹,通过相对比较降低方差;轨迹级与步骤级优势估计的集成,同时捕捉全局和局部优化信号,无需依赖价值网络。

在LIBERO基准的四个任务类别上,TGRPO平均成功率达到80.7%,比SFT高4.2%,且优于其他代表性RL后训练方法。

2.1.4 πRL:流式VLA模型的RL优化

πRL)是首个为流式(Flow-based)VLA模型设计的完整开源RL优化解决方案。流式模型(如π0、π0.5)因其迭代去噪过程而天然难以与RL框架兼容。

πRL通过两种算法——Flow-NoiseFlow-SDE——证明无需改造模型本身,而是通过对迭代去噪过程进行针对性建模(如将其建模为MDP),即可实现与RL框架的兼容。

πRL的核心结论是:”少样本SFT + RL”是性价比最优的路径——仅用少量专家数据进行SFT初始化,再通过RL进行在线优化,其性能可以超越全量SFT

然而,πRL也坦诚指出当前模型在语义新颖性等OOD场景下的性能提升仍然有限,未来需要探索如何将RL与VLM的预训练知识更深度地融合。

2.1.5 PAIR-VLA:视觉鲁棒的RL微调框架

**PAIR-VLA提出了一种视觉鲁棒的RL微调框架,将VLA的视觉泛化问题重新表述为行为级指导(behavior-level guidance)**问题。该框架包含两个核心目标:

  • 不变性目标(Invariance Objective) 确保在任务保持不变的视觉变化下(如背景改变)动作分布稳定;
  • 敏感性目标(Sensitivity Objective) 鼓励在任务相关场景状态变化时(如目标物体移动)采取适应性动作。

这种”该忽略什么、该反应什么”的框架通过成对的视觉变体实现,仅应用于RL微调阶段,不改变部署策略和推理成本。在ManiSkill3的OpenVLA和π0.5上,该方法在多样化视觉偏移下一致地超越标准PPO微调。

2.1.6 RL带来的泛化提升机制分析

一项由多个机构联合进行的实证研究(”What Can RL Bring to VLA Generalization?“,2025年5月)系统分析了RL为何能提升VLA泛化能力。

研究发现:在同等数据量下,RL在OOD场景下的表现明显优于SFT——RL在约0.4M环境步后超越最强的SFT检查点(SFT-16k),在收敛时OOD性能高出42.6%。

RL的优势主要体现在语义泛化(对新物体理解更好)和执行泛化(对新位置、新初始姿态更鲁棒),而在视觉泛化方面优势不明显。研究者假设RL通过试错学习到了不依赖物体类型的”抓取”技能,从而提升了泛化能力。

这一发现与多样性探索假设一致:RL中的探索产生了大量非高质量的多样化数据,这种多样性本身就有助于提升泛化。

2.2 World Action Model(WAM)路线

2.2.1 WAM vs VLA:范式之争

World Action Model(WAM) 是近年来与VLA并行发展的另一重要技术范式。

与VLA直接使用VLM骨干将视觉-语言映射到动作不同,WAM基于视频生成模型(如视频扩散模型)构建,先学习预测未来状态,再基于预测生成动作

WAM的支持者认为,通过在大量互联网视频上预训练获得的时空先验,使WAM具备更强的物理理解和泛化能力。

2026年3月,华为与多伦多大学联合发表的论文”Do World Action Models Generalize Better Than VLAs? 首次对这两种范式进行了系统性的鲁棒性比较。

研究在LIBERO-Plus和RoboTwin 2.0-Plus基准上评估了10种VLA和WAM模型。结果显示:WAM在噪声、光照和布局扰动上通常表现出更强的鲁棒性

例如,在RoboTwin 2.0-Plus上,领先的WAM(LingBot-VA)总体成功率为74.2%,显著高于π0.5的58.6%。

研究者将此归因于WAM的”生成”特性——基于扩散的骨干网络本质上就是为去噪和图像重建而设计的,当接收到嘈杂或光线不足的图像时,其内部世界模型可以根据数百万清晰视频的预训练经验,通过预测场景”应该”是什么样子来有效”清理”信号。

然而,研究也发现WAM在相机视角和机器人初始姿态扰动下表现不佳,表明视频先验在场景几何配置改变时提供的帮助有限。

此外,WAM的推理速度是重大挑战——最慢的WAM比π0.5慢至少4.8倍。

模型类别 代表模型 LIBERO-Plus总体 RoboTwin 2.0-Plus总体 推理速度(vs π0.5)
经典VLA π0.5 85.7% 58.6% 1x (baseline)
VLA OpenVLA-OFT_m 67.9% - ~3-10x slower
VLA VLA-JEPA 77.9% - -
VLA ABot-M0 80.5% - -
VLA GE-Act (hybrid) 80.3% - -
WAM Cosmos-Policy 82.2% - >4.8x slower
WAM LingBot-VA - 74.2% >4.8x slower
WAM GE-Act 80.3% - -
Hybrid MOTUS - 71.5% (2nd best) -

表2:VLA与WAM在OOD鲁棒性基准上的对比(数据来源:华为与多伦多大学联合研究)

2.2.2 MV-WAM:流形感知的世界动作模型

MV-WAM提出了一种流形感知(Manifold-Aware)的WAM设计,旨在解决现有WAM中”更深的视频-动作耦合并未转化为更大动作泛化”的问题

MV-WAM基于Mixture-of-Transformers(MoT)架构,联合生成视觉预测、机器人动作和价值估计。其核心创新包括:流形感知的多目标优化,将视觉和动作模态视为几何上不同的对象,通过流形感知的目标函数和跨模态因果掩码来对齐它们;

进度价值调节机制(Progress-Valued Regulation),估计任务完成进度并检测视觉-动作失配,实现自主偏差检测和价值引导恢复。

在RoboTwin 2.0上,MV-WAM在零样本OOD设置中达到55.7%的成功率,超出最强基线29.3%,同时参数规模更小。

在真实世界双臂操控中,四个不同难度任务的平均成功率为77.5%,而基线方法无法泛化到物理部署。

2.2.3 HarmoWAM:协调泛化与精确性的自适应WAM

HarmoWAM) 识别出现有WAM范式的根本性权衡:“先想象再执行” 的解耦方法擅长泛化性的 transit(移动)但缺乏 manipulation(操控)精确性;

联合建模方法在ID设置中表现强劲但在OOD场景中transit成功率急剧下降。

HarmoWAM提出了一个端到端WAM,统一了泛化性transit和精确性manipulation。

其核心是过程自适应门控机制(Process-Adaptive Gating Mechanism),动态预测当前任务阶段(transit vs interaction),并据此在两个互补的动作专家之间切换:预测性动作专家利用潜在视频特征指导精细的时间连贯动作生成,反应性专家直接从预测的未来观测中推断动作。

在六个真实世界任务中,HarmoWAM在ID设置上超越领先VLA和WAM方法15%和11%,在OOD场景中则分别领先33%和29%。

2.2.4 AGRA:使远见可执行

AGRA(Action-Grounded Representation Alignment) 指出了WAM的一个关键问题:合理的视觉预测并不保证动作可读的表示。

AGRA通过对齐视频扩散模型的隐藏状态与冻结基础视觉编码器提取的空间结构化语义特征,使视觉表示更加动作接地(action-grounded)

具体而言,具有相似语义或功能角色的区域被鼓励形成连贯结构,而外观变化的影响被降低。

在IRON-R01-1.11人形机器人的真实操控任务中,AGRA将基线WAM的ID成功率从34%提升到80%,在语义、实例级和属性泛化上分别提升27%、32%和32%。

2.2.5 WAM路线的优势与局限

WAM路线在OOD鲁棒性方面展现出明确优势,特别是在视觉扰动(噪声、光照、背景变化)下的表现。其核心优势在于视频生成预训练赋予了模型强大的时空先验和”去噪”能力。

然而,WAM也面临几个关键局限:

  • 推理开销大——扩散模型的多步去噪过程导致推理速度显著慢于VLA;
  • 视角和姿态敏感性——视频先验在场景几何配置改变时帮助有限;
  • 模拟到现实的部署挑战——WAM的高计算需求使其在边缘设备上的部署更加困难。

从华为的研究来看,VLA可以通过吸收WAM的组件来增强自己(如VLA-JEPA、MOTUS等混合方法),但反之WAM难以从VLA获得增强,因为VLA的定义包含核心的VLM骨干,而WAM实际上是VA(Vision-Action)而非VLA。

未来的趋势可能是两种范式的融合,而非完全的替代。

2.3 分层架构与注意力机制优化

2.3.1 Pelican-VLA 0.5:注意力级泛化

Pelican-VLA 0.5的核心发现是:当前VLA模型的动作路径注意力弥散(diffuse),分布在机械臂、背景和任务无关物体上,而非聚焦于操控相关区域。

为解决这一问题,Pelican-VLA 0.5引入了可学习的瓶颈Token(Bottleneck Tokens, BotTokens),插入在感知和动作之间,通过紧凑的瓶颈路由任务相关的视觉信息。

这种设计在预训练期间诱导了以操控为中心的注意力模式,并且在未见场景和未见机器人本体上依然有效。

在RoboTwin上微调后,Pelican-VLA 0.5在RoboTwin Clean上达到91.4%的成功率,在RoboTwin Randomized上达到91.0%,均为开源VLA基线中的最佳表现。

值得注意的是,微调前后的注意力模式保持高度相似,表明微调主要增强了从预形成的操控中心注意力区域到可执行动作的映射,而非从头创建这些区域。

2.3.2 PosA-VLA:姿态条件锚点注意力

**PosA-VLA)通过 姿态条件监督(Pose-Conditioned Supervision)**增强动作生成。

该方法使模型能够维持稳定的空间注意力,即使在显著视觉变化下也能避免被无关物体分散注意力。

在DexGraspVLA基线的多种测试条件下(未见背景、光照变化、干扰物体、未见物体),PosA-VLA在几乎所有场景中均达到最高成功率。

在标准Basic设置中达到74.9%,在Unseen Background条件下为57.2%,在Unseen Lights条件下为47.8%,在Distractor Objects条件下为56.1%,相比最强基线提升约4-6%。

虽然在未见物体上表现略逊于利用大规模预训练分割模型的DexGraspVLA,但PosA-VLA的关键优势在于不依赖任何外部分割或基础模型,确认了其 superior 的效率和泛化能力。

2.3.3 分层VLA架构:快慢系统与MoE

分层架构是另一种提升泛化的重要设计范式。

Figure AI的Helix模型采用”系统1+系统2”架构:S1负责200Hz高频实时动作控制(类似小脑),S2基于70亿参数进行7-9Hz的语义推理和规划(类似大脑)。

这种快慢系统的解耦使S2能够利用VLM的互联网海量图文预训练进行广泛的语义理解,而S1则专注于运动控制的响应速度和精度。

类似地,智元机器人的ViLLA框架采用视觉-语言-潜在动作(Vision-Language-Latent-Action)的三阶段训练:

  • 阶段1训练潜在动作模型(LAM)将连续图像投影到潜在动作空间;
  • 阶段2利用这些潜在动作作为伪标签促进与本体无关的长程规划;
  • 阶段3引入动作专家并与潜在规划器联合训练。

这种层次化设计使上层能够利用预训练VLM的泛化能力,下层专注于灵巧操作的执行。

此外,Mixture-of-Experts(MoE) 架构也被引入VLA,如ChatVLA-2的动态混合专家架构,通过自适应选择专家模块来保持特征贡献,避免破坏原始VLM结构,从而缓解知识遗忘问题。

2.4 失败感知与自适应学习

2.4.1 AFIL:自适应失败知情学习

AFIL(Adaptive Failure-Informed Learning) 提出了一种利用失败轨迹作为自适应负引导的框架。

传统VLA学习仅使用成功演示,而AFIL通过双动作生成器(Dual Action Generator) 架构联合建模成功和失败行为,同时共享视觉-语言骨干。

在推理时,失败生成器自适应地引导动作采样远离失败倾向区域,提高鲁棒性。AFIL不需要手工设计的失败模式、任务特定的恢复启发式或单独的大规模VLA模型。

在ManiSkill和LIBERO评估中,AFIL在短程和长程任务上均一致提升成功率,尤其在OOD操控任务上增益显著。π0.5基线在未见物体/颜色上仅为14.7%,而DAG-VLAπ0.5 + AFIL达到62.7%,提升超过48个百分点。

2.4.2 Failing Forward:从失败中学习的VLA

“Failing Forward” 框架进一步系统化地利用失败数据进行VLA训练。该方法通过收集和标注失败轨迹,然后应用纠正性的人类演示来教导模型如何从失败中恢复。

在ManiSkill仿真和真实世界评估中,融入失败纠正数据的π0.5在OOD任务上从14.7%(仅成功数据)提升到53.3%(成功+失败纠正),而结合AFIL的完整方法达到62.7%。

这一结果表明,显式建模失败分布能够为鲁棒动作生成提供高效且可扩展的机制

2.5 Sim2Real迁移技术

2.5.1 域随机化(Domain Randomization)

域随机化是Sim2Real迁移的基础方法,通过在模拟训练期间引入多样化的随机扰动来扩展训练分布,使其涵盖真实世界的变化。2026年的一项大规模实证研究(基于RoboTwin 2.0框架,超过10,000次真实世界试验)揭示了域随机化的关键设计原则:

空间特征比外观特征更重要——随机化桌子高度和相机姿态带来的改进大于纯视觉扰动(如背景纹理或光照);

粒度很重要——逐帧(frame-wise)域随机化优于逐回合(episode-wise)策略,因为它改善了对任务相关物体的注意力而非背景变化;

渲染保真度增强Sim2Real迁移——更高水平的光照真实感和物理真实感持续提升Sim2Real性能,但当模拟保真度达到阈值后改进幅度递减。

2.5.2 域自适应(Domain Adaptation)

域自适应通过在共享特征空间中对齐模拟和真实域来减少域间差异。这包括对抗性训练方法(如GRL-based方法)、特征级对齐方法(如DANN、MMD-based方法)以及最近的基于基础模型的方法(如利用DINO或CLIP特征进行跨域对齐)。

这些方法特别适用于当模拟和真实之间存在显著视觉差异时,通过学习域不变的特征表示来提升泛化。

2.5.3 RL增强Sim2Real

强化学习微调被证明能够显著增强Sim2Real鲁棒性。

在同一项大规模研究中,SFT-only策略的真实世界平均成功率为5.6%,而加入RL微调后提升至33.4%(在干净模拟环境中训练RL),进一步加入域随机化后达到42.8%(真实世界)和70.8%(Sim-OOD)。

这表明RL本身引入了超越监督模仿的更强策略泛化,而当RL与结构化域随机化结合时,性能增益被进一步放大,凸显了策略优化和环境多样性的互补效益。

2.5.4 Sim2Real-VLA:零样本合成技能迁移

Sim2Real-VLA 是一种完全在合成数据上训练的通用VLA模型,无需额外微调即可执行复杂真实世界操控任务。

其核心创新是affordance-driven的双系统设计:高层规划器推断以对象为中心的affordance链,低层执行器通过tokenized动作空间实时执行和验证这些计划。这种设计过滤掉与操控无关的特征,优先处理运动关键动态。

此外,该系统集成了全自动数据生成pipeline,支持可扩展的免手动训练。在双臂倒酒、物品传递和长程装配等任务中,Sim2Real-VLA一致优于之前的VLA基线。

2.6 预训练策略与数据混合优化

2.6.1 Qwen-VLA:大规模预训练提升OOD泛化

Qwen-VLA通过大规模视觉-语言预训练显著提升VLA的OOD泛化能力。Qwen-VLA-Base基于Qwen2.5-VL进行继续预训练,混合了大规模视觉-语言数据和机器人轨迹数据。

在ALOHA双臂平台上的评估显示,Qwen-VLA-aloha w/ pretrain在ID任务上平均成功率达83.6%,显著优于GR00T N1.6(28.6%)和π0.5(71.6%)。

更关键的是,在OOD泛化测试中(未见颜色、未见物体实例、未见空间位置、未见背景光照、未见指令变体),Qwen-VLA平均OOD成功率达76.9%,较π0.5(41.5%)提升35.4个百分点,较从头训练版本(36.2%)提升40.7个百分点。

尤其在背景泛化(80.8%)和指令泛化(84.6%)上表现突出,表明大规模预训练不仅提升了域内性能,更显著增强了视觉条件与指令理解的鲁棒性。

2.6.2 π0.5的数据混合 Scaling Law

Physical Intelligence的π0.5通过系统性的数据混合研究,揭示了OOD泛化的Scaling Law

π0.5的训练混合包括:多机器人数据(ME)、跨实体数据(CE)、以及网页数据(WD)。消融研究表明:

  • 网页数据(WD)对OOD物体泛化影响最大——包含网页数据时OOD成功率达94%,排除后降至74%;
  • 多机器人数据对泛化至关重要——排除ME和CE后,OOD成功率分别降至49%和31%。

此外,π0.5的训练环境数量与性能之间存在明确的正相关:当使用所有可用训练环境时,模型性能接近直接在测试环境上训练的基线。这表明数据多样性(而非单纯数据量)是OOD泛化的关键驱动因素

训练配置 ID成功率 OOD成功率 关键发现
π0.5(完整混合) ~97% 94% 多样化数据混合达到最佳泛化
无网页数据(no WD) ~95% 74% 网页数据对OOD物体识别最关键
无跨实体数据(no CE) ~85% 49% 跨实体数据对整体泛化重要
无多机器人数据(no ME) ~70% 31% 多机器人数据是所有泛化的基础
无ME和CE ~60% ~20% 数据多样性不足导致严重过拟合

表3:π0.5数据混合消融实验结果(数据来源:Physical Intelligence)

2.6.3 ObjectVLA:视觉-语言数据注入实现物体级泛化

ObjectVLA提出了一种轻量级且可扩展的方法来实现物体级泛化。该方法通过整理带有定位元数据(如边界框)的图像-文本对数据集,并与遥操作机器人交互数据共同微调,同时用定位引导推理丰富机器人数据。

这种设计在视觉-语言输入和机器人动作之间建立了统一路径,实现了零样本物体泛化:模型能够识别和操控训练数据中从未见过的物体。

在真实机器人平台上,ObjectVLA在100个OOD物体上达到了64% 的成功率,而仅使用机器人数据训练的基线几乎相当于随机猜测(8%)。这凸显了视觉-语言共微调在防止灾难性遗忘和维持多模态理解能力方面的关键作用。

3. 技术路线的综合分析与未来趋势

3.1 六大技术路线的互补性与融合趋势

当前VLA OOD解决方案的六大技术路线并非互斥,而是呈现出高度互补的特征。

RL后训练提供了在线适应和试错学习的能力,是提升OOD鲁棒性的最直接手段,但其探索效率低、训练不稳定的问题仍需解决。WAM利用视频预测的时空先验提供了强大的视觉鲁棒性,但推理开销大是致命缺陷。

分层架构通过快慢系统解耦兼顾了泛化性和实时性,是当前产业界最实用的架构选择。

失败感知学习从负面样本中提取信息,是对纯成功数据训练的重要补充。

Sim2Real技术(域随机化、域自适应)是连接模拟和真实的桥梁,对于低成本数据获取至关重要。

预训练策略优化(大规模VL预训练、多样化数据混合)则是从”根”上解决泛化问题,是所有其他方法的基础。

未来的趋势是多技术路线的深度融合

例如,RL + WAM的结合(如MV-WAM的进度价值调节)可以兼具鲁棒性和适应性;分层架构 + 大规模预训练(如Qwen-VLA、Gemini Robotics)可以同时获得语义理解和动作执行的优势;失败感知 + Sim2Real(如Sim2Real-VLA的affordance链)可以在合成环境中安全地学习恢复策略。

华为的研究也表明,VLA可以吸收WAM的组件来增强自己(如VLA-JEPA、MOTUS等混合方法),形成兼具两种范式优势的混合架构

3.2 关键挑战与开放问题

尽管取得了显著进展,VLA OOD问题仍面临多个关键挑战

  • 推理速度与鲁棒性的权衡——WAM虽然鲁棒但推理慢(比π0.5慢4.8倍以上),如何在边缘设备上实时运行仍是难题;
  • 长尾场景的覆盖——即使RL通过探索增加了多样性,真实世界中的极端罕见场景(如家中突发火灾时的机器人应对)仍然难以覆盖;
  • 组合泛化——当前模型在单一扰动下表现尚可,但在多种扰动同时发生时的性能仍然急剧下降(如π0在LIBERO-Plus多扰动下从94.2%降至53.6%);
  • 安全性和可解释性——OOD场景下的失败模式往往不可预测,如何确保机器人在面对未知情况时的安全性仍是开放问题;
  • 跨本体泛化的极限——虽然当前模型展示了跨不同机器人平台的泛化能力,但从人形机器人到四足机器人、从固定基座到移动平台的极端跨本体泛化仍然极具挑战。

3.3 未来发展方向

世界模型与VLA的统一是最具前景的方向。

未来的模型可能同时兼具VLA的语言理解能力和WAM的物理预测能力,形成真正”理解世界+执行任务”的统一智能体。

持续学习与在线适应将使机器人能够在部署后不断从交互中学习,逐步扩展其能力边界而非固定于训练时的分布。

因果推理的引入是更深层次的解决方案——如果VLA能够理解物理世界的因果机制(如”推杯子会导致杯子移动”),而非仅仅学习表面统计关联,那么真正的OOD泛化将成为可能。

多模态融合(触觉、力觉、听觉等)将提供更丰富的环境信息,增强模型对物理世界的理解深度。

最后,标准化评估体系的建立(如LIBERO-Plus、RoboTwin 2.0-Plus)对于公平比较不同方法的OOD鲁棒性至关重要,需要持续扩展以覆盖更多真实世界场景。

4. 结论

核心发现包括:RL后训练是提升OOD鲁棒性最直接有效的方法,RobustVLA、LaST-R1等方法通过不同的正则化和推理机制显著提升了VLA在扰动下的表现;

WAM在视觉扰动下展现出优于VLA的鲁棒性,但其推理开销限制了实际部署;

分层架构(如Helix、ViLLA)通过快慢系统解耦实现了泛化性与实时性的平衡;

大规模预训练(如Qwen-VLA)被证明是提升OOD泛化的根本驱动力;

数据多样性(如π0.5的Scaling Law)比单纯的数据量更为关键。

尽管取得了显著进展,OOD问题远未完全解决。推理效率、长尾场景覆盖、组合泛化能力、安全性保障仍是亟待突破的瓶颈。

未来的研究应重点关注世界模型与VLA的深度融合、因果推理的引入、持续学习能力的构建,以及更全面的真实世界评估体系的建设。

随着技术的不断成熟,VLA模型有望逐步从实验室走向真实世界,成为真正的通用机器人”大脑”。

目录