1. 首页
  2. 青稞Talk
  3. LA4VLA:从 VLA 预训练中解耦语言-动作监督

LA4VLA:从 VLA 预训练中解耦语言-动作监督

  • 发布于 2026-08-02
  • ·
  • 22 次阅读
  • ·
  • ·
直播回放

直播平台

YouTube

视频号

哔哩哔哩

相关资源

演示文稿 (PPT)

直播配套幻灯片

下载

当前 VLA 预训练通常将视觉、语言和动作联合映射到动作,但视觉-动作监督更密集,容易使策略依赖视觉捷径,削弱语言对动作执行的约束。

上海交大联合阿里巴巴发布 LA4VLA,提出 Language-Action Pretraining:在预训练阶段暂时去掉视觉输入,让 VLA 更集中地学习语言和动作之间的对应关系。

为什么移除视觉 VLA 反而学得更好?上交大&阿里最新发布 LA4VLA:把语言-动作关系单独拿出来学

论文:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
链接:https://arxiv.org/abs/2606.27295
主页:https://github.com/MINT-SJTU/LA4VLA

LA4VLA 将语言-动作学习从视觉 grounding 中解耦,通过把已有专家示范重组为原子指令-动作片段,构建 33K 规模的 vision-agnostic LA 数据,使策略学习可复用的语言条件动作先验。

45f153bbec9d879b7d4c30170517e2fe.png

8月4日(周二)晚8点​,青稞Talk 第142期,上海交通大学人工智能学院博士生林涛,将直播分享《LA4VLA:从 VLA 预训练中解耦语言-动作监督》。

本次 Talk 将围绕问题诊断、LA 数据构建、LA-only / LA-to-VLA / Mixed LA-VLA 三种预训练范式,以及仿真、跨架构、真实机器人和视觉扰动鲁棒性实验展开,说明显式语言-动作预训练可作为标准 VLA 训练的互补信号,提升策略性能与鲁棒性。

青稞介绍

林涛,上海交通大学人工智能学院博士生,研究方向为具身智能、VLA 模型与多模态大模型。Evo 系列主要开发人员,Evo-0、Evo-1、Evo-Depth 第一作者,主要研究具身大模型 infra、具身数据预训练,以及覆盖数据采集、模型训练、模型评测与部署的全栈技术体系。

主题提纲

LA4VLA:从 VLA 预训练中解耦语言-动作监督

1、为什么 VLA 里的语言监督不够强?
2、LA 数据构建:从长轨迹中提取语言-动作片段
3、LA-only / LA-to-VLA / Mixed LA-VLA 三种预训练范式
4、仿真、跨架构、真实机器人和视觉扰动鲁棒性实验
5、未来技术探索 & AMA (Ask Me Anything)环节

直播时间

8月4日(周二)20:00 - 21:00

目录