Tag

VLA

共 43 篇文章

直播预告!聊聊 NTU & 大晓机器人最新开源的新一代具身智能数据范式 ACE-Data-0

直播预告!聊聊 NTU & 大晓机器人最新开源的新一代具身智能数据范式 ACE-Data-0

ACE-Data-0 是 南洋理工大学 S-Lab 和大晓机器人联合开源的一个面向具身智能与机器人学习的人类中心、多模态、长时程交互数据集。 基于环境式采集系统 ACE,将真实家居环境转化为空间标定、时间同步的数据采集平台,同时记录第一视角与多视角视频、全身与手部运动、物体几何及六自由度动作、运动轨
wangguo
0
0
89
LA4VLA:从 VLA 预训练中解耦语言-动作监督

LA4VLA:从 VLA 预训练中解耦语言-动作监督

当前 VLA 预训练通常将视觉、语言和动作联合映射到动作,但视觉-动作监督更密集,容易使策略依赖视觉捷径,削弱语言对动作执行的约束。 上海交大联合阿里巴巴发布 LA4VLA,提出 Language-Action Pretraining:在预训练阶段暂时去掉视觉输入,让 VLA 更集中地学习语言和动作
wangguo
0
0
69
VLA 模型:从入门到研究实践指南

VLA 模型:从入门到研究实践指南

作者:JoyeeEE https://zhuanlan.zhihu.com/p/2065806583955714218 前导 当大语言模型开始理解文本、多模态模型开始理解图像,下一个自然问题是:模型能否不仅“看懂”和“说清楚”,还能在物理世界中真正采取行动? Vision-Language-Acti
wangguo
0
0
675
自回归 VLA 到底怎么做?从问题定义到工程落地,揭秘通用机器人最关键的那条路线

自回归 VLA 到底怎么做?从问题定义到工程落地,揭秘通用机器人最关键的那条路线

在具身智能快速发展的背景下,视觉-语言-动作(VLA)模型已成为机器人自主操控的核心研究方向。 当前挑战:主流 VLA 方案多聚焦动作拟合与模仿学习,往往弱化了语言理解、常识推理与开放泛化能力。 核心矛盾:通用 VLM 与具身 VLA 数据存在显著表征鸿沟,直接制约了模型的泛化性能与落地效果。 7月
wangguo
0
0
248
VLA的OOD困境:不是模型不够大

VLA的OOD困境:不是模型不够大

作者:原来ID可以这么长 https://zhuanlan.zhihu.com/p/2060361643851256385 核心要点速览 Vision-Language-Action(VLA)模型虽然在机器人操控任务中展现出强大的能力,但在面对分布外(Out-of-Distribution, OOD
wangguo
0
0
182
高德最新开源 ABot-M0.5: 统一移动操作的世界-动作模型

高德最新开源 ABot-M0.5: 统一移动操作的世界-动作模型

作者:杨燕丹,高德地图算法工程师 导语:通用机器人的终极考验,在于能否在复杂多变的物理世界中实现“边走边操作”(Mobile Manipulation)。今日,备受瞩目的具身智能最新成果ABot-M0.5正式发布。本文工作由高德地图完成,是ABot-Manipulation系列继ABot-M0之后的
青稞
0
0
110
World Action Models 真的比 VLAs 更强吗?

World Action Models 真的比 VLAs 更强吗?

作者:Kadima-Du 原文:https://zhuanlan.zhihu.com/p/2030412523703379683 研究人员比较了视觉-语言-动作(VLA)模型和世界动作模型(WAM)在各种视觉和语言扰动下机器人策略的鲁棒性。 WAMs由于其视频预训练,在噪音、光照和布局变化方面表现出
wangguo
0
0
135
直播预告!如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅

直播预告!如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅

在近两年的具身基础模型的研究中,由Pi引领的基于流匹配和动作专家的VLA模型一直是大家追随的主流。 另一方面,自回归的模型具备若干天然优势,比如更强的语言理解能力、更鲁棒的零样本泛化能力、以及已经被证明过的Scaling潜力; 然而,关于如何设计一个好的自回归VLA确没有人做系统讨论与分析。 7月4
wangguo
0
0
171
World Model VLA:真的是形似而神不似?

World Model VLA:真的是形似而神不似?

作者:秋光的梦 https://zhuanlan.zhihu.com/p/2003112989201553035 近期许多基于视频生成网络的VA(也可以说是WAM)的工作,从25年末的LVP到Mimic-Video再到最近比较火的Lingbot-VA以及两篇NVIDIA的工作Cosmos Polic
wangguo
0
0
151
VLANeXt:12条设计准则,从入门到精通的 VLA 终极“配方”

VLANeXt:12条设计准则,从入门到精通的 VLA 终极“配方”

随着大基础模型的崛起,视觉-语言-动作模型 (VLA) 展现出了极大的潜力,通过继承丰富的视觉理解和语言基础,为通用机器人策略学习提供了可扩展的途径。 然而,目前的VLA研究领域依然处于一种“原始汤 (primordial soup)”阶段——充满了各种天马行空的探索和设计,但缺乏清晰的架构。 A组
wangguo
0
0
193
MMLab@NTU联合中山大学推出VLANeXt,一份从入门到精通的VLA终极“配方”,12个维度带你从零构建高性能VLA!

MMLab@NTU联合中山大学推出VLANeXt,一份从入门到精通的VLA终极“配方”,12个维度带你从零构建高性能VLA!

随着大基础模型的崛起,视觉-语言-动作模型 (VLA) 展现出了极大的潜力,通过继承丰富的视觉理解和语言基础,为通用机器人策略学习提供了可扩展的途径。然而,目前的VLA研究领域依然处于一种“原始汤 (primordial soup)”阶段——充满了各种天马行空的探索和设计,但缺乏清晰的架构。 A组说
青稞
0
0
183
或许,端到端VLA不是AGI的正确路径,Agentic Policy才是

或许,端到端VLA不是AGI的正确路径,Agentic Policy才是

作者:Sonata,清华大学 计算机科学与技术博士在读原文:https://zhuanlan.zhihu.com/p/2022547604903339697 这里是一些最近做机器人研究产生的的个人看法。具体内容难免存在局限和疏漏,也可能和主流观点并不相同,欢迎友好讨论和指正。 VLA很火热,但也很稚
wangguo
0
0
287
RLinf-USER:面向现实世界机器人在线策略学习的统一且可扩展系统

RLinf-USER:面向现实世界机器人在线策略学习的统一且可扩展系统

USER 是在 RLinf 上搭建的一套面向现实世界在线策略学习的统一且可扩展的系统。 在系统上,它建立了统一的硬件抽象层、自适应通信平面以解决硬件管理和通信问题。 算法侧,它搭建了全异步学习框架,设计了持久化、缓存感知的缓冲区,并提供了奖励函数、算法与策略的可扩展接口。
wangguo
0
0
223
在看完近50篇VLA+RL工作之后......

在看完近50篇VLA+RL工作之后......

视觉-语言-动作 + 强化学习:VLA+RL 最新研究全景(含论文、链接与代码) 随着基于大规模模仿学习的视觉-语言-动作 (VLA) 模型取得显著进展,将 VLA 与强化学习 (RL) 相结合已成为一种极具前景的新范式。该范式利用与环境的试错交互或预先采集的次优数据,进一步提升机器人的决策与执行能
wangguo
0
0
893
纯干货!做 VLA 的一些头部问题和心得体会

纯干货!做 VLA 的一些头部问题和心得体会

1、VLM 做 AD 的头部问题:(1)幻觉问题,具体表现为无中生有、视而不见;(2)3D 空间理解能力不足;(3)速度慢。 幻觉问题的原因:静态感知。解决方案:动态感知,例如通过多次校验减少训练数据中的幻觉;例如通过 DPO 减少训练模型时产生的幻觉。例如允许模型“回头放大看看”。 3D 空间理解
wangguo
0
0
384
VLA 已经不满足于 SFT,也要上 RL 了?

VLA 已经不满足于 SFT,也要上 RL 了?

作者:张海抱 https://zhuanlan.zhihu.com/p/1976979860405633293 最近 VLA 的一大研究趋势就是不再满足于 SFT,而是也要上 RL 了。最近读了一波这方面的论文,分享一些心得。 首先,有些文献调研还是按照 online RL / offline RL
青稞
0
0
173
从 ICLR 2026,看VLA的研究趋势

从 ICLR 2026,看VLA的研究趋势

原文:https://mbreuss.github.io/blog_post_iclr_26_vla.html 本文总结了 视觉-语言-动作(VLA)模型 在 ICLR 2026 上的研究现状:什么“算作”VLA(以及为什么这个定义很重要)、当前 VLA 领域的研究热点(离散扩散、具身推理、新分词器
wangguo
0
0
350
 万字长文深度解析经典VLA方案:PI-0

万字长文深度解析经典VLA方案:PI-0

提到具身智能就绕不开的经典工作,自动驾驶的VLA虽然在本体确定的情况下(汽车四轮形式),也看起来只有EMMA比较合理的方案,那么来看下本体还不确定收敛的具身行业。我认为目前核心关注的应该是机械臂的操作技术突破。 (以产生和物理世界的交互,末端执行器更多使用两指夹爪、机械臂数量上的也可以任意拓展,从单
wangguo
0
0
1429
系统解析VLA核心技术路线与典型架构

系统解析VLA核心技术路线与典型架构

作者:ning 原文:https://zhuanlan.zhihu.com/p/1967989523196667587 引言:VLA 与智能机器人的具身智能革命 Vision-Language-Action(VLA)模型是具身人工智能(Embodied AI)的核心载体,其核心价值在于打破传统机器人
青稞
0
0
828
 28篇最新论文!系统调研 VLA+RL 最近的研究趋势

28篇最新论文!系统调研 VLA+RL 最近的研究趋势

作者:张海抱 原文:https://zhuanlan.zhihu.com/p/1940702256241575450 写在前面 VLA 时代的强化学习和 Atari 时代的强化学习有什么区别?个人认为有一好两坏两个方面。 好的方面是我们现在有一个非常有用的资源 —— 预训练的大模型,它可以对我们的探
青稞
0
0
268
正在直播 B 站