精选文章 实录精选!流匹配 VLA 的强化学习后训练框架π_RL技术详解 完整PPT下载:【https://t.zsxq.com/gXFFx】 在往期 Talk 分享中,RLinf 团队的林灏、臧宏之分别为大家讲解了 RLinf 的系统设计以及 RLinf VLA 的实践。本期 Talk 我们继续和 RLinf 团队、北京大学博士生陈康一起聊一聊面向流匹配 VLA 的强化
青稞Talk 直播预告!从 端到端 VLA 到 Harness VLA,聊聊具身智能下一站:给 VLA 装上 Harness Layer VLA 刷爆了 Benchmark,却依然搞不定真实世界里的细微变化。 面对这一困境,继续堆叠参数与数据未必是唯一解。数字 AI 的进化已经给出了启发:以 Claude Code 为代表的 Coding Agent,其突破不仅源于更强的 LLM,更依赖于模型之外的执行组织系统(Harness Lay
青稞Talk 直播预告!聊聊 NTU & 大晓机器人最新开源的新一代具身智能数据范式 ACE-Data-0 ACE-Data-0 是 南洋理工大学 S-Lab 和大晓机器人联合开源的一个面向具身智能与机器人学习的人类中心、多模态、长时程交互数据集。 基于环境式采集系统 ACE,将真实家居环境转化为空间标定、时间同步的数据采集平台,同时记录第一视角与多视角视频、全身与手部运动、物体几何及六自由度动作、运动轨
青稞Talk LA4VLA:从 VLA 预训练中解耦语言-动作监督 当前 VLA 预训练通常将视觉、语言和动作联合映射到动作,但视觉-动作监督更密集,容易使策略依赖视觉捷径,削弱语言对动作执行的约束。 上海交大联合阿里巴巴发布 LA4VLA,提出 Language-Action Pretraining:在预训练阶段暂时去掉视觉输入,让 VLA 更集中地学习语言和动作
精选文章 VLA 模型:从入门到研究实践指南 作者:JoyeeEE https://zhuanlan.zhihu.com/p/2065806583955714218 前导 当大语言模型开始理解文本、多模态模型开始理解图像,下一个自然问题是:模型能否不仅“看懂”和“说清楚”,还能在物理世界中真正采取行动? Vision-Language-Acti
精选文章 自回归 VLA 到底怎么做?从问题定义到工程落地,揭秘通用机器人最关键的那条路线 在具身智能快速发展的背景下,视觉-语言-动作(VLA)模型已成为机器人自主操控的核心研究方向。 当前挑战:主流 VLA 方案多聚焦动作拟合与模仿学习,往往弱化了语言理解、常识推理与开放泛化能力。 核心矛盾:通用 VLM 与具身 VLA 数据存在显著表征鸿沟,直接制约了模型的泛化性能与落地效果。 7月
精选文章 VLA的OOD困境:不是模型不够大 作者:原来ID可以这么长 https://zhuanlan.zhihu.com/p/2060361643851256385 核心要点速览 Vision-Language-Action(VLA)模型虽然在机器人操控任务中展现出强大的能力,但在面对分布外(Out-of-Distribution, OOD
精选文章 VLA 已死?2026 年具身智能路线之争:World Model vs VLA 作者:硅基星人 https://zhuanlan.zhihu.com/p/2057783219144110491 VLA 没死,但“纯 VLA”确实不够了。 更准确地说,2026 年这轮争论不是“Vision-Language-Action 要被 World Model 替代”,而是“只把机器人策略
精选文章 2026 上半年 VLA 三条路线:GR00T N1.7、Helix 02、π0.5 架构对比 作者:硅基星人 https://zhuanlan.zhihu.com/p/2051733536873373900 如果只看发布节奏,2026 年上半年的 VLA 赛道确实很热闹。 NVIDIA 在 Isaac-GR00T 仓库里放出了 GR00T N1.7 Early Access;Figure A
青稞Talk 直播预告!和 Qwen 团队研究员陈雄辉,一起聊聊Qwen-Robot Suite 的设计原理和背后的思考 大模型已经具备强大的视觉、语言与空间理解能力,但“看懂世界”并不等于“能够在世界中行动”。 千问(Qwen)大模型团队在 Qwen-Robot Suite / Embodied Foundation Models 方向最新推出了 Qwen-Robot Suite 系列三项重磅工作。 这组工作围绕一个
精选文章 From RLHF to VLA-RL:Agentic RL 的工程教训对具身 RL 的启示 作者:向阳 原文链接:https://zhuanlan.zhihu.com/p/2057411805450866980 最近我在准备从 LLM Post-training 转向 VLA。读完 π0 / π0.5 / RT-2 这一批 imitation learning,以及 π0.6-Recap、
精选文章 为什么移除视觉 VLA 反而学得更好?上交大&阿里最新发布 LA4VLA:把语言-动作关系单独拿出来学 作者:林涛,上交AI院博士生 论文标题:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining 论文链接:https://arxiv.org/abs/2606.27295 项目主页:https://github.c
精选文章 高德最新开源 ABot-M0.5: 统一移动操作的世界-动作模型 作者:杨燕丹,高德地图算法工程师 导语:通用机器人的终极考验,在于能否在复杂多变的物理世界中实现“边走边操作”(Mobile Manipulation)。今日,备受瞩目的具身智能最新成果ABot-M0.5正式发布。本文工作由高德地图完成,是ABot-Manipulation系列继ABot-M0之后的
精选文章 预训练构建想象,微调驱动行动:World-Action Models 的崛起 原文链接:https://developer.nvidia.com/blog/pretrained-to-imagine-fine-tuned-to-act-the-rise-of-world-action-models 背景 视觉动作策略负责将当前观测与目标或指令相融合,映射为机器人的执行动作。世
精选文章 World Action Models 真的比 VLAs 更强吗? 作者:Kadima-Du 原文:https://zhuanlan.zhihu.com/p/2030412523703379683 研究人员比较了视觉-语言-动作(VLA)模型和世界动作模型(WAM)在各种视觉和语言扰动下机器人策略的鲁棒性。 WAMs由于其视频预训练,在噪音、光照和布局变化方面表现出
青稞Talk 直播预告!如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅 在近两年的具身基础模型的研究中,由Pi引领的基于流匹配和动作专家的VLA模型一直是大家追随的主流。 另一方面,自回归的模型具备若干天然优势,比如更强的语言理解能力、更鲁棒的零样本泛化能力、以及已经被证明过的Scaling潜力; 然而,关于如何设计一个好的自回归VLA确没有人做系统讨论与分析。 7月4
精选文章 World Model VLA:真的是形似而神不似? 作者:秋光的梦 https://zhuanlan.zhihu.com/p/2003112989201553035 近期许多基于视频生成网络的VA(也可以说是WAM)的工作,从25年末的LVP到Mimic-Video再到最近比较火的Lingbot-VA以及两篇NVIDIA的工作Cosmos Polic
精选文章 思考 World Action Model!从 Masked World Model 到 Fast WAM 和 Cosmos Policy 作者:钱泽中 原文:http://xhslink.com/o/7qoBKO5BfoI 前言 前两天ICML刚结束,合作的一个项目从3.25 rebuttal涨分到了3.75着实很厉害,这个paper主要做的事情是让world model从预测RGB改为预测Mask,然后增强了鲁棒性。他claim的点
青稞Talk VLANeXt:12条设计准则,从入门到精通的 VLA 终极“配方” 随着大基础模型的崛起,视觉-语言-动作模型 (VLA) 展现出了极大的潜力,通过继承丰富的视觉理解和语言基础,为通用机器人策略学习提供了可扩展的途径。 然而,目前的VLA研究领域依然处于一种“原始汤 (primordial soup)”阶段——充满了各种天马行空的探索和设计,但缺乏清晰的架构。 A组
精选文章 MMLab@NTU联合中山大学推出VLANeXt,一份从入门到精通的VLA终极“配方”,12个维度带你从零构建高性能VLA! 随着大基础模型的崛起,视觉-语言-动作模型 (VLA) 展现出了极大的潜力,通过继承丰富的视觉理解和语言基础,为通用机器人策略学习提供了可扩展的途径。然而,目前的VLA研究领域依然处于一种“原始汤 (primordial soup)”阶段——充满了各种天马行空的探索和设计,但缺乏清晰的架构。 A组说
精选文章 或许,端到端VLA不是AGI的正确路径,Agentic Policy才是 作者:Sonata,清华大学 计算机科学与技术博士在读原文:https://zhuanlan.zhihu.com/p/2022547604903339697 这里是一些最近做机器人研究产生的的个人看法。具体内容难免存在局限和疏漏,也可能和主流观点并不相同,欢迎友好讨论和指正。 VLA很火热,但也很稚
精选文章 如何给 VLA 设计一个好的 Action Tokenizer? 作者:董子斌 https://zhuanlan.zhihu.com/p/2006493733990981927 1. 主流 VLA 架构以及为什么我们需要 action tokenizer 不得不承认 physical intelligence 依旧是 VLA 实践灯塔之一,自从 \pi_{0.5}
青稞Talk RISE: 组合式世界模型,在“想象”中实现机器人策略的自主进化 在具身智能领域,物理世界中的强化学习(RL)长期受限于高昂的硬件成本、繁琐的环境重置需求以及试错过程带来的安全风险 。 为此,OpenDriveLab提出了RISE,一种通过“想象”来实现机器人策略自主进化的可扩展强化学习框架 。 论文:RISE: Self-Improving Robot Poli
精选文章 深度解析 Physical Intelligence 新作 MEM,如何让 VLA 拥有记忆力 作者:梦落花 https://zhuanlan.zhihu.com/p/2017560172977992865 为什么vla需要有记忆? 机器人在运动过程中视线被遮挡时,需要从未被遮挡的历史数据中推断出物品真实位置;而机器人在做饭时需要记住它过去加了哪些食材,顺序是怎么样的。 本文通过这两个例子引出
精选文章 Physical Intelligence 最新工作:如何使用RL高效微调VLA? 作者:dung defender https://zhuanlan.zhihu.com/p/2019320352367494543 今天主要来分享physical intelligence的最新工作: 标题:RL Token: Bootstrapping Online RL with Vision-
青稞Talk RLinf-USER:面向现实世界机器人在线策略学习的统一且可扩展系统 USER 是在 RLinf 上搭建的一套面向现实世界在线策略学习的统一且可扩展的系统。 在系统上,它建立了统一的硬件抽象层、自适应通信平面以解决硬件管理和通信问题。 算法侧,它搭建了全异步学习框架,设计了持久化、缓存感知的缓冲区,并提供了奖励函数、算法与策略的可扩展接口。
精选文章 具身智能真机RL算法的杂谈:Offline或许是真正的解决方案? 作者:钱泽中,西安交通大学少年班本科大三 原文:http://xhslink.com/o/4JTOFucqnmw 之前的相关工作 其实从最早期的一派以Q-learning为基础,以及更加倾向于offline RL的真机强化学习算法就可以展现出整个具身社区对RL这一块的态度了,也就是online RL
青稞Talk InternVLA-A1,虚实贯通:理解、生成、执行一体化的具身操作大模型 为应对具身智能领域数据采集成本高且效率低、模型泛化不足以及训练范式难以规模化的瓶颈,上海人工智能实验室具身智能中心提出了“高质量合成数据驱动+统一学习框架”的数据-模型协同方案。 论文:InternVLA-A1: Unifying Understanding, Generation, and Act
精选文章 在看完近50篇VLA+RL工作之后...... 视觉-语言-动作 + 强化学习:VLA+RL 最新研究全景(含论文、链接与代码) 随着基于大规模模仿学习的视觉-语言-动作 (VLA) 模型取得显著进展,将 VLA 与强化学习 (RL) 相结合已成为一种极具前景的新范式。该范式利用与环境的试错交互或预先采集的次优数据,进一步提升机器人的决策与执行能
精选文章 纯干货!做 VLA 的一些头部问题和心得体会 1、VLM 做 AD 的头部问题:(1)幻觉问题,具体表现为无中生有、视而不见;(2)3D 空间理解能力不足;(3)速度慢。 幻觉问题的原因:静态感知。解决方案:动态感知,例如通过多次校验减少训练数据中的幻觉;例如通过 DPO 减少训练模型时产生的幻觉。例如允许模型“回头放大看看”。 3D 空间理解
精选文章 聊聊AdaMoE:让专家别“独占舞台”的 VLA 稀疏架构 作者:小红师兄 https://zhuanlan.zhihu.com/p/1980358735869268796 今天聊聊AdaMoE(VLA),先用一句话概括一下:AdaMoE 这篇论文想解决的是「在 Vision-Language-Action (VLA) 模型里用 Mixture-of-Exp
精选文章 VDM + DiT = 更聪明的机器人?北大推出新快慢系统 VLA 模型 作者:小秋 https://zhuanlan.zhihu.com/p/1979682819170145066 前言 快慢双系统早已不是第一次在具身智能里被提出来了。 从 Daniel Kahneman 的《思考,快与慢》到机器人,大家都在拿 System 1 / System 2 打比方:一个负责“
青稞Talk 从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架 强化学习可以减少 VLA 模型对大量数据的依赖。我们提出了面向流匹配VLA( π_0, π_{0.5})的强化学习微调框架 π_RL ,提出了 Flow-Noise和 Flow-SDE两种微调技术路线。 Flow-Noise 在单层 MDP 中引入可学习噪声,通过完整的去噪序列计算动作似然;
精选文章 VLA 已经不满足于 SFT,也要上 RL 了? 作者:张海抱 https://zhuanlan.zhihu.com/p/1976979860405633293 最近 VLA 的一大研究趋势就是不再满足于 SFT,而是也要上 RL 了。最近读了一波这方面的论文,分享一些心得。 首先,有些文献调研还是按照 online RL / offline RL
精选文章 从 ICLR 2026,看VLA的研究趋势 原文:https://mbreuss.github.io/blog_post_iclr_26_vla.html 本文总结了 视觉-语言-动作(VLA)模型 在 ICLR 2026 上的研究现状:什么“算作”VLA(以及为什么这个定义很重要)、当前 VLA 领域的研究热点(离散扩散、具身推理、新分词器
精选文章 万字长文深度解析经典VLA方案:PI-0 提到具身智能就绕不开的经典工作,自动驾驶的VLA虽然在本体确定的情况下(汽车四轮形式),也看起来只有EMMA比较合理的方案,那么来看下本体还不确定收敛的具身行业。我认为目前核心关注的应该是机械臂的操作技术突破。 (以产生和物理世界的交互,末端执行器更多使用两指夹爪、机械臂数量上的也可以任意拓展,从单
精选文章 系统解析VLA核心技术路线与典型架构 作者:ning 原文:https://zhuanlan.zhihu.com/p/1967989523196667587 引言:VLA 与智能机器人的具身智能革命 Vision-Language-Action(VLA)模型是具身人工智能(Embodied AI)的核心载体,其核心价值在于打破传统机器人
精选文章 GEN-0 出现的背后我们可以学到什么?以及对后续 VLA 发展的看法 作者:阿汐 原文:https://axi404.top/blog/embodied-talk-3 GEN-0 出现的背后,我们可以从中学到什么。一些被改变,一些新的东西出现,研究还在继续。 前言 最近 GEN-0 的发布对于具身智能领域可以说是轰动性的。Manipulation 作为 Robotic
精选文章 28篇最新论文!系统调研 VLA+RL 最近的研究趋势 作者:张海抱 原文:https://zhuanlan.zhihu.com/p/1940702256241575450 写在前面 VLA 时代的强化学习和 Atari 时代的强化学习有什么区别?个人认为有一好两坏两个方面。 好的方面是我们现在有一个非常有用的资源 —— 预训练的大模型,它可以对我们的探