青稞Talk 深度对话!2025 “青稞” AI 嘉年华,与 20+ 位青年科学家一起探讨AI 技术瞬间 本次活动专为青年科学家打造,旨在搭建一场 AI 技术的深度对话,来自学术和工业界的 20+ 青年科学家,将与大家一起回顾 2025,展望 2026!
精选文章 面向具身智能规模化落地的端侧推理引擎来了:APXInf 开源,Pi 0.5 FP8 在 Thor 上推理延迟降至 26ms 今天的具身模型,已经能够看懂环境、理解指令,并把看到的、听到的信息转化为机器人该怎么动的决策。 但机器人最终还是要在物理世界里连续干活——从“眼睛看到”到“大脑决策”再到“手脚动起来”,整套流程都需要在极短的时间内完成闭环,这也是具身智能从 Demo 走向规模化应用,绕不开的核心关卡。 而当一个在云
精选文章 面向空间智能的统一世界模型Puffin-World:从“生成画面”走向“理解并构建物理可信世界” 世界模型正在成为空间智能和物理AI的重要技术主线。真正的世界模型不应只是逐帧生成逼真的像素,还需要理解当前视角所处的物理世界朝向、场景的几何结构,并支持对世界的建模与连贯模拟。 在这一方向上,来自南洋理工大学S-Lab和大晓机器人等机构的研究团队近期发布了 Puffin-World。它让同一个模型同
精选文章 HoloMotion-1 作者:关于人形运动控制的基础模型路线 作者:Yucheng,HoloMotion-1作者,目前在地平线机器人实验室负责相关研发工作 https://www.zhihu.com/question/2040119808587457550/answer/2076879019094684474 地平线开源 HoloMotion-1 机器人小脑大
青稞Talk 从"如何生成"到"如何验证",探讨物理一致世界模型如何实现可扩展机器人学习 当机器人要学会叠衣物、理线缆、摆弄软体——可变形物体操作的真实数据采集成本高昂、状态空间复杂、仿真与现实的差距显著。物理一致的世界模型,能成为可扩展机器人学习的"数据引擎"吗? 9月1日(周二)20:00,青稞Talk 第150期,上海人工智能实验室物理智能中心青年研究员周云松、王帅,将以 SIM1
精选文章 系统梳理 World Model in Agentic RL! 作者:Sherry https://www.xiaohongshu.com/user/profile/642d87c90000000011020daf World Model 这个概念其实已经提出很久了,我最近才第一次系统涉猎。虽然大家都在讨论 World Model,但真正试图解决的似乎并不是同一
精选文章 不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界 作者:尚书尧 中科院自动化所 自然语言连接了 AI 与人类积累的数字知识。下一步,当AI走入物理世界,PhiZero希望用“物理语言”连接 AI 智能与真实世界。 人类用语言保存经验、传递知识,也用语言进行思考。从日常交流到科学定律,从历史记录到程序代码,自然语言凝结了人类长期积累的知识与经验。今天
精选文章 世界生成模型不仅仅是未来模拟器!上海交通大学最新提出 Enfold:把世界模型的“未来计算”折叠进当下 作者:曾伟力,上海交通大学博士生 无需在每次决策时生成视频,也能让未来建模持续影响机器人的实时控制 世界模型让机器人拥有“想象未来”的能力,但如果每次动作预测都要完整运行一次视频生成,想象本身就会成为实时控制的负担。 来自上海交通大学和齐鲁工业大学(山东省科学院)的研究团队提出 Enfold:不再把
青稞Talk 直播预告!从 端到端 VLA 到 Harness VLA,聊聊具身智能下一站:给 VLA 装上 Harness Layer VLA 刷爆了 Benchmark,却依然搞不定真实世界里的细微变化。 面对这一困境,继续堆叠参数与数据未必是唯一解。数字 AI 的进化已经给出了启发:以 Claude Code 为代表的 Coding Agent,其突破不仅源于更强的 LLM,更依赖于模型之外的执行组织系统(Harness Lay
精选文章 从 Being-M0.7 看人形机器人的 WAM 路线 作者:黄奇浩 https://zhuanlan.zhihu.com/p/2066221445697508532 2026 年 7 月,BeingBeyond 团队放出了 Being-M0.7,一个专门为人形机器人全身移动操作(loco-manipulation)设计的 latent world-ac
青稞Talk 直播预告!聊聊 NTU & 大晓机器人最新开源的新一代具身智能数据范式 ACE-Data-0 ACE-Data-0 是 南洋理工大学 S-Lab 和大晓机器人联合开源的一个面向具身智能与机器人学习的人类中心、多模态、长时程交互数据集。 基于环境式采集系统 ACE,将真实家居环境转化为空间标定、时间同步的数据采集平台,同时记录第一视角与多视角视频、全身与手部运动、物体几何及六自由度动作、运动轨
精选文章 谈论 World Model,请先对齐你的坐标!World Model 的四个象限 作者:Naiyan Wang https://zhuanlan.zhihu.com/p/2066565953501009575 在上一篇文章中,我们探讨了 Physical AI(物理世界 AI)想要在真实环境中运转,必须具备三大核心能力:理解世界(表征)、预测世界(世界模型)以及改造世界(强化学习
青稞Talk LA4VLA:从 VLA 预训练中解耦语言-动作监督 当前 VLA 预训练通常将视觉、语言和动作联合映射到动作,但视觉-动作监督更密集,容易使策略依赖视觉捷径,削弱语言对动作执行的约束。 上海交大联合阿里巴巴发布 LA4VLA,提出 Language-Action Pretraining:在预训练阶段暂时去掉视觉输入,让 VLA 更集中地学习语言和动作
精选文章 VLA 模型:从入门到研究实践指南 作者:JoyeeEE https://zhuanlan.zhihu.com/p/2065806583955714218 前导 当大语言模型开始理解文本、多模态模型开始理解图像,下一个自然问题是:模型能否不仅“看懂”和“说清楚”,还能在物理世界中真正采取行动? Vision-Language-Acti
青稞Talk 清华 x 正行创新最新开源 LAWAM:隐空间世界动作模型将 WAM 瘦身24倍,同时成功率90%+! 折毛巾时,物理世界不会停下来等待机器人思考。 布料会滑动,褶皱会改变,前一秒还合适的抓取点,下一秒可能已经偏离。真实机器人做动态操作时,“想象未来”不能停留在离线视频生成里。它必须进入控制回路,在动作还来得及调整时,给策略一个可用的未来线索。 一个直接的想法,是让模型先生成未来画面,再让机器人根据这
精选文章 自回归 VLA 到底怎么做?从问题定义到工程落地,揭秘通用机器人最关键的那条路线 在具身智能快速发展的背景下,视觉-语言-动作(VLA)模型已成为机器人自主操控的核心研究方向。 当前挑战:主流 VLA 方案多聚焦动作拟合与模仿学习,往往弱化了语言理解、常识推理与开放泛化能力。 核心矛盾:通用 VLM 与具身 VLA 数据存在显著表征鸿沟,直接制约了模型的泛化性能与落地效果。 7月
精选文章 VLA的OOD困境:不是模型不够大 作者:原来ID可以这么长 https://zhuanlan.zhihu.com/p/2060361643851256385 核心要点速览 Vision-Language-Action(VLA)模型虽然在机器人操控任务中展现出强大的能力,但在面对分布外(Out-of-Distribution, OOD
青稞Talk 直播预告!机器人如何实现有效学习?聊聊正行创新 x 清华团队提出自监督帧级别优势建模算法STEAM 随着具身智越来越多地进入生产环境,策略进化的核心变成对混杂数据的高效利用。 这正是离线强化学习发挥的重要场景,但效果严重依赖于帧级的好坏标注——逐帧分辨哪些时刻在推进任务,哪些在停滞或倒退。但靠人类逐帧标注机器人数据非常耗费人力、难以规模化。 为了解决这个问题,清华于超老师团队与正行创新(Strid
精选文章 VLA 已死?2026 年具身智能路线之争:World Model vs VLA 作者:硅基星人 https://zhuanlan.zhihu.com/p/2057783219144110491 VLA 没死,但“纯 VLA”确实不够了。 更准确地说,2026 年这轮争论不是“Vision-Language-Action 要被 World Model 替代”,而是“只把机器人策略
精选文章 2026 上半年 VLA 三条路线:GR00T N1.7、Helix 02、π0.5 架构对比 作者:硅基星人 https://zhuanlan.zhihu.com/p/2051733536873373900 如果只看发布节奏,2026 年上半年的 VLA 赛道确实很热闹。 NVIDIA 在 Isaac-GR00T 仓库里放出了 GR00T N1.7 Early Access;Figure A
精选文章 超越Pi*0.6的RECAP算法!正行创新 x 清华团队提出自监督帧级别优势建模算法STEAM 想象一条折毛巾轨迹:机器人一开始做得不错,抓住了毛巾边缘,也把布料拉开了一部分。随后它抓偏了,布料开始皱在一起,动作进入停滞。几秒后,人类接管,把毛巾重新整理好,任务最终成功。 这是一个典型的真实世界策略在线采集数据的过程。 但关键问题是,这条数据到底该怎么用? 如果我们只保留「成功部分」或只学习人
青稞Talk 直播预告!和 Qwen 团队研究员陈雄辉,一起聊聊Qwen-Robot Suite 的设计原理和背后的思考 大模型已经具备强大的视觉、语言与空间理解能力,但“看懂世界”并不等于“能够在世界中行动”。 千问(Qwen)大模型团队在 Qwen-Robot Suite / Embodied Foundation Models 方向最新推出了 Qwen-Robot Suite 系列三项重磅工作。 这组工作围绕一个
青稞Talk 青稞Talk预告!NTU MMLab 博士后许牧天:面向时空具身仿真的运动学 4D 世界建模 Kinema4D 在具身智能领域,模拟机器人轨迹至关重要。近期,研究者开始利用视频生成模型来进行模拟,但仍存在关键缺陷: (1) 维度缺失:局限于 2D空间,缺乏交互所需的 4D 时空约束; (2) 精度不足:依赖语言指令、隐式动作理解、或静态环境先验,使得模型需要去"猜测"潜在的机器人动作,难以提供精确控制和动态引
精选文章 From RLHF to VLA-RL:Agentic RL 的工程教训对具身 RL 的启示 作者:向阳 原文链接:https://zhuanlan.zhihu.com/p/2057411805450866980 最近我在准备从 LLM Post-training 转向 VLA。读完 π0 / π0.5 / RT-2 这一批 imitation learning,以及 π0.6-Recap、
精选文章 为什么移除视觉 VLA 反而学得更好?上交大&阿里最新发布 LA4VLA:把语言-动作关系单独拿出来学 作者:林涛,上交AI院博士生 论文标题:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining 论文链接:https://arxiv.org/abs/2606.27295 项目主页:https://github.c
精选文章 俞扬团队新作!面向具身决策的世界模型应当如何评估? 作者:俞扬 https://zhuanlan.zhihu.com/p/2054520199282423797 论文:How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric
青稞Talk 直播预告!如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅 在近两年的具身基础模型的研究中,由Pi引领的基于流匹配和动作专家的VLA模型一直是大家追随的主流。 另一方面,自回归的模型具备若干天然优势,比如更强的语言理解能力、更鲁棒的零样本泛化能力、以及已经被证明过的Scaling潜力; 然而,关于如何设计一个好的自回归VLA确没有人做系统讨论与分析。 7月4
精选文章 我们离世界模型还有多远?Yann LeCun提出的自主机器智能愿景到哪层了?关于JEPA家族发展现状研究 作者:CyberSoma https://zhuanlan.zhihu.com/p/2022391438546072926 JEPA的愿景框架与工作进展 提起世界模型& JEPA,JEPA就是不抠像素(细节),只学抽象规律,预测未来,确实的本质特征,相比生成式AI要省算力。要知道2022年Yann提
精选文章 还在用 2D 空间训具身?南洋理工 MMLab 提出 4D 具身世界模拟器,构建虚拟与现实的时空桥梁! 本文第一作者许牧天,南洋理工大学MMLab博士后。导师刘子纬教授,为本文通讯作者。 机器人-环境交互模拟是具身智能的核心。近期,一些研究展现了利用视频生成技术突破传统模拟器“僵化”的视觉与物理限制的潜力。 然而,这些工作主要在 2D 空间运行、或受制于静态环境的单一引导,忽略了一个基本事实:机器人与
精选文章 近 4 倍训练吞吐加速,RLinf 怎样让世界动作模型 DreamZero 训练时长从 1 个月缩短至 1 周? 在通往AGI的道路上,世界模型(World Model)被视为让AI真正理解并预测物理世界的关键拼图。英伟达近期重磅发布的世界动作模型(WAM)DreamZero 一经发布就在两项机器人基准测试RoboArena,MolmoSpaces上双双登顶,在具身智能领域获得极大关注。 与传统VLA等模型不同
精选文章 思考 World Action Model!从 Masked World Model 到 Fast WAM 和 Cosmos Policy 作者:钱泽中 原文:http://xhslink.com/o/7qoBKO5BfoI 前言 前两天ICML刚结束,合作的一个项目从3.25 rebuttal涨分到了3.75着实很厉害,这个paper主要做的事情是让world model从预测RGB改为预测Mask,然后增强了鲁棒性。他claim的点
精选文章 当我们说具身智能缺数据时,我们到底在说什么? 作者:hsj https://zhuanlan.zhihu.com/p/2023447662066762473 机器人不缺数据,缺的是把数据变成能力的结构 一、一个显而易见的问题,做了几年还是没解 Joe Harris 前阵子发了条推文,说机器人行业根本不缺数据,每家部署超过半年的公司都有 TB 级
青稞Talk Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界 多模态空间智能不仅要求机器理解任意相机视角下的现实世界,更要求其具备从任意相机方位创造世界的能力。然而,当前的视觉与生成模型大多仅隐式地感知相机几何,或将理解与生成任务割裂开来。 新加坡南洋理工大学、商汤科技、密西根大学和马普所的研究者们联手提出了一种全新的范式——将“相机几何”破译为一种“语言”,
精选文章 或许,端到端VLA不是AGI的正确路径,Agentic Policy才是 作者:Sonata,清华大学 计算机科学与技术博士在读原文:https://zhuanlan.zhihu.com/p/2022547604903339697 这里是一些最近做机器人研究产生的的个人看法。具体内容难免存在局限和疏漏,也可能和主流观点并不相同,欢迎友好讨论和指正。 VLA很火热,但也很稚
精选文章 如何给 VLA 设计一个好的 Action Tokenizer? 作者:董子斌 https://zhuanlan.zhihu.com/p/2006493733990981927 1. 主流 VLA 架构以及为什么我们需要 action tokenizer 不得不承认 physical intelligence 依旧是 VLA 实践灯塔之一,自从 \pi_{0.5}
青稞Talk RISE: 组合式世界模型,在“想象”中实现机器人策略的自主进化 在具身智能领域,物理世界中的强化学习(RL)长期受限于高昂的硬件成本、繁琐的环境重置需求以及试错过程带来的安全风险 。 为此,OpenDriveLab提出了RISE,一种通过“想象”来实现机器人策略自主进化的可扩展强化学习框架 。 论文:RISE: Self-Improving Robot Poli
精选文章 深度解析 Physical Intelligence 新作 MEM,如何让 VLA 拥有记忆力 作者:梦落花 https://zhuanlan.zhihu.com/p/2017560172977992865 为什么vla需要有记忆? 机器人在运动过程中视线被遮挡时,需要从未被遮挡的历史数据中推断出物品真实位置;而机器人在做饭时需要记住它过去加了哪些食材,顺序是怎么样的。 本文通过这两个例子引出
青稞Talk 从 Depth Scaling 到 Width Scaling!WideSeek-R1:通过多智能体 RL 探索大模型的广度扩展(Width Scaling) DeepSeek-R1 的成功证明,深度扩展(Depth Scaling)在复杂逻辑推理中具有巨大潜力。但当任务从“深推理”转向“广信息”——如汇总全球头部科技公司多维财务数据——单一大模型往往受限于多轮检索带来的上下文干扰与串行效率瓶颈。 为此,我们提出“广度扩展”(Width Scaling)这
青稞Talk 从 VGGT 到 PAGE-4D:动态世界中的 3D 感知统一框架 动态三维建模的统一框架旨在在时间维度上同时建模场景的几何结构与运动变化,实现对动态世界的完整理解与重建。 整体框架通常包括两个核心模块: 首先是感知与表示模块,从多视角图像或视频中提取空间与时间特征,并构建统一的动态场景表示,如隐式场、3D Gaussian 或体渲染表示; 其次是几何与运动建模模块
精选文章 MIT&Harvard新作 | PAGE-4D:让3D模型"看懂"动态世界的统一框架 视觉几何基础变换器(VGGT)在静态场景中表现优异,但在动态场景下面临固有矛盾:相机姿态估计需抑制动态区域,而几何重建则需建模动态信息。如何在统一框架下协调这一任务冲突? 来自MIT和Harvard的研究团队提出了PAGE-4D(Disentangled Pose and Geometry Esti
青稞Talk RLinf-USER:面向现实世界机器人在线策略学习的统一且可扩展系统 USER 是在 RLinf 上搭建的一套面向现实世界在线策略学习的统一且可扩展的系统。 在系统上,它建立了统一的硬件抽象层、自适应通信平面以解决硬件管理和通信问题。 算法侧,它搭建了全异步学习框架,设计了持久化、缓存感知的缓冲区,并提供了奖励函数、算法与策略的可扩展接口。
精选文章 具身智能真机RL算法的杂谈:Offline或许是真正的解决方案? 作者:钱泽中,西安交通大学少年班本科大三 原文:http://xhslink.com/o/4JTOFucqnmw 之前的相关工作 其实从最早期的一派以Q-learning为基础,以及更加倾向于offline RL的真机强化学习算法就可以展现出整个具身社区对RL这一块的态度了,也就是online RL
青稞Talk InternVLA-A1,虚实贯通:理解、生成、执行一体化的具身操作大模型 为应对具身智能领域数据采集成本高且效率低、模型泛化不足以及训练范式难以规模化的瓶颈,上海人工智能实验室具身智能中心提出了“高质量合成数据驱动+统一学习框架”的数据-模型协同方案。 论文:InternVLA-A1: Unifying Understanding, Generation, and Act
精选文章 聊聊AdaMoE:让专家别“独占舞台”的 VLA 稀疏架构 作者:小红师兄 https://zhuanlan.zhihu.com/p/1980358735869268796 今天聊聊AdaMoE(VLA),先用一句话概括一下:AdaMoE 这篇论文想解决的是「在 Vision-Language-Action (VLA) 模型里用 Mixture-of-Exp
精选文章 VDM + DiT = 更聪明的机器人?北大推出新快慢系统 VLA 模型 作者:小秋 https://zhuanlan.zhihu.com/p/1979682819170145066 前言 快慢双系统早已不是第一次在具身智能里被提出来了。 从 Daniel Kahneman 的《思考,快与慢》到机器人,大家都在拿 System 1 / System 2 打比方:一个负责“
青稞Talk 从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架 强化学习可以减少 VLA 模型对大量数据的依赖。我们提出了面向流匹配VLA( π_0, π_{0.5})的强化学习微调框架 π_RL ,提出了 Flow-Noise和 Flow-SDE两种微调技术路线。 Flow-Noise 在单层 MDP 中引入可学习噪声,通过完整的去噪序列计算动作似然;
精选文章 VLA 已经不满足于 SFT,也要上 RL 了? 作者:张海抱 https://zhuanlan.zhihu.com/p/1976979860405633293 最近 VLA 的一大研究趋势就是不再满足于 SFT,而是也要上 RL 了。最近读了一波这方面的论文,分享一些心得。 首先,有些文献调研还是按照 online RL / offline RL
精选文章 世界模型正在重塑机器人大脑!解析World Model × 具身智能的最新论文 作者:gurubar 原文:https://zhuanlan.zhihu.com/p/1974055240048345546 为什么World Model 在Robotics领域中非常重要? 从理论与认知科学角度,Schmidhuber 等人长期主张“智能 = 学会一个可压缩、可预测的世界”;Ha
精选文章 从 ICLR 2026,看VLA的研究趋势 原文:https://mbreuss.github.io/blog_post_iclr_26_vla.html 本文总结了 视觉-语言-动作(VLA)模型 在 ICLR 2026 上的研究现状:什么“算作”VLA(以及为什么这个定义很重要)、当前 VLA 领域的研究热点(离散扩散、具身推理、新分词器
精选文章 万字长文深度解析经典VLA方案:PI-0 提到具身智能就绕不开的经典工作,自动驾驶的VLA虽然在本体确定的情况下(汽车四轮形式),也看起来只有EMMA比较合理的方案,那么来看下本体还不确定收敛的具身行业。我认为目前核心关注的应该是机械臂的操作技术突破。 (以产生和物理世界的交互,末端执行器更多使用两指夹爪、机械臂数量上的也可以任意拓展,从单
精选文章 系统解析VLA核心技术路线与典型架构 作者:ning 原文:https://zhuanlan.zhihu.com/p/1967989523196667587 引言:VLA 与智能机器人的具身智能革命 Vision-Language-Action(VLA)模型是具身人工智能(Embodied AI)的核心载体,其核心价值在于打破传统机器人
精选文章 GEN-0 出现的背后我们可以学到什么?以及对后续 VLA 发展的看法 作者:阿汐 原文:https://axi404.top/blog/embodied-talk-3 GEN-0 出现的背后,我们可以从中学到什么。一些被改变,一些新的东西出现,研究还在继续。 前言 最近 GEN-0 的发布对于具身智能领域可以说是轰动性的。Manipulation 作为 Robotic
精选文章 28篇最新论文!系统调研 VLA+RL 最近的研究趋势 作者:张海抱 原文:https://zhuanlan.zhihu.com/p/1940702256241575450 写在前面 VLA 时代的强化学习和 Atari 时代的强化学习有什么区别?个人认为有一好两坏两个方面。 好的方面是我们现在有一个非常有用的资源 —— 预训练的大模型,它可以对我们的探
青稞Talk SimpleVLA-RL:简单可拓展的VLA强化学习训练 VLA模型已成为使机器人在真实环境中解决各类复杂操作任务极具前景的新范式,其发展仍受限于数据稀缺与泛化能力不足等问题,而强化学习能缓解数据依赖并显著提升模型性能与泛化性,正受到广泛关注。 本次报告将解读所提出的专为VLA模型设计的高效强化学习框架SimpleVLA-RL,内容主要分为三部分: • 首
青稞Talk Virtual Community 虚拟社区:面向人、机器人与社会的开放世界模拟平台 人工智能与机器人技术的飞速发展,正在引领人类社会迈向一个人与机器人共处的新阶段,这将带来深刻的社会变革与挑战。 为探索这一未来,来自马萨诸塞大学阿默斯特分校、约翰霍普金斯大学和卡内基梅隆大学的研究者构建了“虚拟社区”平台——一个基于真实地理场景和通用物理引擎的开放世界模拟环境。 在这一平台中,研究者