Tag

世界模型

共 31 篇文章

面向空间智能的统一世界模型Puffin-World:从“生成画面”走向“理解并构建物理可信世界”

面向空间智能的统一世界模型Puffin-World:从“生成画面”走向“理解并构建物理可信世界”

世界模型正在成为空间智能和物理AI的重要技术主线。真正的世界模型不应只是逐帧生成逼真的像素,还需要理解当前视角所处的物理世界朝向、场景的几何结构,并支持对世界的建模与连贯模拟。 在这一方向上,来自南洋理工大学S-Lab和大晓机器人等机构的研究团队近期发布了 Puffin-World。它让同一个模型同
wangguo
0
0
64
从"如何生成"到"如何验证",探讨物理一致世界模型如何实现可扩展机器人学习

从"如何生成"到"如何验证",探讨物理一致世界模型如何实现可扩展机器人学习

当机器人要学会叠衣物、理线缆、摆弄软体——可变形物体操作的真实数据采集成本高昂、状态空间复杂、仿真与现实的差距显著。物理一致的世界模型,能成为可扩展机器人学习的"数据引擎"吗? 9月1日(周二)20:00,青稞Talk 第150期,上海人工智能实验室物理智能中心青年研究员周云松、王帅,将以 SIM1
wangguo
0
0
113
系统梳理 World Model in Agentic RL!

系统梳理 World Model in Agentic RL!

作者:Sherry https://www.xiaohongshu.com/user/profile/642d87c90000000011020daf World Model 这个概念其实已经提出很久了,我最近才第一次系统涉猎。虽然大家都在讨论 World Model,但真正试图解决的似乎并不是同一
wangguo
0
0
146
不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界

不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界

作者:尚书尧 中科院自动化所 自然语言连接了 AI 与人类积累的数字知识。下一步,当AI走入物理世界,PhiZero希望用“物理语言”连接 AI 智能与真实世界。 人类用语言保存经验、传递知识,也用语言进行思考。从日常交流到科学定律,从历史记录到程序代码,自然语言凝结了人类长期积累的知识与经验。今天
wangguo
0
0
109
世界生成模型不仅仅是未来模拟器!上海交通大学最新提出 Enfold:把世界模型的“未来计算”折叠进当下

世界生成模型不仅仅是未来模拟器!上海交通大学最新提出 Enfold:把世界模型的“未来计算”折叠进当下

作者:曾伟力,上海交通大学博士生 无需在每次决策时生成视频,也能让未来建模持续影响机器人的实时控制 世界模型让机器人拥有“想象未来”的能力,但如果每次动作预测都要完整运行一次视频生成,想象本身就会成为实时控制的负担。 来自上海交通大学和齐鲁工业大学(山东省科学院)的研究团队提出 Enfold:不再把
wangguo
0
0
107
直播预告!聊聊 NTU & 大晓机器人最新开源的新一代具身智能数据范式 ACE-Data-0

直播预告!聊聊 NTU & 大晓机器人最新开源的新一代具身智能数据范式 ACE-Data-0

ACE-Data-0 是 南洋理工大学 S-Lab 和大晓机器人联合开源的一个面向具身智能与机器人学习的人类中心、多模态、长时程交互数据集。 基于环境式采集系统 ACE,将真实家居环境转化为空间标定、时间同步的数据采集平台,同时记录第一视角与多视角视频、全身与手部运动、物体几何及六自由度动作、运动轨
wangguo
0
0
89
清华 x 正行创新最新开源 LAWAM:隐空间世界动作模型将 WAM 瘦身24倍,同时成功率90%+!

清华 x 正行创新最新开源 LAWAM:隐空间世界动作模型将 WAM 瘦身24倍,同时成功率90%+!

折毛巾时,物理世界不会停下来等待机器人思考。 布料会滑动,褶皱会改变,前一秒还合适的抓取点,下一秒可能已经偏离。真实机器人做动态操作时,“想象未来”不能停留在离线视频生成里。它必须进入控制回路,在动作还来得及调整时,给策略一个可用的未来线索。 一个直接的想法,是让模型先生成未来画面,再让机器人根据这
wangguo
0
0
167
VLA的OOD困境:不是模型不够大

VLA的OOD困境:不是模型不够大

作者:原来ID可以这么长 https://zhuanlan.zhihu.com/p/2060361643851256385 核心要点速览 Vision-Language-Action(VLA)模型虽然在机器人操控任务中展现出强大的能力,但在面对分布外(Out-of-Distribution, OOD
wangguo
0
0
182
青稞Talk预告!NTU MMLab 博士后许牧天:面向时空具身仿真的运动学 4D 世界建模 Kinema4D

青稞Talk预告!NTU MMLab 博士后许牧天:面向时空具身仿真的运动学 4D 世界建模 Kinema4D

在具身智能领域,模拟机器人轨迹至关重要。近期,研究者开始利用视频生成模型来进行模拟,但仍存在关键缺陷: (1) 维度缺失:局限于 2D空间,缺乏交互所需的 4D 时空约束; (2) 精度不足:依赖语言指令、隐式动作理解、或静态环境先验,使得模型需要去"猜测"潜在的机器人动作,难以提供精确控制和动态引
wangguo
0
0
83
高德最新开源 ABot-M0.5: 统一移动操作的世界-动作模型

高德最新开源 ABot-M0.5: 统一移动操作的世界-动作模型

作者:杨燕丹,高德地图算法工程师 导语:通用机器人的终极考验,在于能否在复杂多变的物理世界中实现“边走边操作”(Mobile Manipulation)。今日,备受瞩目的具身智能最新成果ABot-M0.5正式发布。本文工作由高德地图完成,是ABot-Manipulation系列继ABot-M0之后的
青稞
0
0
110
World Action Models 真的比 VLAs 更强吗?

World Action Models 真的比 VLAs 更强吗?

作者:Kadima-Du 原文:https://zhuanlan.zhihu.com/p/2030412523703379683 研究人员比较了视觉-语言-动作(VLA)模型和世界动作模型(WAM)在各种视觉和语言扰动下机器人策略的鲁棒性。 WAMs由于其视频预训练,在噪音、光照和布局变化方面表现出
wangguo
0
0
135
World Model VLA:真的是形似而神不似?

World Model VLA:真的是形似而神不似?

作者:秋光的梦 https://zhuanlan.zhihu.com/p/2003112989201553035 近期许多基于视频生成网络的VA(也可以说是WAM)的工作,从25年末的LVP到Mimic-Video再到最近比较火的Lingbot-VA以及两篇NVIDIA的工作Cosmos Polic
wangguo
0
0
151
World Model方向观察:大一统很远,闭环进化更近

World Model方向观察:大一统很远,闭环进化更近

作者:Kiki Huang http://xhslink.com/o/9vI0xkOqra3 最近集中听了几场 world model 相关分享,听下来我最大的感受是:大家其实都在逐渐放弃一种过于理想化的大一统模型想象。 不是说没人想做 unified model,而是落到具体问题上,video、J
wangguo
0
0
138
Model-Based RL 与世界模型!拆解 Latent 世界模型范式

Model-Based RL 与世界模型!拆解 Latent 世界模型范式

一、为什么具身智能重新关注世界模型? "世界模型"在具身智能领域似乎又变成了一个高频词,它为什么又回到了热门呢,和传统强化学习又有哪些区别? 首先,从 Model-Based RL 的视角看,世界模型并不是一个全新的概念,它可以理解为 Model-Based RL 中的 learned dynami
wangguo
0
0
249
还在用 2D 空间训具身?南洋理工 MMLab 提出 4D 具身世界模拟器,构建虚拟与现实的时空桥梁!

还在用 2D 空间训具身?南洋理工 MMLab 提出 4D 具身世界模拟器,构建虚拟与现实的时空桥梁!

本文第一作者许牧天,南洋理工大学MMLab博士后。导师刘子纬教授,为本文通讯作者。 机器人-环境交互模拟是具身智能的核心。近期,一些研究展现了利用视频生成技术突破传统模拟器“僵化”的视觉与物理限制的潜力。 然而,这些工作主要在 2D 空间运行、或受制于静态环境的单一引导,忽略了一个基本事实:机器人与
青稞
0
0
89
直播预告!深度探讨:世界模型(World Model)是进化终点还是视觉幻象?

直播预告!深度探讨:世界模型(World Model)是进化终点还是视觉幻象?

物理智能的“预言家”:世界模型(World Model)是进化终点还是视觉幻象? 在具身智能的演进历程中,我们正处于从“机械模仿”向“认知决策”跨越的关键节点。早期的模型主要依赖行为克隆,但在涉及精密操作时难以为继。 如今,世界模型正成为连接数字智慧与物理交互的桥梁,它不仅让机器人知道“做什么”,更
wangguo
0
0
417
关于 World Action Model 的思考和总结

关于 World Action Model 的思考和总结

作者:硝基苯 https://zhuanlan.zhihu.com/p/2019875354538428076 写在前面 从过年一直到现在,World Action Model这个概念很火,学术界有很多工作(Cosmos Policy, DreamZero, Motus, LingBot-VA, F
wangguo
0
0
646
Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

多模态空间智能不仅要求机器理解任意相机视角下的现实世界,更要求其具备从任意相机方位创造世界的能力。然而,当前的视觉与生成模型大多仅隐式地感知相机几何,或将理解与生成任务割裂开来。 新加坡南洋理工大学、商汤科技、密西根大学和马普所的研究者们联手提出了一种全新的范式——将“相机几何”破译为一种“语言”,
wangguo
0
0
313
正在直播 B 站