Tag

视觉语言大模型

共 10 篇文章

Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

多模态空间智能不仅要求机器理解任意相机视角下的现实世界,更要求其具备从任意相机方位创造世界的能力。然而,当前的视觉与生成模型大多仅隐式地感知相机几何,或将理解与生成任务割裂开来。 新加坡南洋理工大学、商汤科技、密西根大学和马普所的研究者们联手提出了一种全新的范式——将“相机几何”破译为一种“语言”,
wangguo
0
0
312
SimpleVLA-RL:简单可拓展的VLA强化学习训练

SimpleVLA-RL:简单可拓展的VLA强化学习训练

VLA模型已成为使机器人在真实环境中解决各类复杂操作任务极具前景的新范式,其发展仍受限于数据稀缺与泛化能力不足等问题,而强化学习能缓解数据依赖并显著提升模型性能与泛化性,正受到广泛关注。 本次报告将解读所提出的专为VLA模型设计的高效强化学习框架SimpleVLA-RL,内容主要分为三部分: • 首
青稞
0
0
285
VILA^2 :视觉语言模型能力的自我提升

VILA^2 :视觉语言模型能力的自我提升

主讲嘉宾 方云浩,本科毕业于浙江大学,硕士毕业于UCSD(苏昊教授),自24年2月起在Nvidia VILA团队实习(陆垚博士、韩松教授)。主要科研方向是大模型相关的1. 推理能力(通过探索提升推理上限: Unleashing the Creative Mind;通过演绎验证获得可靠思维链: Ded
青稞
0
0
140
MiniCPM-V:端侧可用的GPT-4V级多模态大模型

MiniCPM-V:端侧可用的GPT-4V级多模态大模型

7月15日晚7点,青稞Talk第15期,清华大学自然语言处理实验室博士生余天予,将直播分享《MiniCPM-V:端侧可用的 GPT-4V 级多模态大模型》。 分享嘉宾 余天予,清华大学自然语言处理实验室博士生,发表AAAI、CVPR 等人工智能顶会论文多篇,主要研究方向为多模态大模型。 主题提纲 M
青稞
0
0
214
3D-VLA:构建生成式三维具身世界模型

3D-VLA:构建生成式三维具身世界模型

5月10日晚7点,青稞社区组织【青稞Talk】第五期,邀请到 3D-VLA 一作甄昊宇参与,分享《3D-VLA:构建生成式三维具身世界模型》。 分享嘉宾 甄昊宇,上海交通大学大四,麻省理工学院访问学生,在ICML、NeurIPS、ICCV等会议上发表多篇论文。 主题提纲 3D-VLA:构建生成式三维
青稞
0
0
186
从 3D LLM 到 MultiPLY ,3D 具身基础模型的构建

从 3D LLM 到 MultiPLY ,3D 具身基础模型的构建

4月19日早9点,青稞社区组织【青稞Talk】第三期,邀请到 3D-LLM 和 MultiPLY 一作、加州大学洛杉矶分校在读博士洪逸宁参与,分享《从 3D LLM 到 MultiPLY ,3D 具身基础模型的构建》。 分享嘉宾 洪逸宁,加州大学洛杉矶分校在读博士,MIT-IBM沃森人工智能实验室研
青稞
0
0
224
正在直播 B 站