Tag

视频生成

共 14 篇文章

不让每一层都“翻旧账”!浙大 & 港大最新开源 LayerRecall,让长视频记忆更准、用得更精

不让每一层都“翻旧账”!浙大 & 港大最新开源 LayerRecall,让长视频记忆更准、用得更精

AI能连续生成一分钟视频,就算解决了「长视频」问题吗? 真正的考验,往往发生在主角离开镜头之后。 第一幕,一个穿特定服装的人出现在实验室;第二幕,他离开画面;第三幕再次返回时,模型可能已经给他换了脸、换了衣服,甚至把原本应该回来的物体也一起「忘」了。 原因并不神秘。自回归视频模型通常一段一段生成画面
wangguo
0
0
60
多模态理解可能的未来:从描述世界到进入世界

多模态理解可能的未来:从描述世界到进入世界

作者:Yuwei Niu 应该是从去年做完WISE 开始,碰到我的朋友都以为我是做生成出身的,但其实我从最开始做科研就是沿着CLIP LLaVA的经典多模态理解路线,并且我心中也一直更喜欢多模态理解多一些。 然而,近一年以来,似乎社区的热度在多模态方面始终更倾向于生成(GPT-Image, Nano
wangguo
0
0
362
Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

多模态空间智能不仅要求机器理解任意相机视角下的现实世界,更要求其具备从任意相机方位创造世界的能力。然而,当前的视觉与生成模型大多仅隐式地感知相机几何,或将理解与生成任务割裂开来。 新加坡南洋理工大学、商汤科技、密西根大学和马普所的研究者们联手提出了一种全新的范式——将“相机几何”破译为一种“语言”,
wangguo
0
0
312
为什么视频生成稀疏注意力做不好?中科院自动化所最新提出稀疏注意力纠偏新范式

为什么视频生成稀疏注意力做不好?中科院自动化所最新提出稀疏注意力纠偏新范式

生成式视频模型正以前所未有的速度进化,从数秒短片拓展至长时段叙事,从模糊低清跃升至逼真4K。然而,随着视频时长和空间分辨率的提升,序列长度急剧增加,二次复杂度的注意力计算量随之飙升,即便采用 FlashAttention 等高效优化,推理延时仍然难以遏制。以生成一段 720p、5 秒的视频为例,单是
wangguo
0
0
140
SANA-Series:探索图像视频扩散模型的高效设计与加速

SANA-Series:探索图像视频扩散模型的高效设计与加速

随着 GenAI 视觉模型(如 Sora 2、Google Nano Banana)的爆炸式发展,其惊人的效果背后是庞大的计算资源消耗。图像和视频模型的推理 FLOPs 甚至远超 LLM,导致部署成本高昂,难以普及。 SANA系列模型作为高效生成式基础模型的前沿探索,通过引入线性注意力(Linear
wangguo
0
0
520
Sparse VideoGen:无需重新训练的 DiTs 推理加速框架

Sparse VideoGen:无需重新训练的 DiTs 推理加速框架

5月29日上午9点,青稞Talk 第52期,加州大学伯克利分校计算机科学博士生席浩诚,将直播分享《Sparse VideoGen:无需重新训练的视频扩散 Transformer 推理加速框架》。 分享嘉宾 席浩诚,加州大学伯克利分校计算机科学博士一年级学生,师从Kurt Keutzer教授,研究方向
青稞
0
0
283
Motion Dreamer:面向自动驾驶与物理世界对齐的视频生成模型

Motion Dreamer:面向自动驾驶与物理世界对齐的视频生成模型

1月14日19:00,青稞Talk 第37期,香港科技大学(广州)博士生许添硕,将直播分享《Motion Dreamer:面向自动驾驶与物理世界对齐的视频生成模型》。 主讲嘉宾 许添硕,香港科技大学(广州)博士生,导师为陈颖聪教授,研究兴趣是自动驾驶、视频生成。 主题提纲 Motion Dreame
青稞
0
0
151
Follow Family:可控视频生成方法探索与应用

Follow Family:可控视频生成方法探索与应用

主讲嘉宾 马跃,香港科技大学计算机博士生,清华大学电子信息硕士,主要研究领域是视频生成、图片生成等,曾在百度,腾讯 AI Lab,腾讯混元作为算法研究实习,在NeurIPS,Siggraph,AAAI,CVPR,TMM等发表多篇高水平文章,曾经获得北京市优秀毕业生等荣誉称号。 主题提纲 Follow
青稞
0
0
209
K-Sort Arena:视觉生成模型的高效人类偏好竞技场

K-Sort Arena:视觉生成模型的高效人类偏好竞技场

12月24日20点,青稞Talk 第34期,中国科学院自动化研究所博士生、新加坡国立大学访问博士生李志凯,将直播分享《K-Sort Arena:视觉生成模型的高效人类偏好竞技场》。 主讲嘉宾 李志凯,中国科学院自动化研究所博士生,新加坡国立大学访问博士生。研究方向为高效深度学习和模型压缩,以第一作者
青稞
0
0
196
CogVideoX 视频生成开源模型上手实践

CogVideoX 视频生成开源模型上手实践

9月23日20点,青稞Talk 第23期,智谱AI算法工程师,CogVideoX作者之一张昱轩,将直播分享《CogVideoX 视频生成开源模型上手实践》 主讲嘉宾 张昱轩,智谱AI算法工程师,CogVideoX作者之一;智谱多个开源仓库的核心贡献者。 主题提纲 CogVideoX 视频生成开源模型
青稞
0
0
220
正在直播 B 站