青稞Talk 深度对话!2025 “青稞” AI 嘉年华,与 20+ 位青年科学家一起探讨AI 技术瞬间 本次活动专为青年科学家打造,旨在搭建一场 AI 技术的深度对话,来自学术和工业界的 20+ 青年科学家,将与大家一起回顾 2025,展望 2026!
精选文章 本地千问就能跑!具身 Agent 只纠错就够了:Spotter 用并行结构让 VLM 只在出错时出手,又快又准 简介 具身模型(VLA)失手后很难自己改错,而让 VLM 每一步都当指挥又太慢。Spotter 反过来:具身模型一直执行,本地 Qwen 并行盯着,确认出错时才由 VLM 出手修复并反思,修完交还控制。同样步数下成功率更高,成功的回合只多十几秒,本地一个千问就能跑。 论文:Spotter: Let
青稞Talk 直播预告!基于细粒度准则的多模态强化学习奖励,如何让模型的推理更忠于视觉证据? 视觉语言模型能生成流畅的回答,却可能看错图表数值,或在推理中引入图像无法支持的结论。 来自南洋理工大学 S-Lab、A*STAR 和 UIUC 的研究团队提出了 V-Rubrics,用逐项评分(rubrics)来处理“信用分配”(credit assignment)问题。 论文:V-Rubrics:
精选文章 ECCV 2026 | UniTranslator:统一多模态框架,破解图内机器翻译的「理解-生成」鸿沟 近日,由中国科学院信息工程所、小米 MiLM Plus、南开大学、宾汉姆顿大学合作完成的研究成果《UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation》被 ECCV 202
精选文章 ICML 2026 | 一段视频,同时听懂四道命令!OmniShow把多模态可控视频生成整合成统一「调音台」 论文标题:OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation 论文链接:https://arxiv.org/pdf/2604.11804 项目主页:https://correr-
青稞Talk 直播预告!聊聊 DPA & LLaVA-HUD v4:多模态大模型的深度预对齐与高效视觉编码优化 6月30日(周二)晚8点,青稞Talk 第134期,清华大学人工智能学院博士生方科晨,将直播分享《DPA & LLaVA-HUD v4:多模态大模型的深度预对齐与高效视觉编码优化》。 DPA 提出一种新的视觉语言模型架构:在视觉特征进入目标 LLM 前,引入小型 perceiver VLM 进行深度
青稞Talk 直播预告!聊聊 VeRL-Omni:基于VeRL及vLLM-Omni构建的面向多模态生成模型的开源 RL 后训练框架 随着文生图/视频及全模态模型快速落地,基于人类偏好与可验证信号的 RL 后训练已成为提升生成质量的关键手段。但与纯文本 LLM 不同,多模态生成 RL 在采样 rollout、reward 计算与分布式训练上的 I/O 与算力特征差异显著,亟需专门框架支撑。 VeRL-Omni 基于 VeRL及vL
精选文章 清华最新提出全新 VLM 架构 DPA:让多模态大模型先“对齐”,再“理解”! 近年来,视觉语言模型(Vision-Language Models, VLMs)已经成为多模态理解与推理任务中的主流范式。当前大多数 VLM 采用 “视觉编码器(通常为 Vision Transformer, ViT)+轻量投影层(projector)+大语言模型(Large Language Mo
精选文章 视觉 FLOPs 减半!清华最新成果 LLaVA-UHD v4,突破高分辨率多模态大模型的视觉编码效率瓶颈 随着多模态大语言模型(Multimodal Large Language Models, MLLMs)不断向文档理解、OCR、图表分析与高分辨率真实场景理解等细粒度任务拓展,高分辨率图像输入正在逐渐成为主流配置。 然而,更高的视觉分辨率也带来了急剧增长的视觉 token 数量,使得视觉编码本身逐渐成
精选文章 ACL 2026|多模态大模型是“看错”还是“想错”?浙大 VL-Calibration 让模型学会校准自信 作者:VL- Calibration研究团队 免费为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系:aiFreeCode 长期以来,大型视觉语言模型(LVLMs)在多模态理解与推理任务中展现了惊人的能力,但它们也面临着一个致命的弱点:经常“非常自信地胡说八道”。 模型不仅会产生严重
精选文章 多模态理解可能的未来:从描述世界到进入世界 作者:Yuwei Niu 应该是从去年做完WISE 开始,碰到我的朋友都以为我是做生成出身的,但其实我从最开始做科研就是沿着CLIP LLaVA的经典多模态理解路线,并且我心中也一直更喜欢多模态理解多一些。 然而,近一年以来,似乎社区的热度在多模态方面始终更倾向于生成(GPT-Image, Nano
青稞Talk Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界 多模态空间智能不仅要求机器理解任意相机视角下的现实世界,更要求其具备从任意相机方位创造世界的能力。然而,当前的视觉与生成模型大多仅隐式地感知相机几何,或将理解与生成任务割裂开来。 新加坡南洋理工大学、商汤科技、密西根大学和马普所的研究者们联手提出了一种全新的范式——将“相机几何”破译为一种“语言”,
精选文章 原生多模态推理的涌现时刻?ThinkMorph 仅用 24K 数据开启 Scaling 新赛道 NUS、ZJU、UW、Stanford、CUHK联合提出「ThinkMorph」,主张让文字与图像在统一架构里「原生协作」、「共同演化」,而不是像当下大多数多模态模型那样,看完图像就闭上眼睛,后续完全靠文字链条推进。 仅用2.4万条数据微调7B统一模型,视觉推理平均提升34.74%,多项任务比肩甚至
青稞Talk EditReward : 当 AI 学会“审美”,可控多模态生成的下一代范式 为什么开源图像编辑模型总感觉不如 GPT-4o 或 Nano-Banana 那么“听话”?核心痛点在于缺乏一个真正理解人类审美的 AI “裁判”。 3月14日(周六)上午10点,青稞 Talk 第112期,清华大学在读博士生吴科明,将直播分享《EditReward :当 AI 学会“审美”,可控多模
精选文章 RLLaVA开源:模块化多模态 RL 框架的设计与实践 RLLaVA:模块化多模态强化学习框架的设计与实践 OpenAI 联合创始人 Ilya Sutskever 在最近的访谈中指出,AI 已经从单纯堆算力的“规模扩张时代(Scaling Era)”回到了“研究时代(Research Era)”。 在这一背景下,强化学习(RL)正在从单纯的“偏好对齐”转
精选文章 深度解构!从 LLaVA 到 Qwen3-VL,多模态大模型主流架构的演进之路 作者:我要吃鸡腿 https://zhuanlan.zhihu.com/p/1963658684765833212 引言:当 AI 睁开双眼,我们看到了一个怎样的未来? 曾几何时,我们对人工智能的印象还停留在那个聪慧但略显“盲目”的“数字大脑”上——它能写诗、能编程、能回答深奥的哲学问题,但这一切都
精选文章 多模态统一模型的“理解”真的能指导“生成”吗?北大推出 UniSandbox,揭示理解-生成鸿沟与进化之路 来自北京大学与港大 MMLab 等机构合作的最新研究成果——UniSandbox 。这项工作深入探究了多模态大模型领域一个根本性的问题:统一模型中的“理解能力”是否真正反哺了“生成能力”? 代码与数据已在Github开源 Arxiv:https://arxiv.org/abs/2511.20561
精选文章 增强多模态大模型定位能力的一些方法 作者:爱工作的小小酥 https://zhuanlan.zhihu.com/p/1967662447109310211 多模态大模型在提升各项能力的时候,会发现grounding能力一直处于落后的状态。很多指标都比不过专有的相关任务的模型。那么现在都有什么方法来提升大模型的这项能力呢? 今天就介绍几
青稞Talk Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架 训练与人类意图对齐的多模态大模型是一个长期挑战。传统的基于分数的奖励模型在强化学习(RLHF)中存在准确性低、泛化性弱和可解释性差等问题。 11月15日(周六)上午10点,青稞社区和减论平台将联合组织青稞Talk 第89期,并邀请到北京大学博士生周嘉懿,直播分享《Generative RLHF-V:
青稞Talk 从 DeepSeek-OCR 到 Glyph:深入理解图像-文本压缩技术 长文本建模在智能体、文档问答等任务中具有重要意义,但传统方法在扩展上下文窗口时往往面临计算与内存开销巨大的挑战。 近期,视觉文本压缩(光学文本压缩)的概念因 DeepSeek-OCR 的提出而备受关注,其证明了文本信息可通过图像形式实现近乎无损的压缩与恢复。 在这一背景下,我们的同期工作 Glyph
青稞Talk 从BLIP3o到BLIP3o-NEXT:迈向统一生成与理解的多模态大模型 8月19日(周二)晚8点,青稞Talk 第73期,马里兰大学博士生陈玖海,将直播分享《从BLIP3o到BLIP3o-NEXT:迈向统一生成与理解的多模态大模型》。 代码:https://github.com/JiuhaiChen/BLIP3o 主题提纲 从BLIP3o到BLIP3o-NEXT:迈向
青稞Talk ChatRex & RexSeek & RexThinker: 结合多模态大语言模型的目标检测模型构建 7月15日晚8点,青稞Talk 第63期,华南理工大学与IDEA 联合培养博士蒋擎,将直播分享《ChatRex & RexSeek & RexThinker: 结合多模态大语言模型的目标检测模型构建》。 分享嘉宾 蒋擎,华南理工大学博士生,IDEA-CVR 实习生。其主要研究方向为开集目标检测,多模
青稞Talk GUI-Reflection:让多模态 GUI 智能体获得反思纠错能力的训练框架 GUI-Reflection,是一个开源的,让端到端多模态GUI模型学会自我反思和纠错的自动化框架。GUI-Reflection在智能体的各个训练阶段引入 “反思与纠错”机制,这一机制贯穿预训练、监督微调和在线训练全过程,模拟了人类“犯错→反思→重试”的认知过程,使模型在面对真实环境中的不确定性时,
青稞Talk InternVL3,GPT-4o开源平替:多模态通用感知大模型的技术演进与应用探索 发展更为通用的智能技术是下一代人工智能的重要突破口,学习一个可以广泛应用于各种模态和各种任务的通用感知模型是发展更为通用的智能技术的重要步骤。 6月21日10:00点,青稞Talk第56期,复旦大学博士生王玮赟,将直播分享《InternVL3,GPT-4o开源平替:多模态通用感知大模型的技术演进与应
青稞Talk BAGEL:统一生成理解的多模态基础模型 6月12日20:00,青稞Talk 第54期,BAGEL 一作、中国科学院博士生黎昆昌,将直播分享《BAGEL:统一生成理解的多模态基础模型》。 关于 BAGEL 的更多细节请参考:字节Seed开源BAGEL: 更聪明的统一生成理解模型 分享嘉宾 黎昆昌,中国科学院博士五年级,导师是乔宇、王亚立,研
青稞Talk VITA:开源交互式多模态基础大模型 10月14日19点,青稞Talk 第26期,VITA 第一作者,南京大学智能科学与技术学院研究员、助理教授、博导傅朝友,将直播分享《VITA:开源交互式多模态基础大模型》。 主讲嘉宾 傅朝友,南京大学智能科学与技术学院研究员,助理教授,博导。2022年博士毕业于中国科学院自动化研究所,2022年-2
青稞Talk mPLUG-Owl3:探索长序列模型架构的通用多模态大模型 9月10日19点,青稞Talk 第22期,阿里巴巴通义实验室高级算法工程师、华东师范大学博士叶加博,将直播分享《mPLUG-Owl3:探索长序列模型架构的通用多模态大模型》。 主讲嘉宾 叶加博,华东师范大学博士,阿里巴巴通义实验室高级算法工程师,参与通义多模态大模型mPLUG家族的研发,包含多模态底
青稞Talk InternVL 2.0:通过渐进式策略扩展开源多模态大模型的性能边界 8月6日晚7点,青稞Talk第18期,香港中文大学博士后、上海人工智能实验室青年科学家、“书生”系列视觉基础模型核心开发者王文海,将直播分享《InternVL 2.0:通过渐进式策略扩展开源多模态大模型的性能边界》。他将和大家一起探讨图文多模态大模型的基本原理和技术,如何利用开源套件构建强大的多模态
青稞Talk SEED-Story:生成长篇图文故事的多模态大型语言模型 7月30日晚7点,青稞Talk第17期,香港科技大学(广州)博士生杨帅,将直播分享《SEED-Story:生成长篇图文故事的多模态大型语言模型》。 主讲嘉宾 杨帅,香港科技大学(广州)人工智能方向的博士研究生,导师是陈颖聪博士。他的研究方向是高效深度学习和生成模型,相关成果已发表在ICCV,ICLR
青稞Talk Mini-Gemini:挖掘多模态视觉语言大模型的潜力 4月24日晚7点,青稞社区组织【青稞Talk】第四期,邀请到 Mini-Gemini 一作、香港中文大学在读博士李彦玮参与,分享《Mini-Gemini:挖掘多模态视觉语言大模型的潜力》。 分享嘉宾 李彦玮,香港中文大学计算机科学与工程系四年级博士生,师从贾佳亚教授;主要关注方向为计算机视觉和多模态