Tag

多模态大模型

共 30 篇文章

本地千问就能跑!具身 Agent 只纠错就够了:Spotter 用并行结构让 VLM 只在出错时出手,又快又准

本地千问就能跑!具身 Agent 只纠错就够了:Spotter 用并行结构让 VLM 只在出错时出手,又快又准

简介 具身模型(VLA)失手后很难自己改错,而让 VLM 每一步都当指挥又太慢。Spotter 反过来:具身模型一直执行,本地 Qwen 并行盯着,确认出错时才由 VLM 出手修复并反思,修完交还控制。同样步数下成功率更高,成功的回合只多十几秒,本地一个千问就能跑。 论文:Spotter: Let
wangguo
0
0
3
ACL 2026|多模态大模型是“看错”还是“想错”?浙大 VL-Calibration 让模型学会校准自信

ACL 2026|多模态大模型是“看错”还是“想错”?浙大 VL-Calibration 让模型学会校准自信

作者:VL- Calibration研究团队 免费为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系:aiFreeCode 长期以来,大型视觉语言模型(LVLMs)在多模态理解与推理任务中展现了惊人的能力,但它们也面临着一个致命的弱点:经常“非常自信地胡说八道”。 模型不仅会产生严重
青稞
0
0
216
多模态理解可能的未来:从描述世界到进入世界

多模态理解可能的未来:从描述世界到进入世界

作者:Yuwei Niu 应该是从去年做完WISE 开始,碰到我的朋友都以为我是做生成出身的,但其实我从最开始做科研就是沿着CLIP LLaVA的经典多模态理解路线,并且我心中也一直更喜欢多模态理解多一些。 然而,近一年以来,似乎社区的热度在多模态方面始终更倾向于生成(GPT-Image, Nano
wangguo
0
0
364
Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

Puffin: 统一多模态空间智能大模型——从任意视角理解和生成世界

多模态空间智能不仅要求机器理解任意相机视角下的现实世界,更要求其具备从任意相机方位创造世界的能力。然而,当前的视觉与生成模型大多仅隐式地感知相机几何,或将理解与生成任务割裂开来。 新加坡南洋理工大学、商汤科技、密西根大学和马普所的研究者们联手提出了一种全新的范式——将“相机几何”破译为一种“语言”,
wangguo
0
0
313
RLLaVA开源:模块化多模态 RL 框架的设计与实践

RLLaVA开源:模块化多模态 RL 框架的设计与实践

RLLaVA:模块化多模态强化学习框架的设计与实践 OpenAI 联合创始人 Ilya Sutskever 在最近的访谈中指出,AI 已经从单纯堆算力的“规模扩张时代(Scaling Era)”回到了“研究时代(Research Era)”。 在这一背景下,强化学习(RL)正在从单纯的“偏好对齐”转
青稞
0
0
361
增强多模态大模型定位能力的一些方法

增强多模态大模型定位能力的一些方法

作者:爱工作的小小酥 https://zhuanlan.zhihu.com/p/1967662447109310211 多模态大模型在提升各项能力的时候,会发现grounding能力一直处于落后的状态。很多指标都比不过专有的相关任务的模型。那么现在都有什么方法来提升大模型的这项能力呢? 今天就介绍几
青稞
0
0
221
Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架

Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架

训练与人类意图对齐的多模态大模型是一个长期挑战。传统的基于分数的奖励模型在强化学习(RLHF)中存在准确性低、泛化性弱和可解释性差等问题。 11月15日(周六)上午10点,青稞社区和减论平台将联合组织青稞Talk 第89期,并邀请到北京大学博士生周嘉懿,直播分享《Generative RLHF-V:
青稞
0
0
355
从 DeepSeek-OCR 到 Glyph:深入理解图像-文本压缩技术

从 DeepSeek-OCR 到 Glyph:深入理解图像-文本压缩技术

长文本建模在智能体、文档问答等任务中具有重要意义,但传统方法在扩展上下文窗口时往往面临计算与内存开销巨大的挑战。 近期,视觉文本压缩(光学文本压缩)的概念因 DeepSeek-OCR 的提出而备受关注,其证明了文本信息可通过图像形式实现近乎无损的压缩与恢复。 在这一背景下,我们的同期工作 Glyph
青稞
0
0
274
GUI-Reflection:让多模态 GUI 智能体获得反思纠错能力的训练框架

GUI-Reflection:让多模态 GUI 智能体获得反思纠错能力的训练框架

GUI-Reflection,是一个开源的,让端到端多模态GUI模型学会自我反思和纠错的自动化框架。GUI-Reflection在智能体的各个训练阶段引入 “反思与纠错”机制,这一机制贯穿预训练、监督微调和在线训练全过程,模拟了人类“犯错→反思→重试”的认知过程,使模型在面对真实环境中的不确定性时,
青稞
0
0
248
InternVL3,GPT-4o开源平替:多模态通用感知大模型的技术演进与应用探索

InternVL3,GPT-4o开源平替:多模态通用感知大模型的技术演进与应用探索

发展更为通用的智能技术是下一代人工智能的重要突破口,学习一个可以广泛应用于各种模态和各种任务的通用感知模型是发展更为通用的智能技术的重要步骤。 6月21日10:00点,青稞Talk第56期,复旦大学博士生王玮赟,将直播分享《InternVL3,GPT-4o开源平替:多模态通用感知大模型的技术演进与应
青稞
0
0
307
BAGEL:统一生成理解的多模态基础模型

BAGEL:统一生成理解的多模态基础模型

6月12日20:00,青稞Talk 第54期,BAGEL 一作、中国科学院博士生黎昆昌,将直播分享《BAGEL:统一生成理解的多模态基础模型》。 关于 BAGEL 的更多细节请参考:字节Seed开源BAGEL: 更聪明的统一生成理解模型 分享嘉宾 黎昆昌,中国科学院博士五年级,导师是乔宇、王亚立,研
青稞
0
0
511
VITA:开源交互式多模态基础大模型

VITA:开源交互式多模态基础大模型

10月14日19点,青稞Talk 第26期,VITA 第一作者,南京大学智能科学与技术学院研究员、助理教授、博导傅朝友,将直播分享《VITA:开源交互式多模态基础大模型》。 主讲嘉宾 傅朝友,南京大学智能科学与技术学院研究员,助理教授,博导。2022年博士毕业于中国科学院自动化研究所,2022年-2
青稞
0
0
202
mPLUG-Owl3:探索长序列模型架构的通用多模态大模型

mPLUG-Owl3:探索长序列模型架构的通用多模态大模型

9月10日19点,青稞Talk 第22期,阿里巴巴通义实验室高级算法工程师、华东师范大学博士叶加博,将直播分享《mPLUG-Owl3:探索长序列模型架构的通用多模态大模型》。 主讲嘉宾 叶加博,华东师范大学博士,阿里巴巴通义实验室高级算法工程师,参与通义多模态大模型mPLUG家族的研发,包含多模态底
青稞
0
0
261
InternVL 2.0:通过渐进式策略扩展开源多模态大模型的性能边界

InternVL 2.0:通过渐进式策略扩展开源多模态大模型的性能边界

8月6日晚7点,青稞Talk第18期,香港中文大学博士后、上海人工智能实验室青年科学家、“书生”系列视觉基础模型核心开发者王文海,将直播分享《InternVL 2.0:通过渐进式策略扩展开源多模态大模型的性能边界》。他将和大家一起探讨图文多模态大模型的基本原理和技术,如何利用开源套件构建强大的多模态
青稞
0
0
145
SEED-Story:生成长篇图文故事的多模态大型语言模型

SEED-Story:生成长篇图文故事的多模态大型语言模型

7月30日晚7点,青稞Talk第17期,香港科技大学(广州)博士生杨帅,将直播分享《SEED-Story:生成长篇图文故事的多模态大型语言模型》。 主讲嘉宾 杨帅,香港科技大学(广州)人工智能方向的博士研究生,导师是陈颖聪博士。他的研究方向是高效深度学习和生成模型,相关成果已发表在ICCV,ICLR
青稞
0
0
148
Mini-Gemini:挖掘多模态视觉语言大模型的潜力

Mini-Gemini:挖掘多模态视觉语言大模型的潜力

4月24日晚7点,青稞社区组织【青稞Talk】第四期,邀请到 Mini-Gemini 一作、香港中文大学在读博士李彦玮参与,分享《Mini-Gemini:挖掘多模态视觉语言大模型的潜力》。 分享嘉宾 李彦玮,香港中文大学计算机科学与工程系四年级博士生,师从贾佳亚教授;主要关注方向为计算机视觉和多模态
青稞
0
0
225
正在直播 B 站