自回归 VLA 到底怎么做?从问题定义到工程落地,揭秘通用机器人最关键的那条路线
在具身智能快速发展的背景下,视觉-语言-动作(VLA)模型已成为机器人自主操控的核心研究方向。 当前挑战:主流 VLA 方案多聚焦动作拟合与模仿学习,往往弱化了语言理解、常识推理与开放泛化能力。 核心矛盾:通用 VLM 与具身 VLA 数据存在显著表征鸿沟,直接制约了模型的泛化性能与落地效果。 7月
在具身智能快速发展的背景下,视觉-语言-动作(VLA)模型已成为机器人自主操控的核心研究方向。 当前挑战:主流 VLA 方案多聚焦动作拟合与模仿学习,往往弱化了语言理解、常识推理与开放泛化能力。 核心矛盾:通用 VLM 与具身 VLA 数据存在显著表征鸿沟,直接制约了模型的泛化性能与落地效果。 7月
作者:Shilong Liu,Postdoc Princeton,哥大助理教授(拟入职) https://lsl.zone/blog/2026/a-taxonomy-of-self-evolving-agents/ 自进化 Agent(Self-evolving agents)正变得越来越流行。 H
过去一年,OPD 强势改写大模型后训练格局,消融蒸馏与强化学习的技术壁垒,驱动模型从静态对齐迈向自主进化,一众关乎 AI 自我迭代的前沿疑问应运而生。 在 5 月 30 日,#青稞AMA 第 3 期:On-Policy Distillation(OPD) 专题中,青稞社区邀请到了当前 OPD 方向最
作者:storm 原文:https://zhuanlan.zhihu.com/p/2025536259628569667 英文博客:http://yuqianfu.notion.site/revisiting-opd 论文链接:https://huggingface.co/papers/2603.2
A Comprehensive Textbook on AI Agent Infrastructure Design "The model is the agent. The code is the harness. Build great harnesses. The agent will do
作者:Escapist https://zhuanlan.zhihu.com/p/2009410859999437740 Introduction 从 SFT、RLHF/RLVR 到 On-Policy Distillation 大语言模型的后训练在很长一段时间内有两种主要的方式。 第一个是监督微调
作者:一木不 原文:https://zhuanlan.zhihu.com/p/2004306938188537902 关于On-Policy的工作,我感觉大部分在卖概念,没有太本质上的创新,比如一会说On-Policy Distillation是SFT、一会说是RL,但感觉不如就叫它Distilla
作者:Yancheng He, Weixun Wang, and Xiaoyang Li | Project Leader: Weixun Wang English Version:https://www.notion.so/The-Bitter-Lesson-Behind-Building-Age
直播间的观众朋友们,大家好。首先祝大家新年快乐。刚刚过完假回来,今天很高兴受邀来到青稞社区给大家做一个技术分享。主题是关于 MiniMax M2.1 的 Agent 后训练技术。 我先简单介绍一下 MiniMax M2.1。M2.1 是我们在上一代 M2 模型的基础之上,进一步做了后训练优化的模型。
序章:三条哲学 在探讨技术之前,我们需要先确立三条基石性的认知: 人类的本质:人类在生物界的独特性在于高等智慧,而人与动物的分野,在于制造与使用工具的能力。 大模型的定位:ChatGPT 标志着人类首次赋予机器高等智慧。大模型之于现代人类,如同智慧之于原始人类,不仅不可或缺,更不可退化。 Agent
作者: ZxZhao,复旦大学集成电路与系统设计博士 https://zhuanlan.zhihu.com/p/1988221694591128167 大模型部署技术的演进太快了,相信有很多朋友两三年没有关注这个领域,对相关的名词已经是一头雾水了。这篇文章以杂谈的形式,和大家聊聊这里的几个关键技术节
作者:初级程序员 https://zhuanlan.zhihu.com/p/1978480903136245222 本文面向已了解强化学习中策略梯度(policy gradient)、优势函数(advantage)、重要性采样(importance sampling)等概念的读者,重点对大模型强化学
完整PPT下载:【https://t.zsxq.com/gXFFx】 在往期 Talk 分享中,RLinf 团队的林灏、臧宏之分别为大家讲解了 RLinf 的系统设计以及 RLinf VLA 的实践。本期 Talk 我们继续和 RLinf 团队、北京大学博士生陈康一起聊一聊面向流匹配 VLA 的强化
本工作于字节跳动完成。首次发布于2025年9月17日。 原文:https://richardli.xyz/rl-collapse 图1. 我们在Qwen3-14B-Base上进行的四次失败的GRPO TIR实验的奖励(左)和gradient norm(右)。所有实验在每个训练步骤采样 1024条轨
作者:Hongliang Cao https://chlience.com/articles/agentic-rl-research/ 推理 一次模型调用 对于一次典型的 agentic inference,第 i 次模型调用可以分为三个层次:agent harness 维护的内部状态、按照特定协议
过去几年,大语言模型(LLM)的能力快速提升。从写代码、完成复杂推理,到辅助科研和软件开发,模型正在逐渐成为越来越强大的工程助手。 但一个更深层的问题正在出现:如果模型能够帮助人类构建软件,大模型是否也能够反过来优化支撑自身运行的基础设施? 换句话说:Can Large Language Model
Agent绝大部分时候都运行在环境当中,那么在agent进化的过程中,有没有办法让环境也进化呢。 论文:EnvHarness: Awakening Static Worlds for Agent Learning 链接:https://arxiv.org/abs/2608.19880 主页:http
关于缩放定律(Scaling Law)的讨论并不少,但这篇的难得之处,在于它把来龙去脉讲清楚了:Kaplan 的 2.7:1 怎么让整个行业走上万亿参数的弯路,Chinchilla 怎么在四百个模型上纠偏,推理成本又是怎么把最优解推向"更小、但训练得更久"的模型,再到 MoE 里总参数与激活参数的分
作者:觉醒也醉了 https://zhuanlan.zhihu.com/p/2047396735169908748 一、为什么复杂 RL 离不开分布式系统 近年来,强化学习(Reinforcement Learning, RL)在复杂决策任务中取得了大量突破,尤其是在游戏 AI、机器人控制等领域,以
作者:觉醒也醉了 https://zhuanlan.zhihu.com/p/2066914125012283729 MoE 中的负载 假设一个 batch(或一个路由 group)中有 T 个 token、N 个 routed experts,每个 token 选择 k 个 Expert。 Rout
作者:尚书尧 中科院自动化所(知乎ID:妖妖) https://zhuanlan.zhihu.com/p/2070555284918080338 2026 年,我相信几乎没有CVer不知道 Diffusion。不管是做 AIGC 生成,还是做具身智能里的 policy learning,Diffus
作者:周星星 https://zhuanlan.zhihu.com/p/2069524382196691517 前言 当我们能同时调动上百个agent时,会诞生什么新的产品形态。 这是一篇没有明确中心思想的文章,想围绕多 Agent,聊几个最近不断冒出来的产品问题。 标题里 agent team 和
作者:Junbo Zhao (Jake) https://jzhao2024.github.io/notes/2026/08/08/diffusion-language-models-zh.html 过去一年,diffusion language model(dLLM)快速升温。Google 发布了
作者:Sherry https://www.xiaohongshu.com/user/profile/642d87c90000000011020daf World Model 这个概念其实已经提出很久了,我最近才第一次系统涉猎。虽然大家都在讨论 World Model,但真正试图解决的似乎并不是同一
TL;DR Auto-Research 系统正在快速发展,但当前多数成功案例建立在一个重要前提上:候选方案可以被廉价、快速、明确地验证。只要评分足够便宜,扩大采样与搜索就能持续提高找到好答案的概率。 真实机器学习研究并不总具备这个条件。完整训练昂贵,反馈存在延迟,单次实验只能提供部分证据。系统不仅要
作者:ybq https://zhuanlan.zhihu.com/p/2067725096886785009 这篇文章简单讨论下 rl 的作用,我们到底该如何理解 rl 在 posttrain 阶段的定位?以及,为什么有时候模型仅仅靠蒸馏就能取得极好的效果呢? 文章系个人观点,未必正确,大家随便看
作者:真中合欢 https://www.zhihu.com/question/2067555143608954948/answer/2067908579819102910 为什么OPD、RLHF在线强化学习统一使用反向KL,SFT离线蒸馏却用正向KL?仅调整顺序差异巨大? 因为两个方向的 KL 具有
作者:尚书尧 中科院自动化所 自然语言连接了 AI 与人类积累的数字知识。下一步,当AI走入物理世界,PhiZero希望用“物理语言”连接 AI 智能与真实世界。 人类用语言保存经验、传递知识,也用语言进行思考。从日常交流到科学定律,从历史记录到程序代码,自然语言凝结了人类长期积累的知识与经验。今天
作者:曾伟力,上海交通大学博士生 无需在每次决策时生成视频,也能让未来建模持续影响机器人的实时控制 世界模型让机器人拥有“想象未来”的能力,但如果每次动作预测都要完整运行一次视频生成,想象本身就会成为实时控制的负担。 来自上海交通大学和齐鲁工业大学(山东省科学院)的研究团队提出 Enfold:不再把
作者:storm https://zhuanlan.zhihu.com/p/2064127486921909656 笔者最近在大尺寸 coding/cowork agent 上做了一段时间的后训练与评测,发现了一类有意思的现象。 智能体接到任务后,会首先在思维链中大致猜测“评测会用到哪些测试”,在轨
作者:黄奇浩 https://zhuanlan.zhihu.com/p/2066221445697508532 2026 年 7 月,BeingBeyond 团队放出了 Being-M0.7,一个专门为人形机器人全身移动操作(loco-manipulation)设计的 latent world-ac
如今,评测圈最流行的词之一就是 Live。 旧题可能混进训练数据?那就不断收集刚刚发生的新题,专门挑选模型知识截止日期之后发布的题目,再按月、按季度更新测试集。 这类 Live Benchmark,也就是动态评测(Dynamic Evaluation),听起来几乎无懈可击:题目是在模型“闭卷”之后才
作者:朱时昊(知乎 @保持好奇心) https://zhuanlan.zhihu.com/p/2060420409883898083 大模型推理优化的技术很多,但不建议从 FlashAttention、量化、PagedAttention 这些名字开始背。更有效的办法,是先看一条请求究竟慢在哪里。 在
模型上线之后,还能不能在没有标注的情况下继续变强? TTRL(Test-Time Reinforcement Learning)给出的路径很直接:让模型在测试任务上自己采样、自己构造奖励、自己更新参数。但现有 TTRL 大多依赖答案投票:采样多条回答,抽取最终答案,再用多数票生成伪标签。数学题、选择
作者:Naiyan Wang https://zhuanlan.zhihu.com/p/2066565953501009575 在上一篇文章中,我们探讨了 Physical AI(物理世界 AI)想要在真实环境中运转,必须具备三大核心能力:理解世界(表征)、预测世界(世界模型)以及改造世界(强化学习
作者:zklink https://zhuanlan.zhihu.com/p/2067242658939065932 2026 年以来,以 On-Policy Distillation(在线策略蒸馏,OPD)命名的工作在推理模型后训练领域密集出现,成为继长思维链(Long CoT)蒸馏之后又一个快速
作者:苏剑林 原文:https://kexue.fm/archives/11833 训练一个大型的神经网络,最终效果会受到非常多因素的影响,换个优化器,换个模型架构,或者换一个训练集,结果都可能截然不同。 在工程实践中,我们将调试这些因素的经验结果,戏称为“炼丹”。 但如何从经验上升到规律,更准确、
作者:JoyeeEE https://zhuanlan.zhihu.com/p/2065806583955714218 前导 当大语言模型开始理解文本、多模态模型开始理解图像,下一个自然问题是:模型能否不仅“看懂”和“说清楚”,还能在物理世界中真正采取行动? Vision-Language-Acti
作者:Haoyi Zhu,Ph.D @ USTC. https://www.haoyizhu.site/blog/sparse-linear-attention/ 背景介绍 大家常用的 Softmax Attention,对第 t 个 query 的输出可以写成 \boldsymbol{o}_t=\
如何从一段视频中获得完整、稳定的 3D 物体?过去,这个问题大致沿着两条路线发展。 一条是 3D 重建:把不同视角中真实观察到的几何逐步拼接起来。它擅长忠实恢复“已经看见”的部分,但在输入视角有限、遮挡严重或物体背面从未出现时,往往只能留下缺口或不完整的表面。 另一条是 3D 生成:借助大规模数据中
作者:周星星 https://zhuanlan.zhihu.com/p/2065227313973825752 这几个月,AI 圈子的热词肯定少不了 self-evolving、self-improving、recursive self-improvement(RSI)这几个概念。 模型能自己优化自
本文介绍的研究来自小米大模型 Plus 团队、西安交通大学与中关村学院团队,在 ECCV 2026 上合作提出的 ELVA,一种面向通用多模态检索的排序驱动强化学习框架。 论文标题:ELVA: Exploring Ranking-Driven Universal Multimodal Retriev
作者:陈孟卓,中科院软件所 PhD 一次工具调用返回了 success,任务就真的完成了吗? 未必。 在一个应用自动化任务中,Agent 连续发起了 3 次付款请求。接口表面上返回“执行成功”,但由于请求缺少必填字段,预期的付款记录一条也没有生成。 更糟的是,错误被中间层吞掉,任务完成条件又只检查了
作者:水木SH https://zhuanlan.zhihu.com/p/2062647902879667967 前言:前段时间支持了团队的Agentic RL训练工作,在框架开发过程中碰到诸多问题,有了一些新的思考,在此进行记录。 一、从 LLM Rollout 到 Agentic Rollout
作者:null,上海交通大学AI博一 https://zhuanlan.zhihu.com/p/2063300859472221420 上周五我们发布了 xHC: Expanded Hyper-Connections,这段时间的工作也算告一段落。先用一句话概括我们做了什么:xHC 首次把语言模型的残
作者:原来ID可以这么长 https://zhuanlan.zhihu.com/p/2060361643851256385 核心要点速览 Vision-Language-Action(VLA)模型虽然在机器人操控任务中展现出强大的能力,但在面对分布外(Out-of-Distribution, OOD
作者:SuSun https://zhuanlan.zhihu.com/p/2061411883958137356 从推理角度看一下 Kimi K3,2.8 T, fp4 的话, 1.4 TB,hopper 其实也还行。但肯定这个架构说白了给 B 卡定制的,就是不知道国产卡是否受益了(投机一下,其实
作者:华裳羽照 https://zhuanlan.zhihu.com/p/2061464412574242573 以 Kimi K3 与 Nemotron 3 Super 为例,看 MoE 架构如何在 2026 年完成一次关键的范式跳跃。 2026 年上半年,两件事同时发生:NVIDIA 发布了 1
作者:画饼充饥 https://zhuanlan.zhihu.com/p/2040199323170951424 最近看AI infra和AI compiler的论文,一个很明显的变化是大家已经不满足于把某个算子编译的更快了。 早期深度学习编译器的叙事多半围绕operator graph,例如Mat
作者:蔡恒毅 https://zhuanlan.zhihu.com/p/2058574573143078204 做过 LLM 后训练的人,大概都见过这样一条曲线:强化学习跑着跑着,模型在奖励模型上的得分一路走高,训练日志里一片祥和;可当你真的翻开模型生成的文本,却发现它开始变得冗长、爱堆排版、甚至在
作者:硅基星人 https://zhuanlan.zhihu.com/p/2057783219144110491 VLA 没死,但“纯 VLA”确实不够了。 更准确地说,2026 年这轮争论不是“Vision-Language-Action 要被 World Model 替代”,而是“只把机器人策略
作者:硅基星人 https://zhuanlan.zhihu.com/p/2051733536873373900 如果只看发布节奏,2026 年上半年的 VLA 赛道确实很热闹。 NVIDIA 在 Isaac-GR00T 仓库里放出了 GR00T N1.7 Early Access;Figure A
想象一条折毛巾轨迹:机器人一开始做得不错,抓住了毛巾边缘,也把布料拉开了一部分。随后它抓偏了,布料开始皱在一起,动作进入停滞。几秒后,人类接管,把毛巾重新整理好,任务最终成功。 这是一个典型的真实世界策略在线采集数据的过程。 但关键问题是,这条数据到底该怎么用? 如果我们只保留「成功部分」或只学习人
作者:初七9527 https://zhuanlan.zhihu.com/p/2060313194971846263 TL;DR Molt 是一个 agentic-first、纯 PyTorch-Native 的强化学习框架: 约 9,000 行核心 RL 代码,你能一口气从 CLI 追到执行分支;
论文:MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate 链接:https://arxiv.org/abs/2605.01347 代码:https://github.com/chiefovoav
做 LLM RL 后训练,最干净的做法本该是on-policy:拿当前策略 \pi_\theta现采一批数据,算梯度,更新,再采下一批。policy gradient的理论就建立在"数据来自当前策略"这个前提上,只要严格on-policy,梯度就是无偏的,训练也最稳。 问题是,严格 on-polic
作者:向阳 原文链接:https://zhuanlan.zhihu.com/p/2057411805450866980 最近我在准备从 LLM Post-training 转向 VLA。读完 π0 / π0.5 / RT-2 这一批 imitation learning,以及 π0.6-Recap、
作者:林涛,上交AI院博士生 论文标题:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining 论文链接:https://arxiv.org/abs/2606.27295 项目主页:https://github.c
当Dify、MCP、Ollama等AI基础设施以周为单位迭代时,传统安全工具连“识别组件版本”都做不到。朱雀实验室这篇技术报告试图回答一个更根本的问题:安全检测范式,是否也需要随攻击面分层而进化? 上周,腾讯朱雀实验室发布了一篇题为《Securing the AI Agent: A Unified
作者:杨燕丹,高德地图算法工程师 导语:通用机器人的终极考验,在于能否在复杂多变的物理世界中实现“边走边操作”(Mobile Manipulation)。今日,备受瞩目的具身智能最新成果ABot-M0.5正式发布。本文工作由高德地图完成,是ABot-Manipulation系列继ABot-M0之后的
论文: UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation 链接: https://arxiv.org/abs/2606.2950
原文链接:https://developer.nvidia.com/blog/pretrained-to-imagine-fine-tuned-to-act-the-rise-of-world-action-models 背景 视觉动作策略负责将当前观测与目标或指令相融合,映射为机器人的执行动作。世
原文链接:https://yannx1e.github.io/IW-OPD/ 论文作者:Yan Xie, Sijie Zhu, Tiansheng Wen, Bo Chen, Yifei Wan 摘要 在线蒸馏(On-Policy Distillation, OPD)之所以受到关注,是因为它结合了两
作者:还可以在找实习 https://zhuanlan.zhihu.com/p/2038002855374753895 欢迎关注我们关于异步 Agentic RL 的最新工作。本文聚焦一个在大规模 LLM 强化学习系统中非常基础、但经常被忽略的问题:当 rollout 和 training 异步解耦
作者:朱翼 https://zhuanlan.zhihu.com/p/2056045172111177252 这篇文章来自我最近准备的一个技术分享。原本的主题是 “Distributed Training Systems: From Research to Production”。整理成博客时,我不
罗宇,南开大学博士生 近年来,大语言模型在数学、代码等任务上的表现不断刷新上限,但到了医疗诊断、故障排查这类真实世界任务里,真正困难的是让多个智能体在不确定的动态环境中持续协作推理。 以医疗诊断为例,主治医生不可能一开始就让病人把所有检查都做一遍,而是要根据当前诊断方向,动态安排影像科、检验科等不同
作者:Kadima-Du 原文:https://zhuanlan.zhihu.com/p/2030412523703379683 研究人员比较了视觉-语言-动作(VLA)模型和世界动作模型(WAM)在各种视觉和语言扰动下机器人策略的鲁棒性。 WAMs由于其视频预训练,在噪音、光照和布局变化方面表现出
论文标题:OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation 论文链接:https://arxiv.org/pdf/2604.11804 项目主页:https://correr-
作者:俞扬 https://zhuanlan.zhihu.com/p/2054520199282423797 论文:How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric
作者:YiFan-Zhang https://zhuanlan.zhihu.com/p/2054605815588435332 GLM 5.2: From Grpo to PPO 引入了 slime 这套训练与推理基础设施,同时在长链路任务里改用了更适合 compaction 的 PPO 训练方式,
作者:秋光的梦 https://zhuanlan.zhihu.com/p/2003112989201553035 近期许多基于视频生成网络的VA(也可以说是WAM)的工作,从25年末的LVP到Mimic-Video再到最近比较火的Lingbot-VA以及两篇NVIDIA的工作Cosmos Polic
本工作由中国科学院软件研究所中文信息处理实验室与快手科技联合完成。中科院软件所方面来自孙乐、韩先培团队,主要作者包括陈嘉伟、徐若曦、曹博希、陆垚杰及林鸿宇;快手方面主要作者包括潘若彤、吴翔宇等。中科院软件所中文信息处理实验室长期聚焦大模型知识机制、知识能力增强及应用研究。 让大模型模拟真实人类行为,
作者:Weng, Lilian|青稞编辑部翻译 原文:https://lilianweng.github.io/posts/2026-06-24-scaling-laws/* 缩放定律是深度学习中最关键的实证发现之一。其观察形式简洁:随着模型规模 N、数据集大小 D 和计算量 C 的扩大,训练损失
📄 arXiv:https://arxiv.org/abs/2606.17199 作者机构:东方理工、香港理工大学、上海交通大学、University of Waterloo` On-Policy Distillation(OPD)正在成为大模型后训练的标准组件。和传统 SFT 只在 teach
作者:Jason 原文:https://zhuanlan.zhihu.com/p/2050794185909876253 过去一段时间里,我一直在思考一个问题:Agentic RL 到底和传统 RLVR 有什么本质区别? 最容易想到的答案当然是工具调用。传统 RLVR 往往围绕单轮回答展开,模型生成
作者:虚无 原文:https://zhuanlan.zhihu.com/p/2048769202819949265 TL, DR LLM Pretraining是模型能力的主要来源。模型的能力一般会随着pretraining loss的降低而单调提升。 那么,pretraining loss相同,模
作者:banana 原文:https://zhuanlan.zhihu.com/p/2039735648421163598 OPD相关的论文这几个月每周冒出好几篇,剧本和当年xPO(DPO 之后)、xGRPO(GRPO 之后)几乎一样,大家围着它做排列组合。本文试图对近期这一波工作进行初步梳理——哪
投机采样(Speculative Decoding)这两年几乎成了 LLM 推理加速的标配,但真正理解它的人不多。很多人停留在”小模型猜、大模型验”这一句话上,一到细节就懵:主模型 verify 的时候到底在算什么?为什么一次前向能验好几个 token?长上下文到底是帮忙还是帮倒忙? 这篇文章以 S
作者:CyberSoma https://zhuanlan.zhihu.com/p/2022391438546072926 JEPA的愿景框架与工作进展 提起世界模型& JEPA,JEPA就是不抠像素(细节),只学抽象规律,预测未来,确实的本质特征,相比生成式AI要省算力。要知道2022年Yann提
作者:Kiki Huang http://xhslink.com/o/9vI0xkOqra3 最近集中听了几场 world model 相关分享,听下来我最大的感受是:大家其实都在逐渐放弃一种过于理想化的大一统模型想象。 不是说没人想做 unified model,而是落到具体问题上,video、J
论文: Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models 会议: ACL 2026 |单位: 腾讯混元 × UNSW arXiv:
论文题目:Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty arXiv 链接:https://arxiv.org/abs/2604.10072 作者单位:腾讯混元
作者:小太阳 https://zhuanlan.zhihu.com/p/2038976197065963264 引言 笔者最近在阅读《LeWorldModel》论文和《第一性原理》一书时,偶然发现两者在方法论上有某种相通之处,于是想写下这篇博客,记录自己的一段学习与思考。 当前,大语言模型(LLM)
一、为什么具身智能重新关注世界模型? "世界模型"在具身智能领域似乎又变成了一个高频词,它为什么又回到了热门呢,和传统强化学习又有哪些区别? 首先,从 Model-Based RL 的视角看,世界模型并不是一个全新的概念,它可以理解为 Model-Based RL 中的 learned dynami
蒸馏 + RL 已经是 reasoning 模型后训练的标配:DeepSeek-R1、s1、OpenThinker 走的是“off-policy 蒸馏再 RL”,Qwen3、MiMo、GLM-5 则把 on-policy distillation(OPD)直接编进了后训练管线。 但有一个问题很少有人
近年来,视觉语言模型(Vision-Language Models, VLMs)已经成为多模态理解与推理任务中的主流范式。当前大多数 VLM 采用 “视觉编码器(通常为 Vision Transformer, ViT)+轻量投影层(projector)+大语言模型(Large Language Mo
本文第一作者许牧天,南洋理工大学MMLab博士后。导师刘子纬教授,为本文通讯作者。 机器人-环境交互模拟是具身智能的核心。近期,一些研究展现了利用视频生成技术突破传统模拟器“僵化”的视觉与物理限制的潜力。 然而,这些工作主要在 2D 空间运行、或受制于静态环境的单一引导,忽略了一个基本事实:机器人与
开源链接 📄 Paper: https://arxiv.org/abs/2606.07229 🔥 Daily Paper: https://huggingface.co/papers/2606.07229 💻 Code: https://github.com/ddlBoJack/MMAE 🤖
随着多模态大语言模型(Multimodal Large Language Models, MLLMs)不断向文档理解、OCR、图表分析与高分辨率真实场景理解等细粒度任务拓展,高分辨率图像输入正在逐渐成为主流配置。 然而,更高的视觉分辨率也带来了急剧增长的视觉 token 数量,使得视觉编码本身逐渐成
论文标题: UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems 论文链接: https://arxiv.org/pdf/2605.26646 代码链接: https://github.co
作者:赖睿航,CMU CS Ph.D. https://zhuanlan.zhihu.com/p/2045509863221064141 TL;DR PithTrain 是一个精简、agent-native 的 MoE(Mixture-of-Experts)训练框架,整套实现约 1.1 万行 Pyt
1.Technical Report: https://arxiv.org/abs/2605.29801 2.GitHub: https://github.com/AI45Lab/AgentDoG 3.Project Page: https://ai45lab.github.io/AgentDoG/
作者:朱小霖 原文:https://zhuanlan.zhihu.com/p/2044533166694732929 毫无疑问,OpenClaw 和 Opus 一起撞开了 agent 时代。 slime 从一开始坚持的 server-based engine + custom rollout 设计,
论文:StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning 链接:https://arxiv.org/html/2605.27140v1 作者:Yanfei Zhang, Xu Lin
大模型 Agent 这两年很火。 大家一提到“提升 Agent 能力”,第一反应通常是:换更强的模型、做微调、上强化学习、继续训练。 但我们最近一直在想一个问题: 如果 Agent 表现不好,问题真的一定出在模型本身吗? 很多时候,答案可能不是。 因为Agent并不是一个只会聊天的LLM。 它还要理
如果说过去很多稀疏化方法一直在问“如何更好地剪掉权重”,那么 RT-Lynx 给出的答案是:对于 Diffusion Transformer,真正适合半结构化稀疏的对象可能不是权重,而是激活。 论文标题:RT-Lynx:Putting GEMM Sparsity in the Right Place
作者:jzx 原文:https://zhuanlan.zhihu.com/p/2043283053787841480 TL;DR:SwiGLU 是目前大模型的标配激活函数,但它在低精度训练中会产生严重的数值不稳定问题。我们设计了一个新激活函数 PowLU,用更平缓的增长曲线替代 SwiGLU 的二次
作者:wxzhou https://zhuanlan.zhihu.com/p/2044873485688861958 本文仅使用大模型进行润色,并努力去除 AI 味,部分图片使用 gpt 生成。 1. 引言 先抛出一个问题:以典型 GQA 架构为例,在 LLM 推理的 Decode 阶段,Atten
作者:张曜程,朱圆恒,赵冬斌@中科院自动化所 研究背景 智能体在训练过程中往往面临几个核心瓶颈,标注数据昂贵、奖励信号稀疏,以及长程任务中的信用分配困难。自博弈(Self-Play)提供了一条很有吸引力的路径:模型可以自己生成问题、自己学习解决问题,从而减少对外部训练数据的依赖。然而,现有自博弈方法
作者:孟繁续 https://zhuanlan.zhihu.com/p/2039637653314856841 文章链接:https://huggingface.co/papers/2605.15250 代码链接:https//github.com/MuLabPKU/TransArch GQLA的前