Tag

强化学习

共 22 篇文章

JustRL: 用"最笨"的 RL 方法刷新 1.5B 推理模型新基线

JustRL: 用"最笨"的 RL 方法刷新 1.5B 推理模型新基线

如果有人说:不用分阶段训练、不搞课程学习、不动态调参,只用最基础的 RL 配方也能达到不错的性能,会是怎样的结果? 我们团队用两个 1.5B 模型做了这个尝试。结果在 9 个数学推理基准上达到了 54.87% 和64.32% 的新基线,算力只用了一半,训练过程也很平稳,4000步没遇到什么大问题。 更有趣的是,当我们试着加入一些"应该有用"的优化时,性能反而下降了。也许在某些情况下,简单的方法充分训练后,效果可能比我们预期的要好。这个工作最大的 novelty,也许就在于没有 novelty。
wangguo
0
0
352
GDPO:解决 GRPO  在多奖励 RL 训练中的"优势崩溃"问题

GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题

随着大模型能力的不断提升,越来越多的研究开始在RL(强化学习)训练中同时优化多种偏好(如正确性、格式、长度、bug ratio等)。 我们发现多奖励强化学习(multi-reward RL)中经常会遇到训练不稳定的问题,并非主要源于奖励设计或权重冲突,而是优势信号在归一化过程中被“压扁”,导致分辨率下降,提出“advantage collapse”这一关键问题。 传统 GRPO 在多奖励场景下的 group-wise normalization 会使不同奖励组合的样本难以区分,削弱学习方向。 为此,研究提出 GDPO,通过逐奖励解耦归一化保留细粒度优势差异,并在聚合后进行 batch 归一化以稳定尺度。实验表明,GDPO 在工具调用、数学推理和代码推理任务中显著提升了训练稳定性与最终性能。 该工作指出,多目标 RL 的核心在于保持训练信号清晰度,为推理模型与智能体训练提供了更可诊断、可复用的方法论。
wangguo
0
0
386
Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架

Generative RLHF-V: 面向多模态 RLHF 的人类意图对齐框架

训练与人类意图对齐的多模态大模型是一个长期挑战。传统的基于分数的奖励模型在强化学习(RLHF)中存在准确性低、泛化性弱和可解释性差等问题。 11月15日(周六)上午10点,青稞社区和减论平台将联合组织青稞Talk 第89期,并邀请到北京大学博士生周嘉懿,直播分享《Generative RLHF-V:
青稞
0
0
355
统一 SFT & RL:迈向大型语言模型后训练的统一视角

统一 SFT & RL:迈向大型语言模型后训练的统一视角

10月28日(周二)晚8点,青稞Talk 第83期,清华大学博士生吕兴泰,将直播分享《统一 SFT & RL:迈向大型语言模型后训练的统一视角》。 分享嘉宾 吕兴泰,清华大学二年级博士生,导师为周伯文教授。研究方向为大语言模型架构优化、强化学习和高效训练技术。在ACL,EMNLP,NeurIPS,I
青稞
0
0
304
RL for LRMs:探讨面向推理模型的 RL 最新研究

RL for LRMs:探讨面向推理模型的 RL 最新研究

10月21日(周二)晚8点,青稞Talk 第80期,清华大学博士生张开颜,将直播分享《RL for LRMs:探讨面向推理模型的 RL 最新研究》。 分享嘉宾 张开颜,清华大学三年级博士生,导师为周伯文教授。研究方向为大语言模型测试时扩展(Test-time Scaling)、强化学习和多智能体协同
青稞
0
0
377
“知人者智”:以用户为中心的智能体交互与训练

“知人者智”:以用户为中心的智能体交互与训练

10月18日(周六)上午10点,青稞Talk 第79期,伊利诺伊大学香槟分校 (UIUC) 博士生钱成,将直播分享《“知人者智”:以用户为中心的智能体交互与训练》。 分享嘉宾 钱成,伊利诺伊大学香槟分校 (UIUC) 二年级博士生,导师为季姮教授。本科就读于清华大学计算机系,导师为刘知远教授。目前工
青稞
0
0
200
从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体

从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体

9月18日(周四)晚8点,青稞Talk 第78期,新加坡国立大学博士生张桂彬,将直播分享《从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体》。 分享嘉宾 张桂彬是新加坡国立大学计算学院博士研究生,导师为颜水成教授,研究方向为Multi-Agent System,Agent M
青稞
0
0
692
FlashRL:探讨现代 RL 框架中推理与训练的错位问题及解决方案

FlashRL:探讨现代 RL 框架中推理与训练的错位问题及解决方案

8月30日(周六)上午11点,青稞Talk 第75期,加州大学圣地亚哥分校(UCSD)博士生姚峰,将直播分享《FlashRL:探讨现代 RL 框架中推理与训练的错位问题及解决方案》。 分享嘉宾 姚峰,加州大学圣地亚哥分校(UCSD)二年级博士生,导师是商静波教授,曾在微软研究院Deep Learni
青稞
0
0
359
ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架

ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架

8月23日(周六)上午10点,青稞Talk 第74期,淘天集团未来生活实验室算法专家王维埙博士,爱橙科技智能引擎算法平台大模型强化学习框架工程师熊绍潘,将直播分享《ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架》。 代码:https://github.com/alibaba/RO
青稞
0
0
715
ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界

ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界

7月12日上午10点,青稞Talk 第62期,英伟达公司研究员刁诗哲,将直播分享《ProRL: 延长强化学习训练框架,拓展大语言模型的推理边界》。 分享嘉宾 刁诗哲,英伟达公司研究员,曾以访问学者身份在伊利诺伊大学厄巴纳-香槟分校从事研究,并在字节跳动人工智能实验室与创新工场人工智能研究院实习。研究
青稞
0
0
273
大模型推理强化学习中的熵机制

大模型推理强化学习中的熵机制

往期解读:聊聊在大模型推理强化学习中熵机制上的探索 强化学习已经成为大模型智能跃升的下一个增长点,在这个背景下,本文旨在解决将强化学习用于大语言模型推理时面临的一个主要障碍——策略熵塌缩问题。 这种现象在大量未引入熵干预的强化学习训练中普遍出现,表现为策略熵在训练初期急剧下降,探索能力随之减弱,并始
青稞
0
0
612
从 TTS 到 TTRL:无标签数据强化学习探索与展望

从 TTS 到 TTRL:无标签数据强化学习探索与展望

在预训练 Scaling Law之后,测试时扩展(Test-time Scaling, TTS)已成为提升大模型推理能力的关键。OpenAI o1与DeepSeek R1等模型通过强化学习(RL)进行推理的范式,充分展现了TTS的潜力。然而,推理模型的性能上限仍深受基础模型(其架构与预训练数据)的制
青稞
0
0
348
B-STaR & SimpleRL-Zoo:通过强化学习自我提升推理性能和效率

B-STaR & SimpleRL-Zoo:通过强化学习自我提升推理性能和效率

基于强化学习框架的自我提升正日益成为增强模型推理能力的关键后训练方法,这一方法直接促成了DeepSeek-R1的成功。 青稞Talk 第45期,香港科技大学(HKUST)计算机系博士生曾伟豪,将直播分享《B-STaR & SimpleRL-Zoo:通过强化学习自我提升推理性能和效率》。 B-STaR
青稞
0
0
243
PRIME: 结合隐式过程奖励的强化学习

PRIME: 结合隐式过程奖励的强化学习

2月22日上午11点,青稞Talk 第39期,上海人工智能实验室青年科学家崔淦渠,将直播分享《PRIME: 结合隐式过程奖励的强化学习》。 主讲嘉宾 崔淦渠,上海人工智能实验室青年科学家,博士毕业于清华大学计算机系,导师为刘知远副教授。研究方向为大语言模型的对齐与强化学习技术。在ICML, Neur
青稞
0
0
238
正在直播 B 站