Tag

RL

共 123 篇文章 · 第 2 / 2 页

LLM内部竟藏着众多策略模型?自动化所&腾讯团队首次揭示大模型RL新机制

LLM内部竟藏着众多策略模型?自动化所&腾讯团队首次揭示大模型RL新机制

当前,大模型+强化学习成为AI领域极为热门的研究。现有的强化学习(RL)方法通常将大语言模型(LLM)视为一个单一的整体策略进行优化,主要的算法优化集中在表层的奖励设计等方面,却忽略了模型内部复杂的层级演化机制。 大模型的黑盒特征通常阻碍了我们进一步了解其内部工作机理,然而理解其如何执行内部推理能为
青稞
0
0
260
在看完近50篇VLA+RL工作之后......

在看完近50篇VLA+RL工作之后......

视觉-语言-动作 + 强化学习:VLA+RL 最新研究全景(含论文、链接与代码) 随着基于大规模模仿学习的视觉-语言-动作 (VLA) 模型取得显著进展,将 VLA 与强化学习 (RL) 相结合已成为一种极具前景的新范式。该范式利用与环境的试错交互或预先采集的次优数据,进一步提升机器人的决策与执行能
wangguo
0
0
896
工业级 Agentic RL 训练对比选型指南

工业级 Agentic RL 训练对比选型指南

作者:乞力马扎罗不说话 https://zhuanlan.zhihu.com/p/1978600046514685178 这篇博客想法诞生于上半年基于 trl / verl 魔改 agentic rl 时期,但拖延一直搁置。眼看相关技术栈演进速度惊人,再不发出来就要过气了,于是决定抛砖引玉分享。预计
wangguo
0
0
851
深挖强化学习算法PPO,聊聊前身TRPO

深挖强化学习算法PPO,聊聊前身TRPO

作者:catneverfat https://zhuanlan.zhihu.com/p/1908671543476749557 PPO是一种被广泛应用于各个场景下的强化学习算法,笔者之前对它展开过介绍。但是当时主要的理论推导集中在Policy Gradient部分,对PPO主要介绍的是它的目标函数以
wangguo
0
0
345
TRPO重生:大模型时代的信任域策略优化

TRPO重生:大模型时代的信任域策略优化

在大型语言模型(LLM)的强化学习(RL)阶段,特别是人类反馈强化学习(RLHF)中,我们追求策略 \pi_\theta 的持续优化。 然而,LLM 的复杂性和分布式训练特性,带来了一系列独特挑战,这些挑战在数学上可以统一归结为一个核心问题:策略部署(rollout)与策略更新(\pi_\theta
wangguo
0
0
365
从 BF16 到 FP16:如何解决RL训练-推理不匹配问题

从 BF16 到 FP16:如何解决RL训练-推理不匹配问题

大语言模型(LLM)的强化学习(RL)微调常因训练与推理策略间的数值不匹配而面临训练不稳定的问题。相比在算法上引入重要性采样来打补丁,我们发现直接从根源上提高浮点数的精度更加有效。 论文:Defeating the Training-Inference Mismatch via FP16 链接:ht
wangguo
0
0
417
纯干货!工业场景下,LLM Agent RL的一些实践感悟

纯干货!工业场景下,LLM Agent RL的一些实践感悟

最近几个月在各种场景上做了大量的agent RL训练,例如search agent, 数据分析agent 等等。既有小的dense model,也有大的moe。有单一数据场景,有多源合板数据场景。有失败的经历,也有成功的经历。这里抽空分享下一些感悟,比较乱,随便看看就行: 1、稳定性是工业级场景下R
wangguo
0
0
346
VLA 已经不满足于 SFT,也要上 RL 了?

VLA 已经不满足于 SFT,也要上 RL 了?

作者:张海抱 https://zhuanlan.zhihu.com/p/1976979860405633293 最近 VLA 的一大研究趋势就是不再满足于 SFT,而是也要上 RL 了。最近读了一波这方面的论文,分享一些心得。 首先,有些文献调研还是按照 online RL / offline RL
青稞
0
0
173
VLM RL如何涨点 - 实践和思考

VLM RL如何涨点 - 实践和思考

作者:Chengru's Blog https://hypercool.cn/ai/ai_algorithms/vision/2025/08/19/dpo-rl.html 前言 过去的一个月在比较高强度做RL,最近终于有了一些阶段性成果,整理了一下整体的迭代思路和最近踩过的坑,分享出来,与各位共勉。
青稞
0
0
306
入坑必备基础知识!关于推理模型的一些科普

入坑必备基础知识!关于推理模型的一些科普

作者:ybq https://zhuanlan.zhihu.com/p/1943048398333780944 这篇文章随便聊一下如今比较火的推理模型,给新入坑的同学做一些简单的科普,都是一些偏基础的知识。 推理模型的训练 推理模型的训练和普通模型的训练并无什么区别,仅仅是 sft 语料多了一些特殊
青稞
0
1
194
RL 为什么不如 SFT 稳定?以及 RL 各种 Trick

RL 为什么不如 SFT 稳定?以及 RL 各种 Trick

作者:ybq https://zhuanlan.zhihu.com/p/1966609550032475890 这篇文章随便聊聊 LLM RL 的一些想法。文章的灵感来自于,每次和好哥们 @真中合欢 交流 RL 训练的时候,都会被他批评一顿说不要乱加各种技巧。他成功说服了我,我也来试试看能不能说服一
青稞
0
0
296
 28篇最新论文!系统调研 VLA+RL 最近的研究趋势

28篇最新论文!系统调研 VLA+RL 最近的研究趋势

作者:张海抱 原文:https://zhuanlan.zhihu.com/p/1940702256241575450 写在前面 VLA 时代的强化学习和 Atari 时代的强化学习有什么区别?个人认为有一好两坏两个方面。 好的方面是我们现在有一个非常有用的资源 —— 预训练的大模型,它可以对我们的探
青稞
0
0
268
1 2
正在直播 B 站