Tag

RL Infra

共 29 篇文章

2026,进入 Agent RL 时代!

2026,进入 Agent RL 时代!

序章:三条哲学 在探讨技术之前,我们需要先确立三条基石性的认知: 人类的本质:人类在生物界的独特性在于高等智慧,而人与动物的分野,在于制造与使用工具的能力。 大模型的定位:ChatGPT 标志着人类首次赋予机器高等智慧。大模型之于现代人类,如同智慧之于原始人类,不仅不可或缺,更不可退化。 Agent
wangguo
0
0
2710
MiniMax-H3 音视频生成 RL 后训练:基于 VeRL-Omni 的开源实践

MiniMax-H3 音视频生成 RL 后训练:基于 VeRL-Omni 的开源实践

引言 MiniMax-H3 是当前开源社区中最受关注的音视频生成模型之一。它是一个通用的多模态生成模型,接收文本、图像、视频、音频等多种输入,直接输出带原生立体声音轨的视频,支持最长 15 秒、最高 2K 分辨率、24 FPS、32 kHz 立体声。 在 Artificial Analysis 的
wangguo
0
1
390
深入理解 Agentic RL 中的行为崩塌现象

深入理解 Agentic RL 中的行为崩塌现象

作者:Jason 原文:https://zhuanlan.zhihu.com/p/2050794185909876253 过去一段时间里,我一直在思考一个问题:Agentic RL 到底和传统 RLVR 有什么本质区别? 最容易想到的答案当然是工具调用。传统 RLVR 往往围绕单轮回答展开,模型生成
青稞
0
0
252
MinT: 面向百万级 LoRA 策略的训练与推理基础设施

MinT: 面向百万级 LoRA 策略的训练与推理基础设施

大模型后训练会带来一个很现实的系统问题:模型会不断产生新版本。一次强化学习实验、一个产品功能、一个客户、一组评测结果,都可能对应一种新的模型行为。基础模型本身又非常大,动辄万亿参数规模。系统如果把每种行为都保存成一份完整模型,再分别加载和部署,成本会很快失控。 MinT 是一套面向这个问题的大模型后
wangguo
0
0
223
DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配

DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配

4月25日,当 DeepSeek-V4 带着 1.6 万亿参数(Pro版)和百万级上下文窗口的震撼配置横空出世时,整个大模型圈的目光都聚焦在了它极具野心的架构革新上:混合稀疏注意力(CSA+HCA)、流形约束超连接(mHC)以及 FP4 专家权重。 然而,对于广大开发者和企业用户而言,面对如此庞大且
wangguo
0
0
660
超越精度:为什么训练-推理不一致是一个优化问题,以及简单的学习率调度(LR Scheduling)如何修复它

超越精度:为什么训练-推理不一致是一个优化问题,以及简单的学习率调度(LR Scheduling)如何修复它

在 LLM 强化学习(RL)的训练中,有一个长期困扰算法工程师的“幽灵”:训练-推理不一致(Training-Inference Mismatch) 。很多时候,你会发现训练开始阶段一切正常,但是一段时间后训练引擎和推理引擎生成token的概率分布就有可能越来越远,accuracy断崖式下跌。 主流
青稞
0
0
421
工业级 Agentic RL 训练对比选型指南

工业级 Agentic RL 训练对比选型指南

作者:乞力马扎罗不说话 https://zhuanlan.zhihu.com/p/1978600046514685178 这篇博客想法诞生于上半年基于 trl / verl 魔改 agentic rl 时期,但拖延一直搁置。眼看相关技术栈演进速度惊人,再不发出来就要过气了,于是决定抛砖引玉分享。预计
wangguo
0
0
849
聊聊小模型与大模型下的推理框架

聊聊小模型与大模型下的推理框架

作者:骑虎南下 https://zhuanlan.zhihu.com/p/1931235792501608813 这里,分两个主要模块介绍AI模型推理引擎整体架构与主要功能。回顾AI落地的发展过程,我们可以简单地将AI模型的发展分为小模型领域与大模型领域。 在小模型领域以CNN模型为主,模型结构变化
wangguo
0
0
296
NeMo RL:让大规模 MoE 模型权重 Refit 加速 10 倍

NeMo RL:让大规模 MoE 模型权重 Refit 加速 10 倍

9月6日(周六)上午10点,青稞Talk 第76期,英伟达NeMo团队高级深度学习算法工程师李之愈,以及高级产品经理高文雯,将直播分享《NeMo RL:让大规模 MoE 模型权重 Refit 加速 10 倍》。 分享嘉宾 李之愈是英伟达NeMo团队高级深度学习算法工程师,专注于大语言模型预训练以及后
青稞
0
0
292
ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架

ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架

8月23日(周六)上午10点,青稞Talk 第74期,淘天集团未来生活实验室算法专家王维埙博士,爱橙科技智能引擎算法平台大模型强化学习框架工程师熊绍潘,将直播分享《ROLL:面向 Agentic 场景的生产级大规模强化学习训练框架》。 代码:https://github.com/alibaba/RO
青稞
0
0
715
正在直播 B 站