Tag

后训练

共 16 篇文章

MiniMax-H3 音视频生成 RL 后训练:基于 VeRL-Omni 的开源实践

MiniMax-H3 音视频生成 RL 后训练:基于 VeRL-Omni 的开源实践

引言 MiniMax-H3 是当前开源社区中最受关注的音视频生成模型之一。它是一个通用的多模态生成模型,接收文本、图像、视频、音频等多种输入,直接输出带原生立体声音轨的视频,支持最长 15 秒、最高 2K 分辨率、24 FPS、32 kHz 立体声。 在 Artificial Analysis 的
wangguo
0
1
391
从 GLM/Qwen 看: Agentic RL 最新进展

从 GLM/Qwen 看: Agentic RL 最新进展

作者:YiFan-Zhang https://zhuanlan.zhihu.com/p/2054605815588435332 GLM 5.2: From Grpo to PPO 引入了 slime 这套训练与推理基础设施,同时在长链路任务里改用了更适合 compaction 的 PPO 训练方式,
青稞
0
0
601
ZEDA:将 Post-Trained MoE 迁移为高效动态 MoE

ZEDA:将 Post-Trained MoE 迁移为高效动态 MoE

MoE 通过稀疏激活在扩大参数容量的同时控制计算量;Dynamic MoE 可以动态调整专家激活数量,让简单 token 使用更少计算,从而进一步提升推理效率。 6 月 9 日(周二)晚 8 点,青稞 Talk 第 130 期,清华大学博士生吕兴泰,将直播分享《ZEDA:将 Post-Trained
wangguo
0
0
108
重探 On-Policy Distillation(OPD):三类典型失败以及修复路径

重探 On-Policy Distillation(OPD):三类典型失败以及修复路径

在最近的大模型后训练中,On-Policy Distillation已经成为默认选项之一。 但研究者们在分析训练日志、实验曲线和对比不同 OPD 方法实现时,反复碰到同一个问题:理论上很自然的 sampled-token OPD,实际运行起来并不稳定,甚至会把模型往一些局部上“看起来合理”、整体上却
wangguo
0
0
768
MOE 架构如何做 SFT 和 RL?聊聊 post-training 难点与经验

MOE 架构如何做 SFT 和 RL?聊聊 post-training 难点与经验

作者:燕雄飞的一天 https://zhuanlan.zhihu.com/p/2018018879109091590 无论是开源还是顶尖商业模型,moe架构已经成为绝对主流,区别于dense模型,在sft和rl阶段有什么独特的训练难点或者挑战,对于这些挑战如何缓解。期望从基础原理入手,看如何训练mo
青稞
0
0
640
正在直播 B 站