Tag

OPD

共 21 篇文章

重探 On-Policy Distillation(OPD):三类典型失败以及修复路径

重探 On-Policy Distillation(OPD):三类典型失败以及修复路径

在最近的大模型后训练中,On-Policy Distillation已经成为默认选项之一。 但研究者们在分析训练日志、实验曲线和对比不同 OPD 方法实现时,反复碰到同一个问题:理论上很自然的 sampled-token OPD,实际运行起来并不稳定,甚至会把模型往一些局部上“看起来合理”、整体上却
wangguo
0
0
742
On-Policy Distillation 三大流派:一个方法解决两道难题

On-Policy Distillation 三大流派:一个方法解决两道难题

痛点与破局 RL 训练过的人都知道那种感觉——跑了三天 GRPO,token 消耗是 SFT 的十几倍,最后一看提升,几乎为零。 问题出在哪?Reward 信号太稀疏,credit assignment 做不到 token 级,rollout 全错时梯度直接归零。 但 SFT 也有自己的软肋:推理时
wangguo
0
0
1473
正在直播 B 站