实录精选|On-Policy Distillation专题:与RL 的本质区别、全词表监督、跨模型/黑盒蒸馏、Self-OPD...
过去一年,OPD 强势改写大模型后训练格局,消融蒸馏与强化学习的技术壁垒,驱动模型从静态对齐迈向自主进化,一众关乎 AI 自我迭代的前沿疑问应运而生。 在 5 月 30 日,#青稞AMA 第 3 期:On-Policy Distillation(OPD) 专题中,青稞社区邀请到了当前 OPD 方向最
Tag
共 123 篇文章 · 第 1 / 2 页