强化学习之后,大语言模型还能如何持续进化?
在没有人类专家监督的情况下,大模型到底该怎么练才能不崩溃、不效率低下?

来自贝壳、清华、巴黎高师的研究团队最新带来一篇名为《DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training》的成果。
github:https://github.com/LianjiaTech/drift
blog:https://lianjiatech.github.io/drift/blog
paper:https://arxiv.org/abs/2606.30345
通过引入动态难度路由和节拍门控探索,DRIFT 让智能体不仅能自我纠错,还能精准识别关键推理节点,实现真正意义上的可持续在线自进化(Online Self-Evolution)。
7月28日(周二)晚8点,青稞Talk 第140期,DRIFT 作者、清华大学博士生王颢宁和巴黎萨克雷高等师范学院MVA研究生刘懿玮,将围绕「什么时候该强化学习,什么时候该自蒸馏,以及应该探索哪些推理步骤」这个核心问题,系统讲解在线自进化后训练框架 DRIFT 的算法设计与理论动机。
分享内容涵盖难度路由、节拍门控、成功记忆库、课程学习等关键模块,并结合大量实验分析其为何能够实现更加稳定的策略优化,在多个复杂推理和 ToolUse 基准上取得新的 SOTA。同时也将讨论对 LLM 自进化、后训练范式以及强化学习与蒸馏融合方向的一些思考,希望为社区提供新的研究视角。
青稞介绍
王颢宁,清华大学数学系四年级博士生,贝壳认知智能组实习生。
刘懿玮,巴黎萨克雷高等师范学院MVA研究生,贝壳认知智能组实习生。
主题提纲
在线自进化后训练框架 DRIFT:没有外部专家监督时,如何让 OPD 策略学会自我持续进化
1、RL 之后,大语言模型持续进化的困境
2、在线自进化后训练框架 DRIFT
3、DRIFT 核心算法设计与关键模块详解
4、实验分析:为何能够实现更加稳定的策略优化
5、 LLM 自进化、后训练范式以及强化学习与蒸馏融合方向的一些思考
直播时间
7月28日(周二)20:00 - 21:00