1. 首页
  2. 青稞Talk
  3. 直播预告!没有外部专家监督时,如何让 OPD 策略学会自我持续进化?聊聊在线自进化后训练框架 DRIFT

直播预告!没有外部专家监督时,如何让 OPD 策略学会自我持续进化?聊聊在线自进化后训练框架 DRIFT

  • 发布于 2026-07-24
  • ·
  • 56 次阅读
  • ·
  • ·
直播回放

直播平台

YouTube

视频号

哔哩哔哩

相关资源

演示文稿 (PPT)

直播配套幻灯片

暂未提供

强化学习之后,大语言模型还能如何持续进化?

在没有人类专家监督的情况下,大模型到底该怎么练才能不崩溃、不效率低下?

来自贝壳、清华、巴黎高师的研究团队最新带来一篇名为《DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training》的成果。

github:https://github.com/LianjiaTech/drift
blog:https://lianjiatech.github.io/drift/blog
paper:https://arxiv.org/abs/2606.30345

通过引入动态难度路由和节拍门控探索,DRIFT 让智能体不仅能自我纠错,还能精准识别关键推理节点,实现真正意义上的可持续在线自进化(Online Self-Evolution)。

7月28日(周二)晚8点​,青稞Talk 第140期,DRIFT 作者、清华大学博士生王颢宁和巴黎萨克雷高等师范学院MVA研究生刘懿玮,将围绕「什么时候该强化学习,什么时候该自蒸馏,以及应该探索哪些推理步骤」这个核心问题,系统讲解在线自进化后训练框架 DRIFT 的算法设计与理论动机。

分享内容涵盖难度路由、节拍门控、成功记忆库、课程学习等关键模块,并结合大量实验分析其为何能够实现更加稳定的策略优化,在多个复杂推理和 ToolUse 基准上取得新的 SOTA。同时也将讨论对 LLM 自进化、后训练范式以及强化学习与蒸馏融合方向的一些思考,希望为社区提供新的研究视角。

青稞介绍

王颢宁,清华大学数学系四年级博士生,贝壳认知智能组实习生。

刘懿玮,巴黎萨克雷高等师范学院MVA研究生,贝壳认知智能组实习生。

主题提纲

在线自进化后训练框架 DRIFT:没有外部专家监督时,如何让 OPD 策略学会自我持续进化

1、RL 之后,大语言模型持续进化的困境
2、在线自进化后训练框架 DRIFT
3、DRIFT 核心算法设计与关键模块详解
4、实验分析:为何能够实现更加稳定的策略优化
5、 LLM 自进化、后训练范式以及强化学习与蒸馏融合方向的一些思考

直播时间

7月28日(周二)20:00 - 21:00

目录