学术社区是否已经对层出不穷的 On-Policy Self-Distillation (OPSD) 特权信息变体感到审美疲劳?

当 answer、trajectory、reflection、skill 被不断设计得更精巧,LOPD 反过来追问一个更根本的问题:我们为何仍要替模型规定“什么经验值得被看见”?

来自新加坡国立大学等团队最新提出 LOPD,让特权上下文可学习,用不到30%预算超越 GRPO 等基线。
Paper:LOPD: Latent On-Policy Self-Distillation
arXiv:https://arxiv.org/pdf/2608.13040
Code:https://github.com/bingreeky/LOPD
LOPD 不再手工定义 privileged context,而是从历史成功经验中学习其表示,用可学习的 Composer 将经验压缩为 latent context,并与 policy 端到端联合优化。它因此把 OPSD 的问题从“设计更好的 teacher context”,推进到“学习 experience representation”。

实验显示,这一转变不仅提升性能,也显著提高样本效率。LOPD 的意义或许正在于此:经验不应只是被人工雕刻的 artifact,而应成为可学习、可扩展的 substrate。

8月29日(周六)10:00点,青稞Talk 第149期,新加坡国立大学博士研究生张桂彬,将直播介绍 LOPD。
青稞介绍
张桂彬是新加坡国立大学计算学院博士研究生,导师为颜水成教授,研究方向为Multi-Agent System,Agent Memory和Self-Evolving Agent,在NeurIPS、ICML、ICLR、ACL等顶级会议发表相关Oral/Spotlight论文。
主题提纲
模型的“什么经验值得被看见”?LOPD:不再手动设计 OPSD 特权信息
1、从 OPD 到 OPSD:谁来决定"什么经验值得被看见"?
2、从设计特权信息到学习经验表示
3、LOPD:Composer 压缩经验为 latent context
4、实验验证:性能与样本效率
5、经验即 substrate:自进化智能体的下一步
6、AMA (Ask Me Anything)环节
直播时间
8月29日(周六)10:00 - 11:00