1. 首页
  2. 青稞Talk
  3. 直播预告!模型的“什么经验值得被看见”?一起聊聊 LOPD:不再手动设计 OPSD 特权信息

直播预告!模型的“什么经验值得被看见”?一起聊聊 LOPD:不再手动设计 OPSD 特权信息

  • 发布于 2026-08-25
  • ·
  • 5 次阅读
  • ·
  • ·
即将开始

相关资源

演示文稿 (PPT)

直播配套幻灯片

暂未提供

学术社区是否已经对层出不穷的 On-Policy Self-Distillation (OPSD) 特权信息变体感到审美疲劳?

当 answer、trajectory、reflection、skill 被不断设计得更精巧,LOPD 反过来追问一个更根本的问题:我们为何仍要替模型规定“什么经验值得被看见”

来自新加坡国立大学等团队最新提出 LOPD,让特权上下文可学习,用不到30%预算超越 GRPO 等基线。

Paper:LOPD: Latent On-Policy Self-Distillation
arXiv:https://arxiv.org/pdf/2608.13040
Code:https://github.com/bingreeky/LOPD

LOPD 不再手工定义 privileged context,而是从历史成功经验中学习其表示,用可学习的 Composer 将经验压缩为 latent context,并与 policy 端到端联合优化。它因此把 OPSD 的问题从“设计更好的 teacher context”,推进到“学习 experience representation”。

实验显示,这一转变不仅提升性能,也显著提高样本效率。LOPD 的意义或许正在于此:经验不应只是被人工雕刻的 artifact,而应成为可学习、可扩展的 substrate。

20260829.png

8月29日(周六)10:00点​,青稞Talk 第149期,新加坡国立大学博士研究生张桂彬,将直播介绍 LOPD。

青稞介绍

张桂彬是新加坡国立大学计算学院博士研究生,导师为颜水成教授,研究方向为Multi-Agent System,Agent Memory和Self-Evolving Agent,在NeurIPS、ICML、ICLR、ACL等顶级会议发表相关Oral/Spotlight论文。

主题提纲

模型的“什么经验值得被看见”?LOPD:不再手动设计 OPSD 特权信息

1、从 OPD 到 OPSD:谁来决定"什么经验值得被看见"?
2、从设计特权信息到学习经验表示
3、LOPD:Composer 压缩经验为 latent context
4、实验验证:性能与样本效率
5、经验即 substrate:自进化智能体的下一步
6、AMA (Ask Me Anything)环节

直播时间

8月29日(周六)10:00 - 11:00

目录