1. 首页
  2. 精选文章
  3. 从长/短 CoT SFT、到自蒸馏,再到偏好优化!厘清 OPD 的核心技术演变

从长/短 CoT SFT、到自蒸馏,再到偏好优化!厘清 OPD 的核心技术演变

  • 发布于 2026-08-02
  • ·
  • 48 次阅读
  • ·
  • ·

作者:zklink
https://zhuanlan.zhihu.com/p/2067242658939065932

Gemini_Generated_Image_bb2qkbb2qkbb2qkb.png

2026 年以来,以 On-Policy Distillation(在线策略蒸馏,OPD)命名的工作在推理模型后训练领域密集出现,成为继长思维链(Long CoT)蒸馏之后又一个快速升温的研究议题。

与传统的离线蒸馏不同,OPD 不再让教师模型静态生成训练数据,而是让学生在自身策略采样得到的轨迹上接受教师的监督,从数据分布的根源上缓解了师生失配问题ESRRethinking OPD

短短半年内,从 ESR 提出的早停 rollout 蒸馏,到 OPD+ 对 advantage 的重设计,再到直接 OPD 对弱到强泛化的探索,一系列工作把 OPD 从一个方法论描述推向了独立研究方向,形成了围绕「如何在学生自己的轨迹上做蒸馏」这一核心问题的密集产出。

OPD+ 重新设计了 OPD 的目标函数核心——advantage 项,发现以往基于教师概率比的 advantage 设计在能力迁移上存在效率瓶颈,通过显式构造奖励项显著提升了教师向基础模型的能力迁移效率OPD+ 。

直接 OPD 则挑战了「教师必须强于学生」的隐含假设:让弱模型在自身 rollout 上蒸馏强模型,避免了每轮模型升级后都要重新生成数据的算力开销,在弱到强泛化场景中验证了 OPD 作为一种持续改进机制的可行性Direct OPD 。

紧随其后的弱到强 OPD 系列进一步把教师范围扩展到弱教师、同质教师,系统追问「什么样的教师、以什么方式、在哪些轨迹上监督」才能最有效地提升学生能力Weak-to-Strong OPD 。

从更长的视角看,OPD 并非凭空出现,而是蒸馏技巧长期演进的必然结果。蒸馏经历了从教师静态数据的离线蒸馏,到教师-学生迭代蒸馏,再到学生自采样、教师在线监督的 on-policy 蒸馏三个阶段。

离线阶段的代表是 DeepSeek-R1 的数据蒸馏与 ReasonLite 的两阶段长短 CoT 蒸馏ReasonLiteDeepSeek-R1—— 它们用强模型生成高质量推理链、过滤后做监督微调,证明了「数据质量比数据量更重要」;

在线阶段的代表则是 ESR、OPD+ 与弱到强 OPD 系列——它们把训练数据从「教师能给的」转向「学生需要的」,在推理长度控制、能力迁移效率与持续自我改进三个维度上打开了新空间。

在这一演进脉络中,本报告关注的三条研究线索分别处于 OPD 谱系的不同位置,且各自经历了清晰的方向演变。

长/短 CoT 监督微调(SFT)是 OPD 的离线前身:教师产出长链或短链推理轨迹、学生监督微调,其演变方向是从「获取更多数据」转向「度量数据质量与推理粒度」——s1 用 1000 条精选数据即可激发推理s1 ,TokenSqueeze 与 ConPress 证明长链可被压缩为短链且不损精度TokenSqueezeConPress 。

自蒸馏 / 自我进化是 OPD 的核心:教师被替换为模型自身或旧版本,SPIN 开创自对弈微调SPIN ,R-Zero 与 Absolute Zero 展示了零数据自我进化的可能R-Zero ,其演变方向是从「自我奖励」走向「完全自主进化」,但 reward hacking 与迭代崩溃始终是悬而未决的稳定性难题Can LRMs Self-Train 。

DPO / 偏好优化则是 OPD 的监督信号维度:它回答「用什么信号训练」而非「用什么数据训练」,从 SimPO、ORPO 等免参考离线变体,演进到 OAIF 的在线采集OAIF 、Step-DPO 的推理步级偏好Step-DPO ,在线化之后即与 OPD 直接汇合。

三条线索共同指向一个趋势:推理模型的后训练正从「离线、静态、教师主导」转向「在线、动态、学生主导」

OPD 正是这一转向的理论锚点——它把数据来源、监督信号与训练范式三个维度统一在同一个框架下,也让长/短 CoT SFT、自蒸馏与偏好优化在谱系中的位置变得清晰可辨。

本报告以此为脉络,系统梳理 2025 年 1 月至 2026 年 8 月间约 120 篇经核实的相关工作,厘清三大子方向在 OPD 主线中的位置与演变,并结合研究空白给出选题参考。

目录