资讯详情

【OPD】On-Policy Distillation Survery

📅 2026/10/8 14:09:59 | 华诺云谱 👁 阅读
【OPD】On-Policy Distillation Survery
noteOPD 的监督更多来自 teacher 分布或 teacher feedbackRL 更多来自 reward/verifierOPD 解决长轨迹误差累积exposure bias让学生模型自己 rollout再由教师/奖励模型/验证器对学生真实轨迹提供监督信号最后更新学生模型。OPSD OPD 的自蒸馏版本student 自己 rollout然后用“带 ground truth / privileged information 的自己”当 teacher去教“不带这些信息的自己”OPD 是一个大范式学生自己 rollout再接受监督。GRPO 是一种具体 RL 更新算法rollout 多个样本用 group reward 算 advantage 更新 policy。OPDOn-Policy Distillation让大语言模型从自己的生成轨迹中学习 。【核心问题】语言模型能否在自身生成的轨迹上获得既贴近真实推理状态、又足够稠密的训练信号【OPD 的核心思路】让 student 模型在自身生成的轨迹上采样再由 teacher 模型提供逐 token 的 Reverse KL 监督。这样既保持了 on-policy 的数据特性又获得了稠密的训练信号。【与 SFT、GRPO 的对比】SFToff-policy信号稠密但依赖外部数据存在暴露偏差GRPOon-policy信号稀疏只有最终答案的奖励OPDon-policy 信号稠密逐 token 监督兼顾两者优势【两个扩展变体】MOPD多教师 OPD整合多个领域专家如数学、代码、软件等到一个模型中OPSDon-policy 自蒸馏模型自己当自己的 teacher利用真实答案作为 privileged context减少对外部 teacher 的依赖【为什么用 Reverse KL】Forward KL 会迫使分布 q 覆盖 p 的所有模式mass-covering而 Reverse KL 迫使 q 在 p 为零的地方也为零mode-seeking更适合让 student 聚焦于 teacher 的高概率区域。文章目录note一、研究背景二、OPD1、OPD方法2、OPD的loss3、KL散度三、训练方法1、三个维度2、OPD和OPSD3、OPD和GRPO的区别四、实验效果五、实验坑点Reference一、研究背景链接https://arxiv.org/pdf/2604.00626研究问题这篇文章要解决的问题是如何在大语言模型LLMs中有效地进行知识蒸馏特别是针对推理密集型任务减少推理错误并提高模型的鲁棒性。研究难点该问题的研究难点包括传统知识蒸馏方法在推理任务中表现不佳尤其是在长序列推理中误差会累积导致性能下降现有的蒸馏方法大多采用离线模仿即学生模型在固定的数据集上进行训练但在推理时生成的新序列与训练数据分布不匹配导致误差放大。相关工作该问题的研究相关工作有经典的知识蒸馏方法Hinton et al., 2015其目标是让学生模型继承教师模型的软输出结构早期的方法主要关注如何采样和选择合适的散度函数Agarwal et al., 2024; Gu et al., 2024后续研究揭示了目标函数的形式等价于KL约束形式的强化学习Yang et al., 2026d。二、OPD1、OPD方法f-散度最小化OPD方法将训练过程重新组织为围绕学生采样的轨迹进行优化目标是减少复合误差使其线性化。公式如下L O P D ( θ ) E y ∼ π mix [ ∑ t 1 ∣ y ∣ D f ( p T ( ⋅ ∣ x , y t ) , p θ ( ⋅ ∣ x , y t ) ) ] \mathcal{L}_{OPD}(\theta) E_{y \sim \pi_{\text{mix}}} \left[ \sum_{t1}^{|y|} \mathcal{D}_f \left( p_T(\cdot \mid x, y_{t}), p_\theta(\cdot \mid x, y_{t}) \right) \right]LOPD​(θ)Ey∼πmix​​​t1∑∣y∣​Df​(pT​(⋅∣x,yt​),pθ​(⋅∣x,yt​))​其中D f \mathcal{D}_fDf​表示f-散度族π mix \pi_{\text{mix}}πmix​是混合策略。混合策略混合策略π mix \pi_{\text{mix}}πmix​通过插值或混合不同的策略来控制蒸馏过程中的探索程度。例如GKD方法使用π mix λ p θ ( 1 − λ ) p data \pi_{\text{mix}} \lambda p_\theta (1 - \lambda) p_{\text{data}}πmix​λpθ​(1−λ)pdata​进行插值。2、OPD的lossOPD 通过修改训练期望值使其从学生模型自身的 rollout轨迹采样或混合策略π mix \pi_{\text{mix}}πmix​中进行采样从而解决了曝光偏差exposure bias问题。这种广义的在线策略目标函数将采样轨迹与局部匹配度量解耦L O P D ( θ ) E y ∼ π mix [ ∑ t 1 ∣ y ∣ D f ( p T ( ⋅ ∣ x , y t ) , p θ ( ⋅ ∣ x , y t ) ) ] (8) \mathcal{L}_{OPD}(\theta) \mathbb{E}_{y \sim \pi_{\text{mix}}} \left[ \sum_{t1}^{|y|} \mathcal{D}_f(p_T(\cdot|x, y_{t}), p_\theta(\cdot|x, y_{t})) \right] \tag{8}LOPD​(θ)Ey∼πmix​​​t1∑∣y∣​Df​(pT​(⋅∣x,yt​),pθ​(⋅∣x,yt​))​(8)这里D f \mathcal{D}_fDf​代表来自 f-散度族f-divergence family, Wen et al., 2023的一种散度。形式上给定两个分布P PP和Q QQf-散度定义为D f ( P ∥ Q ) E y ∼ Q [ f ( P ( y ) Q ( y ) ) ] (9) D_f(P \| Q) \mathbb{E}_{y \sim Q} \left[ f\left( \frac{P(y)}{Q(y)} \right) \right] \tag{9}Df​(P∥Q)Ey∼Q​[f(Q(y)P(y)​)](9)其中f : ( 0 , ∞ ) → R f: (0, \infty) \to \mathbb{R}f:(0,∞)→R是一个凸生成器convex generator且满足f ( 1 ) 0 f(1) 0f(1)0。f ff的选择决定了似然比p T ( y ) / p θ ( y ) p_T(y)/p_\theta(y)pT​(y)/pθ​(y)的隐式加权方式前向 KLForward KL,f ( u ) u log ⁡ u f(u) u \log uf(u)ulogu覆盖模式Mode-covering零避免。鼓励学生模型在教师模型分布的任何地方分配概率质量通常会连接不同的教师模式并在模式间空间产生幻觉hallucinating。反向 KLReverse KL,f ( u ) − log ⁡ u f(u) -\log uf(u)−logu寻找模式Mode-seeking零强制。学生模型将其质量坍缩到教师模型的单个最高峰值上忽略次优的可接受输出但专注于高精度。JSD Jensen-Shannon Divergence,f ( u ) u log ⁡ u − ( u 1 ) log ⁡ u 1 2 f(u) u \log u - (u 1) \log \frac{u1}{2}f(u)ulogu−(u1)log2u1​对称的、有界的并在覆盖模式和寻找模式行为之间进行平滑插值。α \alphaα-散度α \alphaα-divergence一个参数化的族在前向 KLα → 1 \alpha \to 1α→1和反向 KLα → 0 \alpha \to 0α→0之间连续插值允许对寻找模式/覆盖模式权衡进行细粒度控制。目标函数选择目标函数的选择取决于具体任务的需求。例如对于数学推理任务反向KL散度Reverse KL有助于集中概率质量在正确答案上而对于开放式生成任务前向KL散度Forward KL则有助于保留输出多样性。kl和反向kl散度公式只是具体表象更本质的是opd是student先rollout出轨迹然后teacher给出supervision。反向kl只是opd其中一个方法参考图中Training Signal列R-KL反向kl。图源自A Survey of On-Policy Distillation for Large Language Models3、KL散度Forward KL 会覆盖多个模式但可能在两个模式中间“糊”出不好的答案Reverse KL 会选择一个峰答案更尖锐但可能丢掉其他合理答案。方法特点适合场景Forward KLmode-covering尽量覆盖 teacher 的多种可能答案开放生成、翻译、摘要Reverse KLmode-seeking集中到 teacher 最有把握的高概率答案数学、代码、推理、唯一答案任务JSD / Adaptive KL折中或按 token 动态切换指令跟随、复杂混合任务三、训练方法1、三个维度将OPD分为三个维度维度问题典型内容Objective / 优化目标学 teacher 的什么Forward KL、Reverse KL、JSD、RL-augmented objectiveSignal Source / 信号来源teacher 怎么给信号white-box logits、black-box API、self-distillationTraining Dynamics / 训练稳定性怎么训稳、训快token weighting、curriculum、compute optimization2、OPD和OPSDOPD和OPSD方法teacher 是谁监督信号来自哪里普通 OPD外部大 teacherteacher logits / reward / critiqueOPSD自己自己在带答案/额外信息条件下的分布一些具体的工作展示3、OPD和GRPO的区别对比OPDGRPO本质蒸馏范式强化学习算法rollout 来源student 当前策略policy 当前策略监督信号teacher logits / teacher correction / reward / verifierreward 分数优化目标让 student 接近 teacher 分布或吸收 teacher 反馈提高高 reward 轨迹概率降低低 reward 轨迹概率常见 lossKL / JSD / Reverse KL / token-level distillation / sequence-level distillationpolicy gradient group advantage clippingteacher 是否必须常见需要 teacher但也有 self-distillation不需要 teacher只需要 reward更像什么“老师批改学生真实输出”“根据奖励强化好输出”四、实验效果性能提升实验结果表明OPD方法在大多数推理任务中显著提升了学生的性能。例如在MATH-500数据集上OPD方法在7B模型上的准确率达到了79.3%比离线知识蒸馏方法提高了7.9个百分点。误差减少OPD方法通过在训练过程中引入学生自己的错误状态减少了误差累积现象。具体来说OPD方法在推理任务中的误差率显著低于离线知识蒸馏方法。计算效率尽管OPD方法的计算开销较大但通过前缀截断和离线预计算等技术可以有效降低计算成本。例如使用前缀截断技术后OPD方法的训练时间减少了约2倍。五、实验坑点问题通俗解释flawed prefix trapstudent 生成了很烂的前缀teacher 在这个烂上下文上给出的分布也可能不可靠diversity collapse模型越来越只会一种答案熵下降、输出模板化length inflation输出越来越长用长推理骗分self-play saturation自蒸馏到后面只能学到自己已有能力无法突破agentic failure多步工具调用里一步错会污染后续 observation 和决策Reference[1] A Survey of On-Policy Distillation for Large Language Models
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑