
📖标题:Multi-Rollout On-Policy Distillation via Peer Successes and Failures
🌐来源:arXiv, 2605.12652v1
🛎️文章简介
🔸研究问题:如何在基于策略的蒸馏中,利用同一提示下生成的多个采样轨迹(包括成功和失败案例)来构建更密集、更具指导性的教师信号,以解决传统方法独立处理每条轨迹导致的信息浪费问题?
🔸主要贡献:论文提出了多轨迹在线策略蒸馏(MOPD)框架,通过让教师模型同时参考同伴的成功与失败轨迹,构建了包含正向证据和结构化负向证据的对比学习信号,显著提升了推理任务性能。
📝重点思路
🔸构建局部试错空间:针对每个提示采样多条学生轨迹,利用验证器将其划分为成功集和失败集,不再将每条轨迹视为孤立样本,而是作为具有局部结构的群体。
🔸设计同伴条件化教师:改变传统教师仅基于全局知识或单一正确答案进行监督的模式,使教师分布显式地以同一问题的其他同伴轨迹为条件,从而具备局部诊断能力。
🔸实施两种上下文策略:一是“正向同伴模仿”,仅向教师展示成功的同伴轨迹以提供多种有效推理路径;二是“对比式成败条件化”,同时输入成功和失败轨迹,利用失败案例作为结构化负向证据,明确指示应避免的错误模式。
🔸优化蒸馏损失函数:在计算令牌级蒸馏损失时,教师模型根据包含成败对比信息的增强上下文生成目标分布,引导学生策略在分支点区分正确延续与错误转向。
🔎分析总结
🔸混合上下文效果最佳:实验表明,结合“两个成功加一个失败”的混合同伴上下文能产生最忠实于验证器奖励的监督信号,在代码、数学及科学问答等基准测试中 consistently 优于仅使用成功案例或标准基线。
🔸教师信号质量显著提升:通过分析发现,引入失败同伴轨迹能大幅提高教师评分与真实奖励之间的排序一致性和判别准确率,证明负向证据能有效锐化决策边界。
🔸解空间探索更高效:MOPD 训练出的模型能更早地发现正确解法,并且在生成解决方案时表现出更高的词汇多样性和结构多样性,避免了模式坍塌。
🔸泛化至师生蒸馏场景:该方法不仅适用于自蒸馏,在大型教师指导小型学生的场景中,引入同伴信息同样能带来性能增益,甚至超越教师模型本身的表现。
💡个人观点
论文打破了传统蒸馏中轨迹独立的假设,将强化学习中的“试错”机制引入蒸馏过程。它不仅仅是在模仿成功,更是通过显式地展示“看似合理但实际错误”的失败案例,教会模型识别并规避特定的推理陷阱。




