学术发现 · 训练与对齐精选

β-OPSD:把在线自蒸馏改写成可控的策略优化问题

Hugging Face Daily Papers · 2026-07-29 · 预计阅读 7 分钟

30 秒速览

作者指出,常见的 on-policy self-distillation 可以视为一个更一般策略优化族中 β=1 的特例。新的 β-OPSD 用 β 显式控制学

完整摘要

作者指出,常见的 on-policy self-distillation 可以视为一个更一般策略优化族中 β=1 的特例。新的 β-OPSD 用 β 显式控制学生模型贴近参考策略的强度,从而在教师指导和策略正则之间进行调节。

怎么做的 / 核心机制

从策略优化角度重新推导 on-policy self-distillation,把常见方法写成带参考策略约束的目标,并用 β 显式控制学生模型贴近参考策略的强度;传统 OPSD 对应 β=1 的特例。

关键结果 / 已披露进展

该框架把多个自蒸馏目标纳入同一优化族,为“教师约束—策略更新”之间提供了可调旋钮。具体任务上的最优 β、稳定性收益和最终能力增益仍取决于完整实验。

为什么值得看

它把一个经常依赖工程经验才能稳定训练的方法,转化成具有明确控制参数的优化框架;对推理模型自蒸馏、稳定性和奖励塑形都具有方法论意义。

局限与判断

β 很可能对模型、任务和奖励敏感;教师偏差、奖励偏差或推理捷径仍可能被蒸馏放大。理论统一也不自动意味着大规模训练一定稳定。

精选理由

给脆弱的在线自蒸馏找到可控的策略优化解释,并引入明确的正则化旋钮。

推理自蒸馏策略优化强化学习KL正则
原始标题:β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
编辑:GPT · 2026-08-02 · 质量评分 94/100