学术发现 · 训练与对齐精选
β-OPSD:把在线自蒸馏改写成可控的策略优化问题
30 秒速览
作者指出,常见的 on-policy self-distillation 可以视为一个更一般策略优化族中 β=1 的特例。新的 β-OPSD 用 β 显式控制学
完整摘要
作者指出,常见的 on-policy self-distillation 可以视为一个更一般策略优化族中 β=1 的特例。新的 β-OPSD 用 β 显式控制学生模型贴近参考策略的强度,从而在教师指导和策略正则之间进行调节。
怎么做的 / 核心机制
从策略优化角度重新推导 on-policy self-distillation,把常见方法写成带参考策略约束的目标,并用 β 显式控制学生模型贴近参考策略的强度;传统 OPSD 对应 β=1 的特例。
关键结果 / 已披露进展
该框架把多个自蒸馏目标纳入同一优化族,为“教师约束—策略更新”之间提供了可调旋钮。具体任务上的最优 β、稳定性收益和最终能力增益仍取决于完整实验。
为什么值得看
它把一个经常依赖工程经验才能稳定训练的方法,转化成具有明确控制参数的优化框架;对推理模型自蒸馏、稳定性和奖励塑形都具有方法论意义。
局限与判断
β 很可能对模型、任务和奖励敏感;教师偏差、奖励偏差或推理捷径仍可能被蒸馏放大。理论统一也不自动意味着大规模训练一定稳定。
精选理由
给脆弱的在线自蒸馏找到可控的策略优化解释,并引入明确的正则化旋钮。
原始标题:β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
编辑:GPT · 2026-08-02 · 质量评分 94/100
编辑:GPT · 2026-08-02 · 质量评分 94/100