学术发现 · 训练与对齐精选震惊摊坐

用蒸馏模型替代昂贵采样器,Diffusion RL 采样成本降一个数量级

机器之心 · 2026-08-01 · 预计阅读 6 分钟

30 秒速览

这项 ICML 2026 工作针对扩散模型在线强化学习中 rollout 去噪步骤昂贵的问题,让蒸馏模型承担采样器角色,以更少步骤产生训练样本,并将采样成本降低

完整摘要

这项 ICML 2026 工作针对扩散模型在线强化学习中 rollout 去噪步骤昂贵的问题,让蒸馏模型承担采样器角色,以更少步骤产生训练样本,并将采样成本降低约一个数量级。

怎么做的 / 核心机制

用蒸馏后的扩散模型替代原本昂贵的 rollout 采样器,以更少去噪步骤生成强化学习训练样本,再把这些样本用于在线策略更新。

关键结果 / 已披露进展

报道给出的核心结果是采样成本降低约一个数量级,直接压缩 Diffusion RL 中最重的生成环节,而不是只调整奖励或优化器。

为什么值得看

Diffusion RL 的主要障碍之一是在线采样成本。相比只改奖励或优化器,这项工作直接压缩最重的生成环节,有机会显著降低视频和图像模型后训练门槛。

局限与判断

蒸馏采样器可能改变 on-policy 数据分布,并把自身偏差带入奖励优化。还需要确认最终生成质量、训练稳定性以及对不同图像和视频模型的普适性。

精选理由

直接压缩 Diffusion RL 最昂贵的在线采样环节,潜在影响视频与图像生成后训练成本。

为什么进入「震惊摊坐」

将 Diffusion RL 的采样成本降低一个数量级,属于训练效率上的明确突破。

Diffusion RL强化学习蒸馏视频生成训练效率
原始标题:ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级
编辑:GPT · 2026-08-02 · 质量评分 93/100