ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models——扩散模型中在线策略蒸馏的统一视角

2026/10/3 8:40:09 拓冰建站 浏览量
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models——扩散模型中在线策略蒸馏的统一视角 《DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models》提出了一种用于扩散模型多任务训练的新范式。其核心思想是将多任务强化学习解耦为“单任务在线策略探索”和“多任务能力整合”两个独立阶段并通过在线策略蒸馏On-Policy Distillation, OPD将多个任务特定教师模型的能力整合到一个统一的学生模型中。以下是对全文主要研究内容的全面总结概括。一、研究背景与问题1.1 扩散模型强化学习的兴起强化学习RL已成为改进扩散模型尤其是文本到图像生成模型的重要范式。现有工作表明针对单一奖励信号如美学质量、文本渲染准确性、组合对齐等优化扩散模型可以显著提升性能。1.2 单任务优化与多目标需求的矛盾然而这些收益通常是任务特定的。在实际应用中用户往往期望单一模型同时满足多个目标例如生成既美观又忠实于文本指令的图像。这种单目标优化与多目标用户需求之间的不匹配自然激发了对多任务强化学习的研究。1.3 现有多任务RL范式的两大挑战现有多任务RL方法主要遵循两种范式但各有局限1联合优化Joint Optimization在统一框架内同时训练所有任务。挑战一目标冲突——不同任务可能诱导不一致的优化方向导致跨任务干扰。挑战二任务难度不平衡——较简单的任务往往主导学习动态抑制来自更具挑战性任务的信号。2级联RLCascade RL按顺序在不同任务上优化策略避免每个训练阶段内的直接梯度冲突。缺点需要多个训练阶段、精心设计的调度和任务特定超参数过程繁琐。容易发生灾难性遗忘——对后续任务的适应可能降低先前学习任务的性能。二、核心思想与贡献2.1 核心思想解耦多任务RL作者提出多任务RL应该解耦为两个不同的过程单任务在线策略探索为每个任务独立训练一个任务特定教师模型。多任务能力整合通过在线策略蒸馏将多个教师的能力整合到一个统一学生模型中。这一思想受在线策略蒸馏OPD在LLM领域成功的启发作者将其扩展到扩散模型领域。2.2 主要贡献提出DiffusionOPD一种新的在线策略蒸馏范式用于扩散模型的多任务训练。领域特定教师沿着统一学生自身的轨迹对其进行监督。建立原则性理论框架通过为随机和确定性采样器推导统一的闭式KL目标建立了在线策略扩散蒸馏的原则性框架实现了比PPO风格策略梯度更低方差的优化。实验验证通过多任务实验和消融证明DiffusionOPD在训练效率和最终性能方面均优于先前基线在美学、OCR和GenEval上取得最先进结果。三、方法DiffusionOPD3.1 预备知识LLM领域的OPD3.2 将OPD提升到扩散模型3.2.1 连续状态马尔可夫链3.2.2 每步高斯转移3.2.3 同协方差高斯分布之间的闭式反向KL3.2.4 确定性情形直接 L2​ 匹配3.3 闭式KL与PPO风格策略梯度的讨论3.3.1 直接闭式KL对Eq. (14)求导得到梯度这是实践中使用的停止轨迹替代目标的梯度不包含通过学生轨迹分布的导数。3.3.2 PPO风格策略梯度3.3.3 为什么闭式KL是更好的解决方案更低方差的梯度估计器直接目标是学生转移均值的解析函数梯度完全通过路径反向传播获得。PPO公式引入额外的得分函数项与高斯噪声成正比虽在期望上无偏但引入非零梯度方差。适用于更广泛的采样器闭式KL损失公式在随机和确定性采样情形下都有效而PPO风格目标本质上通过 log⁡πθ​ 和重要性比率与随机策略密度绑定。3.4 训练配方两阶段训练范式第一阶段每任务教师训练将多任务问题分解为 M 个独立任务。使用现成的扩散RL算法为每个任务训练单独的任务特定教师。允许每个教师专注于自己的奖励目标不受任务间干扰。第二阶段多任务在线策略蒸馏将专门化教师蒸馏为统一学生从预训练扩散策略初始化。训练以轮转在线策略方式在所有任务上进行。对于每个任务采样提示展开当前学生获得在线策略去噪轨迹。沿着采样轨迹评估任务教师计算OPD目标的蒙特卡洛估计。算法1DiffusionOPD输入任务集、提示数据集、预训练扩散策略、去噪调度。输出统一多任务扩散学生。阶段1为每个任务训练任务特定教师。阶段2初始化学生对于每个训练轮次初始化总损失对于每个任务采样提示并展开学生计算任务损失累积总损失最后执行一次反向传播和优化器步骤。为稳定多任务优化梯度累积因子设为 GM每个任务一个累积步骤平均任务损失。只有在所有任务都被访问一次后才执行一次反向传播和优化器步骤。四、实验4.1 实验设置4.1.1 实现细节遵循DiffusionNFT实验设置使用SD3.5-Medium在512×512分辨率下作为基础模型。奖励模型包括基于规则的信号GenEval用于组合生成OCR用于视觉文本渲染和基于模型的信号PickScore、ClipScore、HPSv2.1、Aesthetics、ImageReward、UnifiedReward。数据FlowGRPO的GenEval和OCR划分在Pick-a-Pic上训练在DrawBench上评估基于模型的奖励。采用与DiffusionNFT相同的微调和评估配置使用LoRAα64,r32和40步一阶ODE采样器进行评估。4.1.2 单任务教师根据奖励任务特点选择训练算法。OCR和美学使用GRPO-Guard训练教师。DiffusionNFT在OCR上易受奖励黑客攻击以严重图像质量下降为代价获得高奖励分数。美学教师优化PickScore、ClipScore和HPSv2.1的等权重混合GRPO-Guard表现更优。GenEval使用DiffusionNFT训练教师收敛更快、性能上限更高。4.1.3 基线单任务教师上述专门化模型。多任务RL使用不同RL算法在相应数据集上交替训练课程与DiffusionOPD相同。Cascade NFT顺序训练基线不同任务分阶段学习。4.2 与多任务RL方法的比较主要发现单任务教师高度专门化于自己的训练领域但泛化能力较差。多任务RL方法改善了整体任务覆盖但需要显著更长的训练时间在美学等挑战性目标上仍表现不佳。Cascade NFT达到相对有竞争力的性能但最慢且最繁琐容易发生灾难性遗忘。DiffusionOPD取得最佳整体性能证明了训练范式在多领域偏好优化中的有效性。训练效率多任务RL基线比单任务RL教师收敛更慢表明联合优化异构奖励引入严重优化干扰。DiffusionOPD达到相同目标分数所需总训练时间远少于多任务RL基线同时达到显著更高的性能上限。4.3 消融研究4.3.1 蒸馏方法比较DiffusionOPD与DMD、TDM和监督微调SFT。SFT使用教师在线生成图像训练学生模仿教师生成的样本。DMD和TDM使用学生模型执行在线策略采样通过各自方法定义的训练梯度蒸馏教师。所有基线在与DiffusionOPD相同设置下实现从相同专门化教师集蒸馏。DiffusionOPD在所有比较的蒸馏方法中始终实现最快收敛和最高最终性能上限。4.3.2 损失公式比较闭式KL目标与PPO风格策略梯度。两种方法在多任务设置中以相同采样噪声水平 a0.7 评估。闭式KL目标比PPO风格策略梯度实现更快的奖励提升和更高的性能上限。4.3.3 噪声水平对蒸馏期间使用的SDE采样器噪声水平进行消融。降低噪声水平始终导致学生模型更快的收敛和更高的评估分数。ODE采样器比噪声水平 0.7 的SDE采样器效率高出多达五倍。五、结论5.1 主要贡献总结提出DiffusionOPD一种用于扩散模型多任务训练的新在线策略蒸馏范式。解耦多任务RL将单任务探索与多任务能力整合解耦避免联合多任务RL的优化冲突以及级联RL的低效率和遗忘。理论框架将OPD扩展到扩散马尔可夫链产生闭式每步反向KL目标统一随机SDE和确定性ODE细化。低方差训练与PPO风格策略梯度优化相比闭式KL目标实现更低方差训练自然适用于各种采样器类型。实验验证大量实验和消融表明DiffusionOPD在训练效率和最终性能方面始终优于先前基线在美学、OCR和GenEval上取得最先进结果。5.2 未来展望作者希望DiffusionOPD能够成为未来多任务和偏好对齐扩散建模工作的有用基础。六、核心创新点提炼创新点具体内容范式创新将多任务RL解耦为单任务教师训练和多任务在线策略蒸馏两阶段理论创新将OPD从LLM扩展到扩散模型建立连续状态马尔可夫链视角目标创新推导出同协方差高斯分布之间的闭式反向KL目标无蒙特卡洛方差统一视角闭式KL目标统一随机SDE和确定性ODE采样器优化优势闭式KL比PPO风格策略梯度方差更低适用于更广泛采样器实验效果在美学、OCR、GenEval上取得最先进结果训练效率显著优于多任务RL基线七、关键公式汇总公式含义Eq. (2)LLM领域OPD序列级反向KL目标Eq. (3)LLM领域OPD每步条件KL分解Eq. (4)连续状态马尔可夫链OPD目标Eq. (6)学生一步转移核高斯分布Eq. (8)教师一步转移核高斯分布Eq. (10)同协方差高斯分布闭式KLEq. (11)DiffusionOPD随机SDE目标Eq. (12)DiffusionOPD确定性ODE目标Eq. (14)每步闭式KL表达式Eq. (21)闭式KL与PPO期望梯度等价性八、总结DiffusionOPD是一项针对扩散模型多任务训练的重要研究其核心贡献在于问题诊断准确识别了现有多任务RL范式联合优化和级联RL的根本局限——目标冲突、任务难度不平衡、训练繁琐、灾难性遗忘。范式重构提出将多任务RL解耦为“单任务在线策略探索”和“多任务能力整合”两个独立阶段通过在线策略蒸馏实现能力整合。理论突破将OPD从LLM扩展到扩散模型通过连续状态马尔可夫链建模和同协方差高斯分布闭式KL推导建立了统一的理论框架。优化优势证明闭式KL目标比PPO风格策略梯度方差更低且适用于随机SDE和确定性ODE两种采样器。实验验证在美学、OCR、GenEval等多个基准上取得最先进结果训练效率显著优于多任务RL基线和Cascade NFT。广泛适用性框架不限于闭式反向KL目标一旦学生生成在线策略轨迹教师可使用广泛的现有蒸馏目标进行监督使DiffusionOPD成为扩散模型中在线策略蒸馏的统一框架。这项工作为扩散模型的多任务学习和偏好对齐提供了新的思路和理论基础具有重要的学术价值和实践意义。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示1 引言强化学习RL[Rafailov et al. 2023; Schulman et al. 2017; Shao et al. 2024] 最近已成为改进基于扩散模型[Labs et al. 2025; Li et al. 2026, 2025; Mao et al. 2026; Miao et al. 2026; Rombach et al. 2022; Wei et al. 2024, 2025, 2026; Xing et al. 2024a,b, 2023, 2024c; Zuo et al. 2026]的强大范式。越来越多的研究[Liu et al. 2026; Wallace et al. 2024; Wang et al. 2025a; Xu et al. 2023a; Xue et al. 2025; Zheng et al. 2025]表明针对单一奖励信号进行优化时RL可以显著提升性能。然而这些收益通常是任务特定的。在实践中用户往往期望单一模型能够同时满足多个目标例如生成既美观又忠实于文本指令的图像。单目标优化与多目标用户需求之间的这种不匹配自然激发了对多任务RL的研究。多任务RL旨在通过在多个任务特定奖励上进行优化使单一扩散模型具备多种能力。现有方法主要遵循两种范式。第一种是联合优化即在统一框架内同时训练所有任务。虽然原则上很有吸引力但该策略通常面临两个基本挑战任务间的目标冲突和任务难度不平衡。不同任务可能诱导不一致的优化方向导致训练过程中的跨任务干扰而较简单的任务往往会主导学习动态抑制来自更具挑战性任务的信号。第二种范式是级联RL [Mao et al. 2026; Zheng et al. 2025]它按顺序在不同任务上优化策略而不是同时进行从而避免每个训练阶段内的直接梯度冲突。然而这种策略在实践中通常很繁琐因为它需要多个训练阶段、精心设计的调度以及任务特定的超参数。它也容易发生灾难性遗忘[Kirkpatrick et al. 2017]即对后续任务的适应可能会降低先前学习任务的性能。为了解决联合优化中的奖励冲突和级联优化的繁琐训练过程我们认为多任务RL应该解耦为两个不同的过程单任务在线策略探索和多任务能力整合。受在线策略蒸馏OPD[Thinking Machines Lab 2026]成功的启发我们提出了DiffusionOPD一种用于扩散模型的在线策略蒸馏框架。具体而言我们首先训练一组任务特定的教师模型每个模型针对单一任务独立优化然后将它们的能力蒸馏到一个统一的学生模型中。这避免了教师训练期间的跨任务干扰并消除了学生从头解决所有任务的探索负担。为了将OPD从LLM扩展到扩散模型我们首先推导了扩散领域的OPD目标。具体来说我们将原始公式从自回归token转移提升到连续状态去噪转移并将扩散去噪过程建模为由逆向时间SDE [Liu et al. 2026]诱导的离散时间马尔可夫链。在这种视角下学生和教师在每个去噪状态定义一步高斯转移核。由于这些核共享相同的协方差它们的反向KL散度具有闭式表达式从而为扩散模型产生了解析的OPD目标。给定该目标一个直接的选择是遵循[Thinking Machines Lab 2026]使用PPO风格的目标优化学生将每步反向KL作为密集奖励并将教师视为学生轨迹上的过程级奖励模型[Cui et al. 2025; Wang et al. 2024; Zhang et al. 2025]。然而我们的推导表明该公式引入了一个与高斯噪声成正比的额外得分函数项。虽然在期望上无偏但该项增加了梯度方差使得PPO [Schulman et al. 2017]成为一种不必要噪声较大的方式来优化一个已经以闭式形式可用的量。因此我们直接优化闭式KL目标而不是依赖PPO风格的替代目标。这种设计降低了梯度方差并产生了更强的实证性能。此外它自然地扩展到确定性ODE采样器在此情况下恢复为直接转移匹配从而为不同扩散采样器上的在线策略蒸馏提供了统一视角。更重要的是我们的框架不限于上述闭式反向KL目标。一旦学生生成在线策略轨迹教师就可以使用广泛的现有蒸馏目标[Luo et al. 2025; Yin et al. 2024a,b]对访问过的去噪状态进行监督。因此DiffusionOPD不应仅仅被视为一种反向KL方法而更应被视为扩散模型中在线策略蒸馏的统一框架。我们进一步在多任务设置中评估了DiffusionOPD它在训练效率和最终性能方面始终超越所有多任务RL基线。我们还对关键设计选择进行了消融实验包括蒸馏目标、损失公式和采样器噪声水平。我们的贡献可以总结如下我们提出了DiffusionOPD一种新的在线策略蒸馏范式用于扩散模型的多任务训练其中领域特定的教师沿着统一学生自身的轨迹对其进行监督。我们通过为随机和确定性采样器推导统一的闭式KL目标建立了在线策略扩散蒸馏的原则性框架实现了比PPO风格策略梯度更低方差的优化。我们通过多任务实验和消融验证了DiffusionOPD在训练效率和最终性能方面均优于先前基线在美学、OCR和GenEval上取得了最先进的结果。我们的消融进一步突出了关键设计选择的影响。2 相关工作2.1 扩散模型的强化学习强化学习RL最近已成为改进基于扩散的文本到图像模型[Rombach et al. 2022]的有效范式。基于强化学习的进展[Rafailov et al. 2023; Schulman et al. 2017; Shao et al. 2024]越来越多的研究将RL应用于扩散生成并表明在任务特定奖励信号如美学质量、文本渲染准确性和组合对齐下它可以显著改善模型行为[Liu et al. 2026; Wallace et al. 2024; Wang et al. 2025a; Xu et al. 2023a; Xue et al. 2025; Zheng et al. 2025]。然而大多数现有方法一次只优化单一奖励产生的是任务专门化的改进而非在多个目标上表现良好的统一模型。在实践中用户往往期望单一文本到图像模型同时满足多个需求如视觉吸引力、提示忠实度和OCR正确性。这一差距激发了将扩散模型的RL从单任务优化扩展到多任务设置的兴趣。2.2 扩散蒸馏扩散蒸馏旨在将教师扩散模型的知识转移到学生模型。该领域的大多数先前工作集中在步数蒸馏上即将多步教师压缩为少步学生以实现更高效的推理。现有方法大致可分为两类。轨迹蒸馏[Luo et al. 2023; Meng et al. 2023; Salimans and Ho 2022; Song and Dhariwal 2024; Song et al. 2023]通过模仿中间转移或在时间步之间强制一致性来蒸馏教师的去噪过程。分布匹配方法则通过在选定时间步上对齐学生与教师的分布来训练学生模型包括Diffusion-GAN混合方法[Sauer et al. 2023; Xu et al. 2023b]和得分蒸馏方法[Luo et al. 2025; Wang et al. 2023; Yin et al. 2024a, 2023; Zhou et al. 2024]。与这类工作不同我们不将蒸馏用于步数减少。相反我们研究如何在多任务设置中将多个奖励专门化的教师蒸馏为一个对齐的单一学生使用任务特定的教师为能力整合提供密集监督。3 方法3.1 预备知识LLM领域的OPD与标准在线策略强化学习模型生成完整响应并仅接收结果级标量奖励不同OPD提供token级密集监督。学生在自身轨迹的每个解码步骤都从教师那里接收完整的下一token分布目标。这使得目标可以作为解析的每步KL通过直接反向传播进行优化避免了稀疏奖励设置中固有的高方差策略梯度。3.2 DiffusionOPD3.2.1 将OPD提升到连续状态马尔可夫链3.2.2 每步高斯转移3.2.3 同协方差高斯分布之间的闭式反向KL3.2.4 确定性情形直接L2​匹配3.3 讨论闭式KL与PPO风格策略梯度3.3.1 直接闭式KL3.3.2 PPO风格策略梯度或者可以将教师模型视为过程奖励模型[Cui et al. 2025; Wang et al. 2024; Zhang et al. 2025]它沿学生轨迹提供密集的每步监督。在这种视角下每步优势的一个自然选择是负KL3.3.3 为什么闭式KL是更好的解决方案闭式KL优于PPO风格替代目标有两个原因。第一它产生更低方差的梯度估计器。Eq. (14)中的直接目标是学生转移均值的解析函数因此其梯度完全通过路径反向传播获得。相比之下PPO公式引入了一个额外的得分函数项形式为3.4 训练配方4 实验在本节中我们详细介绍实验设置并从三个角度展示DiffusionOPD的能力(1) 与主要多任务学习基线的比较(2) 与替代蒸馏方法在从多个单任务教师转移知识方面的比较(3) 关于关键设计选择的消融研究。4.1 实验设置4.1.1 实现细节我们遵循DiffusionNFT [Zheng et al. 2025]的实验设置使用SD3.5-Medium [Esser et al. 2024]在512×512分辨率下作为基础模型。我们的奖励模型包括基于规则的信号和基于模型的信号。基于规则的奖励是用于组合生成的GenEval [Ghosh et al. 2023]和用于视觉文本渲染的OCR而基于模型的奖励包括PickScore [Kristain et al. 2023]、ClipScore [Hessel et al. 2021]、HPSv2.1 [Wu et al. 2023]、Aesthetics [Schuhmann 2022]、ImageReward [Xu et al. 2023a]和UnifiedReward [Wang et al. 2025b]。对于数据我们使用FlowGRPO的GenEval和OCR划分并在Pick-a-Pic [Kristain et al. 2023]上训练同时在DrawBench [Saharia et al. 2022]上评估基于模型的奖励。我们还采用与DiffusionNFT相同的微调和评估配置使用LoRA (α64,r32)和40步一阶ODE采样器进行评估。4.1.2 单任务教师我们根据奖励任务的特点为每个教师选择训练算法。对于OCR和美学我们使用GRPO-Guard训练教师。在我们的初步实验中尽管DiffusionNFT收敛迅速但它在OCR上极易受到奖励黑客攻击通常以严重图像质量下降为代价获得高奖励分数。对于美学教师我们优化PickScore、ClipScore和HPSv2.1的等权重1:1:1混合并发现GRPO-Guard在该目标上始终比DiffusionNFT达到更高的性能上限。对于GenEval我们改用DiffusionNFT训练教师因为它在该任务上表现出更快的收敛速度和更高的性能上限。4.1.3 基线我们将DiffusionOPD与几个竞争性基线进行比较(1) 单任务教师即上述专门化模型(2) 多任务RL使用不同的RL算法通过在相应数据集上交替训练来联合训练多个任务课程与DiffusionOPD相同(3) Cascade NFT [Zheng et al. 2025]一种顺序训练基线不同任务分阶段学习。4.2 与多任务RL方法的比较表1显示单任务教师高度专门化于自己的训练领域但在异构奖励之间泛化能力较差。GenEval教师主要在组合对齐方面表现优异OCR教师在文本渲染方面最强Aes教师在美学相关目标上表现最佳而它们各自在自己的优化目标之外显示出有限的迁移能力。多任务RL方法改善了整体任务覆盖但需要显著更长的训练时间并且在美学等更具挑战性的目标上仍然表现不佳表明收敛较慢且跨领域优化干扰更强。尽管Cascade NFT达到了相对有竞争力的性能但由于顺序多阶段训练它是最慢且最繁琐的策略并且容易发生灾难性遗忘这限制了其最终性能。相比之下DiffusionOPD取得了最佳整体性能证明了我们的训练范式在多领域偏好优化中的有效性。图2和图7中的定性比较也展示了我们方法优越的视觉质量。为了进一步评估训练效率我们在图3中绘制了收敛曲线。如图所示多任务RL基线比单任务RL教师收敛更慢表明联合优化异构奖励引入了严重的优化干扰并阻碍了学习效率。此外DiffusionOPD达到相同目标分数所需的总训练时间远少于多任务RL基线同时达到了显著更高的性能上限。4.3 消融研究4.3.1 蒸馏方法我们进一步将DiffusionOPD与几种代表性蒸馏基线进行比较这些基线从单任务教师转移知识包括DMD [Yin et al. 2024a]、TDM [Luo et al. 2025]和监督微调SFT。对于SFT我们使用相应的教师在线生成图像并训练学生模仿这些教师生成的样本这也可以被视为一种教师知识蒸馏形式。对于DMD和TDM我们使用学生模型执行在线策略采样并通过每种方法定义的训练梯度蒸馏相应的教师。为确保公平比较我们在与DiffusionOPD相同的设置下实现所有基线每种方法从相同的专门化教师集蒸馏训练通过在数据集上交替进行。如图5所示DiffusionOPD在所有比较的蒸馏方法中始终实现最快的收敛和最高的最终性能上限。图4和图8中的定性结果也展示了我们的优越性。4.3.2 损失公式为了验证我们在第3.3节中的分析我们比较了闭式KL目标与PPO风格策略梯度。为确保公平比较两种方法在多任务设置中以相同的采样噪声水平a0.7进行评估。如图6所示在相同噪声水平下闭式KL目标比PPO风格策略梯度实现了更快的奖励提升和更高的性能上限。4.3.3 噪声水平我们进一步对蒸馏期间使用的SDE采样器噪声水平进行消融研究。如图6所示降低噪声水平始终导致学生模型更快的收敛和更高的评估分数。特别是ODE采样器比噪声水平0.7的SDE采样器效率高出多达五倍。5 结论我们介绍了DiffusionOPD一种用于扩散模型多任务训练的新在线策略蒸馏范式。通过将单任务探索与多任务能力整合解耦DiffusionOPD避免了联合多任务RL的优化冲突以及级联RL的低效率和遗忘。我们进一步开发了一个原则性理论框架将OPD扩展到扩散马尔可夫链产生了闭式的每步反向KL目标统一了随机SDE和确定性ODE细化。与PPO风格策略梯度优化相比该目标实现了更低方差的训练并自然适用于各种采样器类型。大量实验和消融表明DiffusionOPD在训练效率和最终性能方面始终优于先前基线在美学、OCR和GenEval上取得了最先进的结果。我们希望DiffusionOPD能够成为未来多任务和偏好对齐扩散建模工作的有用基础。