公司动态

图像级奖励反推成「中间去噪步该怎么改」:DiffusionOPSD 把扩散对齐训练提速 40-63%

📅 2026/8/28 4:19:03
图像级奖励反推成「中间去噪步该怎么改」:DiffusionOPSD 把扩散对齐训练提速 40-63%
图像级奖励反推成「中间去噪步该怎么改」DiffusionOPSD 把扩散对齐训练提速 40-63%Hugging Face 每日论文2026-08-26 精选8 月 26 日 Hugging Face 每日论文榜上DiffusionOPSDarxiv:2608.24646以 47 个 upvote 排在前列。这篇由 ByteDance Seed 与新加坡国立大学联合署名、Wei Zhou 等 18 位作者共同完成的工作给扩散模型用人类反馈做对齐alignment这件事提供了一个此前没人认真想过的解法把图像级奖励反推成「中间每一步去噪该怎么动」的明确目标让一次训练同时在 20 个奖励匹配reward-matched设置中拿下 19 个最优、相对最强基线最高 44.0%而训练 GPU-hours 相比 DiffusionNFT 在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。这件事对正在做文生图 RLHF 的团队意味着当奖励信号只是「最终图像好不好」时传统做法需要大量在线采样才能学到怎么改而 DiffusionOPSD 直接在「中间去噪步的目标」上给出明确答案。扩散对齐为什么一直是个「两头不讨好」的工程过去两年扩散模型用人类反馈做对齐RLHF for diffusion的主流路线可以归为两类第一类奖励加权微调RWR / ReFL / DiffusionNFT 等。对同一 prompt 采样若干候选图、用奖励模型打分、按分数高低对每张图做监督微调。这类方法工程简单但训练时奖励信号只在「最终图像」上有定义中间每一步去噪该怎么走完全靠「奖励回传的隐式梯度」自然传播对初始化和数据量极敏感。第二类在线 RL 路线如 DDPO、DPOK 等。把扩散采样本身当成 policy、用强化学习目标直接优化奖励。理论上最优但在实践里需要在线采样大量图、训练方差大、GPU-hours 极高。这两类方法的共同痛点是奖励信号只告诉你「最终图像好不好」但没说中间每一步去噪该怎么动。当奖励模型对某类 prompt 给的反馈很稀薄时训练信号就会在去噪轨迹的中段断掉导致「训了一周但对 prompt X 还是没学会」的情况。DiffusionOPSD 团队的核心观察是图像级奖励虽然只有最后一步有但可以通过「On-Policy Self-Distillation」在线自蒸馏这一招把它反推成中间每一去噪步的明确目标。这件事做对了整个训练就变成一个标准监督学习——稳定、快、不需要在线采样。三件套on-policy 锚点、有限拟合、EMA 行为策略DiffusionOPSD 的方法可以拆成三件配套的事第一冻结行为策略生成轨迹。在每个训练步开始时用一个 frozen 行为策略旧版模型按当前 prompt 采样一条完整的去噪轨迹。把这条轨迹上的每个中间去噪步都当作「锚点」记录下来。第二奖励梯度构造有界正/负目标。对轨迹上的每个锚点分别向「奖励更高」和「奖励更低」的方向各做一次反向传播得到两个梯度方向。把这两个方向夹在「奖励高/低」之间构造出一个有界的、有限步的正/负目标区间——不是无限远的「最优方向」而是「比当前好一点或差一点」的明确锚。第三可训练策略对目标做 detach 监督。训练策略不再直接对奖励做反向传播而是对第二步构造出的正/负目标做有限步的监督拟合finite fitting。所有奖励梯度都被 detach 处理不会反向传播回训练策略——这从根本上把「奖励方差大」和「策略梯度方差大」两件事隔离开。组件输入输出作用冻结行为策略当前 prompt完整去噪轨迹 每个中间步的潜变量提供 on-policy 锚点避免分布漂移奖励梯度反传锚点 奖励模型每个锚点的「有界正/负目标」把图像级奖励反推成中间步明确目标有限拟合训练目标区间策略参数更新detach 监督避免梯度方差爆炸EMA 行为策略训练策略参数新版行为策略平滑更新行为策略锚点分布稳定论文里反复强调的一点是目标构造target construction和有限拟合finite fitting是两个独立的可评估动作。「奖励构造目标阶段获得的增益」和「模型实际更新后的增益」并不一定一致——传统 RWR 类方法隐式地把这两件事混在一起DiffusionOPSD 把它们分开后可以用同一套目标构造做多种 backbone 实验得到一致领先的结论。20 个 reward-matched 设置中 19 个最优不是单点突破DiffusionOPSD 实验设计最值得称道的一点是测试规模足够大。论文在两个 backboneSD 3.5-M 与 Z-Image-Turbo× 10 个奖励评估器PickScore、CLIPScore、HPSv2.1 等上做了完整交叉组合出 20 个 reward-matched 设置即「训练用奖励 R、评估也用同一个 R」的标准设定。结果是 20 个设置中 19 个 SOTA、1 个与 SOTA 持平。相对最强基线DiffusionNFT 及其多策略变体最高提升 44.0%。更值得注意的是单策略 vs 多策略对比。DiffusionNFT 在不同奖励目标上需要训练多个专门策略PickScore 策略、CLIPScore 策略、HPSv2.1 策略……部署时按场景切换而 DiffusionOPSD 用同一份策略权重在 PickScore、CLIPScore、HPSv2.1 三个奖励上同时击败 DiffusionNFT 的多策略。这件事对工程落地的价值是巨大的——过去文生图 RLHF 的部署成本很大程度来自「多策略切换」DiffusionOPSD 把这部分成本压回到「单策略 单一目标构造」。训练 GPU-hours 的下降同样关键- 在 SD 3.5-M 上比 DiffusionNFT 减少 40%- 在 Z-Image-Turbo 上步数蒸馏后的 backbone减少 63%Z-Image-Turbo 是步数蒸馏版 backbone本身推理步数已经远少于 SD 3.5-M。DiffusionOPSD 在这种「又快又小」的 backbone 上还能再砍 63% GPU-hours意味着 RLHF 训练成本首次进入「和个人 fine-tune 一个 LoRA 同量级」的范围。On-Policy Self-Distillation 为什么有效On-Policy Self-Distillation 的有效性来自三个独立贡献的叠加第一on-policy 锚点避免分布漂移。传统 RWR 类方法在训练过程中会逐渐偏离「真实采样分布」导致奖励模型对偏离后的图像打分不准确。DiffusionOPSD 每一步都用 frozen 行为策略重新采样锚点永远在真实分布上奖励信号的有效性得到保证。第二有界目标降低梯度方差。无限远的「最优方向」在 RL 里是方差爆炸的根源。DiffusionOPSD 把目标限制在「比当前锚点好一点/差一点」的有限区间内梯度幅度被锚点附近的局部几何决定不会出现「极端 batch 导致策略突变」的情况。第三detach 监督解耦奖励方差与策略方差。奖励模型本身存在方差同一图像多次打分有抖动。传统做法把这个方差直接传回策略DiffusionOPSD 在构造目标后立刻 detach奖励方差不会进入策略梯度。这三件事叠加起来使得 DiffusionOPSD 在 SD 3.5-M 和 Z-Image-Turbo 两个完全不同性质的 backbone 上都能稳定收敛且单策略可以同时拟合多个奖励目标。这件事对正在做文生图 RLHF 的工程团队意味着从此不必再为「每个奖励单独训一个模型」付出多倍成本。工程配套开源代码 7 个开源评估器论文同步开源了三件东西第一训练代码。在 GitHubworldbench/DiffusionOPSD公开完整训练流程包括 on-policy 锚点采样、目标构造、有限拟合监督、EMA 行为策略更新。第二7 个开源奖励评估器。DiffusionOPSD 团队把实验中用到的 PickScore、CLIPScore、HPSv2.1 等 7 个开源评估器的集成代码一并公开。这件事对文生图 RLHF 生态的价值很大——过去团队做 RLHF 时第一个月的工程时间往往花在「把奖励模型接到扩散训练 pipeline 上」DiffusionOPSD 把这部分的样板代码直接提供。第三模型权重。HuggingFace 上 WeiChow/DiffusionOPSD 提供训练好的策略权重开发者可以直接拉取用于推理。与前一作的连贯OPD 系列的第三步DiffusionOPSD 不是凭空出现的它是 ByteDance Seed 团队的 OPDOn-Policy Distillation系列工作的延续DanceOPD第一代主要针对舞蹈动作/连续动作类生成DiffusionOPD第二代把 OPD 思路迁移到扩散模型验证「奖励反推成中间步目标」在扩散上的可行性FlowOPD第三代扩展把 OPD 思路推广到 flow matching 类生成模型DiffusionOPSD第四代把 self-distillation reward 反推 detach 监督三件事同时拉到 SOTA这条 OPD 路线的连贯性本身是一个信号ByteDance Seed 团队没有把 RLHF for diffusion 当成「刷一次 SOTA 就换方向」的工作而是在四代工作里逐步把方法收敛到一个稳定的工程范式。DiffusionOPSD 是这条范式的成熟形态。局限与未解的问题论文自己承认了几条边界。第一奖励模型的边界即 DiffusionOPSD 的边界。DiffusionOPSD 把图像级奖励反推成中间步目标但前提是奖励模型本身在 prompt X 上有定义。当 prompt 越界超出奖励模型的训练分布时目标构造的稳定性会下降——论文里给出的失败 case 主要集中在「极端风格 prompt」上。第二有界目标区间的宽度选择。论文给出的区间宽度是「当前锚点 ±δ」δ 的选择依赖经验。太小则学习太慢太大则可能跨越奖励模型的不可靠区域。论文没有给出 δ 的自适应方案需要未来工作跟进。第三对 step-distilled backbone 的依赖。Z-Image-Turbo 上 GPU-hours 减少 63% 的部分原因来自 backbone 本身步数少、可学习空间小。当 backbone 是完整步数50-100 步的扩散模型时DiffusionOPSD 的目标构造需要为每一步单独做——这件事论文里用 SD 3.5-M 已经验证可行但工程开销仍高于 Turbo 版本。这篇论文传递的最大信号DiffusionOPSD 给文生图 RLHF 赛道传递的最大信号是奖励信号和训练目标之间的距离可以被工程化地拉近。过去两年文生图 RLHF 一直困在「奖励信号是图像级的、训练目标却要在每一步去噪上定义」这个错位里。DiffusionOPSD 用 on-policy 自蒸馏 有限目标 detach 监督三件事把这个错位直接消除了。这件事对正在做文生图 RLHF 的工程团队意味着当你在评估「是该上在线 RL、还是继续做 RWR」时DiffusionOPSD 提供了一个第三选项——它既不像在线 RL 那样昂贵也不像 RWR 那样对初始化敏感。而对关注扩散模型商业化的人来说DiffusionOPSD 的单策略多奖励能力可能是被低估的部分。当一家公司同时需要在「美感」PickScore、「图文一致」CLIPScore、「人类偏好」HPSv2.1三个维度上做对齐时传统做法是训练三个专门策略、部署时按场景切换。DiffusionOPSD 用同一份策略权重同时拟合三个奖励部署成本压到原来的 1/3且效果在每个奖励上都不输专门策略。这件事对文生图产品的成本结构有直接影响。最后这篇论文也再次印证了 ByteDance Seed 团队在生成模型对齐方向的方法论积累从 DanceOPD 到 DiffusionOPD 到 FlowOPD 再到 DiffusionOPSD四代工作一脉相承地把「on-policy 自蒸馏 有限目标」这个核心思路打磨到工业可用。对正在做生成模型对齐研究的团队来说OPD 系列是一个值得长期跟踪的方法论谱系——它的下一步可能不是 DiffusionOPSD 的某个增量改进而是把这个思路推广到视频生成、3D 生成等其他模态。