一种用于图像超分辨率的有效扩散变换结构)
论文题目Effective Diffusion Transformer Architecture for Image Super-Resolution一种用于图像超分辨率的有效扩散变换结构会议AAAI 2025摘要近年来的研究表明扩散模型在图像超分辨率领域有着广阔的应用前景。虽然最新的方法主要是基于卷积神经网络的潜在扩散模型但很少有人尝试探索变压器这种变压器在图像生成方面表现出了显著的性能。在这项工作中我们设计了一种有效的图像超分辨率扩散变换(DIT-SR)它达到了基于先验方法的视觉质量但通过从头开始训练的方式。在实践中DIT-SR采用整体U型架构并对跨不同阶段的所有变压器块采用统一的各向同性设计。前者便于多尺度分层特征提取而后者将计算资源重新分配到关键层以进一步提高性能。此外深入分析了目前广泛使用的AdaLN模型的局限性提出了一种频率自适应的时间步长调节模型增强了模型在不同时间步长处理不同频率信息的能力。大量实验表明DIT-SR的性能明显优于现有的基于从头开始训练扩散的随机共振方法甚至超过了一些基于先验的方法证明了扩散变换在图像超分辨率方面的优越性。DiT-SR用扩散Transformer从零训练挑战预训练先验方法的图像超分辨率新范式一、背景与问题图像超分辨率Super-Resolution, SR的目标是从低分辨率LR输入重建高分辨率HR图像。近年来扩散模型Diffusion Models在图像生成领域大放异彩并被广泛引入图像超分辨率任务。当前扩散模型在图像超分辨率中的方法大致分为两类第一类从零训练方法Training-from-Scratch代表工作如 SR3、LDM、ResShift将 LR 图像直接注入扩散模型进行训练。这类方法灵活架构修改后可方便地重新训练适合轻量级应用场景。但其性能往往与第二类方法有明显差距。第二类基于先验的方法Prior-based Methods代表工作如 StableSR、DiffBIR、SeeSR、PASD借助在海量数据上预训练了数千 GPU 天的 Stable Diffusion 模型的生成先验来增强图像超分辨率。这类方法效果出色但参数量巨大DiffBIR 达 1670M、SeeSR 达 1619M推理慢且几乎不可能在不大规模重训的情况下修改架构。【配图】Figure 1本文方法与近期 SR 方法在 RealSR 数据集上的对比CLIPIQA vs. 参数量 / FLOPs可以清晰看到从零训练的方法Diff-based SR 区域性能明显低于先验方法而本文的 Ours 以极少的参数量实现了与先验方法相当甚至更优的效果。核心问题能否设计一个从零训练的扩散架构在无需依赖 Stable Diffusion 等大规模先验的前提下逼近甚至超越先验方法的性能同时兼顾灵活性与轻量化二、现有方法的核心局限论文识别出两个主要瓶颈2.1 扩散模型架构设计的局限标准扩散模型如 DDPM、LDM普遍采用U-Net架构作为去噪器具备多尺度层次特征提取能力。2023 年提出的Diffusion TransformerDiT则采用等向同构isotropic的全 Transformer 架构保持分辨率和通道维度不变在图像生成中展现出卓越的可扩展性。然而直接将标准 DiT 应用于图像超分辨率存在问题纯 DiT等向同构缺乏多尺度特征提取对图像细节恢复不利。U 型 DiT加入上下采样后的 U 型结构引入多尺度能力后不同阶段使用不同的通道维度计算资源大量集中在低分辨率层高分辨率层反而资源不足导致参数量激增264M但性能提升有限。【配图】Figure 3从标准 DiT 到 U 型 DiT 再到本文 DiT-SR 的架构演进示意图图中灰色标注为层间特征形状黑色标注为层内通道数展示了等向设计如何将计算资源重新分配到高分辨率层。2.2 时间步条件注入机制的局限扩散模型在不同去噪阶段处理不同频率的信息——早期阶段主要重建低频成分图像结构后期阶段逐步精化高频细节纹理。【配图】Figure 2扩散超分辨率模型在不同去噪阶段生成图像的分析预测的清晰图像与对应傅里叶频谱第一行为各时间步预测的清晰图像第二行为对应的傅里叶频谱。可以看到早期tT频谱中心亮低频主导后期t1频谱边缘亮高频逐步显现。然而广泛使用的自适应层归一化AdaLN仅在通道维度对特征图进行调制对所有空间位置施加统一的调制参数无法区分高低频分量的空间位置也就无法有效感知时间步与频率之间的关联。三、本文提出的方法DiT-SR3.1 整体架构U 型全局结构 等向同构块设计本文提出的DiT-SR的核心思路是将 U 型全局架构与等向同构块设计结合U 型全局结构编码器逐步降低特征图分辨率、增加通道维度解码器做反向操作实现多尺度层次特征提取有助于恢复图像在不同尺度上的细节。等向同构块设计在 U 型的不同阶段内部所有 Transformer 块统一使用相同的内部通道维度记为 C₃而非随层变化。该通道数设置得比 U-Net 中高分辨率阶段的通道数更大但远小于低分辨率阶段的通道数。这一设计带来的效果是计算资源从低分辨率层流向高分辨率层。因为高分辨率层负责捕捉更丰富的高频细节对超分辨率至关重要且高分辨率 DiT 的可扩展性更强这样的资源分配显著提升了模型容量。【配图】Figure 4U 型 DiT 在有/无等向设计下各阶段 FLOPs 和参数量占比对比引入等向设计后高分辨率阶段H×W占据了更多的计算资源而非集中在低分辨率阶段H/4×W/4、H/8×W/8。量化结果相比 U 型 DiT264M 参数本文带等向设计的架构在使用 AdaLN 时仅需 100.64M 参数减少 62%FLOPs 从 122.87G 降至 93.11G减少 24%而性能反而提升RealSR CLIPIQA 0.688→0.700。【配表】Table 2消融实验结果——不同架构配置与时间步条件模块的性能对比3.2 自适应频率调制AdaFM时间步与频域的桥梁为解决 AdaLN 无法感知频率的问题论文提出Adaptive Frequency ModulationAdaFM模块将时间步条件注入从空间域切换到频率域。具体流程如下将空间域特征图切分为的窗口实验中 p8对每个窗口做快速傅里叶变换FFT得到频谱将一维时间步向量映射为维向量并重塑为的频率缩放矩阵将与频谱逐元素相乘实现对不同频率成分的自适应加权做逆 FFTiFFT恢复至空间域。关键优势在频谱中每个像素位置对应确定的频率成分这由特征图的空间维度唯一决定与内容无关。因此同一个可以跨所有窗口和通道共享极大提升了效率。参数量对比AdaLN 需要个映射参数而 AdaFM 仅需参数量仅为 AdaLN 的一个零头。【配图】Figure 5DiT-SR 中 Transformer 块与 AdaFM 模块的结构示意图左侧为整体 Transformer 块右侧为 AdaFM 的详细流程空间域→FFT→频率加权→iFFT→输出。可视化验证论文通过可视化特征图及其频谱证明了 AdaFM 的有效性——在去噪早期tTAdaFM 增强低频成分在去噪后期t1AdaFM 增强高频成分与扩散模型的频率演化规律高度一致。【配图】Figure 6AdaFM 作用前后特征图及其频谱的可视化tT、tT/2、t1可以清楚看到AdaFM 在早期去噪阶段使频谱外围高频区域变暗增强低频在后期使频谱外围变亮增强高频。量化结果将 AdaLN 替换为 AdaFM 后参数量从 100.64M 进一步降至 60.79M减少 77% vs. U 型 DiTRealSR CLIPIQA 从 0.700 提升至 0.716同时 FLOPs 几乎不变93.03G。3.3 完整 Transformer 块设计每个 Transformer 块由以下组件构成多头自注意力MHSA由于高分辨率输入下全局注意力计算代价过高采用局部窗口注意力窗口位移替代逐点前馈网络MLP由两个全连接层 GELU 激活组成作为通道混合器组归一化Group Norm分别在 MHSA 和 MLP 前各加一层AdaFM跟在每个归一化层之后注入时间步信息。LR 图像与带噪图像在通道维度拼接后连同时间步一起作为去噪器的输入预测干净图像。整体训练范式遵循ResShift的残差位移扩散过程有效缩短马尔可夫链长度仅需 15 步去噪。四、实验结果4.1 数据集与实现细节训练集LSDIR82991 张 DIV2K DIV8K OutdoorSceneTraining Flicker2K FFHQ 前 10K 张人脸图像HR 图随机裁剪为 256×256使用 RealESRGAN 的降质流程合成 LR/HR 对。测试集合成数据集 LSDIR-Test2000 张512×512 中心裁剪同样降质真实数据集 RealSR100 张Canon 5D3 / Nikon D810 实拍和 RealSet6565 张。训练配置在潜在空间VQGAN 下采样因子 4运行Adam 优化器学习率 5×10⁻⁵batch size 64300K 次迭代8 块 NVIDIA Tesla V100。4.2 真实场景数据集上的定量对比在 RealSR 和 RealSet65 两个真实场景数据集上本文方法Ours-15仅61M 参数15 步去噪全面超越所有从零训练的扩散方法LDM-100114M 参数ResShift-15119M 参数在 RealSR 上CLIPIQA0.7161超越先验方法 DiffBIR-500.7142和 SeeSR-500.6819仅用约5%的参数量vs. DiffBIR 的 1670MMANIQA 指标0.5022仅略低于 SeeSR-500.5035。【配表】Table 1真实场景数据集RealSR、RealSet65上的性能与去噪器复杂度对比包含 GAN 方法、先验方法、从零训练扩散方法三大类共 9 种对比方法4.3 合成数据集上的定量对比在合成数据集 LSDIR-Test 上参考指标PSNR、LPIPS和无参考指标CLIPIQA、MUSIQ、MANIQA均表明本文方法Ours-15在 LPIPS0.244上优于所有方法MUSIQ69.32超越 LDM-10066.84和 ResShift-1567.74并优于大多数先验方法StableSR-20068.91DiffBIR-5070.05PASD-2069.07。【配表】Table 3合成数据集LSDIR-Test上的性能对比4.4 定性对比论文展示了在真实场景和合成场景数据集上的视觉对比。本文方法在细节纹理恢复如砖墙纹理、动物毛发上视觉效果优秀与先验方法相当明显优于其他从零训练方法。【配图】Figure 7不同方法在真实场景上和合成场景下数据集上的定性对比图上真实场景数据集LR/RealESRGAN/SwinIR/LDM-100/ResShift-15/Ours-15 及 BSRGAN/StableSR-200/DiffBIR-50/PASD-20/SeeSR-50下合成数据集含 HR 参考。五、消融实验深度分析【配表】Table 2消融实验建议结合阅读这个消融实验揭示了几个关键结论U 型 vs. 等向同构相同 FLOPs 下U 型 DiTCLIPIQA 0.688优于纯等向同构0.655但代价是参数量增大 6 倍以上264M vs. 42M。等向设计的价值在 U 型 DiT 中引入等向同构设计后Ours AdaLN参数量从 264M 大幅降至 100.64M减少 62%FLOPs 减少 24%性能反而进一步提升至 0.700。AdaFM 的双重红利将 AdaLN 替换为 AdaFM参数量再降 40%100.64M→60.79M同时 CLIPIQA 继续提升至 0.716充分说明频率域的时间步条件注入既节省参数又提升性能。六、总结与展望核心贡献回顾本文提出的DiT-SR做出了三个核心贡献架构创新首次将 U 型全局架构与等向同构块设计无缝结合将计算资源重新分配到关键的高分辨率层以远少于传统 U-Net 的参数量大幅提升 Transformer 在多尺度框架下的能力条件机制创新提出 AdaFM 模块在频率域进行时间步条件注入以极少的参数开销让模型具备频率感知能力弥补了 AdaLN 在 SR 任务上的核心局限性能突破以61M 参数从零训练在真实场景 SR 任务上超越了所有从零训练的扩散方法并与参数量是其27 倍的先验方法持平甚至超越为轻量化、可灵活修改的 SR 架构树立了新标杆。局限性作者也坦诚指出尽管 DiT-SR 以极少参数实现了与先验方法相竞争的性能但在语义结构恢复方面仍与先验方法有差距——因为缺乏 Stable Diffusion 那样通过海量数据积累的强语义先验。此外和其他内容生成方法一样需注意防范潜在的滥用风险。未来方向AdaFM 有望成为扩散模型通用的时间步条件注入新范式不仅适用于图像超分辨率等低层视觉任务也适用于文生图等遵循先低频后高频生成规律的任务。