CVPR 2026 | Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework
2026/8/30 7:28:01 网站建设 项目流程

上图为ChatGPT生成,用于辅助理解,但它也可能会犯错,请核对重要信息。


1 论文信息

英文题目:Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

中文标题:退化鲁棒融合:面向任意退化场景下多模态图像融合的高效退化感知扩散框架

作者:Yu Shi¹, Yu Liu¹*, Zhong-Cheng Wu¹, Juan Cheng¹, Huafeng Li², Xun Chen³

单位:

¹Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学 生物医学工程系)

²Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学 信息工程与自动化学院)

³School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学 信息科学技术学院)

代码:https://github.com/YShi-cool/DRFusion

下载:https://arxiv.org/abs/2604.08922


2 论文摘要

噪声、模糊、低分辨率等复杂退化是真实世界图像融合任务中的常见挑战,严重限制了现有方法的性能与实用性。基于端到端神经网络的方法设计简单、推理高效,但黑盒特性导致可解释性受限;基于扩散模型的方法虽然凭借强大的生成先验和结构化推理过程在一定程度上缓解了这一问题,但它们通常被训练用于学习单域目标分布,而图像融合本身缺乏天然的"融合标签数据",且依赖于对多源互补信息的建模,这使得扩散模型难以直接应用于融合任务。

为此,本文提出了一种面向任意退化场景下图像融合的高效退化感知扩散框架。具体而言,本方法摒弃了传统扩散模型显式预测噪声的范式,转而通过直接回归融合图像实现隐式去噪,从而能够以有限的扩散步数灵活适应各种复杂退化下的融合任务。此外,作者还设计了一种联合观测模型修正机制,在采样过程中同时施加退化约束与融合约束,确保高质量的重建精度。在多种融合任务和退化配置上的实验验证了所提方法在复杂退化场景下的优越性。

创新总结

① 高效退化感知扩散框架(对应 3.1 节)

将退化建模与多模态图像融合统一在单一扩散过程中。不再显式预测噪声,而是直接回归融合图像,使扩散模型在架构上更接近端到端网络,既能以自监督方式应对融合标签缺失问题,又能在少量扩散步数内取得有竞争力的结果。

② 联合观测修正机制(对应 3.2 节)

将退化约束与融合约束同时注入 DDIM 采样过程,强制中间样本既符合退化模型,又保留跨模态互补信息。通过构造联合退化矩阵及其隐式伪逆求解方式,巧妙避免了显式计算大规模伪逆带来的高计算开销。

③ 灵活适配复杂退化与多种融合任务(对应 3.3 节)

框架支持噪声、模糊、低分辨率以及它们的复合退化形式,并可针对红外可见光融合、医学图像融合等不同任务采用相应的损失函数(如最大值损失、SSIM 损失等),打破了传统扩散融合方法中"单一噪声预测目标"的刚性束缚。


3 方法

整个方法围绕"让扩散模型既能处理融合,又能感知退化"这一目标展开,主要包含三个组件:

(1)面向融合的扩散框架

摒弃标准扩散模型中的显式噪声预测步骤,仅保留逆向过程,通过有限次扩散迭代直接将退化输入映射到融合输出。每一步采用基于 DDIM 的加速采样:先估计去噪结果 ,然后再生成下一时刻样本 。具体迭代形式如下:

这一设计使扩散模型架构上更接近端到端网络,可以自监督训练,无需融合标签

(2)联合观测修正机制

作者将两个源图像的退化约束与融合约束统一写成联合矩阵形式:

整理为联合观测模型

进而得到联合退化矩阵 的隐式伪逆

将其嵌入 DDIM 采样过程,得到最终的扩散迭代:

值得一提的是,融合权重 、 并非固定值,而是通过多任务 U-Net 在预测噪声的同时数据驱动地学习得到(满足 )。

(3)任务自适应损失

总损失由源图像重建损失 与融合损失两部分组成:

其中重建损失为:

针对红外可见光融合,采用最大值梯度损失:

针对医学图像融合,采用 L1 + SSIM 联合损失:

对于含噪场景,仅需在修正项前乘以一个尺度系数 :

对于多种退化复合(),其伪逆按以下顺序组合,框架可统一处理:

(具体公式见原文)


4 实验

实验设置

PyTorch 实现,Adam 优化器,batch size = 8,训练 100 epoch,初始学习率 0.0001,硬件采用双 NVIDIA RTX 4090 GPU。数据集包括红外可见光融合数据集 M3FD与哈佛医学图像融合数据集中的 PET-MRI 配对图像。考察三种退化场景:噪声、模糊、复合退化(噪声+模糊+低分辨率)。对比方法涵盖 IFCNN、U2Fusion、MURF、DDFM、Text-DiFuse、VDMUFusion、RFfusion、Mask-DiFuser 等 8 种代表性方法。评价指标采用六个常用客观指标:Q_MI、Q_NCIE、Q_AB/F、Q_P、Q_CB、Q_W。

① 定性实验

在 M3FD 与 Harvard 数据集上进行可视化对比。对比方法采用"先复原后融合"的级联流程,往往残留模糊伪影或细节丢失;本文方法直接从退化输入端到端重建融合结果,在颜色保真度、纹理细节、热辐射信息保留等方面均明显优于竞争方法。例如:避免了 Mask-DiFuser 在树木区域的色彩失真,文字与车辆等局部细节也更清晰。

② 定量实验

M3FD 数据集:本文方法在三种退化场景的大多数指标上取得最佳或次佳,尤其在 Blur 与 Composite degradation 场景下,Q_MI、Q_NCIE、Q_AB/F、Q_P、Q_W 显著领先;

Harvard 数据集:在三种退化条件下 Q_AB/F、Q_P、Q_W 均取得最高分,复合退化下提升尤为明显;

效率与参数量:相比 DDFM、VDMUFusion 等扩散方法,本方法运行时间显著更低、接近神经网络速度,参数量也保持合理水平;

下游任务(补充材料 E):在 M3FD 目标检测实验中,本方法取得 Precision 0.9750、Recall 0.8005、mAP@0.5 0.9108,较最强基线 IFCNN 提升约 2 个百分点。

③ 消融实验

作者重点验证了联合约束修正机制的有效性。结果表明:去除该机制后,融合图像噪声残留明显增多,结构细节模糊,边缘伪影增加;尤其在复合退化场景下,性能下降最为显著。在 Q_MI、Q_NCIE、Q_AB/F、Q_P、Q_W 等指标上,加入联合约束的版本几乎全面优于无约束版本。此外,作者还分析了迭代步数 T的影响:T 从 1 增至 3 时性能稳步提升,T = 3 时达到最优;继续增大 T 反而带来轻微性能下降并显著增加推理时间,因此默认设置 T = 3。


5 总结

本文针对真实场景中图像融合任务普遍面临的"复杂退化"难题,提出了一种退化感知的扩散融合框架 DRFusion。其关键贡献在于:

范式革新

摒弃标准扩散模型中显式噪声预测的束缚,转而直接回归融合图像,使扩散模型可以像端到端网络一样灵活处理无融合标签的多输入任务,并在少量步数内完成高质量重建。

机制创新

设计联合观测修正机制,通过构造联合退化矩阵与隐式伪逆求解,将退化约束与融合约束统一注入采样过程,显著提升复杂退化下的重建精度。

效果显著

在红外可见光与医学 PET-MRI 两类典型融合任务、三种退化场景下均取得优于现有方法的定性与定量表现,运行效率上接近神经网络方法,并在下游目标检测任务中验证了其实用价值。

这项工作为"扩散模型 + 图像融合"的研究方向提供了一种更高效、更通用、更可解释的新视角,对于真实场景下多模态成像系统具有重要的应用潜力。


需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询