ECCV 2026
图像融合
IMAGE、VIDEO、FUSION
12 篇融合主线 + 5 篇红外延伸|图像 · 视频 · 红外感知
核心信息
这次整理以ECCV 2026接受的论文作为官方锚点,再用ImageFusion、Infrared/Visible、Multi-Exposure、Multi-Focus、Hyperspectral等技术进行融合。Panchromatic、Pansharpening、Video Fusion 等词做并集检索,并且人工剔除了只存在于检测/3D/多模态大模型中的feature fusion。目前主要清单共有12 篇有关红外延伸的论文以及 5 篇相关的红外延伸论文。
1
趣味问答 QA
快速问答
Q1 12 篇融合主线最明显的一个共同趋势是什么?
融合已经由原来的“把两张图拼得更清楚””转变为四个更加实际的问题:输入是否开放、场景是否退化或者运动、模型能否在不同传感器之间进行泛化、以及能否实时部署。
Q2、哪些工作应该先精读?
做 IVIF 看 P²Fusion/AMG-Fuse;做视频融合的话可以使用MAVFusion;使用Mef的时候可以参考FreeMEF、ExpoMotion、LIIFusion等;部署的时候用UHD-MFF;做遥感开放泛化用G-ZAP。如果更加重视“真实的场景”,那么可以优先阅读AMG-Fuse、ExpoMotion以及两篇视频融合的内容。
2
先按主题看一遍
主题地图
红外-可见光:由静态的质量向真实的退化和视频时序
P²Fusion 使用两个先验 Prompt 来调节模态的竞争;AMG-Fuse 把恢复和融合结合起来;两篇视频工作的主要部分是运动稀疏交互和一步扩散。
P²Fusion·AMG-Fuse·MAVFusion·One-stepDiffusionVideoFusion
多曝光:开启帧数、动态Benchmark以及生成式效率一起进行
FreeMEF把输入帧数开放化;ExpoMotion 会补充掉动态去鬼影基准;LIIFusion 使用扩散+INR来降低高分辨率生成的成本;DOME-HDR 将SDR和HDR连接起来。
FreeMEF·ExpoMotion·LIIFusion·DOME-HDR
多焦:4K和移动设备成为新的限制
UHD-MFF 用可以学习的LUT来处理UHD多焦融合,把高分辨率推理从重网络变成查表和细节补救。
UHD-MFF
遥感:由固定的传感器转向零样本、跨域监督以及跨模态动态
G-ZAP 会追求任意尺度以及跨传感器复用;ViPS 通过自然视频来提供空间监督;LGD-Net 重点在于高光谱-全色融合。
G-ZAP、ViPS、LGD-Net
3
12 篇论文的引用
PAPER INDEX
01P²Fusion红外-可见光/双先验Prompt
02AMG-Fuse恶劣天气/恢复-融合联合建模
03MAVFusion红外-可见光视频、稀疏运动交互
04One-step Diffusion Video Fusion红外-可见光视频/One-stepDiffusion
05FreeMEF多曝光/任意帧数
06ExpoMotion / HOP动态多曝光/Benchmark+去鬼影
07LIIFusion生成式MEF/INR
08DOME-HDRMEF/HDR双输出
09UHD-MFF / UMF-LUT多焦/ UHD 4K 部署
10G-ZAP遥感/零样本任意尺度Pansharpening
11ViPS遥感/视频跨域监督
12LGD-Net高光谱/ Panchromatic 融合
4
论文逐篇速览
PAPER CARDS
01| 红外-可见光/双先验Prompt
P²Fusion
题目:P²Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior DistillationP²Fusion:用双内在先验 Prompt 重新组织红外显著性与可见光空间质量
作者:Yi Shi1(共同一作)· Huichao Xie1(共同一作)· Yuqing Wang1· Mingyu Wang1· Kaihui Yang1· Yu Liu2· Ruitao Lu3· Lizhe Li1· Junwei Han1,4(共同通信作者)· Dingwen Zhang1(共同通信作者)
单位:1西北工业大学(Northwestern Polytechnical University);2合肥工业大学(Hefei University of Technology);3火箭军工程大学(Rocket Force University of Engineering);4重庆邮电大学(Chongqing University of Posts and Telecommunications)
IVIFDual Intrinsic PromptsPrior DistillationDynamic Experts
论文:https://arxiv.org/abs/2608.13045
代码:https://github.com/YiShi99/P2Fusion
摘要精读:本文的工作出发点并不是再叠加一层更加厚重的跨模态注意力,而是首先发问:红外和可见光各自最可靠的第一手资料是什么。作者把红外侧的热显著性和可见光侧的空间质量提取为两类内在Prompt,并且通过Teach-to-Fuse逐级蒸馏到融合主干。并且采用门控动态专家重校准不同模态贡献。这样就使得“谁更亮、谁响应更强”的情况不再直接等同于“谁更可信”,融合决策更加贴近场景本身热目标和纹理质量的要求。
一句话看点:把“模态先验”从损失函数中固定的规则,升级为可以参与到特征的竞争和合作当中去的可学习Prompt。
02 恶劣天气/恢复-融合联合建模
AMG-Fuse
题目:Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and InteractionAMG-Fuse:雨雾雪下,先判断哪里坏了,再决定跨模态怎么交互
作者:Xilai Li1(一作)· Xiaosong Li1(通信作者)· Haishu Tan1· Tao Ye2· Huafeng Li3· Hongbin Wang3
单位:1佛山大学(Foshan University);2中国矿业大学(北京)(China University of Mining and Technology, Beijing);3昆明理工大学(Kunming University of Science and Technology)
恶劣天气Restoration+FusionMask GuidanceCross-modal Attention
论文:https://arxiv.org/abs/2606.26812
代码:https://github.com/ixilai/AMG-Fuse
摘要精读:真实的场景中输入的内容并不是所有的红外线和所有的可见光都是干净的。雨、雾、雪会使得不同的地区和不同的形式都遭受着不均等的破坏。因此AMG-Fuse把恢复和融合放在一起同一个闭环中:首先用伪真值学习退化恢复,然后从融合结果和源图的关系估计区域mask。使跨模态交互更多的关注于“目前更为可信”的信息上。它的价值不只在于抗退化,还把“退化程度”显式地变成融合权重中的一份子。
一句话看点:真正面对恶劣天气的融合,问题不在于“怎么加”,而是在于“这一块到底应该相信谁”。
03 红外-可见光视频/稀疏运动交互
MAVFusion
题目:MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse InteractionMAVFusion:不是每个像素都值得做重型注意力,让算力追着运动区域走
作者:Xilai Li1(共同一作)· Weijun Jiang1(共同一作)· Xiaosong Li1(通信作者)· Yang Liu1· Hongbin Wang2· Tao Ye3· Huafeng Li2· Haishu Tan1
单位:1佛山大学(Foshan University);2昆明理工大学(Kunming University of Science and Technology);3中国矿业大学(北京)(China University of Mining and Technology, Beijing)
VideoFusionMotion-Aware稀疏交互实时
论文:https://arxiv.org/abs/2604.01958
代码:https://github.com/ixilai/MAVFusion
摘要精读:视频融合的难点不光是时间顺序一致,还在于“每一张图片都要和整个场景进行跨模态交互的成本很高”。MAVFusion 使用运动信息来先对动态区域和相对静止的背景进行区分:对于动态区域使用更强的跨模态注意机制,而对于静态区域则采用轻量级交互方式,这样就可以把计算预算集中到有可能发生结构变化的地方上。错位或者信息冲突的地方。论文报告在640×480输入的情况下可以达到14.16FPS,体现出了它对于实时视频融合的工程取向。
一句话看点:把“运动”从时序特征中分离出来,并且把它当作一个算力分配器来使用,这样就可以实现动态处精算和静态处省算。
04| 红外-可见光视频 / 一 步 分 泪
One-step Diffusion Video Fusion
题目:Degradation-Robust and Temporally Consistent Infrared–Visible Video Fusion via One-step Diffusion Framework一步扩散同时瞄准退化鲁棒与时序一致:视频融合工作
作者:Songcheng Du1(一作)· HaoYuan Xu2· Xingyuan Li3· Yang Zou1· Jinyuan Liu2· Yunpeng Bai1· Ying Li1
单位:1西北工业大学(Northwestern Polytechnical University);2大连理工大学(Dalian University of Technology);3浙江大学(Zhejiang University)
VideoFusionDegradation RobustnessTemporal Consistencydifussion
论文:暂无
代码:暂无
05 多曝光/任意帧数
FreeMEF
题目:There and Back Again: A Flexible-Frame Transformer for Multi-Exposure FusionFreeMEF:多曝光融合终于不再把输入帧数写死
作者:Lishen Qu1,3,5(一作)· Yao Liu1,3,5· Shihao Zhou1,3· Jie Liang5· Hui Zeng5· Lei Zhang4,5· Jufeng Yang1,2,3(通信作者)
单位:1南开国际先进研究院(深圳·福田)(Nankai International Advanced Research Institute, Shenzhen·Futian);2鹏城实验室(Peng Cheng Laboratory);3南开大学计算机学院(College of Computer Science, Nankai University);4香港理工大学(The Hong Kong Polytechnic University);5OPPO Research Institute(OPPO 研究院)
MEFFlexible FrameRSSMGFGB
论文:https://arxiv.org/abs/2606.27905
代码:https://github.com/qulishen/FreeMEF
摘要精读:在实际拍摄中,由于场景动态范围不一样、曝光帧数也不固定,所以会出现这样的情况。但是很多MEF网络会把2/3/5帧写入到结构中去。FreeMEF的核心就是使用recurrent state-space module来逐帧更新融合状态,使得网络能够接受到各种长度的曝光序列。然后用GFGB在全局引导下恢复细节。它所谈论的并不是“增加一层注意力会不会提高分数”,而是输入接口本身是否可以从固定的帧数变为开放的帧数。
一句话看点:训练好一个模型之后,在进行推理的时候遇到不同的曝光量也不用重新修改网络。
06| 动态多曝光/Benchmark+去鬼影
ExpoMotion / HOP
题目:ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure FusionExpoMotion:1,738 组动态曝光序列,把 MEF 的“鬼影问题”真正做成大规模 Benchmark
作者:Yao Liu1,3,5(共同一作)· Lishen Qu1,3,5(共同一作)· Shihao Zhou3· Jie Liang5· Hui Zeng5· Yabin Peng3· Huipeng Lin3· Lei Zhang4· Jufeng Yang1,2,3(通信作者)
单位:1南开国际先进研究院(深圳·福田)(Nankai International Advanced Research Institute, Shenzhen·Futian);2鹏城实验室(Peng Cheng Laboratory);3南开大学计算机学院(College of Computer Science, Nankai University);4香港理工大学(The Hong Kong Polytechnic University);5OPPO Research Institute(OPPO 研究院)
Dynamic MEFExpoMotionHouseholder投影Deghosting
论文:https://arxiv.org/abs/2607.03110
代码:https://github.com/Leo-LiuYao/ExpoMotion
摘要精读:动态 MEF 长期以来缺乏足够的规模和 GT 的可靠性数据。ExpoMotion收集了1738个曝光序列、10909张图片,涵盖了3/5/7帧以及各种真实的和受控的运动。方法侧提出 HOP,把问题拆分成曝光、预对齐和鬼影过滤:GPIA 先消化巨大的亮度差异,HOA 再用 Householder 几何反射把错位产生的冲突方向视作需要被剔除的正交扰动。数据集和模型两条贡献线都比较明显。
一句话看点:MEF 不再只是在静态基准测试中比较“亮不亮”,而是开始对复杂的运动下去鬼影的能力进行正面评测。
07 生成式 MEF/INR
LIIFusion
题目:LIIFusion: Coarse-to-fine Framework for Generative MEF via Implicit Neural RepresentationLIIFusion:扩散模型不必一直在高分辨率上跑,用 INR 把生成式 MEF 拆成粗到细
作者:Sangmin Han1,2(一作)· Jinho Kim1· Jinwoo Kim1· Dongyoung Kim1· Seon Joo Kim1
单位:1延世大学(Yonsei University);2LG Electronics CTO Division, AI Lab(LG 电子 CTO Division AI Lab)
Generative MEF扩散INRCoarse-to-fine
论文:https://arxiv.org/abs/2607.17611
代码:https://github.com/sangmin213/LIIFusion
摘要精读:生成式MIF可以填补饱和区,但是高分辨率扩散推理非常昂贵。LIIFusion 将整个过程分成 coarse 和 fine 两个部分:低分辨率阶段首先用生成模型来补充全局曝光以及缺失的信息,然后再把粗的结果和局部高分辨率特征交给隐式神经表示。根据目标坐标来查找最后的像素。这样可以保持生成式的先验信息,并且不会在完整的UHD网格上不断扩散。论文报告相比现有的生成式方案提高了大约3.5倍的速度。
一句话看点:把扩散的任务交给它来完成,“补什么”由扩散来做决定;把INR的任务交给它来完成,“补到多细”由INR来做决定。
08 MEF/HDR双输出
DOME-HDR
题目:Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone MappingDOME-HDR:先得到好看的 SDR,再用 Gain Map 把动态范围抬回 HDR
作者:Jinho Kim1(一作)· Jinwoo Kim1· Seon Joo Kim1
单位:1延世大学(Yonsei University)
MEFHDRSDR FusionGain Map
论文:https://arxiv.org/abs/2608.05626
代码:暂未检索到公开代码仓库
摘要精读:把多曝光HDR重建拆分成“SDR融合+逆色调映射”。前半部分使用了 LoRA 适配的 latent diffusion、双 cross-attention 从 bracketed LDR 中生成视觉自然的 SDR;后半部分是预测空间的变化gain map,把SDR映射到HDR。结果并不是只输出一个技术上正确的HDR,而是一条管线同时给出可以直接观看的SDR、gain map和HDR。
一句话看点:把“看起来很好”与“动态范围足够大”的两个阶段分开来处理,并且用gain map把这些阶段连接起来。
09、多焦/ UHD 4K 部署
UHD-MFF / UMF-LUT
题目:UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup TablesUHD-MFF:多焦融合走向 4K,用可学习 LUT 换掉重型高分辨率网络
作者:Yibing Zhang1(共同一作)· Xunpeng Yi1(共同一作)· Qinglong Yan1· Yeda Wang1· Han Xu2· Jiayi Ma1,3(通信作者)
单位:1武汉大学电子信息学院(Electronic Information School, Wuhan University);2东南大学自动化学院(School of Automation, Southeast University);3武汉大学机器人学院(School of Robotics, Wuhan University)
Multi-Focus4K UHDLearnable LUTMobile Deployment
论文:https://arxiv.org/abs/2606.31242
代码:https://github.com/zyb5/UHD-MFF
摘要精读:当多焦融合到4K之后,传统的深网就会出现显存、延迟以及边缘细节被放大等问题。UHD-MFF一边建立UHD多焦数据集,一边把融合过程压缩到可以学习查找表:C-LUT负责低分辨率区域决策,D-LUT借助拉普拉斯高频线索补回精细边界。论文中提到的是实时4K和移动设备的能力,其实质就是对“融合算法是否可以脱离GPU工作站而运行”的问题进行解答。
一句话看点:并不是把网络缩小一些,而是把高分辨率决策本身换成了LUT查询。
10、遥感/零样本任意尺度Pansharpening
G-ZAP
题目:G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale PansharpeningG-ZAP:零样本 + 任意尺度,Pansharpening 也开始摆脱“一传感器一模型”
作者:Zhiqi Yang1(共同一作)· Shan Yin1(共同一作)· Jingze Liang1· Liang-Jian Deng1(通信作者)
单位:1电子科技大学(University of Electronic Science and Technology of China, UESTC)
Pansharpening零样本Arbitrary ScaleINR
论文:https://arxiv.org/abs/2603.14412
代码:暂未检索到公开代码仓库
摘要精读:传统的zero-shot pansharpening往往需要针对每一张PAN/MS图像进行现场优化,而尺度、传感器一变就得重新来。G-ZAP 使用特征基向量INR来建立任意尺度的连续重建接口,然后经过三层协同训练使得权重能够跨图像对、跨场景、跨传感器复用。它与ICML上“跨光谱带/跨尺度”趋势相一致:遥感融合正由固定的成像配置向更加通用的连续表征转变。
一句话看点:把zero-shot从“每张图现学一次”推进到“学会之后可以跨图复用”。
11、遥感/视频跨域监督
ViPS
题目:Video Can Teach PAN-Sharpening: PSF-Aware Cross-Domain SupervisionVideo Can Teach PAN-Sharpening:没有高分辨率卫星 GT,就从自然视频里学空间细节
作者:Hyun-Ho Kim1(一作)· Munchurl Kim2· Jaehyup Lee3(通信作者)
单位:1韩国航空宇宙研究院(Korea Aerospace Research Institute, KARI);2韩国科学技术院电气工程学院(KAIST School of Electrical Engineering);3庆北国立大学(Kyungpook National University)
Pansharpening跨域监督自然视频PSF-aware
论文:暂无
代码:暂无
12、高光谱/Panchromatic融合
LGD-Net
题目:LGD-Net: Leader-Guided Cross-Modal Dynamics for Hyperspectral and Panchromatic Image FusionLGD-Net:ECCV 2026 的高光谱-全色融合新工作
作者:Raj Kumar1(一作)· Balasubramanian Raman1· Pravendra Singh1
单位:1印度理工学院鲁尔基分校计算机科学与工程系(Department of Computer Science and Engineering, Indian Institute of Technology Roorkee)
HyperspectralPanchromaticCross-modal DynamicsRemote Sensing
论文:暂无
代码:暂未检索到公开代码仓库
5
进一步观察:红外相关的新兴任务
IR EXTENSION
下面 5 篇不包括在12篇图像/视频融合主要清单中。我们将它们看作是“融合生态系统”扩展出来的任务:红外超分负责提高源模态的质量,红外小目标检测代表融合结果最下层的感知之一,而可见光和红外之间的转换可以认为是缺失模态补全和融合之前的一个重要环节。
13、红外超分辨率/3DGS
SupIR-GS
题目:SupIR-GS: Thermal Infrared Super-Resolution Novel View Synthesis with Imaging-Calibrated 3D Gaussian Splatting
作者:Jin Liu1(一作)· Haodong Li · Jiagang Chen1· Dabin Leng · Jiguang Li · Zhao Huang · Xiaoshuai Zhang · Qi Xu · Zhiwen Zheng2· Xingru Huang2
单位:1武汉大学(Wuhan University);2杭州电子科技大学(Hangzhou Dianzi University)
论文:暂无
代码:暂未检索到公开代码仓库
14、红外小目标检测/单点监督
SPIRE
题目:Rethinking IRSTD: Single-Point Supervision Guided Encoder-only Framework is Enough for Infrared Small Target Detection
作者:Rixiang Ni1(一作)· Jun Chen1(通信作者)· Boyang Li1(通信作者)· Yonghao Li1· Wujiao He1· Yuji Wang1· Feiyu Ren1· Haoyang Yuan1· Wei An1
单位:1国防科技大学(National University of Defense Technology, NUDT)
论文:https://arxiv.org/abs/2604.05363
代码:https://github.com/NIRIXIANG/SPIRE-IRSTD
摘要精读:SPIRE 对IRSTD的任务定义进行了重新审视:小目标只占很少一部分像素,在工程上首先要解决的问题是可靠的定位,并不需要重建精细的轮廓。因此作者把 IRSTD 从像素级分割改写为质心概率回归,并用单点监督、概率响应先验和 encoder-only 架构降低标注与计算开销。
为什么值得融合读者的关注:融合的结果一般都要进行检测。SPIRE 提醒我们,下游的任务真正所需要的,并不是“纹理越多越好”,而是在于热目标响应是否稳定、位置是否可以辨认。
15、红外小目标检测/粗到细+蒸馏
ECFNet
题目:Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation
作者:Houzhang Fang1(一作)· Ruixuan Huang1(通信作者)· Qiuhuan Chen1· Xiaolin Wang1· Yi Chang2· Luxin Yan2
单位:1西安电子科技大学(Xidian University);2华中科技大学(Huazhong University of Science and Technology)
论文:https://arxiv.org/abs/2606.21956
代码:暂未检索到公开代码仓库
摘要精读:ECFNet 使用粗到细两个阶段的检测方法:粗阶段首先从高分辨率红外图像中筛选出可能存在目标的上下文区域,并利用去噪辅助训练来加强前景和背景区分开的能力;细阶段只在候选区域上做轻量的目标检测,然后用注意力先验来引导知识蒸馏,从而加强小目标的判断能力。
为什么值得融合读者的关注:它和融合的关系就是把算力集中在真正有用的红外区段上。未来的任务驱动融合还可以把检测置信度、目标区域或者注意力先验反向用于模态选择。
16、可见光→红外/缺失模态补全
D3F-IR
题目:D3F-IR: Dual-Domain Deterministic Flow Matching for Visible-to-Infrared Translation
作者:Peiyi Zeng1(一作)· Diedong Feng1· Zhen Liu1· Zhenming Peng1· Bing Zeng1· Shuaicheng Liu1
单位:1电子科技大学(University of Electronic Science and Technology of China, UESTC)
论文:暂无
代码:https://github.com/WanrenZeng/D3F-IR
17、热红外→可见光/跨光谱生成
MTVDiff
题目:MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation
作者:Zhiyuan Xia1,2(一作)· Haojie Li3· Jingyu Lin3· Yiguo Qiao1,2(通信作者)· Cunjian Chen3
单位:1东南大学计算机科学与工程学院(School of Computer Science and Engineering, Southeast University);2新一代人工智能技术与交叉应用教育部重点实验室(东南大学)(Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education);3蒙纳士大学(Monash University)
论文:https://arxiv.org/abs/2607.19886
代码:暂未检索到公开代码仓库
摘要精读:MTVDiff走的是逆向路线:由热红外图像生成可见光人脸,并且利用深度、文本等各种条件来约束几何、语义属性以及身份的一致性。使用的是多模态条件潜扩散模型,将thermal-depth特征融合、文本语义对齐等结合起来,主要服务于跨光谱人脸识别和可视化。
为什么值得融合读者的关注:D3F-IR和MTVDiff一正一反,正好展示了“跨光谱补模态”双方向的过程。对于开放融合来说,这样的生成模型能够充当传感器缺失或者模态质量很差的时候的信息来源。
6
这届 ECCV 的融合论文在回答什么?
TAKEAWAYS
趋势一:融合接口开始对外开放
FreeMEF 将曝光帧数由固定的数值改为序列状态更新;G-ZAP 将尺度 N 直接写入到连续重建接口中去。两者的任务虽然不一样,但是它们的本质都是为了一个模型可以处理更多的输入配置。
趋势二:真实的现实已经不是“测试集更难”的地方了
AMG-Fuse 把雨、雾、雪退化归类到融合决策中去;ExpoMotion 将动态鬼影做成了大規模的基准测试;视频融合开始的时候就一起讨论了运动、时序和计算预算。也就是说,退化、错位和运动已经由附加扰动变为模型需要显式处理的变量。
第三种趋势是把注意力从性能排行榜转到实际应用和推广上
UHD-MFF 直接针对 4K 和移动设备,而 G-ZAP/ViPS 则是从跨传感器、跨域监督来解决数据和模型的复用问题。在评价一篇融合论文的时候,以后可能会多问一个问题:离开了原来的数据集、输入的数量以及硬件之后,它还能够正常运转吗?
7
边界说明
SCOPE
本文仍然没有把所有的题目中出现“fusion”的ECCV论文都塞进主清单里。12 篇主线只保留图像级/视频级融合和典型遥感融合;红外超分、IRSTD、可见光↔红外转换虽然不属于硬融合,但是与模态增强、下游感知和缺失模态补全密切相关,因此单独列入“红外延伸任务”一栏中,并不是混入融合计数之中。
8
往期推荐
RELATED POSTS