江南大学 ICML 2026
训练用文本、推理不用文本:TEDFusion 进入双曲空间
用一句话来概括并引出全文
TEDFusion在训练阶段借助文本学习场景相关的融合策略,并通过双曲空间建模图像与语义的层次关系,推理时仅需输入红外与可见光图像。
01 论文信息
Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space | 文本驱动的红外与可见光图像融合:在双曲空间中实现场景自适应
作者:Huan Kang, Hui Li, Tianyang Xu, Tao Zhou, Xiao-Jun Wu(通讯作者), Josef Kittler
单位:江南大学人工智能与计算机学院;英国萨里大学视觉、语音与信号处理中心
代码:
https://github.com/Shaoyun2023/TEDFusion
下载:
https://arxiv.org/abs/2606.15104v1
02 摘要
传统的红外和可见光融合一般是在欧氏空间里进行跨模态特征处理,很难很好地表示出从场景语义到局部纹理之间的层级关系。已经有的文本引导的方法还需要在推理过程中不断地给出文本信息,从而提高了实际使用的成本。
作者提出了TEDFusion,在训练过程中用BLIP来生成图像描述,并且利用文本语义去控制亮度、饱和度、对比度以及纹理等属性的融合;并且把图像和文本特征都映射到了双曲空间中做层级对齐。推理阶段不需要文本信息,模型可以根据输入的图片自己调节融合方式。
03 创新点
文本监督和无文本推理:在训练过程中使用文本,在推理阶段只提供红外和可见光图像作为输入,从而降低了对文本驱动融合的需求。
属性- 文本门控融合模块(ATGFM),把亮度、饱和度、纹理复杂度和对比度等属性以及文本语义一起进行建模。
双曲语义对齐:Text-Image Association Module(TIAM) 在庞加莱球上建立了图文之间的层级关系,在一定程度上解决了欧式空间里出现的语义平面化的问题。
04 方法
TEDFusion 输入已经对齐好的红外和可见光图像,视觉编码器先提取出多尺度特征。在训练过程中,BLIP会生成两种不同类型的图像描述。
ATGFM提取出饱和度、亮度、纹理复杂度以及对比度等信息之后,利用门控权重把属性和文本特征进行融合。在训练过程中用到30%的概率来随机地丢掉文本嵌入,从而使模型慢慢学会只靠视觉属性来进行语义引导。
然后把图像与文本特征映射到庞加莱球上,并用文本做为语义锚点,利用莫比乌斯平移来组织四种尺度上的视觉特征。经过加强之后的特征被重新映射到欧式空间中,并且通过嵌套式的解码器产生出融合后的图像。
训练损失包括强度损失、梯度损失、SSIM损失以及双曲损失等部分,其中各个部分分别对应于显著性信息、纹理边沿、结构一致性与跨模态语义对齐等方面的要求。
05 实验
实验设置
用TNO、RoadScene、MSRS和LLVIP四个数据集进行融合实验,并且和DenseFuse、U2Fusion、TextFusion、Text-IF、GIFNet等十一种方法做对比,在EN、SD、SF、AG以及SCD上得到的结果。
实验结果
在四个数据集的20个指标里,TEDFusion获得了13个第一和5个第二。在M3FD目标检测上,它的YOLOv7评估结果为57.37%,mAP@0.5;在MSRS语义分割上,它的DeepLabV3+评估结果为69.64%,mIoU。
消融实验
去掉文本监督、ATGFM、双曲关联或者双曲损失之后,各项指标都变差了。从曲率实验的结果来看,在(c=1.0)的情况下比在(c=0.5)和(c=0.7)的时候要好一些,所以可以得出结论说双曲线空间中的分层结构对于融合结果是有好处的。
06 总结
TEDFusion采用的是“文本训练+视觉推理”的模式来学习场景自适应融合策略,并且没有增加推理输入的情况下完成了这个过程;并且用到了双曲线空间去表示图像和文本之间存在的层级关系。实验证明了这种方法在各种不同的数据集中以及目标检测、语义分割等任务上都具有很好的稳定性。
文本部分教给模型如何理解上下文,而双曲空间则用来存储语义层级。