YOLO26最新创新改进系列:小波白平衡前置增强,让检测网络先看清再识别,有效创新!
截止目前,YOLO26最新创新改进系列已更新100+种,排列组合后可达到上万种创新模型!极大节省科研时间!!!仍在持续更新中…
畅享持续更新且可大幅度提升文章档次的纯干货工具!
原文链接:WWE-UIE: A Wavelet & White Balance Efficient Network for Underwater Image Enhancement
arXiv: https://arxiv.org/abs/2511.16321
前言:为什么原始 YOLO26 在退化图像上存在天然短板
YOLO26 的核心优势是端到端检测:输入图像经过卷积下采样、C3k2 主干、SPPF/C2PSA 语义聚合以及 PAN-FPN 多尺度融合后,直接由检测头输出目标位置与类别。这个范式在常规自然图像上非常高效,但它默认输入图像已经具备相对稳定的颜色、对比度和边缘结构。
一旦图像存在水下成像常见退化,这个假设就会被破坏:红光快速衰减造成蓝绿偏色,悬浮粒子散射降低局部对比度,连续下采样进一步压缩弱边缘和小目标纹理。原始 YOLO26 并没有显式的颜色校正、频域补偿或边缘保持机制,等价于要求检测损失同时学习“图像复原”和“目标检测”两个任务。对于追求 SCI 创新点的改进工作来说,这正是一个清晰痛点:检测网络并非不能学增强,而是没有必要把所有退化建模压力都压给检测头。
本文将 WWE-UIE 的核心思想融合到 YOLO26 输入端,构建YOLO26-WWE:在原 YOLO26 Backbone 前插入一个轻量的WWEImageEnhance前置增强模块,让图像先完成弱白平衡、频带增强和边缘结构补偿,再进入检测主干。改进只发生在输入前端,不改动原始 YOLO26 的 Backbone、Neck 和 Detect Head。
1. 原文摘要翻译与介绍总结
摘要翻译
水下图像增强旨在恢复可见性,并校正由波长相关吸收和散射造成的颜色失真。近期将领域先验与现代深度神经网络结合的混合方法取得了较强性能,但计算成本较高,限制了其实时应用价值。WWE-UIE 提出了一种紧凑高效的增强网络,并融合了三个可解释先验:第一,自适应白平衡缓解波长相关颜色衰减,尤其是蓝绿色调占优问题;第二,基于小波的增强块进行多频带分解,使网络能够同时捕获全局结构与细粒度纹理;第三,梯度感知模块利用 Sobel 算子和可学习门控显式保持因散射而退化的边缘结构。
大量基准实验表明,WWE-UIE 能够以更少参数量和更低 FLOPs 达到有竞争力的图像复原质量,并支持资源受限平台上的实时推理。消融实验与可视化进一步验证了各组成部分的贡献。
Introduction 翻译总结提炼
原文介绍部分首先指出,水下成像服务于海洋生态、机器人和基础设施检测等任务,但水体吸收与散射会造成强烈颜色偏移、低对比度和结构模糊。传统物理模型依赖透射率、深度或水体参数,泛化性不足;CNN 方法计算友好但感受野受限;Transformer 或扩散类方法能提升全局建模,却难以兼顾实时性。
WWE-UIE 的切入点是“质量与效率的折中”:不用大规模 Transformer 堆叠,而是把白平衡、小波频带分解、Sobel 梯度保持这些可解释先验嵌入轻量卷积网络中。其贡献可以提炼为三点:
- 用自适应白平衡缓解颜色衰减。
- 用 Haar 小波分解增强多频带信息。
- 用 Sobel 梯度门控保持结构边缘,并以较低计算成本服务实时增强。
这与检测任务高度契合:检测网络真正需要的不是过度美化的图像,而是稳定的颜色分布、清晰的局部边界和更少被散射破坏的浅层证据。
2. 为什么要融合:创新切入点
从论文写作的角度来看,这类改进的价值并不在于“又加了一个模块”,而在于精准抓住了原始 YOLO 在输入端存在的固有缺陷。
第一,原 YOLO 缺少成像退化先验。水下图像的偏色与低对比度并非普通噪声,而是由物理吸收和散射引发的系统性退化。若直接将退化图像送入 YOLO,Backbone 的第一层卷积只能被动地学习颜色校正,难以从根本上消除偏色干扰。
第二,浅层特征对检测尤为关键。YOLO 的 P3/P4/P5 检测依赖浅层边缘与纹理的逐级传递。一旦输入端已经丢失局部对比度,后续的 Neck 很难凭空恢复高质量的小目标边界。
第三,增强模块必须检测友好。直接串接一个强增强网络可能引入伪影,反而损害定位精度。因此,本次融合采用弱锚点残差设计:白平衡、小波与 Sobel 先验提供明确的方向引导,低强度残差则确保不破坏原图的真实性。
3. 改进模块核心结构合并
WWEImageEnhance被放置在 YOLO26 的输入端:
Input RGB -> WWEImageEnhance -> YOLO26 Stem -> Backbone -> Neck -> Detect该模块由四个部分组成:
- Gray-World Retinex 白平衡分支:校正通道均值失衡,缓解颜色偏移。
- 弱增强锚点分支:融合轻量锐化、对比度调节、Gamma 映射和白平衡先验。
- Wavelet Enhancement Block, WEB:利用 Haar 小波分解低频结构和高频细节。
- Sobel Gradient Fusion Block, SGFB:通过 Sobel 梯度和可学习门控强化边缘结构。
3.1 白平衡与 Retinex 校正
对输入图像 (I \in \mathbb{R}^{3\times H\times W}),计算每个颜色通道均值:
\mu_c = \frac{1}{HW}\sum_{i=1}^H\sum_{j=1}^W I_c(i,j)整体灰度均值为:
\bar{\mu} = \frac{1}{3}\sum_c \mu_c通道增益为:
g_c = \frac{\bar{\mu}}{\mu_c + \varepsilon}白平衡结果:
I_{wb}^c = I^c \cdot g_c进一步使用 Retinex 风格的 log-domain 归一化:
R = \exp(\log(I_{wb} + \varepsilon) - \operatorname{mean}(\log(I_{wb} + \varepsilon)))这一过程使输入图像的颜色统计更稳定,降低蓝绿偏色对浅层卷积核的干扰。
3.2 Haar 小波多频带增强
Haar 小波将特征划分为四个子带:
\{LL, LH, HL, HH\} = \operatorname{DWT}_{haar}(F)其中:
LL表示低频结构与主体亮度;LH与HL表示水平和垂直方向纹理;HH表示对角细节和局部高频变化。
经过频带拼接和 1×1 融合:
F_{web} = \operatorname{Up}(\phi([LL, LH, HL, HH]))再与原特征残差相加:
F' = F + F_{web}这相当于在 YOLO 下采样前提前保留多频带线索,降低弱纹理被连续 stride 卷积吞掉的风险。
3.3 Sobel 梯度门控
SGFB 先通过 Sobel 算子提取结构梯度:
G = \sqrt{(S_x * F)^2 + (S_y * F)^2 + \varepsilon}再生成空间门控:
M = \sigma(\operatorname{SepConv}(G))最后进行可学习融合:
F_{sgfb} = \alpha\cdot M\odot F + (1-\alpha)\cdot F该设计对检测尤其重要:边缘并非只是图像质量指标,它直接影响目标框回归、目标轮廓定位和小目标可分性。
3.4 检测友好的弱锚点残差
为了避免增强网络过强造成伪影,融合版采用低强度残差:
I_{enh} = \operatorname{clip}(I_{base} + \lambda\cdot \tanh(\Psi(I)))其中 (I_{base}) 是由白平衡、锐化、对比度和 Gamma 组成的弱增强锚点,(\Psi) 是轻量 WWE 分支,(\lambda) 是低强度残差系数。这样做的目的不是生成“看起来更漂亮”的图像,而是为检测主干提供更稳定、更清晰、更少偏色的输入。
4. 整合融合方法总览
融合方法可以概括为一句话:把原本由 YOLO 隐式学习的颜色、频率和边缘补偿,提前转化为一个轻量、可解释、检测友好的前置增强映射。
与直接替换 Backbone 或堆叠注意力不同,WWE 前置增强的优势在于:
- 插入位置清晰:只位于输入端,便于消融实验;
- 原理可解释:每个分支对应一个明确退化来源;
- 不破坏检测头:YOLO 原始多尺度检测路径保持稳定;
- 论文表述自然:从成像退化到检测特征质量,逻辑链完整;
- 部署友好:输出仍是 3 通道图像,不改变后续模型接口。
5. 适合写进论文的创新点表述
可以将本文方法表述为:
中文表述可以写为:
还可以进一步拆成三个创新点:
- 输入端退化建模创新:将水下图像的颜色偏移、频域细节衰减和边缘模糊建模为检测前的显式增强问题。
- 频域-空间联合增强创新:利用 Haar 小波分解补偿多频带信息,并通过 Sobel 门控强化空间边缘。
- 检测友好融合创新:采用弱锚点残差策略,使增强分支服务于检测特征稳定性,而非追求过度视觉增强。
6. 原网络与融合后特点对比
| 对比维度 | 原始 YOLO26 | YOLO26-WWE |
|---|---|---|
| 输入处理 | 原图直接进入 Stem | 先经过 WWE 前置增强 |
| 颜色退化处理 | 无显式建模 | Gray-World Retinex 白平衡 |
| 频域细节 | 卷积隐式学习 | Haar 小波显式多频带补偿 |
| 边缘结构 | 下采样后被动保留 | Sobel 门控提前强化 |
| 检测头 | P3/P4/P5 | 保持 P3/P4/P5 不变 |
| 改动范围 | 原始结构 | 仅新增输入前端 |
| 论文逻辑 | 通用检测网络 | 面向退化成像的检测增强框架 |
7. 代码融合思路
模型结构层面只需要在backbone第 0 层前插入:
-[-1,1,WWEImageEnhance,[3,4,True,0.08,-5.0,0.5,0.12]]后续原 YOLO26 的 Conv、C3k2、SPPF、C2PSA、PAN-FPN 和 Detect Head 保持原设计,仅因为新增第 0 层,特征连接索引整体顺延。
这类改法适合写作时强调“最小侵入式结构改进”:不是把 YOLO 改得面目全非,而是在最容易被忽视的输入端补上退化成像先验,使检测主干能够从更干净、更稳定的视觉证据开始学习。
结语
WWE-UIE 融合 YOLO26 的关键价值,不是简单地把图像增强网络串到检测网络前面,而是把水下退化图像中的颜色、频率和结构问题拆解成三个可解释的轻量先验。对于论文写作而言,这种改进具备完整的逻辑链:原 YOLO 输入端缺少退化建模 → 水下图像存在系统性偏色和散射模糊 → WWE 前置增强显式补偿颜色、频带与边缘 → YOLO 检测路径保持稳定并获得更高质量输入。
写在最后
学术因方向、个人实验和写作能力以及具体创新内容的不同而无法做到一通百通,关注UP:Ai学术叫叫兽
在所有资料中留下联系方式以便在科研之余为家人们答疑解惑,本up主获得过国奖,发表多篇SCI,擅长目标检测领域,拥有多项竞赛经历,拥有软件著作权,核心期刊等经历。
因为经历过所以更懂小白的痛苦!
因为经历过所以更具有指向性的指导!
祝所有科研工作者都能够在自己的领域上更上一层楼!