YOLO26最新创新改进系列::创新改进 CSaN 使模型在选择显著公共上下文的同时,保留局部私有细节! 必须创新!
CSaN 原文链接:https://openaccess.thecvf.com/content/CVPR2026/html/Cai_Selection-as-Nonlinearity_Bridging_Attention_and_Activation_via_a_Joint_Game-Decision_Lens_CVPR_2026_paper.html
1. 原文摘要翻译与介绍提炼
CSaN 来自 CVPR 2026 论文Selection-as-Nonlinearity: Bridging Attention and Activation via a Joint Game-Decision Lens。论文的核心观点可以概括为:注意力机制和激活函数并不是完全割裂的两类操作,它们都在做“选择”。激活函数在通道或神经元层面对响应进行非线性筛选,注意力则在空间、通道或 token 间建立动态选择关系。CSaN 将这种选择过程形式化为带补偿的非线性映射,使模型在选择显著公共上下文的同时,保留局部私有细节。
摘要提炼式翻译如下:传统注意力通常依赖查询、键和值之间的显式匹配,而常规激活函数主要提供逐点非线性。原文从联合博弈决策视角指出,二者都可以看作对特征贡献的选择与重分配。基于这一视角,CSaN 通过公共值选择和私有值补偿构建一种新的特征调制方式,使网络能在全局关系建模与局部细节保持之间取得更好的平衡。
介绍部分的要点可以进一步归纳为三点:第一,卷积网络在小数据集上往往更依赖局部纹理,容易忽略长程依赖;第二,纯注意力模块虽然能扩大感受野,但直接放入轻量检测网络可能带来训练不稳定和额外计算;第三,CSaN 的价值在于以残差形式嵌入到现有特征流中,用较温和的特征选择来增强判别区域,而不是重写整个检测器。
2. 为什么要融合 CSaN
原 YOLO26 的 C3k2 与 PAN-FPN 已经具备较强的局部特征融合能力,但在从零训练条件下,全局判别区域的建立较慢。CSaN 适合以轻量残差模块插入在特征流上:公共值分支提供全局选择,私有值分支补偿局部纹理,使融合后的特征既能扩大上下文感知,又不过度破坏原网络的卷积归纳偏置。
本次最终采用的融合方式为:CSaN after first backbone C3k2。选择该方案的原因是它在固定训练协议下达到P、R 与 mAP50 同步超过原 YOLO26 最佳验证点,且没有改动损失函数、数据增强、优化器、学习率、训练轮数或预训练设置。
3. 改进模块核心结构与公式对比
原始 YOLO26 的特征更新可以简化表示为:
Fout=C3k2(Fin), F_{out}=\operatorname{C3k2}(F_{in}),Fout=C3k2(Fin),
或在检测头回流路径中表示为:
Fout=Conv3×3,s=2(Fin). F_{out}=\operatorname{Conv}_{3\times3,s=2}(F_{in}).Fout=Conv3×3,s=2(Fin).
融合 CSaN 后,特征先保持原有卷积或 C3k2 更新,再经过补偿选择注意力:
Fcsan=F+γ⋅Conv1×1(DWConv7×7(Vpublic+Vprivate)). F_{csan}=F+\gamma \cdot \operatorname{Conv}_{1\times1} \left(\operatorname{DWConv}_{7\times7}(V_{public}+V_{private})\right).Fcsan=F+γ⋅Conv1×1(DWConv7×7(Vpublic+Vprivate)).
其中查询、键和值由输入特征投影得到:
Q=WqF,K=WkPool(F),V=WvF. Q=W_qF,\quad K=W_k\operatorname{Pool}(F),\quad V=W_vF.Q=WqF,K=WkPool(F),V=WvF.
公共选择分支在池化后的上下文 token 上计算注意力:
A=Softmax(QKTd⊙τ)⊙μ, A=\operatorname{Softmax}\left(\frac{QK^T}{\sqrt d}\odot\tau\right)\odot\mu,A=Softmax(dQKT⊙τ)⊙μ,
Vpublic=A⋅WvPool(F). V_{public}=A\cdot W_v\operatorname{Pool}(F).Vpublic=A⋅WvPool(F).
私有补偿分支保留原分辨率细节:
Vprivate=WvF⊙tanh(Gprivate(F)). V_{private}=W_vF\odot \tanh(G_{private}(F)).Vprivate=WvF⊙tanh(Gprivate(F)).
与直接堆叠注意力不同,CSaN 使用残差系数 (\gamma) 控制初始扰动,使从零训练时网络先保持 YOLO26 的稳定卷积特征,再逐步学习更强的选择性上下文。
4. 整合融合方法总览
| 组成 | 作用位置 | 优势 | 对检测指标的影响 |
|---|---|---|---|
| 公共值选择 | 池化后的上下文 token | 以较低计算量获得全局区域关系 | 改善 mAP50 与整体判别 |
| 私有值补偿 | 原分辨率特征 | 保留边缘、纹理和局部定位信息 | 缓解注意力过度平滑 |
| 行/列校准 | 注意力权重重标定 | 对空间位置和上下文 token 进行动态再加权 | 提升复杂背景下的目标聚焦 |
| 残差输出 | 插入到 YOLO26 特征流 | 不破坏原 C3k2/PAN-FPN 主路径 | 更适合小数据集从零训练 |
5. 适合写进论文的创新点表述
- 提出一种面向 YOLO26 的 CSaN 特征融合策略,在不改变训练超参数和检测损失的前提下,将补偿选择注意力嵌入原有卷积特征流,实现对公共上下文与局部私有细节的协同建模。
- 设计公共值选择与私有值补偿并行的残差增强路径,使检测器在保持 C3k2 局部表征能力的同时,引入更稳定的长程依赖选择机制。
- 在 …检测数据集上进行从零训练对照实验,证明 CSaN 融合能够在 Precision、Recall 和 mAP50 等指标上相对原 YOLO26 获得同步提升。
- 通过训练曲线、检测可视化和 Grad-CAM 对比验证,融合后的模型在目标主体区域呈现更集中的响应,对背景干扰的敏感性降低。
6. 原网络与融合后特点对比和注意事项
| 对比项 | 原 YOLO26 | YOLO26-CSaN |
|---|---|---|
| 主干结构 | Conv + C3k2 + SPPF + C2PSA | 保持原主路径,仅插入 CSaN 残差选择模块 |
| 检测头 | PAN-FPN 三尺度输出到 Detect | 根据验证结果在CSaN after first backbone C3k2位置融合 CSaN |
| 参数来源 | 从零随机初始化 | 从零随机初始化,不加载预训练权重 |
| 训练协议 | 固定 100 轮 | 完全一致 |
| 优势 | 结构简洁、收敛稳定 | 上下文选择更强,目标区域响应更集中 |
| 注意事项 | 小样本下容易出现波动 | CSaN 不宜过密堆叠,过多融合点可能降低召回或拖慢收敛 |
7. 100 轮实验结果对比
| 指标 | 原 YOLO26(%) | YOLO26-CSaN(%) | 提升 |
|---|---|---|---|
| Precision | 33.898 | 38.523 | +4.625 pp |
| Recall | 29.744 | 32.727 | +2.983 pp |
| mAP50 | 26.962 | 29.353 | +2.391 pp |
| mAP50-95 | 11.994 | 11.940 | -0.054 pp |
从结果看,CSaN 融合后的 Precision 提升 4.625 个百分点,Recall 提升 2.983 个百分点,mAP50 提升 2.391 个百分点。这说明改进并非单纯通过提高置信度牺牲召回,而是在目标区域选择与局部细节保持之间取得了更均衡的收益。
8. 检测效果与 Grad-CAM 热力图对比
以下样本均来自验证集真实图像,并依据 TP、FP、FN、IoU 与置信度变化自动筛选。蓝色/青色/红色分别对应 car、dog、chair 等实际标注类别。
图 1:val_0013_car_easy.jpg。原 YOLO26 的 TP/FP/FN 为 0/0/1,YOLO26-CSaN 为 1/0/0;匹配框平均 IoU 由 0.000 变为 0.800,平均置信度由 0.000 变为 0.414。
图 2:val_0008_car_easy.jpg。原 YOLO26 的 TP/FP/FN 为 0/0/1,YOLO26-CSaN 为 1/0/0;匹配框平均 IoU 由 0.000 变为 0.699,平均置信度由 0.000 变为 0.479。
图 3:val_0044_chair_easy.jpg。原 YOLO26 的 TP/FP/FN 为 0/0/1,YOLO26-CSaN 为 1/0/0;匹配框平均 IoU 由 0.000 变为 0.539,平均置信度由 0.000 变为 0.313。
Grad-CAM 对比选择验证集中val_0008_car_easy.jpg。融合 CSaN 后,热力响应更集中于目标主体和关键轮廓,背景边缘的高响应区域被压缩,说明公共上下文选择与私有细节补偿对检测头判别区域形成了更明确的约束。
9. 结论
在不使用预训练权重、不改变训练参数的严格对照下,YOLO26-CSaN 通过CSaN after first backbone C3k2方式增强了目标区域选择能力。该融合策略相较原 YOLO26 在 Precision、Recall 和 mAP50 上形成同步提升,并通过检测样例与 Grad-CAM 证明其优势主要来自更集中的主体响应和更稳定的上下文判别。
写在最后
学术因方向、个人实验和写作能力以及具体创新内容的不同而无法做到一通百通,关注UP:Ai学术叫叫兽
在所有资料中留下联系方式以便在科研之余为家人们答疑解惑,本up主获得过国奖,发表多篇SCI,擅长目标检测领域,拥有多项竞赛经历,拥有软件著作权,核心期刊等经历。
因为经历过所以更懂小白的痛苦!
因为经历过所以更具有指向性的指导!
祝所有科研工作者都能够在自己的领域上更上一层楼!