【CVPR 2025】ImagineFSL 论文解读:想象基集上的自监督预训练,VLM 少样本学习新范式|从少样本学习专家视角
2026/8/17 2:38:43 网站建设 项目流程

摘要

本文解读 CVPR 2025(Highlight)论文《ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning》。该论文提出ImagineFSL,一种基于想象基集(iBase)自监督预训练的 CLIP 少样本学习新范式,通过融合高阶矩表示(HoM-DINO)掩码图像建模(MIM)思维链+上下文学习合成管线(CoT+ICL),先把合成图像当作独立知识仓库进行预训练,再在少样本任务上微调,其特别之处在于把"文生图补充"升级为"独立知识仓库"。实验表明11 个数据集全面刷新 SOTA(少样本平均 79.9%、16-shot 84.4%、LoRA 变体 87.6%),为数据稀缺场景下的视觉语言模型适应提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
    • 少样本学习的数据稀缺困境
    • 为什么"合成图当补充"不是最优解
  • 研究主线:从问题到结论
  • 基准/方法设计
    • 两阶段架构:预训练 + 微调
    • 关键发现:自监督优于监督
  • 分类全景
  • 方法细节
    • HoM-DINO:为少样本定制的自监督目标
    • 可扩展合成管线:CoT + ICL
  • 实验设计与结果
    • 评测协议
    • 合成图方法对比(1/16-shot 平均精度 %)
    • 仅用真实图的 K-shot 对比(平均精度 %)
    • 域泛化、零样本与效率
    • 关键消融(1/16-shot 平均 %)
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • ImagineFSL 与 DISEF、DataDream 有什么区别?
    • 为什么自监督预训练优于监督预训练?
    • HoM-DINO 比 DINO 强在哪里?
    • 合成图像质量对结果影响大吗?
    • ImagineFSL 需要多少额外参数?
    • 本论文有 arXiv 预印本吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning
标题(中文)想象基集上的自监督预训练:VLM 少样本学习
作者Haoyuan Yang, Xiaoou Li, Jiaming Lv, Xianjun Cheng, Qilong Wang, Peihua Li
机构大连理工大学 · 北京邮电大学 · 天津大学
会议CVPR 2025(Highlight)
arXiv无(本论文无 arXiv 预印本)
项目网站https://peihuali.org/ImagineFSL

背景与动机

少样本学习的数据稀缺困境

少样本学习(FSL)旨在从极少量标注样本中识别新概念,一直是计算机视觉的热点。然而,FSL 面临的根本矛盾是标签数据稀缺:标注成本高、长尾类别样本少,CLIP 等视觉语言模型(VLM)虽有零样本能力,但在少样本场景下仍受数据不足制约。

为什么"合成图当补充"不是最优解

近年来文生图(T2I)模型可以生成海量逼真的标注图像,看似为 FSL 提供了数据出路。但现有方法存在系统性局限:

  • DISEF(arXiv:2312.03046):用 LLaVA 描述少样本真实图,再输入 T2I 生成,配合 LoRA 微调;
  • DataDream(ECCV 2024):用真实图微调 T2I 模型,为每个数据集定制生成器;
  • IsSynth(ICLR 2023):用 T5 生成多样化描述。

这三类方法有一个共同问题:只把合成图当作真实图的补充,直接混合进微调阶段。论文作者指出,合成图来自独立基础模型(LLM+T2I),应被当作独立的知识仓库而非附属品——这正是 ImagineFSL 的核心动机。

研究主线:从问题到结论

图 1:ImagineFSL 研究主线:从数据稀缺问题到自监督预训练范式再到全面 SOTA。

基准/方法设计

两阶段架构:预训练 + 微调

ImagineFSL 的核心是两阶段 CLIP 适应

  1. 预训练阶段:在纯合成图像基集(iBase)上,用自监督方法HoM-DINO训练适配器(学生-教师双分支 + EMA,冻结 CLIP 图像编码器);
  2. 微调阶段:保留教师适配器,丢弃头部与学生分支,附加视觉(V)分类器视觉-语言(VL)分类器,损失为 $L_V + L_{VL}$,推理时按融合权重平均 logits。

图 2:HoM-DINO 自监督预训练:SyntAug 构造正对,高阶矩表示 + 掩码图像建模双头,EMA 教师更新。

关键发现:自监督优于监督

论文通过消融证实:相比无预训练,监督预训练(SL)与自监督预训练(Self-SL)都有益,但 Self-SL 显著更好(1-shot/16-shot 平均 +2.3%/+1.1%)。这意味着从合成域到真实域的表示迁移,自监督学习学到的特征更具泛化性。

图 3:少样本微调阶段:视觉与视觉-语言双分类器联合训练,LoRA 进一步微调图像编码器。

分类全景

图 4:CLIP 适应方法谱系:ImagineFSL 开辟"先在合成基集预训练、再微调"的两阶段范式。

方法细节

HoM-DINO:为少样本定制的自监督目标

DINO 只看 [CLS] token,忽略了 patch token。HoM-DINO的关键创新是建模patch 分布的高阶矩

  • 表示 $r = \phi\circ\theta(x) \triangleq [\text{CLS};\ m_1;\ m_2;\ m_3]$(4p 维),其中 $m_1$ 为分布中心,$m_2$、$m_3$ 为归一化的二阶、三阶矩;
  • SyntAug:同一 caption 由 T2I 生成的两张合成图构成正对,语义一致且自然多样,优于手工增强;
  • MIM:随机掩码 patch,学生重建教师预测,强化 patch 级判别;
  • 总损失 $L = L_{\text{HoM}} + L_{\text{MIM}}$,均为 KL 散度自蒸馏,无负样本、无大 batch 依赖。

可扩展合成管线:CoT + ICL

合成数据从哪来?论文设计了系统性管线:

  1. GPT-4 思维链(CoT)分析:识别五个图像描述因子——属性(attribute)、视角(viewpoint)、背景(BG)、光照(LC)、退化原因(CD),设计四种描述模式;
  2. Llama 3 8B 上下文学习(ICL):以 GPT-4 示例为上下文,本地大规模扩写描述(温度 0.5、核采样 0.7);
  3. Stable Diffusion 3 Medium 出图:构建 SyntIN1K(ImageNet-1K 类名,每概念 300 描述 × 4 图)基集。

图 5:合成管线:CoT 提升保真度(FID 40.1→32.6),ICL 保证多样性(1.06→1.21)。

实验设计与结果

评测协议

11 个基准数据集(ImageNet、Caltech、Aircraft、Cars、Food、Pets、Flowers、DTD、EuroSAT、SUN、UCF101)上评测少样本与零样本识别;域泛化用 ImageNet 训练 16-shot,测试 V2/Sketch/A/R 四个目标集。每数据集采样 3 个 All-way-K-shot 任务取平均精度,主模型为 CLIP ViT-B/16。

合成图方法对比(1/16-shot 平均精度 %)

方法类型1-shot16-shot平均
IsSynth补充合成图73.881.777.8
CaFo补充合成图71.581.776.6
DISEF补充+LoRA--85.1--
DataDream微调T2I--87.0--
ImagineFSL两阶段75.884.180.0
ImagineFSL$_{LoRA}$两阶段+LoRA77.387.582.4

共享同一批合成数据时,ImagineFSL 平均超复现基线+2.0%;LoRA 变体 16-shot 达87.5%,全面超过 DISEF(85.1)与 DataDream(87.0)。

仅用真实图的 K-shot 对比(平均精度 %)

方法1-shot2-shot4-shot8-shot16-shot
CoOp67.670.874.076.880.0
PromptSRC72.375.378.480.782.9
CLIP-LoRA72.575.577.480.383.0
GalLoP72.876.479.182.284.5
ImagineFSL76.177.579.482.284.4
ImagineFSL$_{LoRA}$77.679.181.984.287.6

少样本越多优势越大:1-shot 超 CLIP-LoRA+3.6%,16-shot +1.4%;LoRA 变体各 shot 全面领先,平均超第二名 GalLoP+3.1%

域泛化、零样本与效率

  • 域泛化(16-shot):ImagineFSL / LoRA 平均62.7% / 63.2%,刷新 IN-Sketch(53.8%)与 IN-R(80.0%)双 SOTA;
  • 零样本识别:平均72.3% / 73.0%,超 DMN(70.5)1.8%/2.5%,LoRA 在 11 个数据集中 7 个第一;
  • 训练效率:LoRA 变体训练2 倍快(265ms vs DISEF 544ms)、显存减半(11.8G vs 20.6G),参数仅占 5.89%。

关键消融(1/16-shot 平均 %)

设置1-shot16-shot
无预训练(真实图)58.175.6
无预训练(混合合成图)62.276.5
监督预训练(SL)63.176.8
HoM-DINO(Self-SL)65.477.9

Self-SL 方法对比:DINOv2(63.3/77.2)、SynCLR(64.4/77.4)、MAE(61.9/76.3)、HoM-DINO(65.4/77.9)——HoM-DINO 全面胜出。

结果对比总结

图 6:三大评测维度的提升幅度:少样本 +3.1%、零样本 +2.5%、自监督对比 +2.1%。

关键发现

  1. 视角转变带来范式级提升:把合成图从"补充"升级为"独立知识仓库 iBase",少样本平均精度达79.9%,全面超越单阶段方法;
  2. 自监督预训练 > 监督预训练:HoM-DINO 在 1-shot/16-shot 超 SL+2.3%/+1.1%,合成到真实域的迁移性更强;
  3. HoM-DINO 超越主流自监督方法:超 DINOv2+2.1%/+0.7%、SynCLR+1.0%/+0.5%、MAE 显著,高阶矩 + MIM + SyntAug 三者缺一不可;
  4. 合成管线可扩展且高质量:CoT 把 FID 从 40.1 降到32.6,多样性从 1.06 提升到1.21
  5. 轻量且高效:仅5.08% 额外参数(适配器)即可刷新 SOTA,LoRA 变体训练速度快2 倍、显存减半;
  6. 随模型规模扩展:换 ViT-L/14 后 1-shot 精度+5.9%(72.8%),方法对大 CLIP 模型有持续增益。

局限性

  1. 预训练开销:SyntIN1K 预训练约9 小时 / 4 张 RTX 4090(ViT-B/16),ViT-L/14 约 40 小时——虽然一次训练多任务复用,仍有成本门槛;
  2. 合成描述未充分利用:冻结编码器下数据规模增大出现性能饱和(0.3M→0.45M 提升趋缓),合成文本知识的潜力尚未挖尽;
  3. 依赖生成模型质量:GPT-4 与 Llama 的生成质量直接决定合成数据上限,闭源模型有成本与可复现性考量。

作者展望:换用更大 CLIP 模型带来显著增益,合成数据在数据稀缺任务上值得进一步探索。

常见问题(FAQ)

ImagineFSL 与 DISEF、DataDream 有什么区别?

区别在于范式。DISEF、DataDream 是单阶段方法,把合成图直接混入微调;ImagineFSL 是两阶段方法,先在纯合成基集 iBase 上自监督预训练适配器,再微调下游任务,把合成图当作独立知识仓库。

为什么自监督预训练优于监督预训练?

监督预训练用类标签训练,学到的特征偏向于区分 iBase 类别;自监督预训练(HoM-DINO)学习通用的分布统计与局部结构,从合成域到真实域的表示迁移性更强,实验上 1-shot/16-shot 分别高+2.3%/+1.1%

HoM-DINO 比 DINO 强在哪里?

DINO 只用 [CLS] token;HoM-DINO 额外建模patch token 分布的一/二/三阶矩,并用掩码图像建模强化 patch 级判别,用SyntAug(同一 caption 的两张合成图)构造视图——三者组合让它在 1-shot/16-shot 上超 DINOv2+2.1%/+0.7%

合成图像质量对结果影响大吗?

非常大。论文用 CoT 思维链优化描述生成,FID 从 40.1 降到32.6、多样性从 1.06 升到1.21;更好的合成数据直接带来更优的少样本性能,这也是管线设计(GPT-4 分析因子 + Llama 扩写)的核心价值。

ImagineFSL 需要多少额外参数?

基础版只需在冻结 CLIP 编码器上附加适配器,参数占编码器总参数的5.08%;LoRA 变体额外微调图像编码器,占 5.89%,训练速度仍比 DISEF/DataDream 快2 倍、显存减半。

本论文有 arXiv 预印本吗?

没有。ImagineFSL(CVPR 2025 Highlight)无 arXiv 预印本,官方项目网站为 https://peihuali.org/ImagineFSL;注意 arXiv:2312.03046 是另一篇论文 DISEF,不要混淆。

参考链接

  • 项目网站:https://peihuali.org/ImagineFSL
  • DINO 自监督学习(Caron et al., ICCV 2021):https://arxiv.org/abs/2104.14294
  • DISEF(Diversified In-domain Synthesis,arXiv:2312.03046):https://arxiv.org/abs/2312.03046
  • DataDream(ECCV 2024):https://arxiv.org/abs/2403.18807
  • SynCLR(Tian et al., CVPR 2024):https://arxiv.org/abs/2401.13868
  • Tip-Adapter(ECCV 2022):https://arxiv.org/abs/2111.03930

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询