摘要
本文解读 CVPR 2025(Highlight)论文《ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning》。该论文提出ImagineFSL,一种基于想象基集(iBase)自监督预训练的 CLIP 少样本学习新范式,通过融合高阶矩表示(HoM-DINO)、掩码图像建模(MIM)与思维链+上下文学习合成管线(CoT+ICL),先把合成图像当作独立知识仓库进行预训练,再在少样本任务上微调,其特别之处在于把"文生图补充"升级为"独立知识仓库"。实验表明11 个数据集全面刷新 SOTA(少样本平均 79.9%、16-shot 84.4%、LoRA 变体 87.6%),为数据稀缺场景下的视觉语言模型适应提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 少样本学习的数据稀缺困境
- 为什么"合成图当补充"不是最优解
- 研究主线:从问题到结论
- 基准/方法设计
- 两阶段架构:预训练 + 微调
- 关键发现:自监督优于监督
- 分类全景
- 方法细节
- HoM-DINO:为少样本定制的自监督目标
- 可扩展合成管线:CoT + ICL
- 实验设计与结果
- 评测协议
- 合成图方法对比(1/16-shot 平均精度 %)
- 仅用真实图的 K-shot 对比(平均精度 %)
- 域泛化、零样本与效率
- 关键消融(1/16-shot 平均 %)
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- ImagineFSL 与 DISEF、DataDream 有什么区别?
- 为什么自监督预训练优于监督预训练?
- HoM-DINO 比 DINO 强在哪里?
- 合成图像质量对结果影响大吗?
- ImagineFSL 需要多少额外参数?
- 本论文有 arXiv 预印本吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning |
| 标题(中文) | 想象基集上的自监督预训练:VLM 少样本学习 |
| 作者 | Haoyuan Yang, Xiaoou Li, Jiaming Lv, Xianjun Cheng, Qilong Wang, Peihua Li |
| 机构 | 大连理工大学 · 北京邮电大学 · 天津大学 |
| 会议 | CVPR 2025(Highlight) |
| arXiv | 无(本论文无 arXiv 预印本) |
| 项目网站 | https://peihuali.org/ImagineFSL |
背景与动机
少样本学习的数据稀缺困境
少样本学习(FSL)旨在从极少量标注样本中识别新概念,一直是计算机视觉的热点。然而,FSL 面临的根本矛盾是标签数据稀缺:标注成本高、长尾类别样本少,CLIP 等视觉语言模型(VLM)虽有零样本能力,但在少样本场景下仍受数据不足制约。
为什么"合成图当补充"不是最优解
近年来文生图(T2I)模型可以生成海量逼真的标注图像,看似为 FSL 提供了数据出路。但现有方法存在系统性局限:
- DISEF(arXiv:2312.03046):用 LLaVA 描述少样本真实图,再输入 T2I 生成,配合 LoRA 微调;
- DataDream(ECCV 2024):用真实图微调 T2I 模型,为每个数据集定制生成器;
- IsSynth(ICLR 2023):用 T5 生成多样化描述。
这三类方法有一个共同问题:只把合成图当作真实图的补充,直接混合进微调阶段。论文作者指出,合成图来自独立基础模型(LLM+T2I),应被当作独立的知识仓库而非附属品——这正是 ImagineFSL 的核心动机。
研究主线:从问题到结论
图 1:ImagineFSL 研究主线:从数据稀缺问题到自监督预训练范式再到全面 SOTA。
基准/方法设计
两阶段架构:预训练 + 微调
ImagineFSL 的核心是两阶段 CLIP 适应:
- 预训练阶段:在纯合成图像基集(iBase)上,用自监督方法HoM-DINO训练适配器(学生-教师双分支 + EMA,冻结 CLIP 图像编码器);
- 微调阶段:保留教师适配器,丢弃头部与学生分支,附加视觉(V)分类器与视觉-语言(VL)分类器,损失为 $L_V + L_{VL}$,推理时按融合权重平均 logits。
图 2:HoM-DINO 自监督预训练:SyntAug 构造正对,高阶矩表示 + 掩码图像建模双头,EMA 教师更新。
关键发现:自监督优于监督
论文通过消融证实:相比无预训练,监督预训练(SL)与自监督预训练(Self-SL)都有益,但 Self-SL 显著更好(1-shot/16-shot 平均 +2.3%/+1.1%)。这意味着从合成域到真实域的表示迁移,自监督学习学到的特征更具泛化性。
图 3:少样本微调阶段:视觉与视觉-语言双分类器联合训练,LoRA 进一步微调图像编码器。
分类全景
图 4:CLIP 适应方法谱系:ImagineFSL 开辟"先在合成基集预训练、再微调"的两阶段范式。
方法细节
HoM-DINO:为少样本定制的自监督目标
DINO 只看 [CLS] token,忽略了 patch token。HoM-DINO的关键创新是建模patch 分布的高阶矩:
- 表示 $r = \phi\circ\theta(x) \triangleq [\text{CLS};\ m_1;\ m_2;\ m_3]$(4p 维),其中 $m_1$ 为分布中心,$m_2$、$m_3$ 为归一化的二阶、三阶矩;
- SyntAug:同一 caption 由 T2I 生成的两张合成图构成正对,语义一致且自然多样,优于手工增强;
- MIM:随机掩码 patch,学生重建教师预测,强化 patch 级判别;
- 总损失 $L = L_{\text{HoM}} + L_{\text{MIM}}$,均为 KL 散度自蒸馏,无负样本、无大 batch 依赖。
可扩展合成管线:CoT + ICL
合成数据从哪来?论文设计了系统性管线:
- GPT-4 思维链(CoT)分析:识别五个图像描述因子——属性(attribute)、视角(viewpoint)、背景(BG)、光照(LC)、退化原因(CD),设计四种描述模式;
- Llama 3 8B 上下文学习(ICL):以 GPT-4 示例为上下文,本地大规模扩写描述(温度 0.5、核采样 0.7);
- Stable Diffusion 3 Medium 出图:构建 SyntIN1K(ImageNet-1K 类名,每概念 300 描述 × 4 图)基集。
图 5:合成管线:CoT 提升保真度(FID 40.1→32.6),ICL 保证多样性(1.06→1.21)。
实验设计与结果
评测协议
在11 个基准数据集(ImageNet、Caltech、Aircraft、Cars、Food、Pets、Flowers、DTD、EuroSAT、SUN、UCF101)上评测少样本与零样本识别;域泛化用 ImageNet 训练 16-shot,测试 V2/Sketch/A/R 四个目标集。每数据集采样 3 个 All-way-K-shot 任务取平均精度,主模型为 CLIP ViT-B/16。
合成图方法对比(1/16-shot 平均精度 %)
| 方法 | 类型 | 1-shot | 16-shot | 平均 |
|---|---|---|---|---|
| IsSynth | 补充合成图 | 73.8 | 81.7 | 77.8 |
| CaFo | 补充合成图 | 71.5 | 81.7 | 76.6 |
| DISEF | 补充+LoRA | -- | 85.1 | -- |
| DataDream | 微调T2I | -- | 87.0 | -- |
| ImagineFSL | 两阶段 | 75.8 | 84.1 | 80.0 |
| ImagineFSL$_{LoRA}$ | 两阶段+LoRA | 77.3 | 87.5 | 82.4 |
共享同一批合成数据时,ImagineFSL 平均超复现基线+2.0%;LoRA 变体 16-shot 达87.5%,全面超过 DISEF(85.1)与 DataDream(87.0)。
仅用真实图的 K-shot 对比(平均精度 %)
| 方法 | 1-shot | 2-shot | 4-shot | 8-shot | 16-shot |
|---|---|---|---|---|---|
| CoOp | 67.6 | 70.8 | 74.0 | 76.8 | 80.0 |
| PromptSRC | 72.3 | 75.3 | 78.4 | 80.7 | 82.9 |
| CLIP-LoRA | 72.5 | 75.5 | 77.4 | 80.3 | 83.0 |
| GalLoP | 72.8 | 76.4 | 79.1 | 82.2 | 84.5 |
| ImagineFSL | 76.1 | 77.5 | 79.4 | 82.2 | 84.4 |
| ImagineFSL$_{LoRA}$ | 77.6 | 79.1 | 81.9 | 84.2 | 87.6 |
少样本越多优势越大:1-shot 超 CLIP-LoRA+3.6%,16-shot +1.4%;LoRA 变体各 shot 全面领先,平均超第二名 GalLoP+3.1%。
域泛化、零样本与效率
- 域泛化(16-shot):ImagineFSL / LoRA 平均62.7% / 63.2%,刷新 IN-Sketch(53.8%)与 IN-R(80.0%)双 SOTA;
- 零样本识别:平均72.3% / 73.0%,超 DMN(70.5)1.8%/2.5%,LoRA 在 11 个数据集中 7 个第一;
- 训练效率:LoRA 变体训练2 倍快(265ms vs DISEF 544ms)、显存减半(11.8G vs 20.6G),参数仅占 5.89%。
关键消融(1/16-shot 平均 %)
| 设置 | 1-shot | 16-shot |
|---|---|---|
| 无预训练(真实图) | 58.1 | 75.6 |
| 无预训练(混合合成图) | 62.2 | 76.5 |
| 监督预训练(SL) | 63.1 | 76.8 |
| HoM-DINO(Self-SL) | 65.4 | 77.9 |
Self-SL 方法对比:DINOv2(63.3/77.2)、SynCLR(64.4/77.4)、MAE(61.9/76.3)、HoM-DINO(65.4/77.9)——HoM-DINO 全面胜出。
结果对比总结
图 6:三大评测维度的提升幅度:少样本 +3.1%、零样本 +2.5%、自监督对比 +2.1%。
关键发现
- 视角转变带来范式级提升:把合成图从"补充"升级为"独立知识仓库 iBase",少样本平均精度达79.9%,全面超越单阶段方法;
- 自监督预训练 > 监督预训练:HoM-DINO 在 1-shot/16-shot 超 SL+2.3%/+1.1%,合成到真实域的迁移性更强;
- HoM-DINO 超越主流自监督方法:超 DINOv2+2.1%/+0.7%、SynCLR+1.0%/+0.5%、MAE 显著,高阶矩 + MIM + SyntAug 三者缺一不可;
- 合成管线可扩展且高质量:CoT 把 FID 从 40.1 降到32.6,多样性从 1.06 提升到1.21;
- 轻量且高效:仅5.08% 额外参数(适配器)即可刷新 SOTA,LoRA 变体训练速度快2 倍、显存减半;
- 随模型规模扩展:换 ViT-L/14 后 1-shot 精度+5.9%(72.8%),方法对大 CLIP 模型有持续增益。
局限性
- 预训练开销:SyntIN1K 预训练约9 小时 / 4 张 RTX 4090(ViT-B/16),ViT-L/14 约 40 小时——虽然一次训练多任务复用,仍有成本门槛;
- 合成描述未充分利用:冻结编码器下数据规模增大出现性能饱和(0.3M→0.45M 提升趋缓),合成文本知识的潜力尚未挖尽;
- 依赖生成模型质量:GPT-4 与 Llama 的生成质量直接决定合成数据上限,闭源模型有成本与可复现性考量。
作者展望:换用更大 CLIP 模型带来显著增益,合成数据在数据稀缺任务上值得进一步探索。
常见问题(FAQ)
ImagineFSL 与 DISEF、DataDream 有什么区别?
区别在于范式。DISEF、DataDream 是单阶段方法,把合成图直接混入微调;ImagineFSL 是两阶段方法,先在纯合成基集 iBase 上自监督预训练适配器,再微调下游任务,把合成图当作独立知识仓库。
为什么自监督预训练优于监督预训练?
监督预训练用类标签训练,学到的特征偏向于区分 iBase 类别;自监督预训练(HoM-DINO)学习通用的分布统计与局部结构,从合成域到真实域的表示迁移性更强,实验上 1-shot/16-shot 分别高+2.3%/+1.1%。
HoM-DINO 比 DINO 强在哪里?
DINO 只用 [CLS] token;HoM-DINO 额外建模patch token 分布的一/二/三阶矩,并用掩码图像建模强化 patch 级判别,用SyntAug(同一 caption 的两张合成图)构造视图——三者组合让它在 1-shot/16-shot 上超 DINOv2+2.1%/+0.7%。
合成图像质量对结果影响大吗?
非常大。论文用 CoT 思维链优化描述生成,FID 从 40.1 降到32.6、多样性从 1.06 升到1.21;更好的合成数据直接带来更优的少样本性能,这也是管线设计(GPT-4 分析因子 + Llama 扩写)的核心价值。
ImagineFSL 需要多少额外参数?
基础版只需在冻结 CLIP 编码器上附加适配器,参数占编码器总参数的5.08%;LoRA 变体额外微调图像编码器,占 5.89%,训练速度仍比 DISEF/DataDream 快2 倍、显存减半。
本论文有 arXiv 预印本吗?
没有。ImagineFSL(CVPR 2025 Highlight)无 arXiv 预印本,官方项目网站为 https://peihuali.org/ImagineFSL;注意 arXiv:2312.03046 是另一篇论文 DISEF,不要混淆。
参考链接
- 项目网站:https://peihuali.org/ImagineFSL
- DINO 自监督学习(Caron et al., ICCV 2021):https://arxiv.org/abs/2104.14294
- DISEF(Diversified In-domain Synthesis,arXiv:2312.03046):https://arxiv.org/abs/2312.03046
- DataDream(ECCV 2024):https://arxiv.org/abs/2403.18807
- SynCLR(Tian et al., CVPR 2024):https://arxiv.org/abs/2401.13868
- Tip-Adapter(ECCV 2022):https://arxiv.org/abs/2111.03930
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)