Multi-Modal Representation Learning via Semi-Supervised Rate Reductionfor Generalized Category Disc
2026/9/4 21:21:42 网站建设 项目流程

面向广义类别发现的半监督率缩减多模态表示学习

1、摘要

GCD旨在同时识别已知类别和未知类别,其中仅有部分已知类别样本具有标签,因此构成了一个具有挑战性的开放集识别问题。当前MM GCD方法往往更加关注多模态间的对齐,而对模态内的对齐关注不足。

作者认为以前大家太关注“图文之间对没对齐”,却没有充分关注:图像空间内部到底有没有形成适合聚类的结构,文本空间内部有没有形成适合聚类的结构。(因为最终还是要区分类别,并不是模态对齐了就行了)本文提出一种基于半监督率缩减的方法,该方法通过利用模态内对齐,学习具有理想潜在结构的跨模态表示。为了增强知识迁移,利用VLM的模态间对齐能力,对多个候选提示信息进行聚合,从而获得更丰富的文本表示。作者在通用和细粒度基准数据集上进行了大量实验,结果表明 SSR²-GCD 获得了优于现有方法的性能,并验证了模态内对齐在多模态 GCD 中的重要性。

写的不太清楚,实际上是先给定图像数据,再利用VLM相似度检索文本候选,再聚合得到文本表示,这时候才得到多模态数据。

然后再SSR2学习,分别塑造两个模态的内部结构

——那如果同时考虑模态内和模态间对齐会怎么样?论文后面好像做了实验,结果反而下降,作者认为CLIP 已经提供了一定的跨模态语义对齐,在此基础上继续强制 image/text feature 一致,可能会牺牲每个模态自身最适合聚类的结构。

——如果简单地“两种 loss 相加”不行,有没有办法在不破坏模态内部结构的前提下,选择性地利用真正有益的跨模态一致性?

2、引言

介绍GCD任务

现有方法遵循的是在图像数据上用两阶段框架,先微调预训练模型,为图像生成表示,再在所有无标签数据上学习得到聚类算法。单一模态判别力不足,需要迁移到多模态数据中。

现有方法通常采用CLIP风格的模态间损失,或者GCD风格的模态内损失来进行表示学习,但缺乏一种能够恰当利用模态内对齐关系的损失函数,所以模态间对齐和模态内对齐到底如何相互作用,目前仍然不太明确。

——主要是想表达当前GCD模式的模态内对齐关系还不够,需要研究两者到底如何作用,才能找到适合的改进方法

本文将最大编码率缩减原理引入多模态GCD表示学习,并提出半监督率缩减GCD方法,具体而言,引入一个SSR2的损失函数,通过增强模态内部的一致性来学习具有理想结构的表示。这样已知类别和未知类别的信息会得到更加均衡的压缩(可能因为有无标签会导致两个大类数据的表示会不均衡,已知类别的结构紧凑,未知类别的会比较松散)。

此外,还提出基于检索的文本聚合策略,用于改进文本生成过程,生成语义更加丰富的文本表示。

  • 提出了一种面向 GCD 的半监督率缩减框架 SSR²-GCD,以学习具有理想分布结构的结构化表示。
  • 提出了一种有效的基于检索的文本聚合(RTA)策略,通过生成包含更丰富语义信息的文本表示来促进知识迁移。
  • 实验验证

——我觉得引言里的问题描述完全没讲清楚,应该要说当前模态内的损失函数对有无标签数据的压缩程度不一致,所以引入半监督率缩减的方法,此外,模态间和模态内如何相互作用也未知,为了更好利用VLM和模态间对齐信息,我们引入RTA,生成语义更丰富的表示。

——此外,为什么一定要用视觉来生成文本信息再聚合,MM-GCD就是使用的图像-文本成对的数据吗?能否在成对数据的基础上做一点表示,把RTA的思想引入增强?

(SSR²/TextGCD 研究的是“image-only 数据如何借外部文本”;MM-GCD 研究的是“已有真实 image-text pair 如何对齐”。那么中间其实还有一个问题:已有真实多模态数据时,能否利用 VLM 的外部语义知识进一步增强不完整、噪声或低质量的某一模态,并且只选择可靠的增强信息?)

3、相关方法

3.1 广义类别发现

无标签数据集同时包含已知类别和未知类别的样本,要求模型能够同时发现已知类别和未知类别。

3.2 多模态广义类别发现

常用的是用CLIP处理两种模态的数据(一类是成对数据,直接用image encoder和text encoder编码,另一类是用CLIP对图像生成文本,构成多模态信息)

然而,在 GCD 场景下,我们只能获得已知类别的类别名称,因此对于属于未知类别的图像,文本反演网络难以生成高质量的伪文本 token。

现有多模态 GCD 已经从“只利用跨模态信息”发展到同时考虑跨模态和模态内信息。然而,仍有两个问题没有解决:一方面,现有模态内对比学习直接继承传统 GCD,在半监督条件下会对已知类和未知类产生不均衡压缩;另一方面,模态间对齐和模态内结构学习是否相互促进仍不明确。

—— MM-GCD的数据集本身就是成对的多模态数据样本信息,本文是image only,所以文本模态不是数据天然提供的,而是额外构造出来的。但是用的是CLIP,本身并不是生成式模型,所以不能直接提供文本描述,而是要借助tag和attribute库,让CLIP对每一个图像样本去匹配检索相关的tag和attribute,再聚合形成更丰富的语义信息。而label是用来做有监督训练的,并不是做数据预处理的。

——tag 是与图像语义相关的候选概念词,不一定等于或接近真实类别标签。attribute是属性特征的描述

4、预先知识

4.1 问题定义

这里不再看了

4.2 多模态GCD通用流程

文本生成 —— 表示学习 —— 聚类(完成类别发现)

文本生成

imagenet的类别名称本身被拿来构建tag词库,再用GPT3针对这些tag生成属性描述。这两个结合起来构造一个prompt(其实就是候选文本)集合P,针对某一张图像,首先图像编码,给所有的候选文本也编码,再利用CLIP已有的图文匹配能力计算相似度(用CLIP-H/14 冻结不训练做检索),得到最相关的c个tag和attribute,这些c个内容不直接拼接,而是再经过CLIP(CLIP-B/16)的text encoder编码后的特征信息再加权求和,这时候才认为得到了更丰富的语义信息。

表示学习

给定查询图像及其对应的伪文本后,通常还会优化这些表示。

TextGCD:一般用的是对比学习来约束,一个样本的相同模态之间的表示拉近,不同样本不同模态的表示推远,但是它没有考虑各个模态内部的对齐关系。

GET:再加入传统GCD的模态内部的对比学习,就是用有标签数据进行有监督对比损失,簇内压缩,簇间推远

因此,作者认为,继承该范式会导致表示不均衡压缩,这时候有标签数据会被压得很紧,无标签数据压缩相对松散,这种不均衡的压缩会妨碍算法识别不同的簇。

所以,如何让已知和未知类比的样本都形成更加均衡的可区分表示结构是需要解决的问题。

cluster

现有方法通常用同步用交叉熵损失和自蒸馏损失以及熵正则项对无标签样本进行聚类。

此外,textGCD还考虑了一个双分支分类器的设定,两个分支选取高置信度的样本,两个视图在结果层面互相学习和约束。

5、本文方法

由三个模块组成

  • 用于文本生成与聚合的基于检索的文本聚合模块
  • 用于表示学习的半监督率缩减模块
  • 用于学习伪标签的双分支分类器
5.1 基于检索的文本聚合

其实沿用了textGCD的设定,构造tag和attribute,然后检索相似的c个,融合形成更丰富的表示。

本文没有修改怎么构造tag和attribute,这两个部分继承textGCD,真正改变的是检索出多个候选之后,怎么变成最终的文本表示。

textGCD的做法是把所有语义拼接成一个长文本,然后送进CLIP生成表示,但是CLIP在处理长文本时存在限制,超过20个token时,性能会下降。所以本文把c个tag和c个attribute分别进行编码再加权求和。ai bi分别是排在第i位置的tag和attribute,T是把文本变成token,F是把token变成embedding。权重设计如图,只是对top1赋予最高权重。

5.2 用于表示学习的半监督率缩减模块

为了从模态的内部关系中学习具有结构的表示,并且使类别已知和类别未知的数据表示得到更加均衡的压缩,提出了一种SSR2的方法。

感觉insight合理,解决的方式也还行,跟之前看的多视图聚类里一篇cuijinrong写的论文有点类似,看能否借鉴。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询