【CLAP】音频界的CLIP:Learning Audio Concepts From Natural Language Supervision
2026/7/22 21:21:02 网站建设 项目流程

note

  • 架构设计:采用双编码器(Dual-Encoder)结构,分别用 CNN14 处理音频(Log Mel Spectrogram)和 BERT 处理文本,通过可学习线性投影将二者映射到统一的 1024 维多模态空间。
  • 训练目标:基于 CLIP 式的对比学习(Contrastive Learning),在 Batch 内计算音频-文本相似度矩阵并施加对称 InfoNCE 损失,迫使匹配的音频与文本嵌入在空间中靠近,不匹配的远离。
  • 推理机制:利用自然语言 Prompt(如 This is a sound of [label])编码类别描述,通过零样本(Zero-Shot)余弦相似度检索实现开放词汇分类,无需下游任务标注数据或微调即可泛化到 16 个跨域任务。
  • CLAP 证明了即使使用较少的(128k)高质量音频-文本对,通过对比学习也能构建强大的通用音频表征,实现灵活的零样本预测。声音事件类任务受益最大,而语音/情感类任务因训练语料偏差仍有提升空间。未来的方向包括引入更多人类语音描述数据及更智能的噪声文本过滤方法。

文章目录

  • note
    • 一、研究动机
    • 二、CLAP论文核心
    • 三、实验设置与数据
    • 四、实验结果与分析
      • Zero-Shot 性能
      • 有监督微调性能
      • 关键消融与分析

一、研究动机

《CLAP: Learning Audio Concepts From Natural Language Supervision》
2022年

主流音频分析模型通常采用“单一类别标签对应大量录音”的训练范式,存在显著局限性:

  • 依赖标注数据:需要大量人工标注的类别标签进行训练,成本高昂。
  • 灵活性差:模型只能预测训练时预定义的固定类别,无法灵活处理未见过的类别(Closed-set)。
  • 语义缺失:自监督学习(SSL)虽规避了标签依赖,但排除了自然语言的语义知识,仍需在下游任务中适应固定的类别范式。

受计算机视觉中CLIP模型的启发,作者提出Contrastive Language-Audio Pretraining (CLAP),旨在利用自然语言监督学习音频概念,将音频与文本映射到统一的多模态空间,从而实现**Zero-Shot(零样本)**预测,摆脱对固定类别标签的依赖。

二、CLAP论文核心

CLAP 的核心架构与训练流程如下:

  • 双编码器结构
    • 音频编码器:采用 CNN14(来自 PANNs,预训练于 AudioSet),输入为 Log Mel Spectrogram,输出 2048 维特征。
    • 文本编码器:采用 BERT-base-uncased,取 [CLS] token 作为 768 维文本特征。
  • 联合多模态空间:两者分别通过可学习的线性投影层(L a , L t L_a, L_tLa,Lt)映射到维度d = 1024 d=1024d=1024的共同嵌入空间。
  • 对比学习损失:使用对称对比损失(Symmetric InfoNCE Loss)。在一个 Batch 的N NN个音频-文本对中,最大化匹配对的相似度(对角线),最小化非匹配对的相似度(非对角线),并引入可学习的温度参数τ \tauτ缩放 logits。
  • Zero-Shot 推理:推断时,计算测试音频嵌入与所有类别文本描述(如 “This is a sound of [class]”)嵌入的余弦相似度,通过 Softmax/Sigmoid 输出概率,无需任何额外训练。

三、实验设置与数据

  • 训练数据:仅使用约128k音频-文本对(来自 FSD50K、ClothoV2、AudioCaps、MACS),规模远小于 CV 领域的 CLIP。
  • 下游任务:涵盖 8 个领域共 16 个数据集,包括声音事件分类(ESC50, FSD50K, US8K)、音乐分类、场景分类、语音情感识别(CREMA-D, RAVDESS)、关键词识别等。
  • 评估模式
    1. Zero-Shot (ZS):直接推理,无微调。
    2. Supervised Feature Extraction (S):冻结编码器提取特征后训练分类头。
    3. Supervised Finetune (F):解冻编码器进行微调。

四、实验结果与分析

Zero-Shot 性能

CLAP 在零样本设置下取得了显著的 SOTA 表现,证明了自然语言监督的有效性:

  • ESC50:准确率达82.6%,超越人类水平(81%)及 AudioCLIP(69%)。
  • US8K:73.24%,优于 AudioCLIP 的 65%。
  • FSD50K(多标签):mAP 达0.3024,远超 Wav2CLIP(0.03)。
  • GTZAN Music vs Speech:达到100%准确率,甚至匹敌有监督模型。
  • 在所有 16 个任务上均优于随机猜测,在声音事件分类(SEC)领域泛化能力极强。

有监督微调性能

在监督微调(CLAP Best/F)设置下,CLAP 在 5 个数据集上达到 SOTA:

  • GTZAN Music vs Speech (100%)、Music Genre (91.3%)、Mridangam Stroke (97.94%)、Tonic (95.34%)、Vocal Sounds (97.95%)。
  • 在情感识别(ER)等任务上表现稍弱(如 RAVDESS 64.36% vs SOTA 81%),作者分析这是因为训练数据主要来自音频描述(含大量环境声),缺乏对人声内容及语境的描述。

关键消融与分析

  • 编码器冻结实验:同时解冻音频和文本编码器效果最好;有趣的是,仅解冻文本编码器的效果优于仅解冻音频编码器**,说明文本端的学习对多模态对齐至关重要。

  • Prompt 工程的影响:使用自然语言模板(如 “This is a sound of [label]”)比单纯使用单词标签效果更好,在 ESC50 上提升了约 5% 的准确率。怎么写文本描述,直接影响效果。同样是ESC50分类,用不同的prompt:
    • i can hear [label] → 78.6%
    • [label] → 81.2%
    • this is a sound of [label] → 82.6%
    • 说明:零样本不是「随便扔个词就行」,需要用符合预训练语料的句式(预训练的文本都是完整的句子,不是单个词)
  • 数据质量讨论:尝试加入 AudioSet 的标签生成的文本(标题/标签拼接)反而导致性能下降(ESC50 降至 67.15%),说明自然描述的语义质量比单纯增加数据量更重要,YouTube 标题往往不能准确描述片段声学内容。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询