多模态音乐情感数据集
2026/8/29 14:55:34 网站建设 项目流程

摘要:多模态音乐情感数据集是一个面向音乐情绪识别、多模态情感计算与音乐审美教育研究的数据集,通过融合音频、歌词文本和视觉信息,对音乐作品所表达或引发的情绪进行综合建模。

数据集概述

多模态音乐情感数据集是一个面向音乐情绪识别、多模态情感计算与音乐审美教育研究的数据集,通过融合音频、歌词文本和视觉信息,对音乐作品所表达或引发的情绪进行综合建模。每条记录与相应的 singer_id 关联,并提供统一的情绪标签。数据集共包含 14 类情绪:愤怒、黑暗、活力、史诗、狂喜、华丽、快乐、神秘、放松、浪漫、悲伤、恐怖、感性和振奋,可用于研究音乐声学特征、歌词语义、视觉表现与听众情绪感受之间的关联。

数据结构与关键特征

该数据集主要由音频、文本和视觉三种模态构成。视觉模态包含亮度、对比度、清晰锐度、饱和度、色调、运动强度、纹理和整体视觉清晰度等特征,可描述音乐视频或相关视觉内容的色彩与动态表现;文本模态主要分析歌词,包括词数、平均句长、词汇多样性、情感极性、主观性、语言复杂度、词汇丰富度和音节数量等特征;音频模态则由音乐片段及其对应情绪标签组成,可进一步提取 MFCC、Mel 频谱、节奏、音高、能量、频谱质心等声学信息。三种模态均通过 singer_id 和 target 等字段建立对应关系,形成“音频 + 歌词 + 视觉特征 → 14类音乐情绪”的多模态分类结构。

应用价值与研究方向

该数据集适用于音乐情绪分类、跨模态情绪识别、音乐推荐、听众体验分析和审美教育评价等研究。研究人员可以使用 CNN、Audio Transformer 或 Wav2Vec 类模型处理音频,利用 BERT、RoBERTa 等模型分析歌词语义,并采用 CNN、Vision Transformer 等方法处理视觉特征,再通过注意力机制或多模态 Transformer 进行联合建模。进一步可研究不同模态对情绪判断的贡献、音乐情绪随视觉与歌词变化的协同关系、细粒度14类情绪区分、个性化情绪音乐推荐以及面向音乐教育的情感与审美表现评价系统。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-475
文件大小:395M
原创声明:本数据集为整理作品

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询