摘要多模态音乐情感数据集是一个面向音乐情绪识别、多模态情感计算与音乐审美教育研究的数据集通过融合音频、歌词文本和视觉信息对音乐作品所表达或引发的情绪进行综合建模。数据集概述多模态音乐情感数据集是一个面向音乐情绪识别、多模态情感计算与音乐审美教育研究的数据集通过融合音频、歌词文本和视觉信息对音乐作品所表达或引发的情绪进行综合建模。每条记录与相应的 singer_id 关联并提供统一的情绪标签。数据集共包含 14 类情绪愤怒、黑暗、活力、史诗、狂喜、华丽、快乐、神秘、放松、浪漫、悲伤、恐怖、感性和振奋可用于研究音乐声学特征、歌词语义、视觉表现与听众情绪感受之间的关联。数据结构与关键特征该数据集主要由音频、文本和视觉三种模态构成。视觉模态包含亮度、对比度、清晰锐度、饱和度、色调、运动强度、纹理和整体视觉清晰度等特征可描述音乐视频或相关视觉内容的色彩与动态表现文本模态主要分析歌词包括词数、平均句长、词汇多样性、情感极性、主观性、语言复杂度、词汇丰富度和音节数量等特征音频模态则由音乐片段及其对应情绪标签组成可进一步提取 MFCC、Mel 频谱、节奏、音高、能量、频谱质心等声学信息。三种模态均通过 singer_id 和 target 等字段建立对应关系形成“音频 歌词 视觉特征 → 14类音乐情绪”的多模态分类结构。应用价值与研究方向该数据集适用于音乐情绪分类、跨模态情绪识别、音乐推荐、听众体验分析和审美教育评价等研究。研究人员可以使用 CNN、Audio Transformer 或 Wav2Vec 类模型处理音频利用 BERT、RoBERTa 等模型分析歌词语义并采用 CNN、Vision Transformer 等方法处理视觉特征再通过注意力机制或多模态 Transformer 进行联合建模。进一步可研究不同模态对情绪判断的贡献、音乐情绪随视觉与歌词变化的协同关系、细粒度14类情绪区分、个性化情绪音乐推荐以及面向音乐教育的情感与审美表现评价系统。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-475文件大小395M原创声明本数据集为整理作品