资讯动态

FMA 音乐数据集快速上手指南:10 万首免费音频数据

发布时间:2026/8/24 19:29:41 来源:尧图企业网站定制
FMA 音乐数据集快速上手指南10 万首免费音频数据【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fmaFMA 是 2017 年发布的大规模开放音乐分析数据集解决音乐信息检索领域难以合法获取高质量大批量音频的问题。它包含 106,574 首曲目、917 GiB 音频、343 天播放时长覆盖 16,341 位艺术家和 14,854 张专辑流派按 161 个类别做层次划分。音频全部采用 Creative Commons 授权代码以 MIT 协议发布元数据为 CC BY 4.0。 项目全貌四档规格一次看全规格内容适合谁small8,000 首 30 秒片段8 个平衡流派7.2 GiB快速原型、验证流程medium25,000 首 30 秒片段16 个不平衡流派22 GiB中等规模实验large106,574 首 30 秒片段161 个流派93 GiB深入研究、论文复现full106,574 首完整时长879 GiB完整时长场景的专业研究metadatatracks/genres/features/echonest 四张表342 MiB所有任务的基础音频统一为 MP3 格式提供 30 秒片段与完整时长两种切法。官方已内置训练/验证/测试三分割所有任务建议直接沿用保证与已有论文可比。 最短路径从 clone 到第一次成功加载先选 small 档验证流程跑通后再升级 medium 或 large。第一步克隆仓库并安装依赖注意 requirements.txt 锁定了 2017 年的老版本见下文避坑一节git clone https://gitcode.com/gh_mirrors/fm/fma cd fma pip install -r requirements.txt第二步按仓库 README 里的表格下载fma_metadata.zip342 MiB和fma_small.zip7.2 GiB用 README 中给出的 sha1 校验码验证完整性后unzip到data/目录。第三步用项目自带的utils.load加载元数据它会自动处理多行表头和类型解析不需要你手写任何解析逻辑import utils tracks utils.load(data/fma_metadata/tracks.csv) genres utils.load(data/fma_metadata/genres.csv) print(tracks.shape, genres.shape)跑通后打开 usage.ipynb按单元格顺序执行就能看到完整的加载、绘图和训练流程。 核心内容拆解四张表各管什么tracks.csv每首曲目一行含曲目/专辑/艺术家三级元数据、标签、流派、播放次数以及官方的 subset 和 split 两列。你拿它定义训练标签、筛选子集和划分数据是整个数据集的入口表。genres.csv163 个流派每个带一个 parent 字段由此推出层次树和顶层流派genre_top。你需要做多级分类、或在稀有流派上向上归并时用它。features.csvlibrosa 预计算的音频特征每首曲目一行包含 mfcc、chroma_cens、tonnetz、频谱质心等列。你解码音频的数天等待时间被省掉了直接拿它训练分类器。echonest.csvSpotify原 Echonest提供的专业特征仅覆盖 13,129 首含节奏、音色、能量等维度和随时间变化的特征。适合做对照实验或回归类任务。另外 utils.py 提供get_audio_path按曲目 ID 定位 MP3 文件以及多进程音频加载器批量读音频时能避免 IO 瓶颈。 典型任务演示任务一流派分类。输入是 tracks.csv 的genre_top标签和 features.csv 的 MFCC 列操作是取 small 子集的官方 training/test 分割标准化后用 SVM 训练完整流程见 usage.ipynb 第 5 节X_train features.loc[train, mfcc] clf skl.svm.SVC().fit(X_train, y_train)产出是测试集准确率可以直接和论文基线对比。任务二音频探索与特征提取。输入是一个曲目 ID操作是定位 MP3、用 librosa 解码并绘制谱图import librosa x, sr librosa.load(utils.get_audio_path(AUDIO_DIR, 2))产出是波形、梅尔谱图和 MFCC 可视化用来直观理解特征为什么能区分流派。⚠️ 实战避坑磁盘不足full 档 879 GiB、large 档 93 GiB 都会瞬间吃满磁盘。先下 small 加 metadata 共约 7.5 GiB 验证流程确认可行再升级。内存超限全量 10 万行特征用 pandas 一把载入会明显吃内存。按 subset 列过滤后再取列或改用分块读取。依赖装不上requirements.txt 锁定 Python 3.6 时代的版本numpy 1.12、pandas 0.19在新 Python 上大概率编译失败。不必照抄版本号装新版 pandas、librosa、scikit-learn 即可跑通核心流程解码 MP3 还需系统安装 ffmpeg。 进阶路径下一步跑通 baselines.ipynb拿到 sklearn 多种分类器加深度学习的官方基线分数你的模型好不好一目了然。逐节读 usage.ipynb吃透多级表头加载、音频批量加载和可视化写法。执行 analysis.ipynb看流派分布、数据划分和特征的完整可视化分析。更远的方向原始音频端到端深度学习CNN、RNN、Transformer 直接在 30 秒波形上建模替代手工特征。多模态建模把音频特征和标签、播放次数、艺术家简介文本联合起来提升小数据上的表现。预训练迁移在 large 档上训练大模型再迁移到更小的数据集或下游任务放大数据规模的红利。打开 usage.ipynb在仓库根目录写入一行AUDIO_DIR./data/fma_small/的 .env 文件然后执行第一个代码单元全部元数据就加载好了。【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fma创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价