资讯动态

90+医疗公开数据集全盘点:影像、基因组、病理与临床文本使用指南

发布时间:2026/9/16 0:11:51 来源:尧图企业网站定制
做医疗AI或者医学图像分析的朋友应该都体会过那种“万事俱备只欠数据集”的焦灼感。找数据集真的比调模型还折磨人尤其是想跨疾病、跨模态做点研究光是海淘各种公开数据、挨个看清使用限制就够熬好几个通宵。我花了挺长时间整理了90多个各类疾病相关的医疗数据集覆盖影像、基因组、病理、临床文本等多个方向这篇就把我的整理成果、查找经验、使用前的注意事项和一些踩坑记录一次性端出来希望对正在找数据的你有点帮助。这篇内容适合这几类人看刚开始接触医疗AI、需要快速找到可复现数据集的科研新手想跨领域做研究、需要参考公开数据做预实验的工程师还有需要给学生安排课程设计、需要规范数据来源的高校老师。不管你是哪种读完之后至少能少走一半弯路。1. 这90多个数据集到底都藏了哪些疾病和数据格式先说说我整理的整体盘面。这90多个数据集不是随便堆在一起的我大体按“数据类型 疾病领域”做了分层每个数据集都记录了三样东西疾病类型、样本规模、获取地址。这样的话你想做肺癌影像直接定位到影像学分区你想做基因组相关分析就去另个分区找。总比你从一个关键词在各大平台检索几天要高效得多。1.1 影像学数据集是绝对主力影像类数据集几乎占了半壁江山原因是公开门槛相对低、标注方式标准边界框、分割掩码、分类标签而且各大医院和科研机构愿意开放脱敏后的影像数据。这里面比较有代表性的包括胸部X光片的多个大样本数据集比如NIH ChestX-ray系列、CheXpert、RSNA肺炎检测数据集眼底图像相关的糖尿病视网膜病变数据集像DRIVE、STARE、APTOS皮肤镜图像数据集ISIC脑肿瘤磁共振数据集BraTS肺结节CT数据集LIDC-IDRI。你可能注意到数据集大多来自欧美机构。这里有个很关键的信息差欧美公开数据集虽然来源清晰、标注规范但人种偏单一亚洲人群的疾病表现往往有差异。所以你直接拿这些数据训练出来的模型放到国内医院做验证性能掉一截是很常见的。如果有条件最好在本地再采集一部分数据做微调或者在验证时采用分层评估方式先看不同亚组的性能差异。1.2 基因组、病理与临床文本数据同样重要除了影像基因数据和临床文本数据的价值越来越凸显。像TCGA癌症基因组图谱覆盖了几十种癌症类型的多组学数据包括突变、表达、甲基化、拷贝数变异等ICGC则在国际范围做了大规模癌症基因组比对。病理方面有CAMELYON系列比赛提供的全切片图像WSI还有TCGA里配套的大量病理切片。临床文本方面MIMIC系列是最经典的重症监护数据库包含了ICU患者的生命体征、检查结果、护理记录和自由文本出院小结。这些非影像类数据在应用上有点难度。以MIMIC为例它是典型的“高门槛高回报”申请流程麻烦要做数据使用伦理培训、签协议、走PhysioNet认证但一旦拿到手里面的临床叙事文本和结构化数据适合做很多研究比如用药副作用挖掘、疾病表型聚类、预测模型构建。我见过不少人卡在申请这一步其实整个流程走下来也就是一两周的事关键是要沉住气。1.3 按疾病类别快速分组我按疾病类别做了二级分组方便大家直接“跳转”到目标方向。心血管方向有心电图数据集PTB-XL、MIT-BIH、心脏MRI数据集ACDC、UK Biobank的心脏子集神经方向有ADNI阿尔茨海默病神经影像、PPMI帕金森进展标志物、OASIS脑老化与阿尔茨海默呼吸方向有前面提过的肺部CT和X光系列传染病方向COVID-19刚暴发时涌现了一大批CT和X光数据集比如COVID-CT、SARS-CoV-2 CT-scan数据集眼科方向有OCT数据集Kermany等发布的视网膜OCT分类和眼底彩照数据集EyePACS。这里要提醒一下分组是相对粗粒度的不少数据集本身就是“多病种混合”比如MIMIC里什么疾病的患者都有NIH ChestX-ray也包含多种肺部病变。所以我的建议是用分组做定位但不要被分组限制住跨组找数据往往能带来意外的对比视角。2. 去哪找这些数据集渠道与平台深度解析光有清单不够你得知道这些数据集从哪些“源头”来以及以后怎么自行挖掘新数据。我常用的渠道大概可以分成三个层次。2.1 综合型数据竞赛平台Kaggle是绕不开的第一个去处。它的好处是数据集中、描述详细、社区活跃很多数据集都配有公开的Notebook适合快速上手。UCI机器学习库也是老牌平台虽然部分数据集体量不大但胜在规范、引用方便。国内的天池、和鲸社区也有不少医疗类赛事数据集特点是比较贴近本土临床场景但数据描述和标注质量参差不齐。在这类平台上找数据我有个习惯先看“数据集被引用次数”和“最近活跃时间”那些常年没人维护的数据集很可能连下载链接都失效了或者格式老到需要花大量时间清洗。选一个近半年内还有人在讨论的数据集能省去很多前期麻烦。2.2 医学专用数据库医学专用数据库才是主力军。PhysioNet是最经典的一个专注生理信号和临床数据像MIMIC系列、心电图、脑电、脉搏血氧等都能在这找到。癌症影像领域TCIA癌症影像档案库和GDC基因数据共享中心分别侧重影像和基因组数据。神经退行性疾病方面ADNI和PPMI都是官方资助的大型纵向研究数据库数据规范、随访信息全是很多神经影像研究的标配。这类数据库大多数需要注册申请有些还要求提供研究计划书和伦理批件。我第一次申请ADNI的时候以为填个表就行结果对方要求列明研究目的、统计方法、数据使用期限着实花了不少心思。现在回头看这个过程其实是个很好的“过滤器”——逼你想清楚到底要用数据做什么后面分析反而更顺畅。2.3 学术论文和顶会竞赛的“隐藏资源”这个渠道容易被人忽略读论文的时候关注那些基于公开数据集做实验的文章它们通常会在“数据获取”一节写清楚数据集来源、版本、预处理方式。很多顶级会议如MICCAI、CVPR、NeurIPS都有对应的挑战赛赛道比赛结束后数据往往仍然开放。比如BraTS (脑肿瘤分割挑战赛)、CAMELYON (病理切片转移癌检测)、ISIC (皮肤病变分析) 这些都是通过比赛积累起来的宝贵资源。这个渠道的好处是数据有“学术背书”论文里已经验证了基本可行性。但问题是挑战赛的数据集往往经过了高度预处理比如裁剪、归一化、特定协议扫描和真实临床环境的原始数据差异较大。所以用它做基准测试可以想要部署到实际临床流程还是得找机会接触未经处理的原始数据。3. 正式使用前先搞懂这几件要命的事数据集不是下载下来就能灌进模型训练。我在整理这90多个数据集的过程中发现几个问题几乎每个数据集都绕不开提前搞明白能省不少事。3.1 伦理审批和数据使用协议医疗数据最大的特点就是涉及患者隐私所以使用协议极其严格。有些数据集比如MIMIC必须先完成CITI项目的人体研究保护培训课程拿到证书后才能申请访问权限有些则只允许非商业用途商用必须单独联系数据所有者还有些要求在发表论文时注明数据来源和致谢。我强烈建议你在项目开始前就把每个数据集的使用协议翻译成中文整理成一张表列清楚“是否可商用”“是否需要提交研究计划”“发表时如何引用”。别小看这个工作有一次我们团队做预研时用了某个数据集做Demo后来客户想商业化才发现数据协议里明确禁止商用整个方案推倒重来。先审协议再谈模型这是铁律。3.2 数据格式大盘点医疗数据的格式五花八门不同模态差别很大。医学影像一般有DICOM医院设备原生格式、NIfTI神经影像常用、MHD/RAWCT重建常用、PNG/JPEG处理后的图像。临床文本则通常是CSV或JSON但里面的字段含义往往需要读数据字典。基因组数据更复杂VCF、BAM、FASTQ、MAF各管一段。初次接触这些格式的人最容易懵的是为什么同一个数据集里有DICOM又有PNG其实这是数据经过了不同阶段处理DICOM是原始图像加患者信息PNG是脱敏后的导出图。处理的时候要注意DICOM里的像素值通常需要根据Rescale Slope和Rescale Intercept标签转换成HU值亨斯菲尔德单位对于CT影像分析这个步骤做不做直接影响模型性能。而很多人直接拿PNG训练其实已经丢失了原始窗宽窗位信息相当于模型学到了“显示效果”而不是“组织密度”。3.3 标注质量决定模型上限说句扎心的公开数据集的标注质量差别可以大到让你怀疑人生。一些比赛数据集比如BraTS、ISIC由专家小组反复校对标注质量极高但很多早期公开数据集其实是“半自动标注人工抽检”错误率不低。特别是文本类数据比如出院小结里的疾病标签可能来源于ICD编码自动映射和实际诊断存在偏差。所以拿到数据集后第一件事不是看有多少样本而是做“标注抽检”。我通常用以下几种方式看标注分布比如类别占比是否违背临床常识、随机抽几十个样本人工复核、交叉验证同一个患者是否有多个检查结果标注不一致。这些检查看起来很朴素但在实际比赛中我至少三次因为这些基础问题避免了在垃圾数据上浪费几个月时间。4. 用这些数据集实战一个可复制的切入方案数据清单有了使用前的准备也做了接下来重点说一说怎么真正“用”起来。我用一个可复制的方案带你跑通从数据集到模型的完整链路。4.1 以小体量数据集快速验证很多人的误区是一上来就奔着最大的数据集去比如直接从MIMIC或TCGA开始结果光数据下载和预处理就折腾一个月。我的建议是先选一个小体量、标注规范的数据集做通关验证。比如你想做肺部影像分类别急着下载几十万张的ChestX-ray可以先找RSNA肺炎检测数据集里的一个小批次或者用ChestX-ray的子集先跑通数据加载、预处理、训练、评估全流程。这个阶段的目标不是拿到SOTA而是把Pipeline跑通。我在做项目的时候习惯用一个固定的小数据集做“冒烟测试”任何一个新模型、新框架先在它上面过一遍确认没有低级错误再上全量数据。这个方法帮我省下了大量排错时间。4.2 数据集的本地化存储与版本管理策略医疗数据集的存储和管理很容易被人忽视但实际操作中真的是“省事神器”。我强烈建议用数据版本管理工具比如DVCData Version Control把大体积的数据文件和代码仓库分开管理。数据本身不进Git而是用DVC记录版本、存储位置和元数据。这样你后续做实验时可以随时回滚到某个特定版本的数据而不用重下几十个GB的文件。另一个实用的做法是建立“数据卡片”也就是给每个数据集建立一个包含以下信息的Markdown文件数据来源、许可证、伦理要求、样本量、类别分布、预处理流程、已知问题。一开始你可能觉得这个工作没什么用但当你手头同时管理十几个数据集的时候你会发现这种数据卡片就是你的“第二大脑”。我整理这90多个数据集时每一类都做了卡片后面写论文补充方法部分时直接复制粘贴就行效率提升明显。5. 常见问题与排查技巧实录整理和实操过程中我积累了一些“血泪经验”这里挑几条几乎每个人都会遇到的做成一个小型的避坑指南希望能让你少走弯路。5.1 下载慢、解压失败、链接失效怎么办医疗数据集通常体积巨大动辄几十GB甚至上TB下载过程中中断和解压失败极其常见。我的经验是尽量用支持断点续传的下载工具比如使用带重试机制的命令行工具或者分段下载。不要用普通浏览器的下载功能直接拉大文件一旦网速波动就前功尽弃。解压时先检查文件完整性很多数据集会提供MD5或SHA256校验值不要跳过这一步。如果某个数据集的官网下载链接失效了可以考虑在学术搜索引擎里搜一下该数据集的“镜像站点”或论文中提到的备用下载方式。很多研究者会把数据同步到开源数据仓库比如Zenodo、Figshare这些平台的文件一般比较稳定。另外有些数据集通过学校图书馆的数据库订阅也可以获取特别是商业数据库如UpToDate或UpToDate背后的附属数据集。5.2 标签不平衡与类别缺失的应对医疗数据普遍存在类别不平衡问题比如某种疾病发病率低对应的样本就少。如果直接拿原始数据训练模型很容易偏向多数类产生“差不多都预测未见异常”的假阳性错觉。常见的解法是先看类别分布再决定使用欠采样、过采样、焦点损失、加权损失等方法。但这里有个容易被忽略的坑很多公开数据集在划分训练集、验证集、测试集时没有考虑“同一患者的多张影像可能同时出现在多个集合里”导致数据泄露评估结果虚高。正确做法是先按患者ID分组确保同一个患者的样本只出现在一个子集中。这个操作在做影像数据时尤其重要因为同一个患者的多次扫描高度相似模型只要记住患者不需要真正理解疾病。5.3 数据合规与后续发布的边界最后一条涉及“后续发布”的问题。你在公开数据集上训练出的模型如果打算开源一定要再检查一遍数据协议。有些数据集允许学术研究和模型训练但明确规定不能“衍生发布”原始数据或预处理后的数据。比如你复现某个模型的代码代码可以开源但数据集文件不应该直接打包放进仓库最多给出获取链接和引用方式。我自己遇到过这样的尴尬情况模型训练好之后准备在GitHub上开源代码结果仓库因为包含了一个公开数据集的子集文件被数据版权所有方要求下架。从那以后我所有开源项目里都用一个“data/README.md”说明数据来源不直接存放任何原始数据文件只有数据的下载脚本和预处理脚本。这套做法既尊重了数据协议又保证了项目的可复现性。最后再分享一个小技巧在做医疗数据集整理和使用时不妨养成“边用边记”的习惯——每次遇到一个数据集的新坑就把它记录到数据卡片里。这些笔记在你写论文、写技术报告甚至是到了新团队做技术分享时都会成为非常有价值的素材。毕竟医疗AI这个领域数据的坑不是一次性就能踩完的。希望这份整理和这些实战经验能成为你切入医疗数据世界的可靠地图。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价