做医疗AI这几年我收到最多的私信不是问哪个网络结构更好而是“你手头有没有能直接跑起来的公开数据集”。尤其刚入门的学生、从通用视觉转医疗的工程师最容易被卡住的地方反而不是算法而是数据从哪来、授权能不能用、标注格式长什么样、指标该怎么算。所以我把论文里高频出现、社区反馈比较靠谱、普通研究团队基本都能申请到的20个医疗场景数据集整理成一份清单覆盖医学影像、生理信号、结构化临床数据和病历文本几个方向。下面逐个拆门道包括规模、任务、获取方式、预处理注意点和我实际踩过的坑。1. 汇总前先搞清楚医疗数据集怎么选、怎么用1.1 先按任务分类别一味追求“越大越好”医疗数据并不等于“一堆CT片子”。实际接触下来算法团队碰到的场景大概分四类医学影像X光、CT、MRI、眼底彩照、皮肤镜、病理切片这是医疗AI论文里最常见的一类做分类、分割、检测都有对应benchmark。生理信号心电ECG、脑电EEG、睡眠多导图PSG、光电容积脉搏波PPG多用于可穿戴设备、远程监护、情绪识别。结构化临床数据检验指标、诊断编码、用药记录、生命体征等适合传统机器学习模型和表格型深度学习。病历文本与多模态数据影像报告、出院小结、护理记录可以单独做NLP也可以和图像拼成多模态任务。选数据集之前先问自己三个问题我要解决什么任务数据模态和真实场景是否匹配许可协议是否允许我这样用第三点最容易被忽视很多人下载资源时只看到“公开”两个字没读License等到论文投稿或公司合规审计才发现问题。医疗数据的许可普遍比通用数据集严商用和再分发都要单独确认。1.2 授权与合规是硬门槛不是走流程医疗数据涉及患者隐私不是谁都能直接下载的。常见门槛有这么几类PhysioNet上很多生理信号数据集需要先注册成credentialed user完成培训课程并同意数据使用协议MIMIC系列除了PhysioNet认证还要在CITI官网完成对应的人体研究保护课程再单独申请ADNI这类多中心队列数据通常要求机构PI填写使用申请ISIC、BraTS等则相对宽松注册后即可下载。我自己的建议是第一次申请时就把培训证书、数据使用协议、申请邮件全部存档。这些东西用到论文投稿签协议、公司处理外部数据合规时都能用上。别觉得麻烦真到用的时候找不到比跑一个失败的模型还让人头疼。1.3 20个医疗场景数据集总表下面这张表把20个数据集按序号列清楚方便直接对照。后续章节会挑重点逐类展开。序号数据集模态/场景规模概览获取渠道1CheXpert胸部X光多标签分类约22.4万张官网填表申请2MIMIC-CXR胸部X光放射报告约37.7万张图像PhysioNet认证3RSNA Pneumonia Detection胸片肺炎检测训练集约3万张Kaggle/官方渠道4BraTS脑胶质瘤MRI分割多中心每年更新官网注册下载5ADNI阿尔茨海默MRI/PET/临床多中心队列机构PI申请6IXI健康脑MRI约600例官网下载7DRIVE眼底血管分割40张眼底彩照官网下载8APTOS 2019糖网分级3662张眼底图Kaggle下载9Kermany OCT2017视网膜OCT分类84,484张B-scan公开下载10ISIC Archive皮肤镜图像数万张官网/挑战赛11HAM10000皮肤病变7类10,015张官网/Kaggle12CAMELYON16淋巴结转移全切片400张WSI官网申请13PCam病理patch二分类约32.7万patchKaggle下载14BCCD血细胞检测数百张显微图像Kaggle/GitHub15MIT-BIH Arrhythmia两导联动态心电48条半小时记录PhysioNet认证16PTB-XL12导联心电图21,837条记录PhysioNet认证17DEAP情绪EEG多模态32人×40段试验官网申请/公开18Sleep-EDF Expanded睡眠分期约198夜PSGPhysioNet认证19TUH EEG临床脑电/癫痫数万条记录级别官网申请20Pima Diabetes血糖二分类768条记录UCI/Kaggle2. 医学影像数据集详解从胸片到病理切片逐个说清楚怎么用2.1 胸部X光三件套CheXpert、MIMIC-CXR、RSNA Pneumonia Detection胸部X光是医疗影像里最“卷”的方向主要因为胸片资源公开程度高、标注体系成熟。CheXpert来自斯坦福给每张胸片标注14个观察标签比如肺不张、心脏肥大、实变、水肿、胸腔积液等官方还提供了不确定性标签U的处理建议。这个数据集适合做多标签分类也适合做预训练。我的经验是不确定标签处理方式要写在论文实验设置里常见策略是忽略U或全部置0、全部置1不同策略对指标影响不小对比实验必须统一口径。MIMIC-CXR和CheXpert常常被拿来对比。MIMIC-CXR最大的优势是同时有图像和对应的放射报告既能做图像分类又能做报告生成、影像-文本检索、对比学习。数据量大约37.7万张图像、22.7万份报告属于PhysioNet认证数据集申请步骤比CheXpert多一步。如果你做多模态MIMIC-CXR是绕不开的基准。RSNA Pneumonia Detection Challenge的数据来自NIH ChestX-ray14比赛任务是肺炎相关的肺部阴影检测给的是bounding box级别标注评估指标是mAP。和分类任务不同检测任务更考验数据预处理和anchor设置医学目标检测里这类病灶尺寸跨度很大训练时要注意输入分辨率和多尺度策略。这三个数据集分别对应分类、多模态、检测三条技术路线刚好覆盖胸片最常见的三种任务形态。2.2 脑部MRIBraTS、ADNI、IXI分割和分类各有代表BraTS系列是脑胶质瘤MRI分割最常用的benchmark。官方提供T1、T1ce、T2、FLAIR四个序列标注区域包括增强肿瘤、水肿、坏死和非增强肿瘤核心等。这些年挑战赛每年更新版本之间标签定义和样本量不完全一样用之前一定先看当年版本的官方文档。预处理上要统一方向、重采样到一致空间分辨率通常还要做颅内提取。评估指标常用Dice和Hausdorff距离95%只看Dice会忽略边界质量的差异。ADNI做的是阿尔茨海默病包含MRI、PET、认知评分、生物标志物等任务可以是三分类正常、轻度认知障碍、AD、回归认知分数也可以做病程预测。ADNI数据需要机构申请周期可能比PhysioNet长想拿来做毕业论文的同学要早做准备。IXI则是健康受试者的脑MRI包含T1、T2、PD和MRA等序列。它的价值在无监督预训练、图像重建、跨模态合成这类任务没有繁重标注负担非常适合前期搭pipeline。2.3 眼底与OCTDRIVE、APTOS、Kermany OCT2017眼底图像和OCT是眼科AI最常用的两种数据。DRIVE只有40张眼底图规模很小但它几乎是血管分割论文的标配baseline。使用时有几个容易忽略的细节一是要保留FOV mask否则评估时背景区域会把Dice抬得很虚二是分割结果通常只看FOV内部的表现后处理时边界部分要特别小心三是40张图划分成训练20张、测试20张是官方约定别自己乱切否则论文和别人对不上。APTOS 2019是Kaggle上著名的糖尿病视网膜病变分级比赛图像分0到4共5个等级评估指标是quadratic weighted kappa。这个数据集类别不均衡light端到0级的图特别多。实际做的时候预处理阶段要把黑边裁掉图像质量校正要克制过度滤波反而会丢细节。Kermany OCT2017则是一个大样本OCT分类数据集8万多张B-scan分为CNV、DME、Drusen和Normal四类。别看它样本量大公开以后有不少团队指出里面存在标签噪声直接用会带偏模型。我一般会先做一轮较严格的清洗或者用噪声鲁棒损失函数这个细节在论文里也是加分项。2.4 皮肤、病理与细胞ISIC、HAM10000、CAMELYON16、PCam、BCCD皮肤镜数据集绕不开ISIC和它旗下的HAM10000。ISIC Archive是常年更新的皮肤镜图像集合各届挑战赛任务不同有分类、分割、检测。HAM10000是其中被引用极高的一部分包含10015张皮肤病变图像共7类。用HAM10000时最需要注意的是类别不平衡比如黑色素瘤样本量相对少训练时建议分层采样评估用macro-AUC会更能说明模型真实能力。病理切片方向CAMELYON16是乳腺癌淋巴结转移全切片检测的经典数据包含400张WSI任务本质是“在大图上找到小块转移病灶”工程复杂度很高。PCam可以看作是CAMELYON系列里专门抽出来的patch级数据32万多个96x96小patch二分类是否有转移。我的建议是先从PCam跑通算法再上CAMELYON16做全切片推理否则上来就处理十几万像素的WSI光切片读取和内存管理就够折腾很久。BCCD则是一个小规模血细胞检测数据集图像里有红细胞、白细胞、血小板适合做目标检测入门。样本少但用来练手数据标注、微调检测模型完全够用。3. 生理信号数据集心电、脑电、睡眠拿到手先处理这些3.1 心电任务MIT-BIH Arrhythmia与PTB-XL别把数据划分搞错MIT-BIH Arrhythmia是心电图研究里最老牌的数据集48条约30分钟的双导联动态心电记录包含beat级别的标注。学术论文通常按照AAMI标准把心拍分成N、S、V、F、Q五类也有只做二分类正常/异常的。这个数据集最核心的坑是数据划分不同记录可能来自同一个患者如果随机切分心拍模型很可能通过患者特征作弊导致指标虚高。正确做法是按患者或按记录划分训练集、验证集和测试集跨患者评估才有意义。PTB-XL是目前规模较大的12导联心电图数据集21837条10秒记录标注采用多层诊断体系包括诊断大类、子类、形态学、节律等。文件有WFDB格式也有CSV版本。预处理通常要做带通滤波去除基线漂移和工频干扰。还要注意导联顺序和单位有些读取库默认输出幅值单位是mV有些是µV这个坑能让你的loss在同样的代码下完全对不上。心电分类在类别不均衡时建议用macro-F1和AUC一起看单看accuracy很容易被多数类带偏。3.2 脑电与情绪DEAP和TUH EEG数据规模和使用难度差别很大DEAP是情绪识别领域知名度很高的多模态数据集32位受试者观看40段音乐视频同时记录32通道EEG和8路外周生理信号比如眼电、肌电、皮肤电、呼吸、体温等受试者每段看完后对效价、唤醒度、喜好、优势度打分。做情绪分类时大多数人会先做频带特征提取再配SVM或浅层网络。关于划分方式不同论文用的策略差异很大有leave-one-subject-out也有随机按trial划分后者会有信息泄漏风险报告结果时必须说明划分方式。TUH EEG来自Temple University Hospital是目前规模很大的临床EEG数据库标注内容涵盖了癫痫检测、异常分类等。它的特点是大但也很“脏”采集设备不同通道数量不一致采样率有变化临床报告描述也不如标准数据集规整。想直接训练端到端模型坑很多。我建议第一次接触TUH的团队先跑它提供的预处理基线把通道映射、重采样、分段流程固定下来再尝试自己的模型否则很容易把时间耗在排查数据上。3.3 睡眠分期Sleep-EDF Expanded的类别不平衡和分组问题Sleep-EDF Expanded是睡眠分期研究的老朋友包含整夜多导睡眠图记录有脑电、眼电、肌电和呼吸信号标注按30秒一个epoch给出。经典任务是把每个epoch分为W、N1、N2、N3、REM五类。实际使用里最明显的问题是类别分布严重不均衡N1占比很小很多模型最终N1的recall非常低。处理时别只调阈值可以尝试类别加权、焦点损失或者把任务重构成有层次的结构。划分上也应按受试者分组避免同一人的前后epoch同时出现在训练和测试中。不要小看这个细节睡眠结构的个体差异很大不按人划分的结果不能代表模型泛化能力。4. 结构化临床数据与文本MIMIC、皮马糖尿病以及你不该忽略的条条框框4.1 MIMIC-III与MIMIC-IV重症医学里的“富矿”也是最“重”的数据MIMIC系列是重症医学研究方向最常用的公开数据库里面包含ICU患者的生命体征、检验结果、用药、诊断编码、手术记录、影像报告甚至自由文本医嘱。MIMIC-III主流用了很多年MIMIC-IV是后续版本数据组织更规范表结构也有调整。申请流程比一般数据集繁琐得多先要在CITI完成人体研究保护培训拿到证书再到PhysioNet提交研究目的和预期用途审核通过才能下载。整个周期通常以周为单位做课题的话一定要提前规划。使用MIMIC最容易犯的错是拿整张表直接做机器学习而没有先确定分析单元。ICU数据是长时间多粒度的同一个患者有多次住院记录一次住院又有大量时间点采样。你要先想清楚预测目标发生在什么时间点然后以患者、住院记录或ICU停留为单位聚合特征。另外MIMIC包含缺失值、记录时间漂移、数据表之间join条件复杂等问题预处理阶段建议画一张数据流图先跑通一小批样本再全量处理。4.2 皮马糖尿病数据集二分类练手的好选择但别忽略数据质量皮马糖尿病数据集Pima Diabetes来自UCI记录了768条女性健康体检信息特征包括怀孕次数、血糖、血压、皮褶厚度、胰岛素、BMI、糖尿病遗传函数、年龄标签是有无糖尿病。这个数据集非常适合快速验证模型流程、做特征工程练习样本量小跑起来快。但它的坑也很典型部分特征存在异常0值比如血糖、BMI、血压为0在临床上不合理应该视为缺失值而不是有效数值。处理缺失值用什么策略会对最终指标产生明显影响。很多入门选手直接拿0值进模型效果自然差一截。4.3 一段补充组学、药物分子和医学文本方向如果要做组学或者药物研发方向前面20个清单可能不够用常用的还有TCGA、ChEMBL、PubMed/PMC这些更偏“生物信息”的资源。比如TCGA覆盖多种癌症的多组学数据和临床信息适合做生存分析、分子分型ChEMBL收录大量化合物活性数据适合药物分子属性预测。这些资源我这次没有排进20个清单里但路径值得知道。等模型做完单模态下一步大概率会撞上“多模态融合”或“跨模态迁移”那时候手上的数据资源越早攒齐越好。5. 实操心得与避坑指南申请、下载、预处理、评估全流程5.1 申请下载环节最容易被低估建议照着这个顺序准备我把医疗数据集的获取流程简化成四步先读官方说明再准备认证材料然后下载并校验文件最后整理目录和License。PhysioNet类的数据集一定要尽快完成认证因为审核周期不定。MIMIC系列需要CITI证书请提前查清楚所在单位是否已经有机构账号没有账号就得走个人注册。下载大文件时建议用支持断点续传和多线程的工具再对照官方提供的校验文件检查完整性我遇到过解压到一半才发现文件损坏的情况浪费的不只是时间还有快要过期的心态。下载完成后不要急着写模型。先在根目录保存原始License文件和README记录申请日期、数据版本、使用范围。这个习惯在投稿时特别重要有些期刊会要求说明数据使用许可公司内部做合规审计时也必须有这份线索链。医疗数据的合规问题不是“有可能出问题”而是“有没有记录可查”。5.2 预处理阶段最容易翻车统一口径比调参数重要预处理这块我强调三个“不要”。第一医学图像不要随意缩放和裁剪很多病灶依赖分辨率统一前要看一下原始图像尺寸分布选择能够保留关键结构的方案。第二信号数据不要只做归一化先看有没有基线漂移和工频噪声滤波参数要记录在实验设置里。第三划分数据不要按“文件”而是按“受试者”或“病例”这条在图像、信号、表格数据里通用否则会引入数据泄漏导致测试指标好看但真实场景崩掉。类别不均衡是医疗数据的老大难。分类任务建议用分层采样评估用AUC、F1、kappa这些指标分割任务要警惕背景占比过大导致的Dice虚高检测任务则注意NMS阈值和输入尺度。这些细节看上去都是“基本功”但恰恰是决定论文能不能复现、模型能不能上线的最关键环节。5.3 常见问题速查我实际踩过的几个坑现象原因处理思路同一份数据指标和论文对不上数据集版本不同、划分方式不同、不确定标签处理策略不同优先确认官方版本和实验设置再看预处理是否完全一致训练loss正常测试AUC很虚随机划分导致同一患者数据进训练和测试改成按患者/受试者分组划分分割Dice很高边界却一塌糊涂背景占比过高Dice不敏感同时报告Hausdorff距离或边界F1下载大文件总是损坏网络中断、存储空间不足使用断点续传工具下载后做校验病理数据跑着跑着内存爆掉WSI分辨率过大一次性载入用patch级采样配合动态读取不整体载入模型在公开数据好换设备就废过度拟合采集设备风格增加数据归一化、域随机化做跨中心验证最后分享一个我个人坚持到现在的习惯每个数据集下载后在根目录放一个README_zh.txt写下申请日期、许可范围、预处理脚本和改动记录。医疗数据链路长参与的人多这个文件救过我很多次。投稿要补充数据来源说明时查它团队换人交接时也查它。数据这件事慢就是快把基础打好比什么技巧都值钱。