
做医疗AI这一行时间久了你会发现真正拉开差距的不是模型结构而是你手里有什么数据。尤其是在医疗场景里数据集的获取难度、标注质量、模态多样性直接决定了你实验的天花板。标题里提到的“20个医疗场景经典、热门数据集”我在青光眼筛查、心电分类、胸片异常检测这几个项目里都用过其中不少这篇就把它们按模态和用途重新梳理一遍把适合干什么、怎么下载、坑在哪里一次性讲清楚。我不打算像资源帖那样只丢链接那样你下载完还是不知道怎么用。每个数据集我会说清楚背景、适合做什么任务、标注格式大概什么样以及实际使用中容易踩的坑。最后再给你一份速查表和避坑指南照着选就行。1. 选医疗数据集之前先想明白这三件事1.1 医疗数据集和通用数据集的核心差异医疗数据集的特殊性第一是隐私合规这个绕不开。ChestX-ray14这种公开很久的数据集还好MIMIC系列就必须走正规申请流程要过CITI培训、签数据使用协议、等PhysioNet审核。第二是标注成本极高一份高质量的影像分割标注成本可能是通用视觉数据的几十倍。第三是模态极其多样同样是医疗影像胸片是二维灰度病理切片是超大尺寸的二维图CT/MRI是三维体数据超声又是时序视频处理方式完全不同。我在实际项目里的体会是先把你要做的任务定义清楚再去找数据。同样是胸部数据肺结节检测用LUNA16就比ChestX-ray14合适因为前者有明确的结节位置标注后者只是图像级标签。数据不是越大越好匹配任务才是第一位的。1.2 判断数据集好坏的三个维度我筛选数据集时一般只看三个维度标注质量、类别分布、获取成本。标注质量是最要命的。很多公开数据集用NLP从报告里自动提取标签比如ChestX-ray14这在当年是开创性的做法但也引入了不少噪声标签。训练时你会发现验证集指标忽高忽低别急着调模型先看看是不是标签本身的问题。类别分布决定你模型能不能用。医疗数据天然长尾正常样本永远比病变多ISIC皮肤病数据里良性痣就是绝对多数训练时要做重采样或者用Focal Loss。获取成本不只指钱还包括认证流程、下载速度、格式转换的工作量。1.3 下载前必备的两个准备一是把账号体系提前注册好。NIH、PhysioNet、Kaggle、TCGA这几个平台的账号不通用每个都要单独注册其中PhysioNet的认证流程最长建议最先启动。二是确认存储和算力。CT、MRI这类三维数据动辄几百GBMIMIC-IV解压后也接近80GB别等下载到一半才发现磁盘满了。2. 医学影像类数据集胸片、CT、MRI与超声2.1 胸片类从图像分类到报告生成全覆盖先说最经典的 ChestX-ray14由NIH在2017年发布包含约11.2万张胸片覆盖3万多患者标注了14种胸部疾病标签包括肺不张、浸润、气胸、胸腔积液等。它是第一个大规模公开的胸片多标签分类数据集几乎所有胸片预训练模型都会拿它做基准。下载地址在NIH官网文件是打包好的PNG图片不需要额外标注解析属于最容易上手的一类。我当年第一次跑通多标签分类就是用这个数据模型结构也简单DenseNet-121加一个sigmoid输出层就行。唯一要注意的是它本身存在数据泄露问题同一个患者的片子可能同时出现在训练集和测试集里论文里一般会按患者ID划分你复现的时候不要忽略了这一点。接着是 CheXpert斯坦福在2019年放出来的224,316张胸片14个观察项相比ChestX-ray14它的标注更细致而且提出了一个处理不确定标签的方法——把标注为不确定的样本视为负样本用单一模型就能达到不错的准确率。后来官方发布了带专家标注的版本便把比赛榜单和实际使用彻底区分开了。如果你的目标是发表论文CheXpert做预训练再迁移到下游细分任务效果通常比直接用ImageNet初始化的模型好不少。第三个是 RSNA Pneumonia Detection Challenge这是个检测任务的数据集来自Kaggle约26,684张胸片标注的是肺炎病灶的边界框和是否为肺炎。做完分类再做检测我推荐先用这个过渡它的格式是常见的CSV标注文件框坐标是标准化的接入YOLO或Faster R-CNN都很方便。我试过用它训练一个肺炎检测模型虽然图像分辨率普遍不高但对于三四线基层医疗的初步筛查场景效果是能接受的。如果你要做胸片报告生成OpenI可以看看。它由印第安纳大学发布7,470张胸片配对应医学报告而且有MeSH索引词。数据量不大但胜在图文匹配完整适合做图像到文本的跨模态任务。我见过不少人拿它配合MIMIC-CXR一起用。2.2 CT类肺结节、肝脏与多器官分割CT数据里LUNA16是绕不开的一个。它来自LUNA挑战赛从LIDC-IDRI中筛选出888个CT扫描标注了肺结节的位置和直径。评估指标用的是FROC这个指标跟普通检测的mAP不一样它考察的是在多个假阳性率下的召回率代码写起来比模型本身还繁琐。我建议直接用官方评估脚本别自己实现容易出偏差。肝部相关有两个常用数据集。LiTS包含2017年MICCAI挑战赛的CT扫描共201个训练样本标注了肝脏和肝脏肿瘤适合做肝脏及肿瘤分割。CHAOS则覆盖了MRI和CT两种模态包括肝脏、左肾、右肾、脾共4个器官的分割标注。CHAOS的标注文件是逐层mask的PNG读取方式很直观。我做腹部多器官分割时用Synapse多器官数据集做主干再用CHAOS做跨模态验证这类多器官任务对临床辅助评估很有价值。疫情之后SARS-CoV-2 CT分割数据集也成为一个热门资源。它包含约3,700个CT切片标注了COVID-19相关的感染区域虽然不是一个纯官方组织发布的但在当时的科研环境下被广泛使用。如果你现在想做一个泛化能力强的肺部感染分割模型它可以和其他肺部分割数据混合使用。2.3 MRI类脑胶质瘤与多模态融合BraTSBrain Tumor Segmentation是脑胶质瘤分割的标杆数据集每年在MICCAI上更新。它提供四种MRI模态T1、T1ce、T2、FLAIR标注了肿瘤的增强区域、水肿区域和坏死核心。最经典的做法是四通道输入U-Net及其变体是主力backbone评估用Dice系数。现在BraTS 2021版本已经把训练集固定在大约1,251例不再像以前那样每年大改适合做长期比较。注意申请时需要填一个简单的使用协议审核很快基本当天能过。2.4 超声与皮肤镜二维图像里的特殊赛道超声数据相对胸片和CT更难获取但CAMUS是一个质量很高的选择。它包含500例心内超声2D超声心动图数据标注了左心室和右心室的心内膜轮廓同时提供收缩末期和舒张末期两个时相。这个数据非常适合研究心脏功能评估比如射血分数的自动化测量。处理超声数据时有一点需要留意图像对比度低、噪声多一般的图像增强策略不一定管用我在项目里用的最多的是对比度受限自适应直方图均衡化CLAHE效果比普通直方图均衡化好不少。ISIC是皮肤镜图像领域最知名的数据集系列2016到2020年每年都有挑战赛涵盖病变分类、分割、属性识别等任务。它最吸引人的地方是图片规模大且类别覆盖广但类别不均衡非常严重黑色素瘤样本的比例远低于良性痣。训练时我用过各类损失函数最后发现加权的Dice Loss配合数据增强最稳。下载同样在ISIC官网注册后通过Google Drive或AWS镜像拉取。此外RadImageNet虽然不是单一器官的数据集但它是放射影像预训练的宝藏包含超过120万张超声、CT、MRI和X光图像类别超过3,000种。我做过对比实验用RadImageNet初始化的模型在好几个下游任务上比ImageNet初始化靠谱得多毕竟预训练分布和医学影像更接近。2.5 病理与基因组TCGA的特殊之处TCGAThe Cancer Genome Atlas严格来说不是一个完整的数据集而是一个多癌种、多组学的数据库包含基因组、转录组、表观遗传和部分病理切片。它的申请流程在几个数据集中属于偏严格的需要向dbGaP提交研究用途说明等待周期可能以周计。但如果你做肿瘤相关的多模态研究它几乎不可替代。比如用TCGA-BRCA做乳腺癌生存分析可以同时融合基因表达和临床数据。我把这个列进来是想提醒你医疗数据集远不止影像组学数据同样是一大赛道。3. 生理信号与ICU类数据集心电、脑电与多模态监护3.1 心电信号从十二导联到单导联PTB-XL是目前规模最大的公开十二导联心电图数据集包含21,837份记录采样率有100Hz和500Hz两种版本标注基于SCP标准覆盖诊断超类和亚类心梗、传导异常、ST-T改变都能找到。它的下载在PhysioNet不需要额外认证注册账号就行非常友好。我做过一个心梗筛查模型用PTB-XL训练验证集AUC能做到0.9以上但在真实临床数据上会掉一些主要问题是导联位置偏移和采样率不一致。如果只想做单导联、面向移动设备的分类任务PhysioNet Challenge 2017的数据集值得关注它包含8,528条单导联心电信号目标是把心电信号分为正常、房颤、其他、噪声四类。这是入门心电分类最理想的数据集量级小、标注统一、评估指标清晰我建议新手从这里起步而不是直接上PTB-XL。3.2 脑电信号睡眠分期与情绪识别Sleep-EDF是睡眠脑电研究最常用的数据集之一包含从健康志愿者采集的整夜睡眠记录主要有Fpz-Cz和Pz-Oz两个导联标注按30秒一段分为W、N1、N2、N3、REM几个期。睡眠分期的经典做法是把单通道脑电做多尺度特征提取再用LSTM或Transformer做时序建模。这个数据的下载在PhysioNet也是注册即得。DEAP是情感计算领域非常知名的数据集包含32名受试者的40段音乐视频实验记录采集了32通道脑电以及多种外周生理信号。它不完全是临床医疗场景但在疼痛评估、情绪障碍研究、神经反馈训练中经常被用到。我之前结合SEED数据集做过跨受试者情绪分类实验能明显看出个体差异对模型泛化能力的影响这本身也是医疗AI里一个值得研究的问题。3.3 ICU多模态MIMIC系列的重要性MIMIC-III是重症医学AI领域的标志性数据集收录了近6万次ICU住院记录涵盖生命体征、实验室指标、药物、护理记录、影像报告和自由文本。它最大的特点是可以支持多任务研究比如死亡风险预测、败血症早期预警、用药安全分析等。申请需要完成CITI培训提交给PhysioNet的审核流程我去年申请过一次大概十天左右通过。下载后需要把CSV文件导入数据库官方示例用的是PostgreSQL强烈建议你先把official的databuild脚本跑通再考虑自己造轮子。MIMIC-IV是更新版本在做MIMIC-IV v2.x时我发现它把急诊ED、ICU和住院Hosp三个模块拆得更清晰了表结构也在逐步重构跟MIMIC-III的表不能直接对应。如果你是新用户直接学MIMIC-IV就行但如果复现老论文还是绕不开MIMIC-III这就是一个取舍的问题。3.4 影像报告多模态MIMIC-CXR与n2c2MIMIC-CXR是MIMIC系列里的影像分支包含37.7万张胸片以及对应的放射报告其中部分带有专家标注标签。它做视觉语言预训练、报告自动生成、医学图像检索都很有价值。申请条件与MIMIC-III相同也需要先拿到PhysioNet的授权再单独请求这个数据库的权限。拿到以后你会看到一个很大的DICOM目录结构先用官网给的metadata.csv和split.csv做划分不要自己按文件夹猜。n2c2是临床自然语言处理领域最有名的系列挑战数据覆盖了药物信息抽取、时序关系识别、去标识化等多个任务。它需要签署DUA文件审核周期不确定短则几天长则两周。如果你做电子病历的信息抽取n2c2和i2b2的历史数据至今仍是标准基准。4. 多模态与基准数据集快速上手与模型对比4.1 MedMNIST两行代码跑通医学图像分类基线MedMNIST是我非常喜欢的一个基准数据集它把18个二维和三维医学图像数据集统一成了MNIST的接口和使用方式。虽然叫MNIST但里面实际涵盖了眼部、肺部、皮肤、骨骼等多个器官既有分类也有分割。我在开新项目的时候会先用MedMNIST跑一遍模型的baseline确认模型能收敛再切换到大规模数据集调参。这个做法帮我省了很多试错时间。4.2 数据集之间如何组合使用很多实际任务需要跨数据集混合训练。比如做一个通用的胸部异常检测系统你可以用ChestX-ray14做预训练用CheXpert做标签细化再用RSNA的框标注做检测微调。三个数据集的标签体系不完全一致我建议在数据层面做统一映射把14类和14类的观察项合并到一套标准的8大类否则训练时loss很容易震荡。跨数据集训练还有一个好处是降低对单一数据集标注偏差的敏感度。5. 二十个医疗数据集速查表数据集模态任务类型规模获取难度备注ChestX-ray14胸片多标签分类约11.2万张低标签含噪声按患者划分CheXpert胸片多标签分类/预训练约22.4万张低不确定标签策略有价值RSNA Pneumonia Detection胸片目标检测约2.7万张低Kaggle适合检测入门OpenI胸片报告报告生成/图文检索7,470张低图文匹配完整LUNA16CT肺结节检测888个CT低评估指标FROCLiTSCT肝脏/肿瘤分割201例低适合以及肝分割CHAOSCT/MRI多器官分割40例MRI/20例CT低肝、双肾、脾SARS-CoV-2 CTCT感染区域分割约3,700个切片低新冠相关BraTSMRI脑肿瘤分割1,251例低四模态、疾病类型全CAMUS超声心腔分割/心功能500例中左/右心室轮廓ISIC皮肤镜分类/分割/属性数万张低类别不均衡RadImageNet多模态影像预训练超过120万张中适合做迁移学习TCGA多组学病理生存分析/多模态33种癌症高需要dbGaP审核PTB-XL心电分类/多标签21,837份低十二导联PhysioNet Challenge 2017心电单导联分类8,528条低房颤检测入门Sleep-EDF脑电睡眠分期数十晚整夜记录低单通道为主DEAP脑电外周情绪识别32人中可用于情绪障碍研究MIMIC-IIIICU多模态预测/时序/NLP约6万ICU记录高需要认证CITIMIMIC-IVICU多模态多任务横向扩展数据库高新项目推荐MIMIC-CXR胸片报告多模态/报告生成37.7万张高需要MIMIC授权n2c2电子病历文本NLP/NER/关系抽取视任务而定高需要DUA6. 下载与使用避坑指南6.1 认证申请与下载渠道的先后顺序我发现大家最容易忽略的是申请顺序。PhysioNet的认证周期通常在一到两周而MIMIC系和部分挑战赛数据都依赖它所以如果你计划做ICU方向第一件事就是先把CITI培训做完、把账号申请提交上去再去研究算法。别等到数据准备好了才想起申请。TCGA的dbGaP审核更慢有些项目还会要求机构PI签字这部分要预留出足够的时间。Kaggle和NIH官网的数据基本是即下即用没什么门槛。6.2 文件格式与预处理DICOM格式是医学影像最常用的存储格式但直接拿来训练深度学习模型不现实。我建议先用pydicom读取再转成NIfTI或PNG转的时候务必保留图像元数据里的像素间距、窗宽窗位信息尤其是CT和MRI归一化方式跟自然图像完全不同。CT的HU值范围是-1000到2000左右常规做法是先窗宽窗位裁切再线性缩放到0到1而不是直接用MeanStd归一化。心电图数据则要注意滤波PTB-XL自带的预处理工具可以帮你处理基线漂移和工频干扰。6.3 常见问题与排查这一部分我列几个自己和学员在实操中常踩的问题第一个问题是PhysioNet下载中断。MIMIC-IV解压后有几十GB浏览器下载很容易断。建议用wget配合-c参数断点续传或者写脚本做增量下载。解压时要留意嵌套压缩包先解压出.gz再解压内部.tar很多人卡在这里。第二个问题是BraTS数据维度和体素间距不一致。不同患者的MRI图像形状不完全相同需要重采样到统一的spacing。我习惯把spacing重采样到1x1x1mm然后做z-score归一化标准做法基本够用。第三个问题是数据集划分不一致。不少公开数据集官方只给了一个划分方案但不同论文私下里用的划分可能不同对比结果时非常容易失真。我的建议是所有实验都固定使用官方划分同时用MedMNIST这样的基准数据做横向比较尽量避免“自创划分”带来的争议。第四个问题是标签体系不统一。胸片领域ChestX-ray14和CheXpert虽然都是14类但疾病定义有细微差别。跨数据集训练前一定要坐下来把标签映射表理清楚不然出现重名类别但语义不一致的情况模型会学得很乱。第五个问题是类别不均衡。医疗数据里负样本永远多于正样本而且正样本中不同疾病的难例分布也不同。除了重采样和加权损失我在ISIC上试过困难样本挖掘效果比单纯用Focal Loss好一些但实现成本更高前期还是以Focal Loss和加权Dice为主。7. 一点个人体会数据集这个东西表面看是资源问题往里看是工程问题再往深了看是研究品味问题。我在医疗AI这个方向做了不少项目最大的感受是与其追着热门数据集跑不如花时间把一个数据集的坑摸透。ChestX-ray14的标签噪声、LUNA16的FROC评估、MIMIC-IV的表结构任何一个你研究透了都能支撑起一篇像样的工作。反过来泛泛地在20个数据集上各跑一遍最后可能什么也留不下。如果你刚入门我的建议是从MedMNIST和PhysioNet Challenge 2017入手成本低、反馈快能把数据加载、模型迭代、评估全流程跑通。有经验之后再挑战MIMIC和TCGA这种重数据。最后分享一个小技巧下载任何数据集之前先把对应的论文读三遍特别注意实验设置、数据划分和评估指标三块。很多数据集的说明书比想象中更重要读懂了它们你后面能省下大量返工的时间。