ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

疾病数据集|从医院PACS“书签“里挖出32,735个病灶标注:零人工标注成本的超大规模多类型病灶CT数据集

2026/8/5 0:00:48 拓冰建站 浏览量
疾病数据集|从医院PACS“书签“里挖出32,735个病灶标注:零人工标注成本的超大规模多类型病灶CT数据集

摘要

美国国立卫生研究院(NIH)临床中心影像生物标志物与计算机辅助诊断实验室创建了DeepLesion数据集——通过挖掘医院 PACS(影像归档和通信系统)中放射科医师日常阅片时留下的"书签"(bookmarks)标注,构建出包含 32,735 个病灶、32,120 张 CT 切片、覆盖 10,594 项检查和 4,427 名患者的大规模多类型病灶数据集。其意义在于:开创了一种几乎零人工标注成本的数据集构建范式,解决了医学影像领域长期缺乏大规模标注数据集的根本难题,并支撑了首个"通用病灶检测器"的训练——用一套统一框架检测所有类型病灶,为自动化放射诊断与推理系统奠定基础。


一、研究背景

1、研究背景

计算机辅助检测/诊断(CADe/CADx)是医学影像处理领域长盛不衰的研究方向,基于卷积神经网络(CNN)的深度学习算法性能远超传统方法,但这些性能提升往往以海量标注训练数据为代价。与通用计算机视觉不同,医学影像领域一直缺乏一个类似 ImageNet、MS COCO 级别的大规模标注数据集,因为医学图像标注需要专业临床知识,无法像普通图像那样通过"谷歌搜索 + 众包"的方式廉价获取。

病灶的检测与表征是 CADe/CADx 的核心任务。但现有算法大多只针对某一种特定病灶(如皮肤病变、肺结节、肝病灶、结肠息肉),而放射科医师的实际阅片方式是综合性的——同一患者体内多种病灶往往互相关联(例如肿瘤转移会扩散到区域淋巴结或其他部位),只有掌握整体临床画面才能做出准确诊断。

2、目前遇到困难和挑战

(1)医学图像标注昂贵,大规模数据集稀缺

普通计算机视觉任务可以靠网络搜索加众包廉价收集标注,但医学影像标注必须具备临床专业资质,常规众包模式完全失效。当时公开可用的医学影像数据集大多只有几十到几百个病例,超过 5000 个标注良好的病例的数据集极为罕见,严重制约了深度学习模型的能力上限。

(2)单一病灶检测与临床实际脱节

现有 CADe 算法普遍"一次只看一种病"——研究肺结节的不管肝病灶,研究肝病灶的不管淋巴结。但临床实践中,放射科医师读片时会同时关注多种发现,而且不同病灶之间往往存在病理关联(比如转移灶)。缺乏多类别病灶数据集,使得"通用型"CADe 框架一直难以建立。

(3)罕见病灶类型被系统性忽视

研究资源高度集中在少数常见病灶(肺结节、肝病灶等),大量不常见的病灶类型(骨病灶、软组织病灶等)几乎没有对应的 CADe 研究。这些"长尾"病灶同样影响患者健康,却因为缺少数据而被算法研究界忽略。


二、介绍数据集

1、数据集名称

DeepLesion

2、一句话介绍数据集

DeepLesion 是 NIH 通过挖掘医院 PACS 中放射科医师留下的 RECIST 测量"书签"构建的超大规模多类型病灶 CT 数据集,包含 32,735 个病灶标注、覆盖全身 8 大类病灶,构建过程几乎无需人工标注。

3、详细介绍数据

DeepLesion 的核心思路非常巧妙:放射科医师日常阅片时,会在 PACS 里对重要病灶做"书签"标记(按照 RECIST 实体瘤疗效评价标准测量病灶长短径),用于后续随访对比。这些书签在医院系统里积累了二十多年,本身就是现成的专业标注。研究团队把这些书签挖掘、清洗、整理出来,直接变成了深度学习可用的数据集。

核心数据统计:

参数数值
病灶总数32,735 个
标注切片数32,120 张
CT 检查数10,594 项
患者数4,427 名
每张切片病灶数1~3 个
病灶长径范围0.42 ~ 342.5 mm
病灶短径范围0.21 ~ 212.4 mm
层厚范围0.25 ~ 22.5 mm(48.3% 为 1mm,48.9% 为 5mm)
图像尺寸绝大多数 512×512
数据划分训练 70% / 验证 15% / 测试 15%(按患者级划分)

病灶类型分布(人工抽检 9,816 个病灶标注为 8 类):

病灶类型数量说明
肺部2,426肺结节、磨玻璃影等
腹部2,166肝肾之外的腹部杂项病灶
纵隔1,638主要为胸部淋巴结
肝脏1,318肝肿瘤等
盆腔869
软组织677肌肉、皮肤、脂肪内病灶
肾脏490
骨骼232硬化性病变、转移等

标注内容:每个病灶提供 RECIST 长短径测量(4 个顶点坐标)、由直径外扩 5 像素生成的 2D 边界框,以及像素间距、层厚、窗宽窗位、患者性别年龄等元数据。

4、数据集构建

(1)数据挖掘

通过 PACS 系统(Carestream Vue)查询带书签的 CT 检查号,用厂商提供的 Perl 脚本批量下载书签;筛选出信息最完整的 RECIST 直径类书签(占 CT 书签的最大比例),过滤掉非轴位标注,并把坐标从患者空间转换到图像像素空间。

(2)匿名化与格式转换

CT 影像从 DICOM 转为 16 位 PNG(无损压缩),真实患者 ID、检查号、序列号全部替换为自编号(格式:患者号_检查号_序列号),实现匿名化。

(3)标注转换

把 RECIST 直径(两条垂直测量线的 4 个顶点)转换为边界框,四边各外扩 5 像素以覆盖病灶完整空间范围,方便直接用于目标检测任务。

(4)噪声清洗

  • 剔除异常书签:对面积、宽高比、框内像素均值/标准差异常的框(过小/过大/扁平/过暗)逐一人工检查
  • 合并重复标注:同一病灶被不同医师重复书签的情况,将重叠率超过 60% 的框坐标取平均合并

5、数据集特点

全类型病灶覆盖

既有被大量研究的常见病灶(肺结节、肝病灶),也有被学界长期忽视的罕见类型(骨病灶、软组织病灶),是真正意义上的"全科"病灶数据集。一篇检查的图像里常常同时标记多个病灶,天然支持病灶间关联关系研究(后续工作 DeepLesion Graph 就基于此)。

大规模且标注成本极小

超过 3.3 万个标注病灶、1 万多项检查,规模远超同期医学影像数据集(当时超过 5000 个良好标注病例的数据集屈指可数)。最关键的是标注几乎零成本——书签是医师日常工作的副产品,挖掘出来即可用。而且书签数量每年递增(2015 年后爆发式增长),数据集可以持续扩容。

随访时序数据

同一病灶(肿瘤、淋巴结)在多次随访检查中被重复测量,天然形成时序数据,可用于病灶生长分析和预测。

标注贴近真实临床

书签来自医师真实工作流而非专门为科研标注,反映的是临床上真正"值得关注"的病灶,而不是人工设计的标注任务。

6、数据集使用方法

  • 获取方式:数据集已公开释放,通过 NIH 临床中心官网下载(论文接受后提供链接)
  • 数据内容:16 位 PNG 图像 + 边界框坐标 + RECIST 直径 + 元数据(像素间距、层厚、窗宽窗位、性别、年龄)
  • 官方划分:训练 70% / 验证 15% / 测试 15%,按患者级别随机划分(避免同一患者数据泄漏)
  • 使用注意:书签不是完整标注——医师通常只标记代表性病灶,图像中常有未标注的病灶,"假阳性"里其实混着大量真病灶,评估指标会偏保守

7、基准测试总结

在 15% 测试集上,基于 Faster R-CNN 的通用病灶检测器在每图 5 个假阳性的工作点达到81.1%的敏感度(每图 3 个假阳性时为 77.31%),单张图像推理仅需 34 毫秒。


三、数据集有哪些场景的应用

1、通用病灶检测器训练——一次检测全身所有病灶

这是 DeepLesion 最直接也最酷的用法。以前做病灶检测,肺结节一个模型、肝病灶一个模型、淋巴结又一个模型,各管各的。有了 DeepLesion,你可以训练一个统一的检测器,一张 CT 图丢进去,肺里的结节、肝上的肿瘤、肿大的淋巴结全部一次找出来。论文用 Faster R-CNN + VGG-16 做到了 81.1% 敏感度。这个检测器可以当初筛工具用:先把所有可疑病灶找出来,再分发给各个专科模型(比如专门的肺结节良恶性分类器)做精细分析,就像医院里先全科医生初诊再转专科一样。

2、"书签缺失"下的噪声标签学习研究

这个数据集的标注有个天然特点:医师只标记了他们关心的病灶,图像里其他真实病灶并没有标注。这意味着训练数据里的"负样本"不纯——很多被判为假阳性的检测其实是真病灶。这反而是研究"带噪标签学习"(learning with noisy labels)的绝佳场景。你可以实验各种抗噪训练策略,或者从健康人数据集里采样纯净的负样本,看看哪种方式效果最好。这种"不完美标注"才是最真实的世界,研究价值很高。

3、结合放射报告做病灶分类(NLP + 视觉)

书签本身没带病灶类型标签,但每项检查都配有放射诊断报告,而且医师报告里常带超链接指向具体书签。你可以用自然语言处理从报告文本里自动提取病灶类型、性质描述,把文本信息和图像标注对齐,让数据集自动"升级"出细粒度标签。想研究多模态学习、视觉-语言对齐,这个数据集加报告的组合是现成的材料。

4、弱监督病灶分割

DeepLesion 只提供边界框和长短径,没有像素级分割掩码。这恰恰是弱监督分割(weakly-supervised segmentation)的标准设定:能不能只用框级标注训练出像素级分割模型?比如 BoxSup 这类方法就可以直接用。你也可以挑一部分感兴趣的病灶人工补标分割,配合主动学习(active learning)策略,让模型主动挑"最值得标"的样本给人标,把人工标注成本压到最低。

5、病灶图像检索系统

3 万多个覆盖全身各部位的病灶,是做医学影像检索(content-based image retrieval)的理想语料。比如给系统一个病灶图像或一段文字描述,让它从库里找出最相似的既往病灶案例,辅助医师参考历史诊断。数据集的多样性和规模足以支撑检索模型的训练和评估。

6、病灶生长预测与随访分析

癌症患者复查时,同一病灶会被反复测量。DeepLesion 里这种时序随访数据天然存在——你可以追踪一个肿瘤几个月内的变化轨迹,训练模型预测"这个病灶下次复查会长大多少"。这对临床价值巨大:如果模型能提前预判肿瘤生长速度,医师就能更精准地安排复查间隔和治疗时机。

7、多病灶关联关系挖掘

同一个患者身上,肝里的肿瘤、旁边的肿大淋巴结、骨上的转移灶,这些都不是孤立事件。DeepLesion 一次检查常标记多个病灶,让研究者第一次能在大规模数据上研究病灶之间的空间关系和病理关联(论文作者后续的 DeepLesion Graph 工作就是干这个的)。想构建"全身病灶知识图谱"辅助综合诊断,这个数据集是独一无二的起点。

8、罕见病灶检测研究

骨病灶、软组织病灶这类"冷门"病灶,以前根本没数据做研究。DeepLesion 里虽然它们占比不高(骨 232 个、软组织 677 个),但总算有了起步的数据。你可以研究少样本学习、类别不平衡下的检测策略,专门提升这些罕见病灶的检出率——论文也发现软组织病灶和骨病灶敏感度最低,说明这里有明确的改进空间。

9、小病灶与中等尺寸病灶检测难点攻关

论文的尺寸分析很有意思:小于 10mm 的病灶难检测(正常,太小了),大于 50mm 的反而好找,但 10~50mm 之间的敏感度并不随尺寸单调变化——15~20mm 表现最好。这说明中等尺寸病灶的检测受病灶类型、训练样本量等多因素影响。如果你想研究尺度感知检测、特征金字塔改进、小目标增强,这个数据集自带丰富的尺寸梯度(0.42mm 到 342.5mm),想怎么切分实验都行。

10、腹部盆腔复杂场景检测

论文坦诚指出:腹部和盆腔区域假阳性、假阴性最多,因为肠道、肠系膜等正常结构和病灶外观太像了。如果你专门研究复杂背景下的目标检测——比如用 3D 上下文信息、多模型集成、注意力机制来区分"肠袢"和"腹腔肿块",DeepLesion 的腹盆腔数据就是最硬的试金石。能在这里把敏感度提上去,方法肯定有两把刷子。


相关资源

本文是 LIDC-IDRI 数据集的详细解读。对于做医疗 AI 的朋友,数据集选型往往是个痛点——不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中,查阅成本很高。

我们把 LIDC-IDRI 以及全球主流医疗 AI 数据集(涵盖 CT、MRI、病理、超声、多模态等)整理成了 AI-Ready Dataset 条目库,以统一的 Wikipedia 式结构呈现,方便研究者快速比对和选型:

Qianfanghub AI-Ready Dataset:https://www.qianfanghub.com/ai-ready-dataset/

#DeepLesion #通用病灶检测 #PACS数据挖掘 #弱监督标注 #医学影像数据集