本文介绍了一种用于眼眶计算机断层扫描(CT)图像的物体分割方案。文中详细说明了采用超分辨率技术标注眼眶结构真实标签、从CT图像中提取感兴趣区域体积,以及利用二维序列U-Net对眼眶CT图像进行多标签分割建模的方法,以上均适用于监督学习。
本文介绍了一种用于眼眶计算机断层扫描(CT)图像的物体分割方案。文中详细说明了采用超分辨率技术标注眼眶结构真实标签、从CT图像中提取感兴趣区域体积,以及利用二维序列U-Net对眼眶CT图像进行多标签分割建模的方法,以上均适用于监督学习。
近年来,基于深度学习的分割模型已广泛应用于眼科领域。本研究展示了基于U-Net构建眼眶计算机断层扫描(CT)分割模型的完整流程。对于监督学习而言,需要耗费大量人力和时间。本文介绍了采用超分辨率标注方法,以高效地在眼眶CT图像上标注真实标签(ground truth)。此外,在数据集预处理过程中,对感兴趣区域进行裁剪。随后,在提取眼眶结构的感兴趣区域后,利用U-Net构建用于分割眼眶CT关键结构的模型,该模型以连续的二维切片作为输入,并采用两个双向卷积长短期记忆网络来保留切片间的相关性。本研究主要聚焦于眼球、视神经和眼外肌的分割。分割结果的评估表明,深度学习方法在眼眶CT图像分割中具有潜在的应用价值。
眼眶是一个体积约为 30.1 cm3 的狭小而复杂的腔隙,其中包含眼球、神经、眼外肌、支持组织以及与视觉和眼球运动相关的血管等重要结构1。眼眶肿瘤是指眼眶内异常的组织增生,其中部分肿瘤可能威胁患者的视力或眼球运动功能,进而导致严重的功能障碍。为了保护患者的视觉功能,临床医生必须根据肿瘤的特征决定治疗方案,通常难以避免进行手术活检。然而,由于该区域结构紧凑且组织密集,临床医生在活检过程中往往难以避免对正常结构造成损伤。基于深度学习的病理图像分析技术可用于评估眼眶病变情况,有助于在活检过程中避免对眼眶组织造成不必要的或可避免的损伤2。针对眼眶肿瘤的一种图像分析方法是肿瘤的检测与分割。但由于眼眶肿瘤发病率较低,包含眼眶肿瘤的 CT 图像的大规模数据收集仍受限3。另一种高效的计算型肿瘤诊断方法4是将肿瘤与眼眶的正常结构进行比较。相较于肿瘤样本,正常眼眶结构的 CT 图像数量相对较多。因此,对正常眼眶结构进行分割是实现该目标的第一步。
本研究展示了基于深度学习的眶部结构分割的完整流程,包括数据采集、预处理以及后续建模过程。本研究旨在为希望采用当前方法高效生成掩膜数据集的临床医生,以及需要了解眼眶CT图像预处理和建模方法的眼科医生提供参考资源。本文提出了一种新的眶部结构分割方法——序列U-Net,这是一种基于U-Net典型深度学习架构的序列二维分割模型,专用于医学图像分割。该实验方案详细描述了眶部结构分割的操作流程,包括:(1)如何使用掩膜工具标注眶部结构分割的真值;(2)眼眶图像预处理所需的步骤;(3)如何训练分割模型并评估其分割性能。
对于监督学习,由四位具有五年以上眼科专科医师认证经验的资深眼科医生,手动标注了眼球、视神经和眼外肌的掩膜。所有眼科医生均使用掩膜软件程序(MediLabel,参见材料表),该软件采用超分辨率技术,可在CT扫描图像上高效完成掩膜标注。该掩膜软件具备以下半自动功能:(1)智能铅笔(SmartPencil),可生成具有相似图像强度值的超像素图簇5;(2)智能填充(SmartFill),通过计算前景与背景的能量函数生成分割掩膜6,7;(3)自动校正(AutoCorrection),可使分割掩膜的边界清晰,并与原始图像保持一致。图1展示了上述半自动功能的示例图像。手动掩膜的具体操作步骤详见方案部分(步骤1)。
下一步是对眼眶CT扫描图像进行预处理。为了获取感兴趣的眼眶体积区域(VOI),需识别在正常情况下眼球、肌肉和神经所在的眼眶区域,并对这些区域进行裁剪。该数据集具有高分辨率,平面内体素分辨率和层厚均小于<1 mm,因此跳过插值过程。取而代之的是在48 HU的裁剪水平和400 HU的窗宽下进行窗截处理。完成裁剪和窗截处理后,生成三个连续的眼眶VOI切片,作为分割模型的输入8。 方案部分(步骤2)详细说明了预处理步骤。
U-Net9 是一种广泛应用于医学图像分割的模型。U-Net 架构包含一个编码器和一个解码器:编码器用于提取医学图像的特征,解码器则以语义方式呈现具有判别性的特征。在将 U-Net 应用于 CT 扫描时,卷积层采用 3D 滤波器10,11。这带来了一个挑战,因为 3D 滤波器的计算需要大量内存。为了降低 3D U-Net 的内存需求,研究者提出了 SEQ-UNET8,该方法在 U-Net 中使用一组连续的 2D 切片。为防止 3D CT 扫描中 2D 图像切片之间的时空相关性丢失,在基础 U-Net 中引入了两个双向卷积长短期记忆网络(C-LSTM)12。第一个双向 C-LSTM 在编码器末端提取切片间的相关性;第二个双向 C-LSTM 在解码器输出之后,将切片序列维度上的语义分割信息转换为单幅图像分割结果。SEQ-UNET 的架构如图 2所示。实现代码可在 github.com/SleepyChild1005/OrbitSeg 获取,代码的使用方法详见方案部分(步骤 3)。
本研究已获得天主教医疗中心机构审查委员会(IRB)的批准,并保护了健康信息的隐私性、保密性和安全性。眼眶CT数据来自韩国天主教大学医学院附属医院(CMC;首尔圣玛丽医院、汝矣岛圣玛丽医院、大田圣玛丽医院和圣文森特医院)的去标识化人类受试者。眼眶CT扫描数据收集时间为2016年1月至2020年12月。该数据集包含46例韩国男性和女性的眼眶CT扫描,年龄范围为20至60岁。运行环境(RTE)详见补充表1。
1. 在眼眶CT扫描中遮蔽眼球、视神经和眼外肌
2. 预处理:窗口裁剪与感兴趣区域的截取
3. 眼眶分割模型的四重交叉验证
为了进行定量评估,采用了两种在CT图像分割任务中使用的评估指标。这两种指标均为相似性度量,包括骰子系数(DICE)和体积相似性(VS)13:
DICE (%) = 2 × TP/(2 × TP + FP + FN)
VS (%) = 1 − |FN − FP|/(2 × TP + FP + FN)
其中,TP、FP 和 FN 分别表示在给定分割结果和分割掩膜时的真阳性、假阳性和假阴性值。
通过四项交叉验证评估了 SEQ-UNET 在眼眶结构分割中的性能,结果如表1所示。使用 SEQ-UNET 进行眼球分割的 Dice 评分为 0.86,VS 评分为 0.83。眼外肌和视神经的分割得分较低(Dice 评分分别为 0.54 和 0.34)。眼球分割的 Dice 评分超过 80%,原因是其在感兴趣体积(VOIs)中占比较大,且不同 CT 扫描之间的异质性较小。眼外肌和视神经的 Dice 评分相对较低,是因为它们在 CT 容积中出现频率较低,且仅存在于相对较少的 CT 层面中。然而,眼外肌和视神经的视觉相似性评分(分别为 0.65 和 0.80)高于其 Dice 评分。该结果表明分割的特异性较低。总体而言,SEQ-UNET 对所有眼眶亚结构分割的 Dice 评分和视觉相似性评分分别为 0.79 和 0.82。眼眶结构分割的视觉结果示例如图3所示。在图3A-C中,蓝色表示预测的分割结果,红色表示真实标签掩膜。在图3D中,红色、绿色和橙色分别表示眼球、眼外肌和神经的分割结果。

图1:半自动掩膜功能。 在眼眶CT扫描中使用(A)SmartPencil、(B)SmartFill 和(C)AutoCorrection 对眼球、眼外肌和视神经进行掩膜。眼球的掩膜由SmartPencil标记,该工具通过计算图像切片的超像素,并通过点击超像素生成掩膜。在点击部分眼球超像素后,可利用SmartFill计算出完整的眼球掩膜。在视神经掩膜过程中,通过AutoCorrection进行掩膜优化。蓝色标记的眼球显示在(A)和(B)中。请点击此处查看此图的放大版本。

图2:SEQ U-Net 网络架构。以序列化的二维切片作为输入和输出;在基于U-Net架构的编码和解码模块末端,分别引入两个双向C-LSTM。 请点击此处查看该图的放大版本。

图3:眼眶结构的分割结果。(A)眼球(标签1),(B)眼外肌(标签2),(C)视神经(标签3),以及(D)多标签(标签1、2和3)。左侧图像为眼眶的感兴趣容积(VOI),中间图像为预测的分割结果,右侧图像为真实标注。在(A)、(B)和(C)中,蓝色表示预测的分割结果,红色表示真实标注掩膜。在(D)中,红色、绿色和橙色分别表示眼球、眼外肌和视神经的分割结果。在眼球分割中,预测结果表现出较高的性能(DICE:0.86 vs. 0.82),但在眼外肌(DICE:0.54 vs. 0.65)和视神经(DICE:0.34 vs. 0.8)的分割中性能较低。请点击此处查看此图的放大版本。
| 多标签 | 标签 1(眼球) | 标签 2(眼外肌) | 标签 3(视神经) | |||||
| DICE | VS | DICE | VS | DICE | VS | DICE | VS | |
| SEQ-UNET | 0.79 | 0.82 | 0.86 | 0.83 | 0.54 | 0.65 | 0.34 | 0.8 |
表1:Dice分数与视觉相似性的分割结果。 眼球的切片数量相对较多,分割效果良好,DICE值达到0.8;但眼外肌和视神经由于切片数量少且呈线状,分割不完整,DICE值分别为0.54和0.34。, 分别。
视频 1:遮罩软件程序中的 SmartPencil 向导。 演示如何对多个像素进行眼球遮罩标注。通过单击聚集的超像素,即可一键完成遮罩任务。请点击此处下载该视频。
视频 2:掩膜软件程序中的 SmartFill 向导。 演示如何对多个像素进行眼球掩膜标注。在标注区域中选择部分像素后,该功能将生成与所选像素强度相似的完整分割掩膜。请点击此处下载该视频。
视频 3:掩膜软件程序中的自动校正。 演示如何使用预训练的卷积神经网络算法对被掩膜的像素进行自动校正。请点击此处下载该视频。
补充表1:掩膜、预处理和分割建模的运行环境(RTE)。 请点击此处下载该表格。
基于深度学习的医学图像分析已广泛应用于疾病检测。在眼科领域,检测和分割模型被用于糖尿病视网膜病变、青光眼、年龄相关性黄斑变性以及早产儿视网膜病变的研究。然而,由于难以获取大规模公开数据集用于深度学习分析,其他罕见疾病(尤其是眼科以外的疾病)尚未得到充分研究。在缺乏公开数据集的情况下应用该方法时,图像标注(掩膜)步骤不可避免,而这一过程通常耗时且劳动密集。然而,本文提出的掩膜步骤(方案部分,步骤1)可在短时间内实现高精度的掩膜生成。通过使用超像素和基于神经网络的填充方法——对低级图像特征相似的像素进行聚类——临床医生只需点击像素组即可完成标注,而无需逐个指定具体像素。此外,自动校正功能有助于进一步优化掩膜过程。该方法的高效性与有效性将有助于在医学研究中生成更多标注图像。
在预处理的多种方法中,提取感兴趣体积(VOI)和窗宽裁剪是有效的手段。本方案的第2步将介绍提取VOI和窗宽裁剪的方法。临床医生准备数据集时,从给定数据集中提取VOI是整个流程中最关键的步骤,因为大多数分割任务都集中在整幅医学图像中的小范围特定区域。关于VOI,通常根据位置对眼球、视神经和眼外肌区域进行裁剪,但更高效的VOI提取方法有望提升分割性能14。
在分割任务中,本研究采用了 SEQ-UNET 模型。三维医学图像具有较大的体积,因此深度神经网络模型需要较大的内存容量。在 SEQ-UNET 中,分割模型通过使用较少的切片数来实现,从而在不丢失三维信息特征的前提下减少所需的内存大小。
该模型使用了46个感兴趣体积(VOI)进行训练,这一数量在模型训练中并不算大。由于训练数据集数量较少,视神经和眼外肌分割的性能受到限制。迁移学习15和领域自适应8可能为提升分割性能提供解决方案。
本文介绍的完整分割流程不仅限于眼眶CT图像分割。高效的标注方法有助于为研究领域特有的应用创建新的医学图像数据集。GitHub上的Python代码涉及预处理和分割建模,通过调整裁剪区域、窗宽窗位、模型超参数(如连续切片数量、U-Net网络结构等),可将其应用于其他领域。
作者声明无利益冲突。
本研究由韩国国家研究基金会(NRF)资助,该基金会由韩国科学技术信息通信部(MSIT)提供资金支持(编号:2020R1C1C1010079)。对于CMC-ORBIT数据集,天主教医疗中心中央机构审查委员会(IRB)已提供批准(XC19REGI0076)。 本研究还获得了2022年弘益大学研究基金的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| GitHub 链接 | github.com/SleepyChild1005/OrbitSeg | ||
| MediLabel | INGRADIENT (首尔, 韩国) | 一种用于分割的医学图像标注软件,点击更少、速度更快 | |
| SEQ-UNET | 可从 GitHub 下载 | ||
| SmartFil | MediLabel 中的向导功能 | ||
| SmartPencil | MediLabel 中的向导功能 |