方法文章

一种用于实时去除吲哚菁绿引导腹腔镜胆囊切除术中肝脏荧光的新型双模态深度学习方法

157 次观看

DOI:

10.3791/68488

2026年4月17日

 ,  ,  ,  ,  ,  ,  ,  ,  , 

通讯作者: Xianlin Han <hanxianlin@pumch.cn>, Surong Hua <huasurong@tsinghua.org.cn>

* These authors contributed equally

本文内容

摘要

本方案介绍了一种双模态深度学习方法,用于在吲哚菁绿引导的腹腔镜胆囊切除术(ICGLC)过程中实时去除肝脏荧光。

摘要

吲哚菁绿引导的腹腔镜胆囊切除术(ICGLC)可改善胆道的可视化效果,但常受到肝脏荧光污染的限制,从而干扰解剖结构的识别。本研究旨在开发并评估一种新型双模态深度学习框架,以在ICGLC手术过程中实时自动检测并去除肝脏荧光污染。研究构建了一个包含来自48例接受择期ICGLC患者共33,123帧双模态手术图像的数据集。对荧光图像与白光图像进行融合并标注。比较了多种深度学习模型,最终选用基于DeepLabV3的中层融合网络。通过形态学后处理及分阶段训练策略,提升了分割的准确性与泛化能力。所提出的模型在最终测试集上达到了0.838的Dice系数和0.863的召回率。在主观评估中,10名资深外科医生一致认为经人工智能处理的视频画面更清晰,胆管可视化显著改善,视觉疲劳明显减轻。该模型实现了每帧0.018秒的实时处理性能。本研究首次提出用于ICGLC中肝脏荧光去除的实时人工智能解决方案。该双模态深度学习模型显著提高了视觉清晰度,有望提升手术安全性、操作效率及培训效果。未来需开展前瞻性研究以评估其对手术结局的临床影响。

引言

胆石症是一种常见的胃肠道疾病,在全球不同人群中发病率持续较高,影响超过全球4%的人口1,2,3,4。腹腔镜胆囊切除术(LC)因其术中创伤小、术后疼痛轻、美容效果好及住院时间短等优势,被广泛视为治疗胆石症的“金标准”5,6,7。仅在美国,普通外科医生每年就实施75万至100万例LC手术。然而,LC的并发症发生率高于传统开腹手术8,其中胆管损伤(BDI)等严重并发症的发生率高出2至3倍9,10。研究表明,腹腔镜手术中BDI的发生常源于解剖分离阶段的技术错误,其中解剖结构误判尤为常见(高达85%),常涉及对胆总管(CBD)的误判或右后肝管解剖变异的识别错误11,12

为了降低现代临床实践中手术并发症的发生率,已开发出一系列复杂的方法和先进技术,包括安全视野法(critical view of safety, CVS)、术中胆管造影术以及近红外荧光(near-infrared fluorescence, NIRF)技术5,8。目前,CVS 越来越被视为识别胆囊结构的标准方法5,13,14,该方法要求清除胆囊肝三角区的结缔组织,并解剖分离胆囊下三分之一与胆囊床之间的组织,以清晰显露胆囊管和胆囊动脉,从而在腹腔镜胆囊切除术中避免血管和胆道损伤11,15

基于吲哚菁绿(ICG)的术中实时近红外荧光(NIRF)胆道造影是另一种已被证实有效的解决方案,其首次临床报道于2008年16。ICG 仅由肝脏代谢,与血浆蛋白结合,在近红外光照射下发射约830 nm的峰值波长光17。这一特性使得肝脏肿瘤和胆道系统得以显影,在提高手术安全性及缩短手术时间方面展现出良好的应用前景18,19,20。比较CVS联合NIRF与单独使用CVS的研究表明,该技术对肥胖患者及存在严重炎症的病例具有优势,不仅能缩短手术时间,还可降低胆道损伤(BDI)的发生率21,22。然而,其临床应用仍面临若干限制,包括使用多种成像设备23,以及ICG注射延迟或肝脏组织过度吸收导致肝脏荧光强度过高,从而污染视野,遮蔽关键的胆道系统显像24。若能在术中应用辅助技术,在保留正确胆道荧光显像的同时去除肝脏荧光干扰,则有望优化手术视野,进一步提升手术的安全性与顺利程度。

人工智能(AI)技术是优化荧光成像的有力工具。近年来,AI在医学影像和外科手术中的应用已成为研究热点,已实现多项技术突破和临床应用25,26,27。目前关于AI深度学习技术在腹腔镜手术视频中的研究与应用,多基于白光单模态图像,包括对各种解剖标志的识别,如喉返神经、肾脏边缘、血管和胆囊28,29,30,31。然而,目前尚缺乏针对荧光辅助腹腔镜胆囊切除术(LC)中肝脏荧光污染实时去除的研究。双模态图像分割技术已在工业领域广泛应用,有望填补这一空白。本研究旨在探索双模态图像分割在吲哚菁绿荧光腹腔镜胆囊切除术(ICGLC)场景中的应用,开发并验证用于肝脏过度荧光的实时动态识别与屏蔽的训练方法。

方案

本研究中包含的所有手术视频均来自在中国医学科学院北京协和医院接受择期吲哚菁绿引导腹腔镜胆囊切除术(ICGLC)的患者。该研究已获得相关伦理委员会批准,并在入组前获得了所有参与者的知情同意。

1. 数据准备与图像标注

  1. 回顾性收集2022年至2024年间在中国医学科学院北京协和医院接受ICGLC手术的48例患者的手术视频。
    注:本研究纳入的患者均在手术前20分钟静脉注射0.5 mg ICG。
  2. 指派一名普通外科医生审阅所有手术视频,并提取涵盖Calot三角关键解剖步骤的视频片段。手动选取76个聚焦于Calot三角解剖的手术视频片段。从每个片段中提取荧光成像和白光成像通道,并沿RGB通道进行拼接。
  3. 为减少冗余,以8:1的间隔采样帧图像,将分辨率从1920 × 1080降低至960 × 540,并将图像导入自定义标注平台。
  4. 指派一名普通外科医生手动勾画肝脏荧光轮廓,并由高年资外科医生监督以确保标注质量。

2. 模型评估指标

  1. 基于指定的测试数据集,使用标准的计算机视觉指标(包括精确率、召回率和 Dice 系数)评估模型的分割性能。
  2. 通过测量推理过程中的计算负载来评估实时性能。
    1. 使用 Python/C 标准库中的 time 模块测量推理时间。
    2. 在数据加载前调用 time.perf_counter() 记录起始时间戳。
    3. 在模型生成预测结果后再次调用 time.perf_counter() 以获取结束时间戳。
    4. 将结束时间戳与起始时间戳的差值定义为单个样本的推理时间。
    5. 对测试数据集中的每个样本重复此过程,并计算所有样本的平均推理时间,以表示模型的整体推理延迟。
    6. 参考以下总结该流程的伪代码:
      初始化 Inference_time = 0 且 ind = 0
      设 X 表示测试集存储路径,model 表示推理模型
      对于 X 中的每个 x_path:
      同步 CPU 与 GPU
      Start_timestamp = time.perf_counter() # 起始时间戳
      x = load(x_path) # 数据加载
      y = model(x) # 模型推理
      同步 CPU 与 GPU
      End_timestamp = time.perf_counter() # 结束时间戳
      Inference_time += (end_timestamp - start_timestamp)
      ind += 1
      结束循环
      Inference_time = Inference_time / ind # 平均推理时间
  3. 将肝胆荧光识别的主要目标设定为检测手术视野内的肝脏区域,并替换相应的白光信息,从而最大限度地减少肝荧光的干扰。
  4. 使用交并比(Intersection over Union, IoU)来量化模型的预测准确性。
    注:交并比(IoU)定义为预测正区域与真实正区域重叠区域的像素数与这两个区域并集总像素数的比值。
  5. 若预测结果与真实标签的 IoU 超过指定阈值,则定义该预测为真阳性(True Positive, TP);否则将其归类为假阴性(False Negative, FN)。
  6. 将任何无对应标注的预测分割标记为假阳性(False Positive, FP)。
  7. 在计算预测结果与真实标签之间的交并比(IoU)后,将 IoU 阈值设为 0.1,以考虑手术成像中荧光信号弥散且对比度低的特性。
  8. 定义并计算以下评估指标:
    精确率公式;Precision = True Positive / (True Positive + False Positive);统计公式。
    召回率公式示意图,用于评估分类模型性能的指标。
    Dice 系数公式;用于图像分割准确性分析的数学公式。

3. 形态学后处理

  1. 使用基于插值的方法( specifically 为双线性插值),将所有肝胆荧光帧从 1920 × 1080 下采样至 960 × 540 分辨率。
  2. 沿宽度方向应用零填充,生成一个 960 × 544 的全零矩阵,并将当前图像居中放置其中,以获得最终输入尺寸 960 × 544。
  3. 通过在 PyTorch 框架构建的张量中按顺序存储白光图像和荧光图像对应的矩阵,沿通道维度将二者拼接,然后输入模型。
  4. 为减少噪声预测并优化边界质量,对初始分割输出执行形态学开运算和闭运算,以滤除虚假噪声并改善边缘轮廓。
  5. 首先进行开运算,以消除预测掩膜中的小突起和边缘伪影32
  6. 随后进行闭运算,以去除孤立的孔洞和碎片化区域。
  7. 两种操作均使用 25 × 25 的结构元素核,以确保有效优化器官边界并降低分割噪声。

4. 训练环境与超参数

  1. 使用单个 NVIDIA A100 Tensor Core GPU 训练模型。
  2. 将批量大小设置为 16。
  3. 使用 ImageNet33 预训练权重初始化编码器(主干网络),以利用迁移学习并加速收敛。
  4. 采用随机梯度下降(Stochastic Gradient Descent, SGD)34 优化器,因其在大规模图像分割任务中具有鲁棒性,并能有效缓解噪声梯度的影响。
  5. 将初始学习率设为 0.01,并采用多项式衰减策略逐步降低学习率,下限为 0.0001。
  6. 持续训练共计 50,000 次迭代,以获得最终模型。

5. 三相模型训练

  1. 在模型选择阶段,使用双模态输入比较多种分割模型,包括 DeeplabV335、DLinkNet3436 和 U-Net37;根据分割精度和计算效率选择最优模型。
  2. 在算法结构优化阶段,研究网络中不同的特征融合位置,以确定白光与荧光数据最有效的融合策略。
  3. 在泛化与临床验证阶段,应用渐进式数据增强技术以提高模型鲁棒性;在临床场景中验证最终模型,评估其实际应用能力。

6. 手术视频处理

  1. 提取显示术中吲哚菁绿(ICG)荧光可视化胆道解剖结构的视频片段,包括胆总管(CBD)和胆囊管。
  2. 使用最优模型对选定的视频进行实时处理;计算每帧的平均处理时间,以评估实时计算性能。

7. 肝脏荧光污染去除

  1. 在ICGLC手术过程中,应用该模型实时检测并抑制肝脏荧光污染。
  2. 确保保留胆道结构的可视化,以有效识别胆管。
  3. 即使在术中常见干扰(如器械遮挡或摄像头移动)情况下,仍保持对污染的有效抑制性能。

8. 视频质量的临床评估

  1. 从外部机构招募10名高级普通外科医生组成专家组,对经人工智能处理的视频效果进行评估。
  2. 向每位外科医生提供原始视频和经人工智能增强的视频片段,并指导他们根据五个预定义的评估标准完成主观评估问卷。

结果

本研究回顾性纳入了2022年至2024年间在北京协和医院普通外科接受择期吲哚菁绿腹腔镜胆囊切除术(ICGLC)的48例患者。所有患者均在手术前20分钟静脉注射0.5 mg吲哚菁绿。术后病理检查证实,所有病例均诊断为结石性胆囊炎。

经过手动分割和筛选后,共获得76个视频片段。对于每个片段,将荧光和白光成像通道沿RGB通道进行拼接。以8:1的比例进行帧采样,最终得到包含33,123个融合荧光-白光帧的双模态手术视频数据集。该数据集被随机划分为三个子集,分别对应三个实验阶段。在每一阶段内,数据进一步以4:1的比例划分为训练集和测试集。

为了在当前主流算法中寻找双模态分割的最佳方案,我们开展了对比实验,涵盖了 DlinkNet34、Deeplabv3 和 U-Net 模型。DlinkNet34 融合了 LinkNet 与 DenseNet 的优势,专注于高效的特征重用以实现实时性能;Deeplabv3 采用空洞卷积,在不显著增加计算负担的前提下增强上下文信息的融合;而 U-Net 因其独特的对称结构,在医学图像分割中表现出色,能够有效结合低层特征图与高层特征图,实现精确的定位(图1)。在所评估的模型中,DeepLabv3-Res34 表现最优,取得了最高的 Dice 系数(0.872)和召回率(0.907),成为最佳选择(表1)。图2 直观展示了 Deeplabv3 在双模态分割任务中的能力,相较于 DlinkNet34 和 U-Net,其在图像边缘划分以及在低光照条件下准确识别特征方面展现出更优的适应性。

为了提高该模型的泛化能力,我们在原始 Deeplabv3 基础配置中引入了更多数据,但这导致 Dice 系数下降至 0.731。为解决这一问题,我们探讨了不同融合结构在双模态分割任务中对模型性能的影响。在模型比较阶段,所有实验均采用 Deeplabv3 基础方法进行。根据图形特征在算法结构中的融合位置,共测试了四种不同方案。结果表明,中层融合(mid-fusion)结构最适用于双模态分割任务,其 Dice 分数、精确率和召回率分别提升至 0.800、0.919 和 0.825。相比之下,其他方案如早期融合(early-fusion)方法效果不理想,Dice 系数仅为 0.762。在实施 DeepLabv3 中层融合方案并进一步进行数据增强后,模型性能进一步提升,Dice 分数上升至 0.815(表 2)。图 3 展示了中层融合方法所取得的显著改进,尤其体现在对图像边界处肝脏的准确分割以及对光照较暗区域肝脏的精准识别。该优选方案随后在第三阶段(包含未对齐数据集)中进行了验证。经过三个阶段的优化,模型的性能与泛化能力显著增强,Dice 系数和召回率均有所提高,分别达到 0.838 和 0.863(表 2)。如 图 4 所示,该模型能够在 Calot 三角未解剖、存在器械遮挡或解剖结构异常的情况下,仍准确去除肝脏荧光信号,同时保留胆管的可视化效果。

在主观评估方面,我们随机选取了2024年在北京协和医院普通外科进行的选择性ICGLC手术中的一例病例。随后,对该视频采用相同的8:1帧采样方法进行处理,并将所得帧输入本研究提出的方法模型中进行处理。

所有10名普通外科医生对经人工智能处理的手术视频均给予了高度积极的评价(表3)。特别是,肝脏荧光污染的评分从原始视频的3.25 ± 0.67显著提高到人工智能处理视频的9.15 ± 0.81,表明该模型有效减少了背景荧光干扰,增强了胆道解剖结构的清晰度。

每帧的平均处理时间为0.018秒,表明我们模型的高效性,并提示其在未来术中应用中具有实现实时手术视频处理的潜力。

Deep learning segmentation diagram with ResNet34 backbone, pooling, upsampling, ASPP, and prediction.
图1神经网络结构. (AD-LinkNet 网络结构本质上是对 U-Net 架构的改进。 (B底部右图所示的空洞卷积结构用于扩展网络的感受野。CDeepLabv3 引入了ASPP(空洞空间金字塔池化)模块,以提升对图像中不同尺度物体的分割能力。D以 DeepLabv3 作为基础网络,采用四种不同的融合方法,依据特征拼接的位置分为:基础融合、早期融合(在主干网络之前拼接特征)、中期融合(在主干网络之后、ASPP 之前拼接特征)和晚期融合(在 ASPP 之后拼接特征)。 请点击此处以查看此图的放大版本。

不同模型识别结果对比示意图;U-Net、DeepLabv3、D-LinkNet;白光与荧光成像。
图2 不同模型的识别结果。图中绿色框表示预测值,红色框表示真实标注。可以观察到,DeepLabv3 取得了最佳效果,因其能够更有效地检测边缘处的小目标,并提供更完整的分割边界。此外,在荧光强度较暗的区域,其检测能力也有所提升。WL,白光通道;FL,荧光通道。 请点击此处查看该图的放大版本。

医学图像分割;U-Net、DeepLabv3、D-LinkNet 对比;手术视野,WL/FL 分析。
图3 中层融合方法的改进效果如图所示。图中,绿色框表示预测值,红色框表示真实标注。(A)该模型在识别图像边缘方面表现出更强的能力。(B)该模型对较暗区域的检测能力更强。(C)该模型对肝脏荧光范围的界定更加准确。请点击此处查看该图的放大版本

荧光成像示意图;以序列形式展示荧光融合与切除的肝脏手术过程。
图4:肝脏荧光去除效果示意图,展示了三种由模型预测实现肝脏荧光遮蔽的不同图像示例。(A)未解剖的胆管。胆囊三角尚未解剖,但脂肪层下方的胆管成像已成功保留。(B)器械遮挡。尽管受到手术器械遮挡,仍实现了背景肝脏荧光污染的去除。(C)解剖结构变异。左右肝管分叉位置较低,异常的右肝管成像未被遮蔽。请点击此处查看该图的高清版本。

不同模型实验的比较 *模型计算负载 (GFlops)参数Dice精确率召回率
双模态DlinkNet3466.663.10 × 1070.8380.9040.872
分割DeepLabv3-Res3466.942.54 × 1070.8720.9060.894
Unet-Res3473.981.25 × 1070.740.8450.807

表1:不同模型实验的比较。*使用25 × 25的核大小进行后处理,IoU阈值 = 0.1

不同融合策略的实验结果*Dice精确率
基础模型:DeepLabv30.7310.897
DeepLabv3 早期融合0.7620.856
DeepLabv3 中期融合0.80.919
DeepLabv3 晚期融合0.7870.876
第3阶段0.8380.912

表2:不同融合策略的实验结果。*使用25×25的核大小进行后处理,IoU阈值 = 0.1。

评估项目原始视频AI处理视频
肝脏荧光污染3.25 ± 0.679.15 ± 0.81
胆管识别难易程度5.24 ± 0.558.73 ± 0.36
手术中使用的意愿4.36 ± 0.839.05 ± 0.47
眼部疲劳程度2.37 ± 0.268.84 ± 0.48
对手术学习的帮助性4.52 ± 0.869.13 ± 0.69
*平均分(±标准差)(评分范围1-10)

表3:临床评估问卷结果。

讨论

本研究利用人工智能深度学习技术,解决ICGLC手术中的一项关键挑战:识别并屏蔽肝脏荧光污染。使用近红外荧光(NIRF)技术的外科医生常报告,肝脏自发荧光会引起视觉疲劳,并干扰胆道成像38。通过应用计算机视觉技术,本研究旨在减轻这些问题,并有望降低胆管损伤(BDI)的发生率,后者是ICGLC手术中常见的并发症。该模型处理单帧图像的推理时间约为0.018秒,相当于每秒约56帧(fps),超过24 fps的视频标准。

尽管先前的研究(如 Patrick A. Boland39 和 Niall P. Hardy37,38 的研究)主要将人工智能应用于荧光成像,以分析强度-时间曲线来区分肿瘤的恶性程度,但本研究采用了一种新颖的方法以拓展其应用范围。据我们所知,该项研究首次尝试整合白光与荧光通道,用于双模态分割训练。

为了提高准确性,我们测试了多种融合策略,发现将中层融合应用于主干结构之后,显著提升了肝脏荧光识别的准确率。该调整使 Dice 系数从 0.731 提高到 0.800,召回率从 0.732 提升至 0.825,精确率达到 0.919(表 2)。值得注意的是,在模型泛化阶段,通过增加数据丰富性并降低过拟合风险,进一步提升了模型性能,从而使其适用于更广泛的应用场景。

本研究代表了采用分阶段实验方法对肝脏荧光进行双模态分割的首次探索。我们在方案设计和模型训练方面的策略可为临床从业者在不同场景下开展荧光与白光双模态分割研究提供有价值的参考。

在主观临床评估中,经人工智能处理的视频评分显著高于原始未处理版本。值得注意的是,所有10名参与的外科医生均表示,该方法有助于手术学习,应考虑在未来临床实践中推广应用。这些发现表明,在吲哚菁绿荧光腹腔镜手术(ICGLC)中应用基于人工智能的实时荧光滤波技术,可能提高手术安全性、增强操作效率,并缩短低年资外科医生的学习曲线。

本研究存在一些局限性,有待未来研究进一步改进。分析基于中国北京协和医院48例患者的视频数据,可能限制了模型的普适性。扩大样本量、采用多中心研究方法以及提高各影像通道之间的一致性,有望增强模型的稳健性。此外,纳入肝硬化和脂肪肝等更多病例类型,可进一步拓宽其适用范围。尽管该模型展现出良好前景并获得积极反馈,但其在真实临床环境中的实际影响,例如是否能够缩短手术时间、减少胆管损伤等,仍有待进一步验证。另外,由于本研究的标注目标为肝组织荧光,周围结缔组织上的荧光污染尚未被检测和去除,这可能仍会对术野的可视性造成一定影响。

综上所述,本研究首次尝试将深度学习技术应用于涉及ICGLC手术视频中肝脏荧光的双模态图像分割任务。我们构建了一个神经网络模型,并提出了一种最优的双模态分析方案,成功实现了对肝脏荧光污染的自动识别与掩膜。该方法有望帮助外科医生更轻松地定位胆管荧光,从而降低胆管损伤(BDI)的风险。此外,本研究还探索了双模态分割模型的训练策略,为未来在更多手术场景中推进双模态分割技术的发展奠定了基础。

披露

作者声明无利益冲突。

致谢

本工作得到中国国家高水平医院临床研究基金(编号:2022-PUMCH-B-003)、中国医学科学院医学科学创新基金(2023-I2M-2-002)和国家高水平医院临床研究基金(2022-PUMCH-D-001)的资助。

材料

本文使用的材料清单
姓名公司目录编号评论
4K 荧光成像控制台Hangzhou Kangji Medical instrument Co. Ltd.KJ-EP4K-01提供三种成像模式:白光、荧光和融合荧光;支持人工智能模块扩展
4K 荧光摄像头Hangzhou Kangji Medical instrument Co. Ltd.KJ-EC-4K全数字化摄像头,配备多功能按钮设置;支持视频录制、拍照和荧光模式切换
冷光源系统Hangzhou Kangji Medical instrument Co. Ltd.KJ-CLS-1LED 冷光源及荧光 LED 光源,荧光波长为 808 nm
NVIDIA A100 Tensor CoreNVIDIA Corporation900-21001-0020-100GPU

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

DeepLabV3
视频即将推出

相关文章