本方案介绍了一种双模态深度学习方法,用于在吲哚菁绿引导的腹腔镜胆囊切除术(ICGLC)过程中实时去除肝脏荧光。
方法文章
* These authors contributed equally
本方案介绍了一种双模态深度学习方法,用于在吲哚菁绿引导的腹腔镜胆囊切除术(ICGLC)过程中实时去除肝脏荧光。
吲哚菁绿引导的腹腔镜胆囊切除术(ICGLC)可改善胆道的可视化效果,但常受到肝脏荧光污染的限制,从而干扰解剖结构的识别。本研究旨在开发并评估一种新型双模态深度学习框架,以在ICGLC手术过程中实时自动检测并去除肝脏荧光污染。研究构建了一个包含来自48例接受择期ICGLC患者共33,123帧双模态手术图像的数据集。对荧光图像与白光图像进行融合并标注。比较了多种深度学习模型,最终选用基于DeepLabV3的中层融合网络。通过形态学后处理及分阶段训练策略,提升了分割的准确性与泛化能力。所提出的模型在最终测试集上达到了0.838的Dice系数和0.863的召回率。在主观评估中,10名资深外科医生一致认为经人工智能处理的视频画面更清晰,胆管可视化显著改善,视觉疲劳明显减轻。该模型实现了每帧0.018秒的实时处理性能。本研究首次提出用于ICGLC中肝脏荧光去除的实时人工智能解决方案。该双模态深度学习模型显著提高了视觉清晰度,有望提升手术安全性、操作效率及培训效果。未来需开展前瞻性研究以评估其对手术结局的临床影响。
胆石症是一种常见的胃肠道疾病,在全球不同人群中发病率持续较高,影响超过全球4%的人口1,2,3,4。腹腔镜胆囊切除术(LC)因其术中创伤小、术后疼痛轻、美容效果好及住院时间短等优势,被广泛视为治疗胆石症的“金标准”5,6,7。仅在美国,普通外科医生每年就实施75万至100万例LC手术。然而,LC的并发症发生率高于传统开腹手术8,其中胆管损伤(BDI)等严重并发症的发生率高出2至3倍9,10。研究表明,腹腔镜手术中BDI的发生常源于解剖分离阶段的技术错误,其中解剖结构误判尤为常见(高达85%),常涉及对胆总管(CBD)的误判或右后肝管解剖变异的识别错误11,12。
为了降低现代临床实践中手术并发症的发生率,已开发出一系列复杂的方法和先进技术,包括安全视野法(critical view of safety, CVS)、术中胆管造影术以及近红外荧光(near-infrared fluorescence, NIRF)技术5,8。目前,CVS 越来越被视为识别胆囊结构的标准方法5,13,14,该方法要求清除胆囊肝三角区的结缔组织,并解剖分离胆囊下三分之一与胆囊床之间的组织,以清晰显露胆囊管和胆囊动脉,从而在腹腔镜胆囊切除术中避免血管和胆道损伤11,15。
基于吲哚菁绿(ICG)的术中实时近红外荧光(NIRF)胆道造影是另一种已被证实有效的解决方案,其首次临床报道于2008年16。ICG 仅由肝脏代谢,与血浆蛋白结合,在近红外光照射下发射约830 nm的峰值波长光17。这一特性使得肝脏肿瘤和胆道系统得以显影,在提高手术安全性及缩短手术时间方面展现出良好的应用前景18,19,20。比较CVS联合NIRF与单独使用CVS的研究表明,该技术对肥胖患者及存在严重炎症的病例具有优势,不仅能缩短手术时间,还可降低胆道损伤(BDI)的发生率21,22。然而,其临床应用仍面临若干限制,包括使用多种成像设备23,以及ICG注射延迟或肝脏组织过度吸收导致肝脏荧光强度过高,从而污染视野,遮蔽关键的胆道系统显像24。若能在术中应用辅助技术,在保留正确胆道荧光显像的同时去除肝脏荧光干扰,则有望优化手术视野,进一步提升手术的安全性与顺利程度。
人工智能(AI)技术是优化荧光成像的有力工具。近年来,AI在医学影像和外科手术中的应用已成为研究热点,已实现多项技术突破和临床应用25,26,27。目前关于AI深度学习技术在腹腔镜手术视频中的研究与应用,多基于白光单模态图像,包括对各种解剖标志的识别,如喉返神经、肾脏边缘、血管和胆囊28,29,30,31。然而,目前尚缺乏针对荧光辅助腹腔镜胆囊切除术(LC)中肝脏荧光污染实时去除的研究。双模态图像分割技术已在工业领域广泛应用,有望填补这一空白。本研究旨在探索双模态图像分割在吲哚菁绿荧光腹腔镜胆囊切除术(ICGLC)场景中的应用,开发并验证用于肝脏过度荧光的实时动态识别与屏蔽的训练方法。
本研究中包含的所有手术视频均来自在中国医学科学院北京协和医院接受择期吲哚菁绿引导腹腔镜胆囊切除术(ICGLC)的患者。该研究已获得相关伦理委员会批准,并在入组前获得了所有参与者的知情同意。
1. 数据准备与图像标注
2. 模型评估指标



3. 形态学后处理
4. 训练环境与超参数
5. 三相模型训练
6. 手术视频处理
7. 肝脏荧光污染去除
8. 视频质量的临床评估
本研究回顾性纳入了2022年至2024年间在北京协和医院普通外科接受择期吲哚菁绿腹腔镜胆囊切除术(ICGLC)的48例患者。所有患者均在手术前20分钟静脉注射0.5 mg吲哚菁绿。术后病理检查证实,所有病例均诊断为结石性胆囊炎。
经过手动分割和筛选后,共获得76个视频片段。对于每个片段,将荧光和白光成像通道沿RGB通道进行拼接。以8:1的比例进行帧采样,最终得到包含33,123个融合荧光-白光帧的双模态手术视频数据集。该数据集被随机划分为三个子集,分别对应三个实验阶段。在每一阶段内,数据进一步以4:1的比例划分为训练集和测试集。
为了在当前主流算法中寻找双模态分割的最佳方案,我们开展了对比实验,涵盖了 DlinkNet34、Deeplabv3 和 U-Net 模型。DlinkNet34 融合了 LinkNet 与 DenseNet 的优势,专注于高效的特征重用以实现实时性能;Deeplabv3 采用空洞卷积,在不显著增加计算负担的前提下增强上下文信息的融合;而 U-Net 因其独特的对称结构,在医学图像分割中表现出色,能够有效结合低层特征图与高层特征图,实现精确的定位(图1)。在所评估的模型中,DeepLabv3-Res34 表现最优,取得了最高的 Dice 系数(0.872)和召回率(0.907),成为最佳选择(表1)。图2 直观展示了 Deeplabv3 在双模态分割任务中的能力,相较于 DlinkNet34 和 U-Net,其在图像边缘划分以及在低光照条件下准确识别特征方面展现出更优的适应性。
为了提高该模型的泛化能力,我们在原始 Deeplabv3 基础配置中引入了更多数据,但这导致 Dice 系数下降至 0.731。为解决这一问题,我们探讨了不同融合结构在双模态分割任务中对模型性能的影响。在模型比较阶段,所有实验均采用 Deeplabv3 基础方法进行。根据图形特征在算法结构中的融合位置,共测试了四种不同方案。结果表明,中层融合(mid-fusion)结构最适用于双模态分割任务,其 Dice 分数、精确率和召回率分别提升至 0.800、0.919 和 0.825。相比之下,其他方案如早期融合(early-fusion)方法效果不理想,Dice 系数仅为 0.762。在实施 DeepLabv3 中层融合方案并进一步进行数据增强后,模型性能进一步提升,Dice 分数上升至 0.815(表 2)。图 3 展示了中层融合方法所取得的显著改进,尤其体现在对图像边界处肝脏的准确分割以及对光照较暗区域肝脏的精准识别。该优选方案随后在第三阶段(包含未对齐数据集)中进行了验证。经过三个阶段的优化,模型的性能与泛化能力显著增强,Dice 系数和召回率均有所提高,分别达到 0.838 和 0.863(表 2)。如 图 4 所示,该模型能够在 Calot 三角未解剖、存在器械遮挡或解剖结构异常的情况下,仍准确去除肝脏荧光信号,同时保留胆管的可视化效果。
在主观评估方面,我们随机选取了2024年在北京协和医院普通外科进行的选择性ICGLC手术中的一例病例。随后,对该视频采用相同的8:1帧采样方法进行处理,并将所得帧输入本研究提出的方法模型中进行处理。
所有10名普通外科医生对经人工智能处理的手术视频均给予了高度积极的评价(表3)。特别是,肝脏荧光污染的评分从原始视频的3.25 ± 0.67显著提高到人工智能处理视频的9.15 ± 0.81,表明该模型有效减少了背景荧光干扰,增强了胆道解剖结构的清晰度。
每帧的平均处理时间为0.018秒,表明我们模型的高效性,并提示其在未来术中应用中具有实现实时手术视频处理的潜力。

图1神经网络结构. (AD-LinkNet 网络结构本质上是对 U-Net 架构的改进。 (B底部右图所示的空洞卷积结构用于扩展网络的感受野。CDeepLabv3 引入了ASPP(空洞空间金字塔池化)模块,以提升对图像中不同尺度物体的分割能力。D以 DeepLabv3 作为基础网络,采用四种不同的融合方法,依据特征拼接的位置分为:基础融合、早期融合(在主干网络之前拼接特征)、中期融合(在主干网络之后、ASPP 之前拼接特征)和晚期融合(在 ASPP 之后拼接特征)。 请点击此处以查看此图的放大版本。

图2: 不同模型的识别结果。图中绿色框表示预测值,红色框表示真实标注。可以观察到,DeepLabv3 取得了最佳效果,因其能够更有效地检测边缘处的小目标,并提供更完整的分割边界。此外,在荧光强度较暗的区域,其检测能力也有所提升。WL,白光通道;FL,荧光通道。 请点击此处查看该图的放大版本。

图3: 中层融合方法的改进效果如图所示。图中,绿色框表示预测值,红色框表示真实标注。(A)该模型在识别图像边缘方面表现出更强的能力。(B)该模型对较暗区域的检测能力更强。(C)该模型对肝脏荧光范围的界定更加准确。请点击此处查看该图的放大版本。

图4:肝脏荧光去除效果示意图,展示了三种由模型预测实现肝脏荧光遮蔽的不同图像示例。(A)未解剖的胆管。胆囊三角尚未解剖,但脂肪层下方的胆管成像已成功保留。(B)器械遮挡。尽管受到手术器械遮挡,仍实现了背景肝脏荧光污染的去除。(C)解剖结构变异。左右肝管分叉位置较低,异常的右肝管成像未被遮蔽。请点击此处查看该图的高清版本。
| 不同模型实验的比较 * | 模型 | 计算负载 (GFlops) | 参数 | Dice | 精确率 | 召回率 |
| 双模态 | DlinkNet34 | 66.66 | 3.10 × 107 | 0.838 | 0.904 | 0.872 |
| 分割 | DeepLabv3-Res34 | 66.94 | 2.54 × 107 | 0.872 | 0.906 | 0.894 |
| Unet-Res34 | 73.98 | 1.25 × 107 | 0.74 | 0.845 | 0.807 |
表1:不同模型实验的比较。*使用25 × 25的核大小进行后处理,IoU阈值 = 0.1
| 不同融合策略的实验结果* | Dice | 精确率 |
| 基础模型:DeepLabv3 | 0.731 | 0.897 |
| DeepLabv3 早期融合 | 0.762 | 0.856 |
| DeepLabv3 中期融合 | 0.8 | 0.919 |
| DeepLabv3 晚期融合 | 0.787 | 0.876 |
| 第3阶段 | 0.838 | 0.912 |
表2:不同融合策略的实验结果。*使用25×25的核大小进行后处理,IoU阈值 = 0.1。
| 评估项目 | 原始视频 | AI处理视频 |
| 肝脏荧光污染 | 3.25 ± 0.67 | 9.15 ± 0.81 |
| 胆管识别难易程度 | 5.24 ± 0.55 | 8.73 ± 0.36 |
| 手术中使用的意愿 | 4.36 ± 0.83 | 9.05 ± 0.47 |
| 眼部疲劳程度 | 2.37 ± 0.26 | 8.84 ± 0.48 |
| 对手术学习的帮助性 | 4.52 ± 0.86 | 9.13 ± 0.69 |
| *平均分(±标准差)(评分范围1-10) | ||
表3:临床评估问卷结果。
本研究利用人工智能深度学习技术,解决ICGLC手术中的一项关键挑战:识别并屏蔽肝脏荧光污染。使用近红外荧光(NIRF)技术的外科医生常报告,肝脏自发荧光会引起视觉疲劳,并干扰胆道成像38。通过应用计算机视觉技术,本研究旨在减轻这些问题,并有望降低胆管损伤(BDI)的发生率,后者是ICGLC手术中常见的并发症。该模型处理单帧图像的推理时间约为0.018秒,相当于每秒约56帧(fps),超过24 fps的视频标准。
尽管先前的研究(如 Patrick A. Boland39 和 Niall P. Hardy37,38 的研究)主要将人工智能应用于荧光成像,以分析强度-时间曲线来区分肿瘤的恶性程度,但本研究采用了一种新颖的方法以拓展其应用范围。据我们所知,该项研究首次尝试整合白光与荧光通道,用于双模态分割训练。
为了提高准确性,我们测试了多种融合策略,发现将中层融合应用于主干结构之后,显著提升了肝脏荧光识别的准确率。该调整使 Dice 系数从 0.731 提高到 0.800,召回率从 0.732 提升至 0.825,精确率达到 0.919(表 2)。值得注意的是,在模型泛化阶段,通过增加数据丰富性并降低过拟合风险,进一步提升了模型性能,从而使其适用于更广泛的应用场景。
本研究代表了采用分阶段实验方法对肝脏荧光进行双模态分割的首次探索。我们在方案设计和模型训练方面的策略可为临床从业者在不同场景下开展荧光与白光双模态分割研究提供有价值的参考。
在主观临床评估中,经人工智能处理的视频评分显著高于原始未处理版本。值得注意的是,所有10名参与的外科医生均表示,该方法有助于手术学习,应考虑在未来临床实践中推广应用。这些发现表明,在吲哚菁绿荧光腹腔镜手术(ICGLC)中应用基于人工智能的实时荧光滤波技术,可能提高手术安全性、增强操作效率,并缩短低年资外科医生的学习曲线。
本研究存在一些局限性,有待未来研究进一步改进。分析基于中国北京协和医院48例患者的视频数据,可能限制了模型的普适性。扩大样本量、采用多中心研究方法以及提高各影像通道之间的一致性,有望增强模型的稳健性。此外,纳入肝硬化和脂肪肝等更多病例类型,可进一步拓宽其适用范围。尽管该模型展现出良好前景并获得积极反馈,但其在真实临床环境中的实际影响,例如是否能够缩短手术时间、减少胆管损伤等,仍有待进一步验证。另外,由于本研究的标注目标为肝组织荧光,周围结缔组织上的荧光污染尚未被检测和去除,这可能仍会对术野的可视性造成一定影响。
综上所述,本研究首次尝试将深度学习技术应用于涉及ICGLC手术视频中肝脏荧光的双模态图像分割任务。我们构建了一个神经网络模型,并提出了一种最优的双模态分析方案,成功实现了对肝脏荧光污染的自动识别与掩膜。该方法有望帮助外科医生更轻松地定位胆管荧光,从而降低胆管损伤(BDI)的风险。此外,本研究还探索了双模态分割模型的训练策略,为未来在更多手术场景中推进双模态分割技术的发展奠定了基础。
作者声明无利益冲突。
本工作得到中国国家高水平医院临床研究基金(编号:2022-PUMCH-B-003)、中国医学科学院医学科学创新基金(2023-I2M-2-002)和国家高水平医院临床研究基金(2022-PUMCH-D-001)的资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 4K 荧光成像控制台 | Hangzhou Kangji Medical instrument Co. Ltd. | KJ-EP4K-01 | 提供三种成像模式:白光、荧光和融合荧光;支持人工智能模块扩展 |
| 4K 荧光摄像头 | Hangzhou Kangji Medical instrument Co. Ltd. | KJ-EC-4K | 全数字化摄像头,配备多功能按钮设置;支持视频录制、拍照和荧光模式切换 |
| 冷光源系统 | Hangzhou Kangji Medical instrument Co. Ltd. | KJ-CLS-1 | LED 冷光源及荧光 LED 光源,荧光波长为 808 nm |
| NVIDIA A100 Tensor Core | NVIDIA Corporation | 900-21001-0020-100 | GPU |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可