需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

基于深度学习的白内障手术视频时空分析用于手术风险评估

150 次观看

DOI:

10.3791/70025

2026年5月15日

 ,  , 

通讯作者: Chengsheng Gu <gcsgyzxyy@sina.cn>

本文内容

摘要

本研究提出了一种基于深度学习的流程,用于通过条件生成对抗网络(cGAN)预处理、分割、图卷积网络(GCN)、自适应空间特征优化(ASFO)和Transformer建模,从术中显微镜视频中预测手术风险。该方法在CaDIS和SICS-105数据集上实现了高性能,但由于标签为间接标注,临床有效性受到一定限制。

摘要

玻璃体切除术后的并发症仍然是手术中面临的重要挑战,常导致视力预后不良和需要重复干预。本研究提出了一种基于深度学习的框架,通过从术中显微镜视频中提取时空特征来预测手术风险。在预处理阶段,采用包括运动稳定、光照归一化以及基于条件生成对抗网络(cGAN)的伪影抑制在内的视频增强技术,以提高输入质量。采用轮廓自适应分割方法界定相关手术区域,随后利用图卷积网络进行结构感知的特征提取。集成自适应向日葵优化算法以优化特征选择,并采用基于Transformer的模型捕捉时间依赖性,实现最终的风险预测。该框架在两个公开数据集CaDIS和SICS-105上进行了评估。在CaDIS数据集上,模型达到了98.9%的准确率、97.5%的精确率、98.2%的召回率、97.9%的F1分数以及98.1%的AUC值。此外,分割模块实现了98.9%的像素准确率、98.5%的类别平均准确率和96.6%的平均交并比(mIoU)。在SICS-105数据集上,模型达到了99.1%的准确率、98.5%的F1分数、98.7%的灵敏度、98.7%的特异度以及99.10%的ROC曲线下面积(AUC)。这些结果表明,与基线模型相比具有持续的性能提升。总体而言,结合GAN增强的预处理、基于图的特征学习、优化策略与Transformer建模,显著提高了预测的可靠性。该方法凸显了术中视频分析在实现实时临床决策支持和改进术后风险分层方面的潜力。

引言

玻璃体切除术(pars plana vitrectomy, PPV)是治疗多种玻璃体视网膜疾病(包括视网膜脱离、糖尿病性视网膜病变、黄斑裂孔和玻璃体积血)外科手术的基础1。尽管手术器械和可视化技术不断进步,术后并发症仍是重要的致病因素,其后果从轻微的视觉干扰到威胁视力的事件不等,例如复发性视网膜脱离、眼内炎或无法控制的眼内压2。在临床实践中,识别具有较高并发症风险的患者仍是一项尚未满足的重要需求,因为这有助于制定更科学的手术计划、实施个体化的术后护理以及及时干预3。传统上,PPV的风险评估依赖于静态的术前因素(如合并症和术前眼部状况)以及术者主观的术中判断4,5,6,7。此外,近年来的玻璃体切除手术通常以高分辨率手术显微镜视频形式被广泛记录,这些视频提供了丰富但尚未充分利用的数据来源。这些录像不仅捕捉了解剖和病理特征,还记录了术者与组织的相互作用、术中事件以及手术操作动作,而这些信息可能对后续并发症具有预测价值8,9

访问受限。请登录或开始试用以查看此内容。

方案

本研究使用的 CaDIS 和 SICS-105 数据集为公开数据集,最初在获得机构审查委员会批准并取得知情同意后收集,相关信息见于各自发表的文献。本研究仅对完全匿名化的数据进行二次分析,因此无需额外的伦理审批或知情同意。

该建议的模型旨在通过利用术中显微镜视频中的时空模式来预测术后玻璃体切除术并发症。该流程包括四个主要阶段:预处理、分割、特征提取、特征优化和分类,如图1所示。

术中对术后并发症风险的评估是本研究的预测目标。由于CaDIS和SICS-105数据集缺乏纵向随访数据,该模型无法预测特定时间窗口内经临床确认的术后事件。相反,它利用术中手术模式来推断可能出现问题的概率。在此背景下,“"并发症"的操作性定义包括异常的手术阶段转换、异常的器械-组织交互以及与更高手术复杂性相关的手术流程变异。为确保可解释性和可靠评估,该预测任务被设计为一个二分类问题,将病例分为低风险和高风险两组。这种设计使所提出的框架并非作为直接的临床诊断系统,而是作为术中决策支持工具发挥作用。

数据集描述:

该模型在两个数据集上进行了评估:数据集A(CaDIS,用于图像分割的白内障数据集)和SICS-105(小切口白内障手术)数据集。<....

访问受限。请登录或开始试用以查看此内容。

结果

为了评估所提出模型的有效性,使用真实世界玻璃体切除术数据集进行了大量实验。性能评估涵盖了预处理、特征提取效果以及预测准确率等方面。

性能分析与比较评估

采用准确率、精确率、召回率、F1分数、平均交并比(mIoU)、像素准确率(PA)、类别准确率(PAC)、灵敏度、特异度、受试者工作特征曲线(ROC)和曲线下面积(AUC)等指标,将所提出的 methodology 与基线模型进行了比较。通过真阳性(TP)、真阴性(TN)、假阳性(FP)和假阴性(FN)率来解释分类结果,其中 TP 表示被正确识别的高风险病例,FN 表示被漏诊的高风险病例,这在临床环境中至关重要。

基于 Transformer 的分类头与时空注意力池化——数据集 A 的性能比较

在数据集A上进行了性能评估,并使用多种指标将所提出方法获得的结果与基线技术进行了比较。在三个风险类别(低风险、.......

访问受限。请登录或开始试用以查看此内容。

讨论

在 CaDIS 和 SICS-105 数据集上的实验评估验证了所提出模型相较于传统方法的鲁棒性与优越性。ResNet-50、LSTM-CNN 以及基于分割的网络(UNet、DeepLabV3+、UPerNet、HRNetV2)等基线模型表现尚可,但受限于术中视频固有的变异性,包括光照变化、遮挡、运动模糊以及器械与组织的交互作用22,23。这些局限性导致在少数类别上准确率下降、召回率偏低以及预测不稳定。通过引入先进的预处理策略(运动稳定化、光照归一化和基于生成对抗网络的伪影抑制),所提出的方案确保了输入数据的一致性与高质量,从而显著减少了后续阶段的误差累积11,12。引入图依赖的时空特征表示方法,能够有效建模手术过程中的动态变化13,14,

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

致谢

作者谨此感谢川北医学院提供的必要机构支持与资源。特别感谢广元市中心医院的临床工作人员在收集术中显微镜视频过程中给予的协助。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
高性能工作站NVIDIA Corporation, USARTX-A6000用于模型训练;配备48 GB显存的GPU,搭载Intel Core i9 CPU和128 GB内存
Python (v3.10)Python软件基金会开源模型开发与实验的核心编程语言
TensorFlow (v2.15)Google Research开源用于实现cGAN预处理和Transformer分类器的框架
PyTorch (v2.2.0)Meta AI开源用于实现GCN和自适应向日葵优化模块
CUDA Toolkit (v12.1)NVIDIA CorporationCUDA-12.1为所有深度学习计算提供GPU加速支持
条件生成对抗网络(cGAN)改编自Pix2Pix框架用于预处理阶段的视频增强和伪影去除
光流估计器(RAFT)Teed & Deng (ECCV 2020)确保预处理过程中帧间的时间一致性
轮廓自适应分割(CAS)模型自定义实现改进的主动轮廓模型,用于玻璃体切除术视频中的精确边界分割
动态图卷积网络(GCN)自定义实现(基于Kipf & Welling, 2017)提取视频特征节点之间的时空关系
自适应向日葵优化算法(ASFO)自定义实现用于优化特征选择和降维
Transformer编码器模型自定义实现(基于Vaswani等, 2017)结合时空注意力池化,用于术后并发症的最终分类
Matplotlib (v3.8)Python软件基金会开源用于性能指标和图表的可视化
Seaborn (v0.13)Python软件基金会开源用于高级可视化和统计图形绘制
Adam优化器TensorFlow内置用于模型训练;学习率 = 1e-4,β1=0.9,β2=0.999
损失函数套件(L_adv, L_l1, L_perc, L_temp, L_G)自定义实现定义GAN训练中的对抗损失、感知损失、像素损失和时间损失
操作系统Ubuntu Linux 22.04 LTS深度学习实验的基础环境
评估指标包scikit-learn (v1.5.0)开源用于计算准确率、精确率、召回率、F1分数、AUC和mIoU

参考文献

  1. Zhang, Z. R., Li, J. J., Li, K. R. Artificial intelligence in individualized retinal disease management. Int. J. Ophthalmol. 17, 1519(2024).
  2. Liu, Y., et al. Automated detection of nine infantile fundus diseases and conditions....

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Transformer