研究文章

基于深度学习的白内障手术时空分析视频用于手术风险评估

DOI:

10.3791/70025

2026年5月15日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究通过cGAN预处理、分割、GCN、ASFO和变压器建模,提出了深度学习流程,用于预测术中显微镜视频中的手术风险。CaDIS和SICS-105数据集表现较高,但临床有效性受间接标记限制。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

术后并发症仍是玻璃体切除手术中的重大挑战,常导致视力受损和反复干预。本研究提出了一个深度学习框架,通过从术中显微镜视频中提取时空特征来预测手术风险。在预处理过程中,会应用包括运动稳定、照明归一化和基于cGAN的伪影抑制在内的视频增强技术,以提升输入质量。采用轮廓自适应分割来划定相关的手术区域,随后采用图卷积网络进行结构感知特征提取。集成了自适应向日葵优化方法以优化特征选择,基于变换器的模型捕捉时间依赖性以实现最终风险预测。该框架基于两个公开数据集 CaDIS 和 SICS-105 进行评估。该模型在CaDIS数据集上实现了98.9%的准确率、97.5%的准确率、98.2%的回忆率、97.9%的F1评分和98.1%的AUC。此外,分段模块实现了98.9%的像素精度、98.5%的每类准确率和96.6%的mIoU。该模型在SICS-105数据集上实现了99.1%的准确率,98.5%的F1评分,98.7%的敏感性,98.7%的特异性,以及99.10%的ROC AUC。这些结果显示出相较基线模型的持续改进。总体而言,整合GAN增强的预处理、基于图的特征学习、优化和变换器建模,提升了预测可靠性。该方法凸显了术中视频分析在实时临床决策支持和改善术后风险分层方面的潜力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

玻璃体平面切除术(PPV)是治疗多种玻璃体视网膜疾病(包括视网膜脱离、糖尿病视网膜病变、黄斑洞和玻璃体出血1型)的外科手术基础。尽管手术器械和可视化技术有所进步,术后并发症仍是显著的发病率来源,结局范围从轻微视觉障碍到视力威胁事件,如反复视网膜脱落、眼内炎或眼内压失控。识别这些并发症高风险患者是临床实践中一个关键的未满足需求,因为这有助于更明智的手术计划、个性化术后护理和及时干预3.传统上,PPV的风险评估依赖于静态的术前因素(如合并症和术前眼部疾病)以及外科医生的主观术中判断(4,5,6,7)。此外,近期的玻璃体切除手术通过高分辨率手术显微镜视频进行了大量记录,提供了丰富但未被充分利用的数据来源。这些记录不仅捕捉了解剖和病理特征,还包括外科医生与组织的相互作用、术中事件和手术动作,这些可能预测进一步并发症的发生 8,9,10,11。

深度学习在眼科多个领域表现出显著表现,包括眼底影像分类、自动手术技能评估和光学相干断层扫描(OCT)分析12。此外,一些研究系统地利用术中视频数据预测术后结局。手术视频的时空性质带来了独特挑战:高维数据、不同外科医生的差异、时间依赖性、患者解剖结构以及设备13141516。然而,临床领域的流畅整合不仅需要准确或精准的预测,还需要在手术环境中实时实现的鲁棒性、可解释性和普遍性17

在眼科和外科数据科学领域,机器学习(ML)和深度学习(DL)近年来变得相当流行。其应用包括预后预测、外科技能评估和诊断影像19。多项研究探讨了基于DL的框架来理解术中手术情况。例如,Nespolo20 通过提出用于玻璃体视膜手术中组织和器械语义解释的DL流程,展示了跨任务的通用性。为便于客观的性能评估,进一步扩展以提取有关手术技术和器械-组织相互作用的全面数据。同样,Nespolo等人21 通过利用术中显微镜和实例分割网络(YOLACT++)开发了实时检测与分割模型,展示了手术引导的可行性。

此外,人工智能驱动的方法也被认可为改善工作流程、培训和手术评估的有用工具22,23。这些技术实现了相位分割、实时仪器跟踪以及眼科显微外科的安全性提升。Mueller等人在系统性综述23的一项系统综述中进一步证明了机器学习在术中手术记录分析中的应用日益扩大,同时也强调了临床转化和可靠性方面存在的当前问题。多项研究利用带有影像和临床数据的DL模型预测术后结局。例如,基于OCT和临床特征的模型已被用于预测特发性视网膜前膜病例的视觉结局24,类似方法也显示出在多中心数据集中预测黄斑洞患者术后结局的有效性25。其他研究则聚焦于利用多模态DL框架确定增生性玻璃体视网膜病变的严重程度26,以及利用超广域成像预测视网膜剥离复发27。此外,玻璃体视网膜疾病的视觉结局和潜在病因已通过机器学习模型预测,这些模型包含人口统计学、临床和手术变量28,29,30。

尽管有这些进展,大多数现有方法对术中动态的重视较少,主要依赖术前数据或静态术后影像。尽管一些研究使用手术视频分析进行202122、23的分割和评估,但它们并未直接纳入时空术中数据来预测并发症的可能性。因此,使用术中显微视频数据进行预测建模方面仍存在显著空白。为了建立精确且临床意义显著的框架来预测术后玻璃体切除术并发症,必须填补这一空白。

本研究提出了一种新型多模态双重诊断框架,将从术中玻璃体切除术视频中提取的时空特征与结构化临床元数据整合,用于预测术后并发症的风险。通过采用先进的视频编码器(如卷积和变压器架构)以及元数据融合策略18,该方案旨在识别高风险手术中事件,提供校准的并发症概率,并为医生生成可解读的可视化。通过多中心估计、可解释性分析和比较研究,已证明使用术中视频作为手术结局预测生物标志物的可行性18。本项目的主要目标是建立一个强大的DL框架,利用术中显微镜记录的时空数据预测玻璃体切除术术中的术后并发症。在预测准确性和泛化方面,所提出的综合方法结合了基于cGAN的预处理、基于GCN的特征提取、基于ASFO的优化和基于变压器的建模,预计将超越现有方法。

本研究高效利用术中显微镜视频,提出了全面的DL框架,用于术后玻璃体切除术问题预测。与目前主要依赖静态成像方式或术前临床数据的方法不同,本方法论以新颖方式将先进机器学习技术与时空视频分析相结合。特别是,该方法使用图卷积网络(GCN)捕捉手术场景中的结构和关系关系,利用等高线自适应分割(CAS)进行准确区域划分,以及基于cGAN的视频增强模块进行伪影抑制。此外,为了提升模型收敛性和判别能力,采用自适应向日葵优化(ASFO)算法,在特征选择中平衡探索与利用。最后,跨手术序列的时间动态采用基于变换器的架构建模,并结合时空注意力集中。相比现有流程,这一全面集成了预处理、分段、基于图的特征学习、优化和注意力驱动预测,使风险预测更加精准、可靠且具有临床意义。本研究使用CaDIS和SICS-105数据集作为代理视觉数据集,用于学习术中时空特征,尽管它们的主要目的是白内障手术分析。这些特征不再使用明确标记的并发症标签,而是用来建模和推断术后玻璃体切除术问题的风险。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究所用的CaDIS和SICS-105数据集已公开,最初采集时已获得机构审查委员会的事先批准和知情同意,相关内容均见其各自的出版物。本研究仅对完全匿名化数据进行二次分析,因此无需额外的伦理批准或知情同意。

该模型设计旨在利用术中显微镜视频中的时空模式预测术后玻璃体切除术并发症。该流水线包括四个主要阶段:预处理、分割、特征提取、特征优化和分类,如 图1所示。

术中评估术后并发症风险是研究的预测目标。由于CaDIS和SICS-105数据集缺乏纵向随访数据,模型无法在特定时间窗口内预测临床验证的术后事件。相反,它通过术中手术模式推断可能出现问题的概率。在此语境下,“并发症”的操作定义包括不规则的相变、异常的器械与组织相互作用,以及与手术复杂度增加相关的手术工作流程变化。为了确保可解释性和可靠评估,预测工作被设计为二元分类问题,将病例分为低风险组和高风险组。该框架不再作为直接的临床诊断系统,而是作为术中决策支持工具。

数据集描述:

该模型在两个数据集上进行了评估:数据集A(CaDIS,用于图像分割的白内障数据集)和SICS-105数据集(小切口白内障手术数据集)。

(i) CaDIS31:该数据集用于白内障手术视频的分割任务。该项目旨在补充公开的CATARACTS挑战数据集,旨在推动手术视频分析DL方案的发展。该数据集包含25段视频录制,共计4,670帧注释帧,展示了白内障手术的多个阶段(补充图1)。每一帧都经过细致注释,提供训练和估计分割方案所需的像素级标签。它作为评估DL模型在手术视频表现的基准。

(ii) SICS-105(小切口白内障手术)数据集32:该数据集包含2023–2024年间6个月内由外科医生进行并由四位眼科医生注释的105条记录,涵盖20个阶段(补充图2)。视频总时长为22小时39分钟,分辨率为1920×1080像素(下采样为960×540像素),帧率为30帧每秒。平均视频时长为12分57秒(σ=4分31秒)。一个数据集在Zenodo仓库中公开访问,网址为:https://doi.org/10.5281/zenodo.13847781。代表性输入样本见 补充图1 和补充 图2。 尽管CaDIS和SICS-105数据集最初设计用于白内障手术中的阶段识别和分割,但关于术后玻璃体切除并发症的信息有限。为解决术后玻璃体切除并发症信息不足,我们提出了一套基于术中视觉模式和视频序列事件的风险代理标签。数据集中的帧和视频序列根据临床理解启发的一套启发式方法,标注了三级风险信息(低、中、高),包括器械-组织相互作用复杂度、手术时间异常、阻塞、不稳定性和异常运动。拟议的表述不将临床结局作为标签,而是将其视为潜在术后并发症风险信息的代理标签。

采用cGAN方法的预处理

通常,原始帧常因光照变化、模糊和镜面伪影而退化。为此,使用条件生成对抗网络(cGAN)来增强视频效果。原始帧是指在进行任何增强或归一化之前,直接从术中显微镜视频录制中提取的原始、未处理帧。这些画面通常包含光照变化、运动模糊、镜面反射以及手术器械和摄像机运动产生的噪点等伪影。生成器恢复干净的帧,而判别器则强制视觉真实感。该目标函数整合了像素重建、对抗性和时间一致性损失,确保无伪影且稳定的视频序列以便进一步分析。

在时间步t处,退化的帧It是生成器的输入,而改进的帧Yt = G(It)是其输出。在输入 It 的条件下,判别器被训练以区分生成的输出和地面真实的干净帧 Yt。训练目标包含多个损失函数以确保高质量重建:(i) 对抗性损失以强化真实性;(ii)像素重建损耗(L1损耗)以保持强度保真度;(iii)通过深度特征表示保持结构一致性而导致感知损失;以及(iv)时间一致性丢失,以确保连续帧间的平滑过渡并防止闪烁伪影。

为了确保特征提取的输入质量高,术中显微镜视频最初采用cGAN(合成神经干扰网)增强。每一个原始帧 I t* 都被认为是对干净帧的降级观察。生成元G学习映射G(It) = It以恢复增强帧,而判别器D区分真实样本和生成样本。训练目标整合了对抗性损失L、度、感知损失L、基于像素的重建损失L、l1和时间一致性L温度。该模型抑制模糊、镜面伪影和噪声,同时保持时间和结构的连贯性,产生稳定且无伪影的视频序列,用于后续分析。GAN的表述见补充文件1的方程[1-6]。

利用轮廓自适应分割(CAS)进行分割

其中,分割采用等高线自适应分割模型。这为显微镜图像中受影响的玻璃体切除图像分段提供了初步轮廓,从而降低能量函数,如 补充文件1中的方程[7-12]所示。低能量值确保了对风险区域的精确表征和局部评估。这反过来又允许对受影响区域进行精确切割,进而便于后续切片中的特征提取。

利用动态时空GCN(dGCN)进行特征提取

预处理阶段完成后,下一步是提取判别性时空特征。因此,采用图卷积网络(GCN),因为它在捕捉结构化依赖方面非常有效。采用的模型由叠加GCN层组成,具有非线性激活,通过归一化机制减轻过拟合并解决梯度消失问题。GCN表述依赖于图卷积的一阶谱近似,适合大规模半监督学习任务。此外,线性化表示简化了优化,从而确保了参数学习的有效性。简化GCN的操作在 补充文件1的方程[13–15]中表达。应用时,GCN能高效从手术中视频数据中提取更高层次的结构表示。随后,只有最相关或合适的特征会被保留在优化辅助选择机制中,后续章节将详细说明。

基于自适应向日葵的特征优化(ASFO)进行特征优化

自适应向日葵优化算法(ASFO)是经典向日葵优化方法(SFOA)的增强版。在所建议的模型中,这一生物学驱动的过程通过数学建模,以解决高维数据集中的细化和特征选择。具体来说,这种方法旨在提升收敛速度,平衡探索与利用,以保持解的多样性,并减轻过早收敛。ASFO的数学表述见 补充文件1的方程[16–21]。该方案在解接近最优时加快收敛。详细算法见 补充文件1。在拟议的流水线中,ASFO用于变压器聚变后的特征矢量精细化。所选特征包括基于纹理的、颜色和强度、形态和结构、运动与时间、高维度以及注意力加权的区域描述。目标是最小化特征相关性损失函数,从而选择并加权以减少冗余来提升分类准确性。

基于变换器的分类头具时空注意力集中

基于变换器的模型用于捕捉手术视频序列中的时间依赖性。该模型配置了多头自关注、位置编码和全连接层,用于最终风险预测。超参数优化采用ASFO进行。集成的流程结合了预处理、特征提取、优化和基于变压器的分类,实现了准确的手术风险预测。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为评估模型的有效性,使用真实世界玻璃体切除数据集进行了大量实验。在预处理、特征提取效能和预测准确性方面进行了性能评估。

性能分析与比较估计

所提方法与基线模型进行了比较,采用了包括准确率、精度、召回率、F1分数、mIoU、像素精度(PA)、每类别准确率(PAC)、灵敏度、特异性、ROC和AUC等指标。用于解释分类结果时,采用了真阳性(TP)、真阴性(TN)、假阳性(FP)和假阴性(FN)率,其中TP代表正确识别的高风险病例,FN表示漏诊的高风险病例,这在临床环境中至关重要。

基于变换器的分类头具时空注意力集中——数据集A的性能比较

在数据集A上进行了性能估计,并用不同指标将所提出方法与基线技术进行比较。观察到三个风险类别(低风险、中度和高风险)的高度分类表现。共有94例被准确归类为低...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

对CaDIS和SICS-105数据集的实验评估确认了该模型相较传统方法的鲁棒性和优越性。基线模型如ResNet-50、LSTM-CNN和分段驱动网络(UNet、DeepLabV3+、UPerNet、HRNetV2)表现尚可,但受限于固有的术中视频变异性,包括照明变化、遮挡、运动模糊和工具-组织相互作用22,23。这些局限导致少数群体的准确性降低、召回率低和预测不稳定。通过整合先进的预处理策略(运动稳定、照明归一化和基于GAN的伪影抑制),所提方案确保了一致且高质量的输入,从而显著减少后续阶段的错误积累11,12。引入了图依赖的时空特征表示,使得手术动态13141...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者没有利益冲突可披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢四川北医科大学提供必要的机构支持和资源。特别感谢广源中央医院临床人员协助收集术中显微镜视频。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
高性能工作站英伟达公司,美国RTX-A6000用于模型训练;48GB 显存显卡,配备英特尔Core i9 CPU和128 GB 内存
Python(v3.10)Python 软件基础开源用于模型开发和实验的核心编程语言
TensorFlow(v2.15)谷歌研究开源用于实现cGAN预处理和变换器分类器的框架
PyTorch(v2.2.0)元人工智能开源用于实现GCN和自适应向日葵优化模块
CUDA 工具包(v12.1)英伟达公司CUDA-12.1为所有深度学习计算提供GPU加速
条件生成对抗网络(cGAN)改编自 Pix2Pix 框架用于视频增强和预处理时的伪影去除
光流估计器(RAFT)蒂德与邓(ECCV 2020)确保预处理期间帧间的时间一致性
等高线自适应分割(CAS)模型自定义实现修正主动轮廓模型用于玻璃体切除视频中的准确边界分割
动态图卷积网络(GCN)自定义实现(基于 Kipf 和韦林,2017)提取视频特征节点之间的时空关系
自适应向日葵优化算法(ASFO)自定义实现用于优化特征选择和降维
变压器编码器模型自定义实现(基于Vaswani等,2017年)用于术后并发症的最终分类,伴随时空注意力汇集
Matplotlib(v3.8)Python 软件基础开源用于性能指标和图表的可视化
海本(v0.13)Python 软件基础开源用于高级可视化和统计图形
亚当·优化者TensorFlow 内置用于模型训练;学习率 = 1e-4,β;1=0.9, β2=0.999
损失函数套件(L_adv、L_l1、L_perc、L_temp、L_G)自定义实现定义了GAN训练中的对抗性、感知性、像素和时间损失
操作系统Ubuntu Linux 22.04 LTS深度学习实验的基础环境
评估指标包Scikit-Learn(v1.5.0)开源用于计算准确性、精度、召回率、F1分数、AUC和mIoU

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Z. R., Li, J. J., Li, K. R. Artificial intelligence in individualized retinal disease management. Int. J. Ophthalmol. 17, 1519(2024).
  2. Liu, Y., et al. Automated detection of nine infantile fundus diseases and conditions in retinal images using a deep learning system. EPMA J. 15, 39-51 (2024).
  3. Wang, X. N., et al. A deep learning system for detection of optic disc neovascularization in diabetic retinopathy. Vis. Comput. 41, 1293-1302 (2025).
  4. Ni, L., et al. Prediction of postoperative macular hole status by automated preoperative retinal OCT analysis. Ophthalmic Surg. Lasers Imaging Retina. 56, 355-360 (2025).
  5. Mathews, M. R., Anzar, S. M. Advancing computer-assisted diabetic retinopathy grading. Int. J. Imaging Syst. Technol. 35, e70152(2025).
  6. Wu, X. Y., et al. Bibliometric analysis of global myopia research. Int. J. Ophthalmol. 17, 940(2024).
  7. Rahat, S. R. U. I., et al. Advancing diabetic retinopathy detection with AI and deep learning. Br. J. Nurs. Stud. 5, 1-13 (2025).
  8. Rezaei, A., et al. Automated multimodal severity assessment of diabetic retinopathy. SSRN. , (2024).
  9. Suzue, M., et al. Predicting visual outcomes after vitrectomy. Graefes Arch. Clin. Exp. Ophthalmol. 263, 2505-2513 (2025).
  10. Sabeena, A. S., Jeyakumar, M. K. Ensemble deep learning for diabetic retinopathy classification. Biomater. Devices. , (2025).
  11. Gencer, K., et al. GAN-based approach for diabetic retinopathy detection. Photodiagn. Photodyn. Ther. 53, 104552(2025).
  12. Huang, Z., et al. Risk prediction model for neovascular glaucoma. Front. Cell Dev. Biol. 13, 1604832(2025).
  13. Wang, Y., Liu, L., Wang, C. Trends in deep learning for biomedical prediction. Front. Neurosci. 17, 1256351(2023).
  14. Tang, J., et al. Ectopic inner foveal layer as prognostic predictor. Sci. Rep. 15, 25066(2025).
  15. Shamsan, A., et al. Predicting diabetic retinopathy stages using deep learning. PLoS One. 18, e0289555(2023).
  16. Baldi, P. F., et al. Vitreoretinal surgical instrument tracking. Transl. Vis. Sci. Technol. 12, 20(2023).
  17. Yuan, S., et al. Risk factors after vitrectomy with silicone oil. Sci. Rep. 13, 10423(2023).
  18. Wei, Y., et al. DRDB platform for diabetic retinopathy. Oxid. Med. Cell Longev. 2022, 1718353(2022).
  19. Yagin, F. H., et al. Explainable AI for metabolomics analysis. Diagnostics. 14, 1364(2024).
  20. Nespolo, R. G. Intraoperative artificial intelligence in ophthalmology. , University of Illinois Chicago. Doctoral dissertation (2024).
  21. Nespolo, R. G., et al. Real-time segmentation in vitreoretinal surgery. Ophthalmol. Retina. 7, 236-242 (2023).
  22. Mishra, K., Leng, T. Artificial intelligence and ophthalmic surgery. Curr. Opin. Ophthalmol. 32, 425-430 (2021).
  23. Mueller, S., et al. AI in cataract surgery: systematic review. Transl. Vis. Sci. Technol. 13, 20(2024).
  24. Wen, D., et al. Postoperative visual acuity prediction. BMC Ophthalmol. 23, 361(2023).
  25. Hu, Y., et al. Prediction of macular hole status. Ann. Transl. Med. 9, 51(2021).
  26. Catania, F., et al. Deep learning for retinal detachment recurrence. Acta Ophthalmol. 102, e984-e993 (2024).
  27. Gan, F., et al. AI-PVR Insight system. Quant. Imaging Med. Surg. 15, 2774(2025).
  28. Lee, S. S., et al. Prediction after diabetic vitrectomy. Transl. Vis. Sci. Technol. 11, 25(2022).
  29. Kamnig, R., et al. Neural network for visual acuity prediction. Ophthalmol. Sci. 5, 100762(2025).
  30. Kim, J., et al. Prediction of vitreous hemorrhage causes. Diagnostics. 15, 371(2025).
  31. Flouty, E., et al. CaDIS dataset. CoRR. abs/1905.08993, (2019).
  32. Mueller, S., et al. Phase recognition in cataract surgery. Sci. Rep. 15, 16886(2025).
  33. Aravinda, C. V., et al. Hybrid architecture for video frame prediction. J. Real-Time Image Process. 22, 50(2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Transformer

相关文章