Artículo de investigación

Análisis espaciotemporal basado en aprendizaje profundo de vídeos sobre cirugía de cataratas para la evaluación de riesgos quirúrgicos

DOI:

10.3791/70025

15 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta una cadena de aprendizaje profundo para predecir el riesgo quirúrgico a partir de vídeos de microscopía intraoperatoria utilizando preprocesamiento cGAN, segmentación, GCN, ASFO y modelado de transformadores. Se logra un alto rendimiento en los conjuntos de datos CaDIS y SICS-105, aunque la validez clínica está limitada por el marcado indirecto.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Las complicaciones postoperatorias siguen siendo un desafío significativo en la cirugía de vitrectomía, lo que a menudo conduce a un deterioro visual y a intervenciones repetidas. Este estudio presenta un marco de aprendizaje profundo para predecir el riesgo quirúrgico extrayendo características espaciotemporales de vídeos de microscopía intraoperatoria. Durante el preprocesado, se aplican técnicas de mejora de vídeo, incluyendo estabilización de movimiento, normalización de iluminación y supresión de artefactos basada en cGAN, para mejorar la calidad de entrada. Se emplea segmentación adaptativa a contornos para delimitar regiones quirúrgicas relevantes, seguida de Redes Convolucionales de Grafos para la extracción de características conscientes de la estructura. Se integra un enfoque de Optimización Adaptativa del Girasol para refinar la selección de características, y un modelo basado en transformadores captura dependencias temporales para la predicción final del riesgo. El marco se evalúa en dos conjuntos de datos públicos, CaDIS y SICS-105. El modelo alcanzó un 98,9% de precisión, 97,5% de precisión, 98,2% de recuerdo, 97,9% de puntuación F1 y 98,1% de AUC en el conjunto de datos CaDIS. Además, el módulo de segmentación alcanzó un 98,9% de precisión en píxeles, un 98,5% de precisión por clase y un 96,6% de mIoU. El modelo alcanzó un 99,1% de precisión, un 98,5% de puntuación F1, un 98,7% de sensibilidad, un 98,7% de especificidad y un ROC AUC del 99,10% en el conjunto de datos SICS-105. Estos resultados demuestran mejoras constantes respecto a los modelos de referencia. En general, la integración de preprocesamiento mejorado con GAN, aprendizaje de características basado en grafos, optimización y modelado de transformadores mejora la fiabilidad predictiva. Este enfoque pone de manifiesto el potencial del análisis de vídeo intraoperatorio para un apoyo clínico a la decisión en tiempo real y una mejora en la estratificación del riesgo postoperatorio.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La vitrectomía de Pars plana (VPP) es una base para procedimientos quirúrgicos en el manejo de diversas enfermedades vítreorretinicas, incluyendo el desprendimiento de retina, la retinopatía diabética, el agujero macular y la hemorragiavítrea 1. A pesar del avance en la instrumentación quirúrgica y la visualización, las complicaciones postoperatorias siguen siendo una fuente significativa de morbilidad, con resultados que van desde pequeñas alteraciones visuales hasta eventos que amenazan la visión como desprendimiento recurrente de retina, endoftalmitis o presión intraocularno controlada 2. La identificación de pacientes con mayor riesgo de estas complicaciones es una necesidad crucial no satisfecha en la práctica clínica, ya que permite una planificación quirúrgica más informada, cuidados postoperatorios personalizados e intervencionesoportunas 3. Tradicionalmente, la evaluación de riesgos en la VPP se ha basado en factores preoperatorios estáticos (como comorbilidades y condiciones oculares preoperatorias) y en el juicio subjetivo intraoperatorio por parte del cirujano 4,5,6,7. Además, la reciente cirugía de vitrectomía está ampliamente documentada en un vídeo de microscopía quirúrgica de alta resolución, ofreciendo una fuente de datos rica pero poco utilizada. Estos registros capturan no solo características anatómicas y patológicas, sino también interacciones cirujano-tejido, eventos intraoperatorios y movimientos quirúrgicos que pueden predecir complicacionesposteriores 8,9,10,11.

El Aprendizaje Profundo ha demostrado un rendimiento notable en diversos ámbitos de la oftalmología, incluyendo la clasificación de imágenes del ojo de ojo, la evaluación automática de habilidades quirúrgicas y el análisis de Tomografía de Coherencia Óptica (OCT) 12. Además, algunos estudios han aprovechado sistemáticamente los datos de vídeo intraoperatorios para predecir los resultados postoperatorios. La naturaleza espaciotemporal de los vídeos quirúrgicos presenta desafíos únicos: datos de alta dimensión, variabilidad entre cirujanos, dependencias temporales, anatomía del paciente y dispositivos 13,14,15,16. Sin embargo, una integración elocuente del ámbito clínico requiere no solo predicciones precisas o precisas, sino también robustez, interpretabilidad y generalizabilidad en entornos quirúrgicos entiempo real 17.

En los campos de oftalmología y ciencia de datosquirúrgica 18, el aprendizaje automático (ML) y el aprendizaje profundo (DL) se han vuelto recientemente bastante populares. Sus aplicaciones incluyen la predicción de resultados, la evaluación de habilidades quirúrgicas y la obtención de imágenesdiagnósticas 19. Se han investigado marcos basados en DL para comprender situaciones quirúrgicas intraoperatorias en varios estudios. Por ejemplo, Nespolo20 demostró generalizabilidad entre tareas al proponer una canalización DL para la interpretación semántica de tejidos e instrumentos en cirugía vitreorretiniana. Para facilitar la evaluación objetiva del rendimiento, esto se amplió aún más para permitir la extracción de datos completos sobre técnicas quirúrgicas e interacciones instrumento-tejido. En una línea similar, Nespolo et al.21 demostraron la viabilidad de la guía quirúrgica desarrollando un modelo de detección y segmentación en tiempo real utilizando microscopía intraoperatoria y una red de segmentación de instancias (YOLACT++).

Además, los métodos impulsados por IA han sido reconocidos como herramientas útiles para mejorar el flujo de trabajo, la formación y la evaluaciónquirúrgica 22,23. Estas técnicas permiten la segmentación de fase, el seguimiento en tiempo real de los instrumentos y una mayor seguridad en la microcirugía oftálmica. El uso creciente del aprendizaje automático (ML) en el análisis de registros quirúrgicos intraoperatorios se demostró aún más mediante una revisión sistemática de Mueller et al.23, que también destacó problemas actuales con la traducción clínica y la fiabilidad. Varios estudios han utilizado modelos DL con imágenes y datos clínicos para predecir los resultados postoperatorios. Por ejemplo, se han utilizado modelos basados en OCT y características clínicas para predecir resultados visuales en casos de membrana epirretinianaidiopática 24, y métodos similares han demostrado eficacia para predecir los resultados postoperatorios en pacientes con orificio macular a lo largo de conjuntos de datosmulticéntricos 25. Otros estudios se han centrado en determinar la gravedad de la vitroretinopatía proliferativa utilizando marcos multimodales de DL26 y en predecir la recurrencia del desprendimiento de retina mediante imágenes de campoultraamplio 27. Además, se han predicho los resultados visuales y las etiologías subyacentes en las enfermedades vítreorretinianas utilizando modelos de aprendizaje automático que incorporan variables demográficas, clínicas yquirúrgicas 28,29,30.

A pesar de estos avances, la mayoría de los métodos actuales ponen poca importancia en la dinámica intraoperatoria y se basan principalmente en datos preoperatorios o en imágenes postoperatorias estáticas. Aunque algunos estudios utilizan análisis quirúrgico de vídeo para segmentación y evaluación 20,21,22,23, no incorporan directamente datos intraoperatorios espaciotemporales para predecir la probabilidad de complicaciones. Como resultado, sigue existiendo una brecha significativa en el uso de datos microscópicos intraoperatorios de vídeo para modelado predictivo. Para crear marcos precisos y clínicamente significativos que predigan las complicaciones postoperatorias de la vitrectomía, este vacío debe cubrirse.

En este estudio se presenta un novedoso marco multimodal de DL que integra características espaciotemporales extraídas de vídeos de vitrectomía intraoperatoria con metadatos clínicos estructurados para predecir el riesgo de complicaciones postoperatorias. Mediante el emplear codificadores de vídeo avanzados (como arquitecturas convolucionales y basadas en transformadores) junto con estrategias de fusión demetadatos 18, este esquema pretende reconocer eventos intraoperatorios de alto riesgo, proporcionar probabilidades calibradas de complicaciones y generar visualizaciones interpretables para los médicos. Mediante estimaciones multicéntricas, análisis de interpretabilidad y estudios comparativos, se demuestra la viabilidad de utilizar vídeo intraoperatorio como biomarcador predictivo del resultado quirúrgico18. El objetivo principal de este proyecto es desarrollar un sólido marco de DL que utilice datos espaciotemporales de grabaciones intraoperatorias en microscopio para predecir complicaciones postoperatorias en la cirugía de vitrectomía. En términos de precisión predictiva y generalización, se espera que el enfoque integrado propuesto, que combina preprocesamiento basado en cGAN, extracción de características impulsada por GCN, optimización basada en ASFO y modelado basado en transformadores, se espera que supere a los métodos actuales.

Este trabajo aprovecha eficazmente los vídeos del microscopio intraoperatorio para presentar un marco integral de DL para la predicción de problemas postoperatorios de vitrectomía. A diferencia de los métodos actuales, que se basan principalmente en modalidades de imagen estática o datos clínicos preoperatorios, la metodología propuesta combina técnicas avanzadas de aprendizaje automático con análisis de vídeo espaciotemporal de una manera novedosa. En particular, la metodología utiliza Redes Convolucionales de Grafos (GCNs) para capturar relaciones estructurales y relacionales dentro de escenas quirúrgicas, Segmentación Adaptativa de Contorno (CAS) para una delimitación precisa de regiones, y un módulo de mejora de vídeo basado en cGAN para la supresión de artefactos. Además, para mejorar la convergencia de modelos y el poder discriminatorio, se utiliza un algoritmo de Optimización Adaptativa de Girasol (ASFO) para equilibrar la exploración y la explotación en la selección de características. Por último, la dinámica temporal a través de secuencias quirúrgicas se modela utilizando una arquitectura basada en transformadores con agrupación de atención espaciotemporal. Una mejora importante respecto a las pipelines actuales, esta integración integral de preprocesamiento, segmentación, aprendizaje de características basado en gráficos, optimización y predicción orientada a la atención permite una predicción de riesgos más precisa, fiable y clínicamente significativa. Los conjuntos de datos CaDIS y SICS-105 se utilizan en este estudio como conjuntos visuales proxy para conocer características espaciotemporales intraoperatorias, a pesar de que su propósito principal es el análisis de cirugía de cataratas. En lugar de usar etiquetas de complicaciones explícitamente marcadas, estos rasgos se emplean para modelar e inferir el riesgo de problemas de vitrectomía postoperatoria.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los conjuntos de datos CaDIS y SICS-105 utilizados en este estudio están disponibles públicamente y fueron recopilados originalmente con la aprobación previa del comité de revisión institucional y consentimiento informado, según se informa en sus respectivas publicaciones. Este estudio implica únicamente un análisis secundario de datos completamente anonimizados y, por tanto, no se requirió aprobación ética adicional ni consentimiento informado.

El modelo sugerido fue diseñado para predecir complicaciones de vitrectomía postoperatoria aprovechando patrones espaciotemporales de vídeos de microscopía intraoperatoria. La tubería consta de cuatro etapas principales: preprocesamiento, segmentación, extracción de características, optimización de características y clasificación, como se muestra en la Figura 1.

La evaluación intraoperatoria del riesgo de complicaciones postoperatorias es el objetivo de predicción del estudio. El modelo no puede predecir eventos postoperatorios clínicamente verificados dentro de un periodo temporal específico porque los conjuntos de datos CaDIS y SICS-105 carecen de datos longitudinales de seguimiento. Más bien, utiliza patrones quirúrgicos intraoperatorios para inferir la probabilidad de posibles problemas. Las definiciones operativas de "complicación" en este contexto incluyen transiciones de fase irregulares, interacciones anómalas instrumento-tejido y variaciones en el flujo de trabajo quirúrgico asociadas a una mayor complejidad quirúrgica. Para garantizar la interpretabilidad y una evaluación fiable, el trabajo de predicción está diseñado como un problema de clasificación binaria que clasifica los casos en grupos de bajo y alto riesgo. En lugar de servir como un sistema clínico diagnóstico directo, esta formulación permite que el marco sugerido sirva como una herramienta de apoyo a la decisión intraoperatoria.

Descripción del conjunto de datos:

El modelo propuesto fue evaluado en dos conjuntos de datos: el conjunto de datos A (CaDIS, Conjunto de datos de cataratas para segmentación de imágenes) y el conjunto de datos SICS-105 (Cirugía de Cataratas de Pequeña Incisión).

(i) CaDIS31: Este conjunto de datos fue desarrollado para la tarea de segmentación en vídeos de cirugía de cataratas. Esto se introduce para complementar el conjunto de datos de desafíos CATARACTAS disponible públicamente y, por tanto, tiene como objetivo avanzar en el desarrollo de esquemas DL para el análisis de vídeos quirúrgicos. El conjunto de datos consta de 25 grabaciones de vídeo que suman un total de 4.670 fotogramas anotados, que representan varias etapas de la cirugía de cataratas (Figura suplementaria 1). Cada fotograma está meticulosamente anotado, proporcionando etiquetas a nivel de píxel necesarias para entrenar y estimar el esquema de segmentación. Sirve como referencia para evaluar el rendimiento del modelo DL en vídeos quirúrgicos.

(ii) Conjunto de datos SICS-105 (cirugía de cataratas de pequeña incisión) 32: Este conjunto de datos comprende 105 registros realizados por cirujanos y anotados por cuatro oftalmólogos durante un periodo de 6 meses entre 2023 y 2024, cubriendo 20 fases (Figura suplementaria 2). La duración total del vídeo es de 22 h y 39 min, con una resolución de 1920 × 1080 píxeles (reducida a 960 × 540) y 30 fps. La duración media de un vídeo es de 12 minutos y 57 segundos (σ=4:31 min). Un conjunto de datos es accesible públicamente en el repositorio Zenodo en la URL: https://doi.org/10.5281/zenodo.13847781. Las muestras representativas de entrada se muestran en la Figura Suplementaria 1 y la Figura Suplementaria 2. Aunque los conjuntos de datos CaDIS y SICS-105 fueron diseñados originalmente para el reconocimiento y segmentación de fases quirúrgicas en cirugía de cataratas, hay poca información sobre las complicaciones de la vitrectomía postoperatoria. Para abordar la falta de información sobre las complicaciones de la vitrectomía postoperatoria, proponemos un conjunto de etiquetas proxy para la información de riesgo basadas en patrones visuales intraoperatorios y eventos en la secuencia de vídeo. Los fotogramas y secuencias de vídeo en los conjuntos de datos se anotaron con información de riesgo de tres niveles (bajo, moderado, alto) según un conjunto de heurísticas inspiradas en el conocimiento clínico, incluyendo la complejidad de interacción instrumento-tejido, anomalías en la duración quirúrgica, oclusión, inestabilidad y movimiento anormal. La formulación propuesta no utiliza los resultados clínicos como etiquetas, sino que las trata como etiquetas proxy para la información de riesgo sobre posibles complicaciones postoperatorias.

Preprocesamiento usando el enfoque cGAN

Normalmente, los fotogramas en bruto suelen degradarse por variaciones de iluminación, desenfoque y artefactos especulares. Para abordar esto, se utiliza una Red Generativa Adversarial condicional (cGAN) para mejorar el vídeo. Los fotogramas en bruto son los fotogramas originales, sin procesar, extraídos directamente de grabaciones de vídeo con microscopía intraoperatoria, antes de cualquier mejora o normalización. Estos fotogramas suelen contener artefactos como variabilidad de la iluminación, desenfoque de movimiento, reflejos especulares y ruido procedente de instrumentos quirúrgicos y movimientos de cámara. Un generador restaura fotogramas limpios mientras que un discriminador refuerza el realismo visual. La función objetivo que integra la reconstrucción de píxeles, las pérdidas adversariales y de consistencia temporal, asegurando secuencias de vídeo estables y libres de artefactos para su análisis posterior.

Un fotograma degradado It en el paso temporal t es la entrada del generador, mientras que un fotograma mejorado Yt = G(It) es su salida. Condicionado a la entrada it, el discriminador se entrena para distinguir entre la salida generada y el marco Y t limpio de la verdadfundamental. El objetivo de entrenamiento incorpora varias funciones de pérdida para garantizar una reconstrucción de alta calidad: (i) pérdida adversarial para imponer el realismo; (ii) pérdida de reconstrucción píxel a píxel (pérdida L1) para mantener la fidelidad de intensidad; (iii) pérdida perceptual para preservar la consistencia estructural usando representaciones profundas de características; y (iv) pérdida de consistencia temporal para asegurar transiciones suaves entre fotogramas consecutivos y evitar artefactos de parpadeo.

Para garantizar una entrada de alta calidad para la extracción de características, los vídeos de microscopía intraoperatoria se mejoran inicialmente usando un cGAN. Cada fotograma en bruto It* se considera una observación degradada de un fotograma limpio . Un generador G aprende una correspondencia G(It) = It para restaurar fotogramas mejorados, mientras que el discriminador D distingue entre muestras reales y generadas. Un objetivo de entrenamiento integra la pérdida adversarial Ladv, , la pérdida perceptual L perc basada en píxeles L L 1 y la consistencia temporal Ltemp. Este modelo suprime el desenfoque, los artefactos especulares y el ruido, manteniendo la coherencia temporal y estructural, proporcionando secuencias de vídeo estables y libres de artefactos para análisis posteriores. La formulación de GAN se expresa en las Ecuaciones [1-6] del Archivo Suplementario 1.

Segmentación mediante Segmentación Adaptativa de Contorno (CAS)

En esto, la segmentación se realiza utilizando un modelo de segmentación adaptativo a los contornos. Esto define contornos preliminares para segmentar imágenes afectadas de vitrectomía en imágenes microscopicas, reduciendo así la función de energía, como se muestra en las ecuaciones [7-12] del archivo suplementario 1. El bajo valor energético garantiza representaciones precisas y una evaluación localizada de las regiones en riesgo. Esto, a su vez, permite una segmentación precisa de las regiones afectadas, lo que posteriormente facilita la extracción de características en la sección siguiente.

Extracción de características usando GCN(dGCN) espaciotemporal dinámico

Una vez completada la etapa de preprocesamiento, el siguiente paso es extraer características espaciotemporales discriminativas. Por esta razón, se utiliza una Red Convolucional de Grafos (GCN), ya que es eficaz para capturar dependencias estructuradas. El modelo adoptado comprende capas GCN apiladas con activaciones no lineales que mitigan el sobreajuste y abordan el problema de anulación del gradiente mediante un mecanismo de normalización. La formulación del GCN se basa en una aproximación espectral de primer orden de las convoluciones de grafos, lo que la hace adecuada para tareas de aprendizaje semi-supervisado a gran escala. Además, la representación linealizada simplifica la optimización, asegurando así un aprendizaje eficaz de los parámetros. El funcionamiento del GCN simplificado se expresa en las Ecuaciones [13–15] del Archivo Suplementario 1. Cuando se aplica, el GCN extrae de forma eficiente representaciones estructurales de mayor nivel a partir de datos de vídeo intraoperatorios. Posteriormente, solo se conservan las características más relevantes o apropiadas sobre un mecanismo de selección asistido por optimización, que se describe en la sección siguiente.

Optimización de características usando optimización adaptativa basada en girasol (ASFO)

El Algoritmo de Optimización Adaptativa de Girasoles (ASFO) es una versión mejorada del Enfoque Clásico de Optimización de Girasoles (SFOA). En el modelo sugerido, este proceso impulsado biológicamente se modela matemáticamente para abordar el refinamiento y la selección de características en un conjunto de datos de alta dimensión. Específicamente, este enfoque está diseñado para mejorar la velocidad de convergencia, equilibrar la exploración y explotación para preservar la diversidad de soluciones y mitigar la convergencia prematura. La formulación matemática de ASFO se expone en las Ecuaciones [16–21] del Archivo Suplementario 1. Este esquema acelera la convergencia una vez que las soluciones están cerca de lo óptimo. El algoritmo detallado se proporciona en el Archivo Suplementario 1. En la tubería propuesta, el ASFO se utiliza para refinar el vector de características tras la fusión basada en transformadores. Las características seleccionadas son basadas en texturas, color e intensidad, morfológicas y estructurales, de movimiento y temporales, de alta dimensión y descriptores de regiones ponderadas en atención. El objetivo es minimizar la función de pérdida de relevancia de características, seleccionando y ponderando así características que mejoren la precisión de la clasificación al reducir la redundancia.

Cabeza de clasificación basada en transformadores con agrupamiento de atención espaciotemporal

Se utiliza un modelo basado en transformadores para capturar dependencias temporales a través de secuencias de vídeo quirúrgicas. El modelo está configurado con autoatención multicabezal, codificación posicional y capas totalmente conectadas para la predicción final del riesgo. La optimización de hiperparámetros se realiza utilizando ASFO. La tubería integrada combina preprocesamiento, extracción de características, optimización y clasificación basada en transformadores para permitir una predicción precisa del riesgo quirúrgico.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para evaluar la efectividad del modelo propuesto, se realizaron experimentos extensos utilizando conjuntos de datos reales de vitrectomía. El rendimiento se evaluó en preprocesamiento, eficacia en la extracción de características y precisión en la predicción.

Análisis del rendimiento y estimación comparativa

La metodología propuesta se comparó con modelos de referencia utilizando métricas como precisión, precisión, ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Una evaluación experimental de los conjuntos de datos CaDIS y SICS-105 confirma la robustez y superioridad del modelo propuesto frente a los enfoques tradicionales. Modelos de referencia como ResNet-50, LSTM-CNN y redes basadas en segmentación (UNet, DeepLabV3+, UPerNet, HRNetV2) funcionan razonablemente bien, pero se ven obstaculizados por la variabilidad intraoperatoria inherente del vídeo, incluyendo cambios en la iluminación, oclusiones, desenfoque de movimiento e interacciones

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que revelar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores desean agradecer al Colegio Médico del Norte de Sichuan por proporcionar el apoyo institucional y los recursos necesarios. Un agradecimiento especial al personal clínico del Hospital Central de Guangyuan por su ayuda en la recopilación de los vídeos de microscopía intraoperatoria.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Estación de trabajo de alto rendimientoNVIDIA Corporation, EE. UU.RTX-A6000Utilizado para entrenamiento de modelos; GPU de 48 GB de VRAM con CPU Intel Core i9 y 128 GB de RAM
Python (v3.10)Fundación de Software PythonCódigo abiertoLenguaje de programación básico para el desarrollo y experimentación de modelos
TensorFlow (v2.15)Investigación en GoogleCódigo abiertoMarco utilizado para implementar el preprocesamiento cGAN y el clasificador Transformer
PyTorch (v2.2.0)Meta IACódigo abiertoUtilizado para implementar módulos de optimización GCN y Adaptive Sunflower
Kit de herramientas CUDA (v12.1)NVIDIA CorporationCUDA-12.1Proporciona aceleración GPU para todos los cálculos de aprendizaje profundo
Red Generativa Condicional Adversarial (cGAN)Adaptado de Pix2Pix FrameworkN/AUsado para mejorar vídeo y eliminar artefactos durante el preprocesamiento
Estimador óptico de flujo (RAFT)Teed & Deng (ECCV 2020)N/AGarantiza la consistencia temporal entre fotogramas durante el preprocesamiento
Modelo de segmentación adaptativa de contorno (CAS)Implementación personalizadaN/AModelo de contorno activo modificado para segmentación precisa de límites en vídeos de vitrectomía
Red Convolucional Dinámica de Grafos (GCN)Implementación personalizada (basada en Kipf & Welling, 2017)N/AExtrae relaciones espaciotemporales entre nodos de características de vídeo
Algoritmo Adaptativo de Optimización de Girasoles (ASFO)Implementación personalizadaN/AUtilizado para la selección optimizada de características y la reducción de dimensionalidad
Modelo de codificador de transformadorImplementación personalizada (basada en Vaswani et al., 2017)N/AUtilizado para la clasificación final de complicaciones postoperatorias con agrupación de atención espaciotemporal
Matplotlib (v3.8)Fundación de Software PythonCódigo abiertoUtilizado para la visualización de métricas de rendimiento y gráficos
Seaborn (v0.13)Fundación de Software PythonCódigo abiertoUtilizado para visualización avanzada y gráficos estadísticos
Adam OptimizerTensorFlow integradoN/AUtilizado para entrenamiento de modelos; Tasa de aprendizaje = 1e-4, β 1=0,9, β 2=0,999
Suite de Funciones de Pérdida (L_adv, L_l1, L_perc, L_temp, L_G)Implementación personalizadaN/ADefine pérdidas adversariales, perceptivas, píxeles y temporales para el entrenamiento GAN
Sistema operativoUbuntu Linux 22.04 LTSN/AEntorno base para experimentación de aprendizaje profundo
Paquete de Métricas de Evaluaciónscikit-learn (v1.5.0)Código abiertoUtilizado para calcular precisión, precisión, recall, puntuación F1, AUC y mIoU

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Z. R., Li, J. J., Li, K. R. Artificial intelligence in individualized retinal disease management. Int. J. Ophthalmol. 17, 1519(2024).
  2. Liu, Y., et al. Automated detection of nine infantile fundus diseases and conditions in retinal images using a deep learning system. EPMA J. 15, 39-51 (2024).
  3. Wang, X. N., et al. A deep learning system for detection of optic disc neovascularization in diabetic retinopathy. Vis. Comput. 41, 1293-1302 (2025).
  4. Ni, L., et al. Prediction of postoperative macular hole status by automated preoperative retinal OCT analysis. Ophthalmic Surg. Lasers Imaging Retina. 56, 355-360 (2025).
  5. Mathews, M. R., Anzar, S. M. Advancing computer-assisted diabetic retinopathy grading. Int. J. Imaging Syst. Technol. 35, e70152(2025).
  6. Wu, X. Y., et al. Bibliometric analysis of global myopia research. Int. J. Ophthalmol. 17, 940(2024).
  7. Rahat, S. R. U. I., et al. Advancing diabetic retinopathy detection with AI and deep learning. Br. J. Nurs. Stud. 5, 1-13 (2025).
  8. Rezaei, A., et al. Automated multimodal severity assessment of diabetic retinopathy. SSRN. , (2024).
  9. Suzue, M., et al. Predicting visual outcomes after vitrectomy. Graefes Arch. Clin. Exp. Ophthalmol. 263, 2505-2513 (2025).
  10. Sabeena, A. S., Jeyakumar, M. K. Ensemble deep learning for diabetic retinopathy classification. Biomater. Devices. , (2025).
  11. Gencer, K., et al. GAN-based approach for diabetic retinopathy detection. Photodiagn. Photodyn. Ther. 53, 104552(2025).
  12. Huang, Z., et al. Risk prediction model for neovascular glaucoma. Front. Cell Dev. Biol. 13, 1604832(2025).
  13. Wang, Y., Liu, L., Wang, C. Trends in deep learning for biomedical prediction. Front. Neurosci. 17, 1256351(2023).
  14. Tang, J., et al. Ectopic inner foveal layer as prognostic predictor. Sci. Rep. 15, 25066(2025).
  15. Shamsan, A., et al. Predicting diabetic retinopathy stages using deep learning. PLoS One. 18, e0289555(2023).
  16. Baldi, P. F., et al. Vitreoretinal surgical instrument tracking. Transl. Vis. Sci. Technol. 12, 20(2023).
  17. Yuan, S., et al. Risk factors after vitrectomy with silicone oil. Sci. Rep. 13, 10423(2023).
  18. Wei, Y., et al. DRDB platform for diabetic retinopathy. Oxid. Med. Cell Longev. 2022, 1718353(2022).
  19. Yagin, F. H., et al. Explainable AI for metabolomics analysis. Diagnostics. 14, 1364(2024).
  20. Nespolo, R. G. Intraoperative artificial intelligence in ophthalmology. , University of Illinois Chicago. Doctoral dissertation (2024).
  21. Nespolo, R. G., et al. Real-time segmentation in vitreoretinal surgery. Ophthalmol. Retina. 7, 236-242 (2023).
  22. Mishra, K., Leng, T. Artificial intelligence and ophthalmic surgery. Curr. Opin. Ophthalmol. 32, 425-430 (2021).
  23. Mueller, S., et al. AI in cataract surgery: systematic review. Transl. Vis. Sci. Technol. 13, 20(2024).
  24. Wen, D., et al. Postoperative visual acuity prediction. BMC Ophthalmol. 23, 361(2023).
  25. Hu, Y., et al. Prediction of macular hole status. Ann. Transl. Med. 9, 51(2021).
  26. Catania, F., et al. Deep learning for retinal detachment recurrence. Acta Ophthalmol. 102, e984-e993 (2024).
  27. Gan, F., et al. AI-PVR Insight system. Quant. Imaging Med. Surg. 15, 2774(2025).
  28. Lee, S. S., et al. Prediction after diabetic vitrectomy. Transl. Vis. Sci. Technol. 11, 25(2022).
  29. Kamnig, R., et al. Neural network for visual acuity prediction. Ophthalmol. Sci. 5, 100762(2025).
  30. Kim, J., et al. Prediction of vitreous hemorrhage causes. Diagnostics. 15, 371(2025).
  31. Flouty, E., et al. CaDIS dataset. CoRR. abs/1905.08993, (2019).
  32. Mueller, S., et al. Phase recognition in cataract surgery. Sci. Rep. 15, 16886(2025).
  33. Aravinda, C. V., et al. Hybrid architecture for video frame prediction. J. Real-Time Image Process. 22, 50(2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Marco de aprendizaje profundoan lisis de video intraoperatoriomejora de videosegmentaci n adaptativa de contornosredes neuronales convolucionales de grafosmodelo Transformersoporte para la toma de decisiones cl nicas

Artículos relacionados