$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Los conjuntos de datos CaDIS y SICS-105 utilizados en este estudio están disponibles públicamente y fueron recopilados originalmente con la aprobación previa del comité de revisión institucional y consentimiento informado, según se informa en sus respectivas publicaciones. Este estudio implica únicamente un análisis secundario de datos completamente anonimizados y, por tanto, no se requirió aprobación ética adicional ni consentimiento informado.
El modelo sugerido fue diseñado para predecir complicaciones de vitrectomía postoperatoria aprovechando patrones espaciotemporales de vídeos de microscopía intraoperatoria. La tubería consta de cuatro etapas principales: preprocesamiento, segmentación, extracción de características, optimización de características y clasificación, como se muestra en la Figura 1.
La evaluación intraoperatoria del riesgo de complicaciones postoperatorias es el objetivo de predicción del estudio. El modelo no puede predecir eventos postoperatorios clínicamente verificados dentro de un periodo temporal específico porque los conjuntos de datos CaDIS y SICS-105 carecen de datos longitudinales de seguimiento. Más bien, utiliza patrones quirúrgicos intraoperatorios para inferir la probabilidad de posibles problemas. Las definiciones operativas de "complicación" en este contexto incluyen transiciones de fase irregulares, interacciones anómalas instrumento-tejido y variaciones en el flujo de trabajo quirúrgico asociadas a una mayor complejidad quirúrgica. Para garantizar la interpretabilidad y una evaluación fiable, el trabajo de predicción está diseñado como un problema de clasificación binaria que clasifica los casos en grupos de bajo y alto riesgo. En lugar de servir como un sistema clínico diagnóstico directo, esta formulación permite que el marco sugerido sirva como una herramienta de apoyo a la decisión intraoperatoria.
Descripción del conjunto de datos:
El modelo propuesto fue evaluado en dos conjuntos de datos: el conjunto de datos A (CaDIS, Conjunto de datos de cataratas para segmentación de imágenes) y el conjunto de datos SICS-105 (Cirugía de Cataratas de Pequeña Incisión).
(i) CaDIS31: Este conjunto de datos fue desarrollado para la tarea de segmentación en vídeos de cirugía de cataratas. Esto se introduce para complementar el conjunto de datos de desafíos CATARACTAS disponible públicamente y, por tanto, tiene como objetivo avanzar en el desarrollo de esquemas DL para el análisis de vídeos quirúrgicos. El conjunto de datos consta de 25 grabaciones de vídeo que suman un total de 4.670 fotogramas anotados, que representan varias etapas de la cirugía de cataratas (Figura suplementaria 1). Cada fotograma está meticulosamente anotado, proporcionando etiquetas a nivel de píxel necesarias para entrenar y estimar el esquema de segmentación. Sirve como referencia para evaluar el rendimiento del modelo DL en vídeos quirúrgicos.
(ii) Conjunto de datos SICS-105 (cirugía de cataratas de pequeña incisión) 32: Este conjunto de datos comprende 105 registros realizados por cirujanos y anotados por cuatro oftalmólogos durante un periodo de 6 meses entre 2023 y 2024, cubriendo 20 fases (Figura suplementaria 2). La duración total del vídeo es de 22 h y 39 min, con una resolución de 1920 × 1080 píxeles (reducida a 960 × 540) y 30 fps. La duración media de un vídeo es de 12 minutos y 57 segundos (σ=4:31 min). Un conjunto de datos es accesible públicamente en el repositorio Zenodo en la URL: https://doi.org/10.5281/zenodo.13847781. Las muestras representativas de entrada se muestran en la Figura Suplementaria 1 y la Figura Suplementaria 2. Aunque los conjuntos de datos CaDIS y SICS-105 fueron diseñados originalmente para el reconocimiento y segmentación de fases quirúrgicas en cirugía de cataratas, hay poca información sobre las complicaciones de la vitrectomía postoperatoria. Para abordar la falta de información sobre las complicaciones de la vitrectomía postoperatoria, proponemos un conjunto de etiquetas proxy para la información de riesgo basadas en patrones visuales intraoperatorios y eventos en la secuencia de vídeo. Los fotogramas y secuencias de vídeo en los conjuntos de datos se anotaron con información de riesgo de tres niveles (bajo, moderado, alto) según un conjunto de heurísticas inspiradas en el conocimiento clínico, incluyendo la complejidad de interacción instrumento-tejido, anomalías en la duración quirúrgica, oclusión, inestabilidad y movimiento anormal. La formulación propuesta no utiliza los resultados clínicos como etiquetas, sino que las trata como etiquetas proxy para la información de riesgo sobre posibles complicaciones postoperatorias.
Preprocesamiento usando el enfoque cGAN
Normalmente, los fotogramas en bruto suelen degradarse por variaciones de iluminación, desenfoque y artefactos especulares. Para abordar esto, se utiliza una Red Generativa Adversarial condicional (cGAN) para mejorar el vídeo. Los fotogramas en bruto son los fotogramas originales, sin procesar, extraídos directamente de grabaciones de vídeo con microscopía intraoperatoria, antes de cualquier mejora o normalización. Estos fotogramas suelen contener artefactos como variabilidad de la iluminación, desenfoque de movimiento, reflejos especulares y ruido procedente de instrumentos quirúrgicos y movimientos de cámara. Un generador restaura fotogramas limpios mientras que un discriminador refuerza el realismo visual. La función objetivo que integra la reconstrucción de píxeles, las pérdidas adversariales y de consistencia temporal, asegurando secuencias de vídeo estables y libres de artefactos para su análisis posterior.
Un fotograma degradado It en el paso temporal t es la entrada del generador, mientras que un fotograma mejorado Yt = G(It) es su salida. Condicionado a la entrada it, el discriminador se entrena para distinguir entre la salida generada y el marco Y t limpio de la verdadfundamental. El objetivo de entrenamiento incorpora varias funciones de pérdida para garantizar una reconstrucción de alta calidad: (i) pérdida adversarial para imponer el realismo; (ii) pérdida de reconstrucción píxel a píxel (pérdida L1) para mantener la fidelidad de intensidad; (iii) pérdida perceptual para preservar la consistencia estructural usando representaciones profundas de características; y (iv) pérdida de consistencia temporal para asegurar transiciones suaves entre fotogramas consecutivos y evitar artefactos de parpadeo.
Para garantizar una entrada de alta calidad para la extracción de características, los vídeos de microscopía intraoperatoria se mejoran inicialmente usando un cGAN. Cada fotograma en bruto It* se considera una observación degradada de un fotograma limpio . Un generador G aprende una correspondencia G(It) = It para restaurar fotogramas mejorados, mientras que el discriminador D distingue entre muestras reales y generadas. Un objetivo de entrenamiento integra la pérdida adversarial Ladv, , la pérdida perceptual L perc basada en píxeles L L 1 y la consistencia temporal Ltemp. Este modelo suprime el desenfoque, los artefactos especulares y el ruido, manteniendo la coherencia temporal y estructural, proporcionando secuencias de vídeo estables y libres de artefactos para análisis posteriores. La formulación de GAN se expresa en las Ecuaciones [1-6] del Archivo Suplementario 1.
Segmentación mediante Segmentación Adaptativa de Contorno (CAS)
En esto, la segmentación se realiza utilizando un modelo de segmentación adaptativo a los contornos. Esto define contornos preliminares para segmentar imágenes afectadas de vitrectomía en imágenes microscopicas, reduciendo así la función de energía, como se muestra en las ecuaciones [7-12] del archivo suplementario 1. El bajo valor energético garantiza representaciones precisas y una evaluación localizada de las regiones en riesgo. Esto, a su vez, permite una segmentación precisa de las regiones afectadas, lo que posteriormente facilita la extracción de características en la sección siguiente.
Extracción de características usando GCN(dGCN) espaciotemporal dinámico
Una vez completada la etapa de preprocesamiento, el siguiente paso es extraer características espaciotemporales discriminativas. Por esta razón, se utiliza una Red Convolucional de Grafos (GCN), ya que es eficaz para capturar dependencias estructuradas. El modelo adoptado comprende capas GCN apiladas con activaciones no lineales que mitigan el sobreajuste y abordan el problema de anulación del gradiente mediante un mecanismo de normalización. La formulación del GCN se basa en una aproximación espectral de primer orden de las convoluciones de grafos, lo que la hace adecuada para tareas de aprendizaje semi-supervisado a gran escala. Además, la representación linealizada simplifica la optimización, asegurando así un aprendizaje eficaz de los parámetros. El funcionamiento del GCN simplificado se expresa en las Ecuaciones [13–15] del Archivo Suplementario 1. Cuando se aplica, el GCN extrae de forma eficiente representaciones estructurales de mayor nivel a partir de datos de vídeo intraoperatorios. Posteriormente, solo se conservan las características más relevantes o apropiadas sobre un mecanismo de selección asistido por optimización, que se describe en la sección siguiente.
Optimización de características usando optimización adaptativa basada en girasol (ASFO)
El Algoritmo de Optimización Adaptativa de Girasoles (ASFO) es una versión mejorada del Enfoque Clásico de Optimización de Girasoles (SFOA). En el modelo sugerido, este proceso impulsado biológicamente se modela matemáticamente para abordar el refinamiento y la selección de características en un conjunto de datos de alta dimensión. Específicamente, este enfoque está diseñado para mejorar la velocidad de convergencia, equilibrar la exploración y explotación para preservar la diversidad de soluciones y mitigar la convergencia prematura. La formulación matemática de ASFO se expone en las Ecuaciones [16–21] del Archivo Suplementario 1. Este esquema acelera la convergencia una vez que las soluciones están cerca de lo óptimo. El algoritmo detallado se proporciona en el Archivo Suplementario 1. En la tubería propuesta, el ASFO se utiliza para refinar el vector de características tras la fusión basada en transformadores. Las características seleccionadas son basadas en texturas, color e intensidad, morfológicas y estructurales, de movimiento y temporales, de alta dimensión y descriptores de regiones ponderadas en atención. El objetivo es minimizar la función de pérdida de relevancia de características, seleccionando y ponderando así características que mejoren la precisión de la clasificación al reducir la redundancia.
Cabeza de clasificación basada en transformadores con agrupamiento de atención espaciotemporal
Se utiliza un modelo basado en transformadores para capturar dependencias temporales a través de secuencias de vídeo quirúrgicas. El modelo está configurado con autoatención multicabezal, codificación posicional y capas totalmente conectadas para la predicción final del riesgo. La optimización de hiperparámetros se realiza utilizando ASFO. La tubería integrada combina preprocesamiento, extracción de características, optimización y clasificación basada en transformadores para permitir una predicción precisa del riesgo quirúrgico.