Article de recherche

Analyse spatiotemporelle basée sur l’apprentissage profond des vidéos de chirurgie de la cataracte pour l’évaluation des risques chirurgicaux

DOI :

10.3791/70025

15 mai 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un pipeline d’apprentissage profond pour prédire le risque chirurgical à partir de vidéos de microscopie intraopératoire en utilisant le prétraitement cGAN, la segmentation, le GCN, l’ASFO et la modélisation des transformateurs. Une haute performance est atteinte sur les ensembles de données CaDIS et SICS-105, bien que la validité clinique soit limitée par l’étiquetage indirect.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les complications postopératoires restent un défi important lors de la vitrectomie, conduisant souvent à des résultats visuels altérés et à des interventions répétées. Cette étude présente un cadre d’apprentissage profond pour prédire le risque chirurgical en extrayant des caractéristiques spatiotemporales à partir de vidéos de microscopie intraopératoire. Lors du prétraitement, des techniques d’amélioration vidéo, incluant la stabilisation du mouvement, la normalisation de l’illumination et la suppression d’artefacts basée sur cGAN, sont appliquées pour améliorer la qualité des entrées. La segmentation adaptative aux contours est employée pour délimiter les régions chirurgicales pertinentes, suivie des réseaux convolutionnels de graphes pour l’extraction de caractéristiques conscientes de la structure. Une approche d’optimisation adaptative du tournesol est intégrée pour affiner la sélection des caractéristiques, et un modèle basé sur un transformateur capture les dépendances temporelles pour la prédiction finale du risque. Le cadre est évalué sur deux ensembles de données publics, CaDIS et SICS-105. Le modèle a obtenu 98,9 % de précision, 97,5 % de précision, 98,2 % de rappel, 97,9 % de score F1 et 98,1 % d’AUC sur le jeu de données CaDIS. De plus, le module de segmentation a atteint 98,9 % de précision en pixels, 98,5 % par classe et 96,6 % de mIoU. Le modèle a obtenu une précision de 99,1 %, un score F1 de 98,5 %, une sensibilité de 98,7 %, une spécificité de 98,7 %, ainsi qu’un AUC de 99,10 % sur le jeu de données SICS-105. Ces résultats démontrent des améliorations constantes par rapport aux modèles de base. Dans l’ensemble, l’intégration du prétraitement amélioré par GAN, de l’apprentissage des caractéristiques par graphes, de l’optimisation et de la modélisation par transformateurs améliore la fiabilité prédicative. Cette approche met en lumière le potentiel de l’analyse vidéo intraopératoire pour un soutien clinique à la décision en temps réel et une stratification du risque postopératoire améliorée.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La vitrectomie à la pars plana (VPP) est une base pour les interventions chirurgicales dans la prise en charge de diverses maladies du vitri-rétinien, notamment le décollement de la rétine, la rétinopathie diabétique, le trou maculaire et l’hémorragievitrée 1. Malgré les avancées dans l’instrumentation chirurgicale et la visualisation, les complications postopératoires restent une source importante de morbidité, avec des résultats allant de troubles visuels mineurs à des événements menaçant la vision tels qu’un décollement récidient de la rétine, une endophtalmite ou une pression intraoculaireincontrôlée 2. L’identification des patients à risque élevé de ces complications est un besoin crucial non satisfait en pratique clinique, car elle permet une planification chirurgicale plus éclairée, des soins postopératoires personnalisés et des interventionsen temps opportun 3. Traditionnellement, l’évaluation du risque en PPV s’est appuyée sur des facteurs préopératoires statiques (tels que les comorbidités et les affections oculaires préopératoires) et sur le jugement subjectif intraopératoire du chirurgien 4,5,6,7. De plus, la récente vitrectomie est largement documentée dans une vidéo de microscopie chirurgicale haute résolution, offrant une source de données riche, mais sous-utilisée. Ces enregistrements capturent ainsi non seulement des caractéristiques anatomiques et pathologiques, mais aussi les interactions chirurgien-tissu, les événements intraopératoires et les mouvements chirurgicaux pouvant prédire d’autres complications 8,9,10,11.

L’apprentissage profond a montré des performances remarquables dans divers domaines de l’ophtalmologie, notamment la classification des images du fond d’œil, l’évaluation automatisée des compétences chirurgicales et l’analyse par tomographie de cohérence optique (OCT) 12. De plus, certaines études ont systématiquement exploité les données vidéo intraopératoires pour prédire les résultats postopératoires. La nature spatio-temporelle des vidéos chirurgicales pose des défis uniques : données en haute dimension, variabilité selon les chirurgiens, dépendances temporelles, anatomie du patient et dispositifs 13,14,15,16. Cependant, une intégration éloquente du domaine clinique nécessite non seulement des prédictions précises ou précises, mais aussi robustesse, interprétabilité et généralisation à travers les milieux chirurgicauxen temps réel 17.

Dans les domaines de l’ophtalmologie et de la science des donnéeschirurgicales 18, l’apprentissage automatique (ML) et l’apprentissage profond (DL) sont récemment devenus très populaires. Leurs applications incluent la prédiction des résultats, l’évaluation des compétences chirurgicales et l’imageriediagnostique 19. Des cadres basés sur la DL pour comprendre les situations chirurgicales intraopératoires ont été étudiés dans plusieurs études. Par exemple, Nespolo20 a démontré la généralisabilité à travers les tâches en proposant un pipeline DL pour l’interprétation sémantique des tissus et instruments en chirurgie vitré-rétinienne. Pour faciliter une évaluation objective de la performance, cela a été élargi afin de permettre l’extraction de données complètes sur les techniques chirurgicales et les interactions instrument-tissu. Dans le même ordre d’idées, Nespolo et al.21 ont démontré la viabilité du guidage chirurgical en développant un modèle de détection et de segmentation en temps réel utilisant la microscopie intraopératoire et un réseau de segmentation d’instances (YOLACT++).

De plus, les méthodes pilotées par l’IA ont été reconnues comme des outils utiles pour améliorer les flux de travail, la formation et l’évaluationchirurgicale 22,23. Ces techniques permettent la segmentation de phase, le suivi en temps réel des instruments et une sécurité accrue en microchirurgie ophtalmique. L’utilisation croissante de l’apprentissage automatique (ML) dans l’analyse des enregistrements chirurgicaux intraopératoires a été également démontrée par une revue systématique de Mueller et al.23, qui a également mis en lumière les problèmes actuels de traduction clinique et de fiabilité. Plusieurs études ont utilisé des modèles DL avec des données d’imagerie et cliniques pour prédire les résultats postopératoires. Par exemple, des modèles basés sur l’OCT et les caractéristiques cliniques ont été utilisés pour prédire les résultats visuels dans les cas de membrane épirétinienneidiopathique 24, et des méthodes similaires ont montré une efficacité dans la prédiction des résultats postopératoires chez les patients atteints de trou maculaire à travers des ensembles de donnéesmulticentriques 25. D’autres études se sont concentrées sur la détermination de la gravité de la vitrréorétinopathie proliférative à l’aide de cadres multimodaux DL26 et la prédiction de la récidive du décollement de la rétine à l’aide de l’imagerie ultra-largechamp 27. De plus, les résultats visuels et les étiologies sous-jacentes dans les maladies vitré-rétiniennes ont été prédits à l’aide de modèles d’apprentissage automatique intégrant des variables démographiques, cliniques etchirurgicales 28,29,30.

Malgré ces avancées, la majorité des méthodes actuelles accordent peu d’importance à la dynamique intraopératoire et s’appuient principalement sur des données préopératoires ou une imagerie postopératoire statique. Bien que certaines études utilisent l’analyse vidéo chirurgicale pour la segmentation etl’évaluation 20,21,22,23, elles n’intègrent pas directement les données intraopératoires spatiotemporelles pour prédire la probabilité de complications. En conséquence, il existe encore un écart important dans l’utilisation des données vidéo microscopiques intraopératoires pour la modélisation prédictive. Pour créer des cadres précis et cliniquement significatifs pour prédire les complications post-opératoires de vitrectomie, ce manque doit être comblé.

Dans cette étude, un nouveau cadre multimodal de DL est présenté qui intègre des caractéristiques spatiotemporelles extraites des vidéos de vitrectomie intraopératoire avec des métadonnées cliniques structurées pour prédire le risque de complications postopératoires. En utilisant des encodeurs vidéo avancés (tels que des architectures convolutionnelles et basées sur transformateurs) ainsi que des stratégies de fusion demétadonnées 18, ce schéma vise à reconnaître les événements intraopératoires à haut risque, à fournir des probabilités de complication calibrées et à générer des visualisations interprétables pour les médecins. Par estimation multicentrique, analyses d’interprétabilité et études comparatives, la faisabilité d’utiliser la vidéo intraopératoire comme biomarqueur prédictif du résultat chirurgical estdémontrée 18. Le développement d’un cadre solide de DL utilisant les données spatiotemporelles issues d’enregistrements intraopératoires au microscope pour prévoir les complications postopératoires lors de la vitrectomie est l’objectif principal de ce projet. En termes de précision prédictive et de généralisation, l’approche intégrée proposée, qui combine le prétraitement basé sur cGAN, l’extraction de caractéristiques pilotée par GCN, l’optimisation basée sur l’ASFO et la modélisation basée sur des transformateurs, devrait surpasser les méthodes actuelles.

Ce travail exploite efficacement les vidéos du microscope intraopératoire pour présenter un cadre complet de DL pour la prédiction du problème postopératoire de vitrectomie. Contrairement aux méthodes actuelles, qui reposent principalement sur des modalités d’imagerie statiques ou des données cliniques préopératoires, la méthodologie proposée combine de manière novatrice des techniques avancées d’apprentissage automatique avec l’analyse vidéo spatiotemporelle. En particulier, la méthodologie utilise des réseaux convolutionnels de graphes (GCN) pour capturer les relations structurelles et relationnelles dans les scènes chirurgicales, la segmentation adaptative de contour (CAS) pour une délimitation précise des régions, et un module d’amélioration vidéo basé sur cGAN pour la suppression des artefacts. De plus, pour améliorer la convergence des modèles et la puissance discriminatoire, un algorithme d’optimisation adaptative du tournesol (ASFO) est utilisé pour équilibrer exploration et exploitation dans la sélection des caractéristiques. Enfin, la dynamique temporelle entre les séquences chirurgicales est modélisée à l’aide d’une architecture basée sur un transformateur avec pooling d’attention spatio-temporelle. Amélioration majeure par rapport aux pipelines actuels, cette intégration complète du prétraitement, de la segmentation, de l’apprentissage des caractéristiques basé sur les graphes, de l’optimisation et de la prédiction axée sur l’attention permet une prédiction des risques plus précise, fiable et cliniquement significative. Les ensembles de données CaDIS et SICS-105 sont utilisés dans cette étude comme ensembles visuels proxy pour apprendre les caractéristiques spatiotemporales intraopératoires, bien que leur objectif principal soit l’analyse de la chirurgie de la cataracte. Au lieu d’utiliser des labels de complication explicitement marqués, ces traits servent ensuite à modéliser et à déduire le risque de problèmes de vitrectomie postopératoire.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les ensembles de données CaDIS et SICS-105 utilisés dans cette étude sont accessibles au public et ont été initialement collectés avec l’approbation préalable du comité d’examen institutionnel et le consentement éclairé, tels que rapportés dans leurs publications respectives. Cette étude ne consiste qu’en analyse secondaire de données entièrement anonymisées, et par conséquent, aucune approbation éthique supplémentaire ni consentement éclairé n’a été requis.

Le modèle suggéré a été conçu pour prédire les complications de vitrectomie postopératoire en exploitant les schémas spatiotemporaux issus des vidéos de microscopie intraopératoire. Le pipeline comprend quatre étapes majeures : prétraitement, segmentation, extraction de caractéristiques, optimisation des fonctionnalités et classification, comme montré à la Figure 1.

L’évaluation intraopératoire du risque de complications postopératoires constitue la cible de prédiction de l’étude. Le modèle ne peut pas prévoir les événements postopératoires cliniquement vérifiés dans une fenêtre de temps spécifique car les ensembles de données CaDIS et SICS-105 ne disposent pas de données longitudinales de suivi. Elle utilise plutôt des schémas chirurgicaux intraopératoires pour déduire la probabilité de problèmes possibles. Les définitions opérationnelles de « complication » dans ce contexte incluent des transitions de phase irrégulières, des interactions anormales instrument-tissu, et des variations dans le flux de travail chirurgical associées à une plus grande complexité chirurgicale. Pour garantir l’interprétabilité et une évaluation fiable, la tâche de prédiction est conçue comme un problème de classification binaire qui classe les cas en groupes à faible et haut risque. Au lieu de servir de système diagnostique clinique direct, cette formulation permet au cadre suggéré de servir d’outil d’aide à la décision intraopératoire.

Description du jeu de données :

Le modèle proposé a été évalué sur deux ensembles de données : l’ensemble de données A (CaDIS, jeu de données de cataractes pour segmentation d’images) et le jeu de données SICS-105 (chirurgie de la cataracte à petite incision).

(i) CaDIS31 : Ce jeu de données a été développé pour la tâche de segmentation dans les vidéos de chirurgie de la cataracte. Cette technologie est introduite pour compléter le jeu de données de défis CATARACT, disponible publiquement, et vise ainsi à faire progresser le développement de schémas DL pour l’analyse des vidéos chirurgicales. L’ensemble de données comprend 25 enregistrements vidéo totalisant 4 670 images annotées, illustrant plusieurs étapes de la chirurgie de la cataracte (Figure supplémentaire 1). Chaque image est méticuleusement annotée, fournissant des étiquettes au niveau du pixel nécessaires pour entraîner et estimer le schéma de segmentation. Il sert de référence pour évaluer la performance du modèle DL sur les vidéos chirurgicales.

(ii) Ensemble de données SICS-105 (chirurgie de la cataracte à petite incision)32 : Ce jeu de données comprend 105 enregistrements réalisés par des chirurgiens et annotés par quatre ophtalmologistes sur une période de 6 mois entre 2023 et 2024, couvrant 20 phases (Figure supplémentaire 2). La durée totale de la vidéo est de 22 h et 39 min, avec une résolution de 1920 × 1080 pixels (réduite à 960 × 540) et 30 fps. La durée moyenne d’une vidéo est de 12 minutes et 57 secondes (σ=4:31 min). Un jeu de données est accessible publiquement dans le dépôt Zenodo à l’URL : https://doi.org/10.5281/zenodo.13847781. Des échantillons d’entrée représentatifs sont présentés dans la Figure 1 et la Figure 2 en supplément. Bien que les ensembles de données CaDIS et SICS-105 aient été initialement conçus pour la reconnaissance et la segmentation de la phase chirurgicale en chirurgie de la cataracte, les informations sur les complications postopératoires de vitrectomie sont limitées. Pour pallier le manque d’informations sur les complications postopératoires de vitrectomie, nous proposons un ensemble d’étiquettes proxy pour les informations de risque basées sur les schémas visuels intraopératoires et les événements dans la séquence vidéo. Les images et séquences vidéo dans les ensembles de données ont été annotées avec des informations de risque à trois niveaux (faible, modéré, élevé) selon un ensemble d’heuristiques inspirées par la compréhension clinique, incluant la complexité des interactions instrument-tissu, les anomalies de durée chirurgicale, l’occlusion, l’instabilité et les mouvements anormaux. La formulation proposée n’utilise pas les résultats cliniques comme étiquettes mais les traite plutôt comme des étiquettes proxys pour les informations sur les risques concernant les complications postopératoires potentielles.

Prétraitement utilisant l’approche cGAN

Typiquement, les images brutes sont souvent dégradées par la variation de l’éclairage, le flou et les artefacts spéculaires. Pour y remédier, un réseau antagoniste génératif conditionnel (cGAN) est utilisé pour améliorer la vidéo. Les images brutes sont les images originales, non traitées, extraites directement des enregistrements vidéo par microscopie intraopératoire, avant toute amélioration ou normalisation. Ces images contiennent généralement des artefacts tels que la variabilité de l’éclairage, le flou de mouvement, les reflets spéculaires et le bruit provenant des instruments chirurgicaux et des mouvements de caméra. Un générateur restaure des images propres tandis qu’un discriminateur impose un réalisme visuel. La fonction objectif qui intègre la reconstruction des pixels, les pertes de cohérence adversaire et temporelle, garantissant des séquences vidéo stables et sans artefacts pour une analyse ultérieure.

Un référentiel dégradé It à l’étape temporelle t est l’entrée du générateur, tandis qu’un référentiel amélioré Yt = G(It) en est la sortie. Conditionné à l’entrée It, le discriminateur est entraîné à distinguer entre la sortie générée et le référentiel clair Yt. L’objectif de formation intègre plusieurs fonctions de perte pour garantir une reconstruction de haute qualité : (i) la perte adversaire pour imposer le réalisme ; (ii) perte de reconstruction pixel par pixel (perte L1) pour maintenir la fidélité d’intensité ; (iii) la perte perceptuelle pour préserver la cohérence structurelle en utilisant des représentations profondes des caractéristiques ; et (iv) perte de cohérence temporelle pour assurer des transitions fluides entre images consécutives et prévenir les artefacts de scintillement.

Pour garantir une entrée de haute qualité pour l’extraction des caractéristiques, les vidéos de microscopie intraopératoire sont initialement améliorées à l’aide d’un cGAN. Chaque image brute It* est considérée comme une observation dégradée d’une image propre . Un générateur G apprend une application G(It) = It pour restaurer des images améliorées, tandis que le discriminateur D distingue entre échantillons réels et générés. Un objectif d’entraînement intègre la perte adversaire Ladv, la perte perceptuelle Lperc la perte de reconstruction basée sur le pixel L, et la consistance temporelle Ltemp. Ce modèle supprime le flou, les artefacts spéculaires et le bruit tout en maintenant la cohérence temporelle et structurelle, offrant des séquences vidéo stables et sans artéfact pour une analyse en aval. La formulation de GAN est exprimée dans les Équations [1-6] du Fichier Supplémentaire 1.

Segmentation utilisant la segmentation adaptative de contour (CAS)

Dans ce cas, la segmentation est réalisée à l’aide d’un modèle de segmentation adaptatif aux contours. Cela définit des contours préliminaires pour segmenter les images affectées de vitrectomie dans les images microscopiques, réduisant ainsi la fonction d’énergie, comme montré dans les équations [7-12] du fichier supplémentaire 1. La faible valeur énergétique assure des représentations précises et une évaluation localisée des régions à risque. Cela permet à son tour une segmentation précise des régions touchées, ce qui facilite ensuite l’extraction des caractéristiques dans la section suivante.

Extraction de caractéristiques utilisant le GCN spatiotemporal dynamique (dGCN)

Une fois l’étape de prétraitement terminée, l’étape suivante consiste à extraire les caractéristiques spatiotemporelles discriminantes. Pour cette raison, un réseau convolutionnel de graphes (GCN) est utilisé, car il est efficace pour capturer les dépendances structurées. Le modèle adopté comprend des couches GCN empilées avec des activations non linéaires qui atténuent le surajustement et résolvent le problème de nullité du gradient grâce à un mécanisme de normalisation. La formulation du NCG repose sur une approximation spectrale du premier ordre des convolutions de graphes, ce qui la rend adaptée aux tâches d’apprentissage semi-supervisées à grande échelle. De plus, la représentation linéarisée simplifie l’optimisation, assurant ainsi un apprentissage efficace des paramètres. Le fonctionnement du GCN simplifié est exprimé dans les équations [13–15] du fichier supplémentaire 1. Lorsqu’il est appliqué, le GCN extrait efficacement des représentations structurelles de haut niveau à partir de données vidéo intraopératoires. Par la suite, seules les caractéristiques les plus pertinentes ou appropriées sont ainsi conservées par rapport à un mécanisme de sélection assisté par l’optimisation, décrit dans la section suivante.

Optimisation des caractéristiques en utilisant l’optimisation adaptative des caractéristiques basée sur le tournesol (ASFO)

L’Algorithme d’Optimisation Adaptative des Tournesols (ASFO) est une version améliorée de l’Approche classique d’optimisation des tournesols (SFOA). Dans le modèle suggéré, ce processus biologiquement piloté est modélisé mathématiquement pour aborder le raffinement et la sélection des caractéristiques dans un ensemble de données à haute dimension. Plus précisément, cette approche est conçue pour améliorer la vitesse de convergence, équilibrer l’exploration et l’exploitation afin de préserver la diversité des solutions, et atténuer la convergence prématurée. La formulation mathématique de l’ASFO est exposée dans les Équations [16–21] du Fichier Supplémentaire 1. Ce schéma accélère la convergence une fois que les solutions sont proches de l’optimalité. L’algorithme détaillé est fourni dans le Fichier Supplémentaire 1. Dans la chaîne proposée, l’ASFO est utilisée pour affiner le vecteur de caractéristiques après fusion basée sur un transformateur. Les caractéristiques sélectionnées sont basées sur la texture, la couleur et l’intensité, morphologiques et structurelles, le mouvement et le temps, les descripteurs de région à haute dimension et pondérés par l’attention. L’objectif est de minimiser la fonction de perte de pertinence des caractéristiques, sélectionnant ainsi et pondérant les caractéristiques qui améliorent la précision de la classification en réduisant la redondance.

Tête de classification basée sur transformateurs avec pooling d’attention spatio-temporelle

Un modèle basé sur un transformateur est utilisé pour capturer les dépendances temporelles à travers les séquences vidéo chirurgicales. Le modèle est configuré avec une auto-attention multi-têtes, un codage positionnel et des couches entièrement connectées pour la prédiction finale du risque. L’optimisation des hyperparamètres est réalisée à l’aide de l’ASFO. Le pipeline intégré combine prétraitement, extraction de caractéristiques, optimisation et classification basée sur transformateurs afin de permettre une prédiction précise des risques chirurgicaux.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour évaluer l’efficacité du modèle proposé, des expériences approfondies ont été menées à l’aide de jeux de données de vitrectomie du monde réel. La performance a été évaluée en prétraitement, en efficacité à l’extraction des caractéristiques et en précision des prédictions.

Analyse de performance et estimation comparative

La méthodologie proposée a été comparée à des modèles de référence utilisant des métriques te...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Une évaluation expérimentale des ensembles de données CaDIS et SICS-105 confirme la robustesse et la supériorité du modèle proposé par rapport aux approches traditionnelles. Les modèles de référence comme ResNet-50, LSTM-CNN et les réseaux pilotés par segmentation (UNet, DeepLabV3+, UPerNet, HRNetV2) fonctionnent raisonnablement bien mais sont freinés par une variabilité vidéo intraopératoire inhérente, incluant des changements d’éclairage, des occlusions, du flou de mouvement et des int...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à divulguer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs tiennent à remercier le Collège Médical du Nord du Sichuan pour avoir fourni le soutien institutionnel et les ressources nécessaires. Un grand merci au personnel clinique de l’hôpital central de Guangyuan pour son aide à collecter les vidéos de microscopie intraopératoire.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Station de travail haute performanceNVIDIA Corporation, États-UnisRTX-A6000Utilisé pour l’entraînement de modèles ; GPU VRAM de 48 Go avec processeur Intel Core i9 et 128 Go de RAM
Python (v3.10)Fondation Python SoftwareOpen SourceLangage de programmation de base pour le développement et l’expérimentation de modèles
TensorFlow (v2.15)Google ResearchOpen SourceCadre utilisé pour implémenter le prétraitement cGAN et le classificateur Transformer
PyTorch (v2.2.0)Méta IAOpen SourceUtilisé pour la mise en œuvre des modules GCN et Adaptive Sunflower Optimization
Boîte à outils CUDA (v12.1)NVIDIA CorporationCUDA-12.1Fournit une accélération GPU pour tous les calculs d’apprentissage profond
Réseau antagoniste génératif conditionnel (cGAN)Adapté du cadre Pix2PixN/AUtilisé pour l’amélioration vidéo et l’élimination d’artefacts lors du prétraitement
Estimateur optique de débit (RAFT)Teed & Deng (ECCV 2020)N/AAssure une cohérence temporelle entre les trames lors du prétraitement
Modèle de segmentation adaptative de contour (CAS)Implémentation personnaliséeN/AModèle de contour actif modifié pour une segmentation précise des limites dans les vidéos de vitrectomie
Réseau convolutionnel dynamique de graphes (GCN)Implémentation personnalisée (basée sur Kipf & Welling, 2017)N/AExtrait les relations spatiotemporelles entre les nœuds de caractéristiques vidéo
Algorithme d’optimisation adaptative du tournesol (ASFO)Implémentation personnaliséeN/AUtilisé pour la sélection optimisée des caractéristiques et la réduction de dimensionnalité
Modèle d’encodeur transformateurImplémentation personnalisée (basée sur Vaswani et al., 2017)N/AUtilisé pour la classification finale des complications postopératoires avec regroupement spatiotemporel de l’attention
Matplotlib (v3.8)Fondation Python SoftwareOpen SourceUtilisé pour la visualisation de métriques de performance et de graphiques
Seaborn (v0.13)Fondation Python SoftwareOpen SourceUtilisé pour la visualisation avancée et les graphiques statistiques
Adam OptimiserTensorFlow intégréN/AUtilisé pour l’entraînement de modèles ; taux d’apprentissage = 1e-4, &bêta ; 1=0,9, &bêta ; 2=0,999
Suite de Fonctions de Perte (L_adv, L_l1, L_perc, L_temp, L_G)Implémentation personnaliséeN/ADéfinit les pertes adverses, perceptuelles, en pixels et temporelles pour l’entraînement GAN
Système d’exploitationUbuntu Linux 22.04 LTSN/AEnvironnement de base pour l’expérimentation en apprentissage profond
Paquet de mesures d’évaluationscikit-learn (v1.5.0)Open SourceUtilisé pour calculer la précision, la précision, le rappel, le score F1, l’AUC et le mIoU

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Z. R., Li, J. J., Li, K. R. Artificial intelligence in individualized retinal disease management. Int. J. Ophthalmol. 17, 1519(2024).
  2. Liu, Y., et al. Automated detection of nine infantile fundus diseases and conditions in retinal images using a deep learning system. EPMA J. 15, 39-51 (2024).
  3. Wang, X. N., et al. A deep learning system for detection of optic disc neovascularization in diabetic retinopathy. Vis. Comput. 41, 1293-1302 (2025).
  4. Ni, L., et al. Prediction of postoperative macular hole status by automated preoperative retinal OCT analysis. Ophthalmic Surg. Lasers Imaging Retina. 56, 355-360 (2025).
  5. Mathews, M. R., Anzar, S. M. Advancing computer-assisted diabetic retinopathy grading. Int. J. Imaging Syst. Technol. 35, e70152(2025).
  6. Wu, X. Y., et al. Bibliometric analysis of global myopia research. Int. J. Ophthalmol. 17, 940(2024).
  7. Rahat, S. R. U. I., et al. Advancing diabetic retinopathy detection with AI and deep learning. Br. J. Nurs. Stud. 5, 1-13 (2025).
  8. Rezaei, A., et al. Automated multimodal severity assessment of diabetic retinopathy. SSRN. , (2024).
  9. Suzue, M., et al. Predicting visual outcomes after vitrectomy. Graefes Arch. Clin. Exp. Ophthalmol. 263, 2505-2513 (2025).
  10. Sabeena, A. S., Jeyakumar, M. K. Ensemble deep learning for diabetic retinopathy classification. Biomater. Devices. , (2025).
  11. Gencer, K., et al. GAN-based approach for diabetic retinopathy detection. Photodiagn. Photodyn. Ther. 53, 104552(2025).
  12. Huang, Z., et al. Risk prediction model for neovascular glaucoma. Front. Cell Dev. Biol. 13, 1604832(2025).
  13. Wang, Y., Liu, L., Wang, C. Trends in deep learning for biomedical prediction. Front. Neurosci. 17, 1256351(2023).
  14. Tang, J., et al. Ectopic inner foveal layer as prognostic predictor. Sci. Rep. 15, 25066(2025).
  15. Shamsan, A., et al. Predicting diabetic retinopathy stages using deep learning. PLoS One. 18, e0289555(2023).
  16. Baldi, P. F., et al. Vitreoretinal surgical instrument tracking. Transl. Vis. Sci. Technol. 12, 20(2023).
  17. Yuan, S., et al. Risk factors after vitrectomy with silicone oil. Sci. Rep. 13, 10423(2023).
  18. Wei, Y., et al. DRDB platform for diabetic retinopathy. Oxid. Med. Cell Longev. 2022, 1718353(2022).
  19. Yagin, F. H., et al. Explainable AI for metabolomics analysis. Diagnostics. 14, 1364(2024).
  20. Nespolo, R. G. Intraoperative artificial intelligence in ophthalmology. , University of Illinois Chicago. Doctoral dissertation (2024).
  21. Nespolo, R. G., et al. Real-time segmentation in vitreoretinal surgery. Ophthalmol. Retina. 7, 236-242 (2023).
  22. Mishra, K., Leng, T. Artificial intelligence and ophthalmic surgery. Curr. Opin. Ophthalmol. 32, 425-430 (2021).
  23. Mueller, S., et al. AI in cataract surgery: systematic review. Transl. Vis. Sci. Technol. 13, 20(2024).
  24. Wen, D., et al. Postoperative visual acuity prediction. BMC Ophthalmol. 23, 361(2023).
  25. Hu, Y., et al. Prediction of macular hole status. Ann. Transl. Med. 9, 51(2021).
  26. Catania, F., et al. Deep learning for retinal detachment recurrence. Acta Ophthalmol. 102, e984-e993 (2024).
  27. Gan, F., et al. AI-PVR Insight system. Quant. Imaging Med. Surg. 15, 2774(2025).
  28. Lee, S. S., et al. Prediction after diabetic vitrectomy. Transl. Vis. Sci. Technol. 11, 25(2022).
  29. Kamnig, R., et al. Neural network for visual acuity prediction. Ophthalmol. Sci. 5, 100762(2025).
  30. Kim, J., et al. Prediction of vitreous hemorrhage causes. Diagnostics. 15, 371(2025).
  31. Flouty, E., et al. CaDIS dataset. CoRR. abs/1905.08993, (2019).
  32. Mueller, S., et al. Phase recognition in cataract surgery. Sci. Rep. 15, 16886(2025).
  33. Aravinda, C. V., et al. Hybrid architecture for video frame prediction. J. Real-Time Image Process. 22, 50(2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Cadre d apprentissage profondanalyse vid o perop ratoiream lioration de la vid osegmentation adaptative aux contoursr seaux convolutionnels sur graphesmod le Transformeraide la d cision clinique

Articles connexes