Article de méthode

Modèles hybrides innovants d’apprentissage profond CNN-Transformer pour le diagnostic automatisé de la variole du singe à partir d’images médicales

DOI :

10.3791/70533

29 mai 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’utilisation d’une collection soigneusement sélectionnée de 2 280 images de lésions cutanées a permis d’établir un flux de travail standardisé d’apprentissage profond binaire pour classifier la présence de mpox dans chaque image. Un modèle personnalisé et un modèle InceptionV3, ResNetV2, ResNet50, DenseNet121 et un hybride CNN-transformateur ont été comparés dans le contexte d’un pipeline commun de prétraitement et d’entraînement.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’apparence visuelle des lésions cutanées de variole du singe reste peu établie en raison de leur similarité avec d’autres maladies cutanées vésiculaires et pustulaires. Cet article a testé l’hypothèse qu’un modèle hybride d’apprentissage profond, intégré à des encodeurs de caractéristiques convolutionnels et basés sur des transformateurs, peut automatiquement classer les images mpox au sein d’un pipeline expérimental unifié. Pour assurer la cohérence entre modèles et rapports, l’analyse principale a été réalisée sous forme de tâche binaire : mpox vs autres conditions présentant la même ou une présentation similaire. Ces données de référence comprenaient 2 280 images : 1 020 images de mpox et 1 260 images de lésions non mpox. Les images ont été réduites à une taille d’entrée standard de 150 × 150 pixels, et les valeurs étaient dans la plage [0, 1]. Pendant la formation, les images étaient complétées par la rotation, la translation, le cisaillement, le zoom et le retournement horizontal. Un CNN séquentiel personnalisé, InceptionV3, ResNetV2, ResNet50, DenseNet121, ainsi qu’une architecture hybride CNN-transformateur proposée ont été comparés. Chaque modèle de base a été entraîné pendant 15 époques en utilisant l’optimiseur Adam et la perte d’entropie croisée binaire. La précision de l’entraînement et de la validation, la perte, la précision, le rappel, le score F1 et la zone sous la courbe caractéristique de fonctionnement du récepteur ont été mesurés pour évaluer la performance, lorsque possible. La meilleure précision interne rapportée a été observée avec le CNN séquentiel, et le modèle hybride a atteint une précision de 98,50, un rappel de 98,50 et un score F1 de 98,58, donnant un profil discriminatif équilibré. InceptionV3 montre des signes de sur-ajustement, et ResNetV2 n’a pas fourni suffisamment de données de validation pour soutenir un test de généralisation robuste. Dans l’ensemble, le modèle hybride peut être considéré comme une stratégie viable et équilibrée, et pas nécessairement meilleure que toutes les références.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La détection automatisée et rapide des mpox dans les cas médicaux est cliniquement significative, car la maladie peut être similaire à diverses autres éruptions vésiculaires ou pustulaires lors de l’évaluation visuelle initiale. Les cliniciens en pratique ne prêtent pas beaucoup d’attention à la morphologie des lésions seule, mais ils combinent le schéma, la distribution, l’historique, le risque d’exposition, le contexte épidémiologique et la confirmation enlaboratoire 1. Néanmoins, les outils informatiques utilisent des images et peuvent également effectuer une procédure de triage utile dans des environnements où la revue dermatologique spécialisée est limitée ou retardée. Elle est particulièrement pertinente pour le suivi des épidémies, le dépistage télédermatologique et les milieux qui manquent de ressources et comportent un nombre significatif de cas possibles qui doivent être priorisés pour un test confirmatoire.

Les approches basées sur l’apprentissage profond se sont également révélées attractives pour cette tâche, car elles peuvent découvrir des images discriminantes de lésions sans utiliser de descripteurs à créermanuellement 2. La revue la plus populaire de la littérature appartient encore aux réseaux neuronaux convolutionnels en raison de leur efficacité dans la texture locale, la plage de couleurs et la reconnaissance des marges deslésions 3. Des travaux récents ont développé davantage ce paradigme grâce à l’apprentissage par transfert, aux mécanismes d’attention et aux modules transformateurs, qui tentent de modéliser une dépendance spatiale plus large de l’image. Néanmoins, la littérature sur les mpox présente des performances élevées rapportées qui doivent être prises avec prudence. Une grande variété d’études a utilisé des ensembles de données publics clairsemés, propose différents ensembles de classes hétérogènes, ou compare les résultats à divers régimes de prétraitement et de validation4. De ce fait, il existe souvent un dilemme de savoir si les augmentations de performance résultent d’un modèle véritablement supérieur, d’une division souhaitable, d’une augmentation vigoureuse ou de disparités dans la formulation de la tâche sous-jacente.

La mpox reste l’une des maladies infectieuses majeures ayant des conséquences négatives sur la santé publique, car ses lésions impliquant des infections cutanées peuvent sembler être confondues avec d’autres lésions vésiculaires et pustulaires à l’interface lors du dépistage oculaire lors de l’examen primaire5. En pratique, les cliniciens ne posent pas leur diagnostic de móops sur la base de la morphologie : le schéma, la distribution, l’antécédent, l’épidémiologie et la confirmation en laboratoire sont des composantes de la décisionde diagnostic 6. Néanmoins, ils peuvent jouer un rôle bénéfique dans le processus de triage grâce à des outils informatiques qui reposent sur les images, en particulier lorsque l’expérience des dermatologues est insuffisante, lente ou insuffisante. Ils pourraient être applicables en télédermatologie, dans les cas où une épidémie doit être traitée par un dépistage, et dans des endroits où les cas suspects sur la liste des priorités doivent être rapidementtraités 7.

Les méthodes basées sur l’apprentissage profond, car elles permettent d’apprendre des représentations discriminantes des lésions, seraient attractives pour cette tâche car elles apprennent ces représentations sans descripteurs manuels, selon les caractéristiques des images d’entrée8. Il y a eu une frénésie dans le domaine des images dermatologiques d’utiliser les réseaux neuronaux convolutionnels (CNN) pour analyser les images, car ils possèdent la capacité d’encoder la texture locale, la périphérie des lésions et une signification morphologique exquise. Des études ultérieures ont permis de développer ce paradigme grâce à l’apprentissage par transfert, à l’attention et aux sous-modules basés sur les transformateurs pour apprendre des relations spatiales plus générales et des tendancescontextuelles 9. Néanmoins, la littérature sur l’imagerie par mpox reste hétérogène. Il n’est pas rare que la performance soit rapportée comme étant basée non seulement sur la sélection de l’architecture, mais aussi sur la structure du jeu de données, le plan d’augmentation, la définition des classes et la structurede validation 10. Ainsi, une bonne performance en gros titre n’indique pas nécessairement une généralisation accrue.

Dans les travaux actuels, ce problème est résolu en utilisant un benchmark de classification d’image mpox binaire plus perceptible et internementcohérent 11. Il ne discute pas de la contribution sous forme de la proposition d’une toute nouvelle architecture hybride, car les méthodes CNN-transformateurs ont déjà été dispersées dans lalittérature 12. Au contraire, l’expérience introduit une comparaison standard avec la décomposition binaire primaire explicite, où les éléments supplémentaires de preuve multiclasse, le prétraitement/entraînement et la performance du modèle sont considérés de manière compatible avec le protocole, et la performance du modèle est prise en compte de manière conservatrice par rapport à l’environnementexpérimental 13. Dans ce paradigme, un modèle CNN-transformateur peut toujours avoir une importance fonctionnelle puisque les CNN sont structurés de manière optimale pour capturer des informations locales sur les lésions, tandis que les représentations basées sur les transformateurs ont le potentiel de représenter une structure spatiale à longue portée d’intérêt en dermatologie.

Les recherches récentes sur la classification d’images sur les mpox peuvent être divisées en trois grandes branches de recherche fondées sur une méthodologie. Ce dernier est basé sur les CNN conventionnels et l’apprentissage par transfert en raison de sa maturité, de sa rapidité de calcul et de sa recréation de textures spécifiques à chaquelésion 14. Ce dernier explore des modèles basés sur l’attention ou des modèles transformateurs, mieux adaptés pour apprendre le contexte global des lésions. Le troisième intègre convolutionnel et attention dans les pipelines hybrides pour préserver la sensibilité locale tout en utilisant une modélisation contextuelle de plus grand corps. Plusieurs études rapportent des performances élevées qui ne peuvent pas être facilement comparées directement car elles diffèrent par la taille de leur jeu de données, la stratégie de curation, la structure de leurs classes, le protocole de prétraitement et de validation15. Ils sont orientés classification binaire, multiclasses et discrimination dermatologique, et tous n’ont pas les mêmes mesures d’évaluation. Les ensembles de données d’images mpox rendus accessibles au public peuvent également inclure des images quasi dupliquées ou très similaires, ce qui nécessitera une augmentation des performances apparentes si le contrôle fractionné n’est pas suffisant16.

L’analyse donnée repose sur un ensemble binaire contrôlé de 2 280 photographies de lésions cutanées, 1 020 photographies de mpox et 1 260 photographies d’autres étaient prévues. L’Autre catégorie recoupe les lésions non impox qui apparaissent à l’œil nu, ce qui fait de la tâche une formulation de triage précoce cliniquement intéressante, comparée à un système complet de localisationdermatologique 17. Les images ont toutes été redimensionnées, normalisées, standardisées, augmentées et évaluées dans un pipeline interne typique de validation d’entraînement. L’objectif principal était de comparer le comportement des modèles d’apprentissage profond conventionnels et hybrides dans un benchmark transparent et de conclure si l’architecture hybride suggérée offre un meilleur équilibre entre discrimination et interprétabilité, par rapport aux références populaires.

La lacune définie que la version révisée actuelle comble n’est donc pas la simple présentation du modèle hybride, puisque les stratégies du CNN-transformateur hybride ont déjà été abordées dans la littérature. Au contraire, la déconnexion est que ce qui était nécessaire était une métrique plus distincte, cohérente en interne, qui ignore les sorties principales de tâches binaires et multiclasses exploratoires, caractérise le pipeline de prétraitement et d’entraînement de manière reproductible, et présente la performance du modèle sans surestimer la nouveauté ni la préparation clinique18. À cet égard, une architecture hybride mérite néanmoins d’être envisagée, car les CNN excellent dans l’extraction locale de caractéristiques, et une attention de type transformateur peut, en théorie, modéliser les configurations globales de lésions et les connexions spatiales à plus longue portée pour faciliter le diagnosticvisuel 19. La question pratique n’est pas de savoir si un design hybride offrira un équilibre favorable entre discrimination, stabilité et interprétabilité par rapport aux références typiques sur le même aspect de données sélectionnées, mais plutôt de savoir si cela offre un bon équilibre entre fiscalité, stabilité et interprétabilité.

Les travaux les plus récents sur l’analyse d’images mpox peuvent être divisés en trois volets généraux de l’étude des méthodes. La première utilise des CNN traditionnelles et des architectures d’apprentissage par transfert en raison de leur maturité, de leur efficacité computationnelle et de leur capacité à apprendre des textures spécifiques à la lésion et des caractéristiques morphologiques locales20. Le second courant propose le transformateur de vision ou des modèles améliorés par l’attention pour pouvoir capturer les associations spatiales plus larges sur le champ de la lésion, en particulier lorsque les plaques de texture sont composées d’une distribution contextuelle des lésions, et donc elles peuvent être aussi importantes que les taches de texture individuelles. Le troisième courant ajoute le convolutionnel et l’attention pour soutenir les pipelines hybrides dans le but de maintenir la sensibilité locale des CNN tout en utilisant la modélisation contextuelle des blocs d’attention.

Bien que la plupart de ces travaux revendiquent une excellente précision, la comparaison entre études croisées n’est pas une tâche facile en raison des différences de taille, de stratégie de curation, de composition de classes et de conception de validation entre lesensembles de données 21. Il existe des publications qui évaluent la discrimination binaire, et celles qui évaluent la catégorisation dermatologique multiclasse, certaines sont également équilibrées dans la précision et la mémoire des rapports, tandis que d’autres se concentrent sur laprécision 22. De plus, les ensembles de données mpox rapportés peuvent être basés sur des collections d’images en ligne, des collections sélectionnées ou des sous-ensembles augmentés, ce qui peut améliorer les performances rapportées lorsque les fuites de validation de train ou les images quasi-doublées ne sont pas bien gérées. Le tableau 1 n’est donc pas conservé comme un simple compendium de travaux antérieurs, mais plutôt comme une carte schématique des familles de modèles, des contraintes de jeux de données et des opportunités offertes par les méthodes disponibles dans cette recherche.

La valeur méthodologique de l’œuvre donnée se reflète de manière plus limitée et plus défendable. Cet article discutera de la nécessité du benchmark binaire transparent à l’aide du jeu de données sélectionné fourni, fera un rapport sur la procédure de prétraitement et d’entraînement, et comparera directement le modèle hybride proposé avec les référencespopulaires 23. Ces changements séparent également l’expérience binaire principale et les preuves multiclasses de supplémentation d’une manière qui permet d’associer les revendications de performance au contexte expérimentalapproprié 24. Cette différence fait une différence décisive dans l’analyse discursive de la conduite des modèles, des mesures rapportées et de la praticité.

L’expérience principale de ce script est une expérience de classification binaire sur un ensemble plus restreint de 2280 images de lésions cutanées, qui a été sélectionnée à la main. Dans cet ensemble de données, le nombre d’images identifiées comme mpox était de 1 020, et celles catégorisées comme autres étaient de 1 260. L’autre catégorie concerne la présentation d’apparences dermatologiques non liées à la myéopée et de caractère visuel, principalement des lésions que le manuscrit désigne comme lésions ressemblant à la varicelleet à la rougeole 25. Cette nomenclature double rend ce groupe binaire cliniquement significatif en tant que formulation primitive de criblage car le modèle s’interroge sur la capacité de désagréger des mpox suspectés et des alternatives visuellement confuses, mais il est aussi moins complexe qu’un benchmark dermatologique multiclasse complet.

L’entraînement des modèles devait être standardisé, toutes les images étant prétraitées avant d’être entraînées. Le redimensionnement, la normalisation d’intensité, l’augmentation et la conversion des étiquettes catégoriques en binaires sont également mentionnées dans le manuscrit. Cependant, dans le sens actualisé, ces étapes sont considérées comme des composantes d’un pipeline reproductible et non comme des notes écrites en périphérie. Son tableau a ensuite été divisé en sous-ensembles d’entraînement et de validation composés de répertoires, et les indicateurs de performance mentionnés devaient alors être considérés comme des impacts internes sur la performance de validation plutôt que comme des indicateurs d’un groupe de test externe complètement indépendant. Pour être plus clair, cette collection de 2 280 images sera considérée comme les données officielles sur lesquelles l’analyse principale sera réalisée. Le cadrage binaire a été choisi car il reflète la question du triage précoce courante en pratique : l’image d’une lésion suspecte est-elle plus susceptible d’être un mox que d’autres affections visuellement similaires ? Ce cadre est limité par rapport à un diagnostic dermatologique étendu, mais il constitue un point de départ valide et techniquement interprétable pour un benchmarking comparé.

La description mise à jour de l’ensemble de données prend également en compte le fait que l’article inclut des résultats supplémentaires obtenus grâce à différentes structures de classes ou à certains sous-ensembles enrichis, qui sont illustrés dans les Figures 1A–I. Au lieu de supprimer ces documents, le manuscrit les contextualise désormais directement afin de permettre aux lecteurs de voir les résultats qui font partie du benchmark binaire et ceux qui font partie des expériences secondaires. Cette méthode conservera l’intégralité de la documentation de cette étude, mais n’autorisera pas l’intégration d’expériences incompatibles dans une seule assertion.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

REMARQUE : Utilisez le jeu de données d’images binaires mpox sélectionnées décrit dans le manuscrit pour l’expérience principale. Le jeu de données contient 2 280 images de lésions cutanées, dont 1 020 images mpox et 1 260 images classées Autres. Utilisez uniquement l’analyse secondaire de l’image ; Ne réalisez pas de recrutement direct de patients, d’intervention clinique, d’expérimentation animale ou de génération de nouveaux spécimens biologiques dans le cadre de ce flux de travail.

1. Obtenir et conserver le jeu de données

  1. Définissons un schéma d’étiquetage binaire avec deux classes : mpox et Autre.
  2. Attribuez les lésions visuellement similaires non des microcisses à la classe Autre.
  3. Examinez toutes les images pour la lisibilité, l’identité de la classe et l’adéquation à la classification supervisée des images.
  4. Excluez les images inutilisables ou ambiguës pendant la curation.
  5. Organisez les images sélectionnées dans des dossiers de classes basés sur des annuaires pour charger en aval avec des générateurs d’images.

2. Redimensionner et normaliser les images

  1. Redimensionnez toutes les images à 150 x 150 pixels avant l’entraînement du modèle.
  2. Appliquez l’interpolation bicubique lors du redimensionnement pour préserver des transitions d’image fluides.
  3. Redimensionnez l’intensité des pixels en divisant chaque valeur de pixel par 255.
  4. Normaliser toutes les intensités d’image à la plage [0,1].
    REMARQUE : Utilisez la même résolution spatiale et la même procédure de normalisation pour tous les modèles afin de maintenir une comparaison équitable entre les architectures.

3. Augmenter les images d’entraînement

  1. Appliquez l’augmentation uniquement au sous-ensemble d’entraînement.
  2. Réglez la plage de rotation à 20°.
  3. Réglez la plage de décalage de largeur à 0,2.
  4. Réglez la plage de décalage de hauteur à 0,2.
  5. Réglez la plage de cisaillement à 0,2.
  6. Réglez la plage de zoom à 0,2.
  7. Activez le retournement horizontal.
  8. Utilisez le remplissage du plus proche voisin pour les pixels introduits lors de l’augmentation.
  9. Effectuez des augmentations en ligne pendant l’entraînement plutôt qu’en dupliquant définitivement les fichiers images.
    REMARQUE : Ne pas augmenter les images de validation ; Redimensionnez-les seulement.

4. Encoder les étiquettes et diviser le jeu de données

  1. Encodez les deux classes comme des étiquettes binaires.
  2. Chargez les images à l’aide de générateurs basés sur des répertoires en mode classe binaire.
  3. Réglez la taille du lot à 32.
  4. Divisez l’ensemble de données en sous-ensembles d’entraînement et de validation.
    REMARQUE : Le manuscrit rapporte uniquement un benchmarking interne de validation de formation et n’inclut pas de cohorte externe de test indépendante.

5. Construire les modèles de base CNN

  1. Construisez une ligne de base CNN séquentielle avec trois blocs convolutifs.
  2. Utilisez 32 filtres dans le premier bloc convolutionnel et suivez le bloc avec le pool maximal.
  3. Utilisez 64 filtres dans le second bloc convolutionnel et suivez le bloc avec le pool maximal.
  4. Utilisez 128 filtres dans le troisième bloc convolutionnel et suivez le bloc avec le max pooling.
  5. Aplanir les cartes de caractéristiques extraites.
  6. Ajoutez une couche dense avec 512 unités.
  7. Postule à un taux d’abandon de 0,5.
  8. Utilisez une couche de sortie sigmoïde pour la classification binaire.
  9. Incluez InceptionV3, ResNetV2, ResNet50 et DenseNet121 comme architectures de base comparatives.
    REMARQUE : Utilisez le même ensemble de données binaires sélectionné et le même pipeline de prétraitement pour toutes les comparaisons de base, lorsque cela est applicable.

6. Définir le modèle hybride CNN-transformateur

  1. Utilisez un module CNN comme encodeur de fonctionnalités local.
  2. Extraire la texture de la lésion, les bords et les motifs morphologiques locaux avec la composante CNN.
  3. Utilisez un module basé sur un transformateur comme encodeur de contexte.
  4. Modéliser des dépendances spatiales plus larges dans la représentation apprise avec la composante transformateur.
  5. Projeter les vecteurs de caractéristiques CNN et transformateur à la même dimension et les fusionner par addition élémentaire.
  6. Mapper la représentation fusionnée à une sortie binaire mpox contre Autre via une tête de classification.
    REMARQUE : Signalez l’architecture hybride au niveau du module si le nombre de têtes d’attention, de dimensions d’immersion et de couches transformateurs n’est pas explicitement disponible.

7. Processus de formation et pratique de l’évaluation

  1. Assemblez le classificateur binaire en utilisant le modèle implémenté avec l’optimiseur d’Adam, la perte d’entropie binaire croisée et la précision comme métrique d’entraînement principale.
  2. Entraînez le modèle de base clairement défini pour 15 époques sur le jeu de données mpox contre autres sélectionné.
  3. Mener toutes les expériences dans un environnement d’apprentissage profond basé sur Python sur un système équipé de GPU, et résumer les ressources logicielles et l’environnement informatique généralisé dans Table of Materials.
  4. Surveillez les courbes de perte d’entraînement et de validation pendant l’entraînement, et calculez la précision, la précision, le rappel, le score F1 et l’AUC pour chaque modèle individuel lorsque disponible.
  5. Interprétez la performance du modèle en mettant l’accent sur la cohérence du rapport et le comportement de généralisation, et priorisez un équilibre entre sensibilité et spécificité plutôt que des valeurs de précision de pic unique.
  6. Formulez deux questions d’évaluation pour chaque modèle : (i) dans quelle mesure le modèle s’ajuste aux données d’entraînement et (ii) dans quelle mesure la représentation apprise se transfère aux images de validation tenues à partir de la même source sélectionnée.
    REMARQUE : Présentez ces deux aspects explicitement dans le manuscrit afin de distinguer la capacité représentative de la généralisation utile.
  7. Interpréter une grande précision d’entraînement comme une preuve d’une capacité représentative suffisante, et interpréter une performance de validation élevée et stable comme l’indicateur le plus significatif d’une généralisation utile.

8. Analyses expérimentales

  1. Ne rapportez que les résultats directement étayés par les résultats enregistrés, et évitez d’extrapoler au-delà des preuves documentées.
  2. Énoncez explicitement des limitations lorsque des informations de validation manquent ou lorsqu’une table reflète une structure de classes différente.
  3. Considérez la tâche de classification binaire mpox contre autre comme analyse principale et utilisez-la comme référence interne pour toutes les expériences.
  4. Traduire le code d’implémentation original en protocole narratif et dans le tableau 2 afin que le jeu de données, l’environnement logiciel, les familles de modèles et la configuration d’entraînement soient résumés de manière concise pour la reproductibilité.
  5. Généralisez les descriptions du matériel et du logiciel afin que l’accent reste sur la reproductibilité méthodologique plutôt que sur une plateforme spécifique à un seul fournisseur.
  6. Les résultats actuels modèle par modèle suivent la même séquence que les architectures introduites, afin de simplifier la comparaison du comportement d’entraînement, du comportement de validation et de l’exhaustivité des rapports.
  7. Décrivez la référence CNN séquentielle comme atteignant des performances de validation internes très élevées tout en avertissant que cela peut refléter des caractéristiques de division favorables et ne pas se généraliser à l’extérieur.
  8. Interprétez le modèle séquentiel comme une référence interne forte plutôt qu’une démonstration définitive de la robustesse diagnostique déployable.
  9. Justifiez le maintien de panneaux InceptionV3 séparés car les trajectoires de perte et de précision révèlent ensemble une optimisation efficace de l’entraînement mais un comportement de validation incohérent.
  10. Décrivez ResNetV2 comme une référence informative mais partiellement rapportée, car des métriques de validation comparables n’étaient pas disponibles.
  11. Considérez l’expérience multiclasse ResNet50 comme une preuve supplémentaire distincte du benchmark binaire principal.
  12. Interprétez DenseNet121 comme un benchmark intermédiaire avec des performances compétitives mais non dominantes sur le sous-ensemble binaire rapporté.
  13. Décrivez le transformateur CNN hybride comme réalisant une discrimination équilibrée des classes plutôt qu’un gain unilatéral dans un seul indicateur.
  14. Évitez de revendiquer la supériorité universelle du modèle hybride sur toutes les bases de référence, car certains modèles ont été évalués dans des conditions de rapport différentes.
  15. Positionner le modèle hybride comme un compromis prometteur entre haute performance de validation et équilibre métrique, et recommander une évaluation complémentaire sur des benchmarks standardisés testés en externe.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comparaison au-delà de l’exactitude des titres

Ces résultats montrent que les comparaisons de modèles en analyse d’images médicales doivent se concentrer non seulement sur la précision des titres, mais aussi sur le comportement des architectures par rapport à un certain nombre de métriques et différents contextes expérimentaux. Tout au long des expériences, les modèles ne se comportaient pas de manière similaire : le simple CNN séquentiel étai...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le résultat clé de l’étude est que la classification binaire des lésions de mpox versus les lésions visuellement similaires, appelée classification automatisée, est possible avec le jeu de données sélectionné utilisé dans cette étude, mais un tel succès dépend en grande partie de l’interprétation de lapreuve 27. En séparant correctement les expériences, le manuscrit présente des preuves que les architectures hybrides conventionnelles et proposées peuvent être util...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun intérêt financier ou non financier concurrent connu qui aurait pu influencer le travail rapporté dans ce manuscrit.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs reconnaissent chaleureusement le soutien financier reçu de Vel Tech Rangarajan, Dr Sagunthala R&D Institute of Science and Technology, dans le cadre du Fonds de Recherche et de Développement (RDF), Subvention n° VTU/RDF/FY2026-27/009. Ce soutien a été déterminant pour faciliter la réussite de ce travail de recherche.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Jeu de donnéesun jeu de données d’images mpox sélectionné ; 2 280 images pour le benchmark binaire principal (1 020 mpox et 1 260 autres)Source de formation primaire et de validation interne
Définition de la tâcheClassification binaire pour l’étude principale ; les résumés multiclasses et augmentés supplémentaires conservés séparémentAssure une interprétation cohérente des indicateurs rapportés
Environnement de programmationFlux de travail de notebook basé sur PythonGestion des données, entraînement des modèles et tracé
Cadre d’apprentissage profondL’implémentation de TensorFlow / Keras est rapportée dans le code soumisDéveloppement et optimisation de modèles
Utilitaires d’imageImageDataGenerator avec remise à l’échelle et augmentation ; Tracé des bibliothèques pour les courbes d’entraînementPrétraitement, augmentation et reporting visuel
Architectures de baseCNN séquentiel, InceptionV3, ResNetV2, ResNet50, DenseNet121Comparaison comparative
Architecture proposéeClassificateur hybride CNN-transformateurContribution méthodologique principale
Environnements d’entraînementTaille d’entrée 150 x 150 ; taille du lot : 32 ; Optimiseur Adam ; entropie croisée binaire ; 15 époques rapportées pour le code de référence fourniReproductibilité du flux de travail central
Environnement de calculsystème informatique compatible GPU ; Détails matériels généralisés dans le récitAccélération du modèle pendant l’entraînement

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Diagnostic du monkeypoxapprentissage profond hybrideclassification d images m dicalesimages de l sions cutan esclassification binaireaugmentation d imagesvalidation de mod le

Articles connexes