$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La détection automatisée et rapide des mpox dans les cas médicaux est cliniquement significative, car la maladie peut être similaire à diverses autres éruptions vésiculaires ou pustulaires lors de l’évaluation visuelle initiale. Les cliniciens en pratique ne prêtent pas beaucoup d’attention à la morphologie des lésions seule, mais ils combinent le schéma, la distribution, l’historique, le risque d’exposition, le contexte épidémiologique et la confirmation enlaboratoire 1. Néanmoins, les outils informatiques utilisent des images et peuvent également effectuer une procédure de triage utile dans des environnements où la revue dermatologique spécialisée est limitée ou retardée. Elle est particulièrement pertinente pour le suivi des épidémies, le dépistage télédermatologique et les milieux qui manquent de ressources et comportent un nombre significatif de cas possibles qui doivent être priorisés pour un test confirmatoire.
Les approches basées sur l’apprentissage profond se sont également révélées attractives pour cette tâche, car elles peuvent découvrir des images discriminantes de lésions sans utiliser de descripteurs à créermanuellement 2. La revue la plus populaire de la littérature appartient encore aux réseaux neuronaux convolutionnels en raison de leur efficacité dans la texture locale, la plage de couleurs et la reconnaissance des marges deslésions 3. Des travaux récents ont développé davantage ce paradigme grâce à l’apprentissage par transfert, aux mécanismes d’attention et aux modules transformateurs, qui tentent de modéliser une dépendance spatiale plus large de l’image. Néanmoins, la littérature sur les mpox présente des performances élevées rapportées qui doivent être prises avec prudence. Une grande variété d’études a utilisé des ensembles de données publics clairsemés, propose différents ensembles de classes hétérogènes, ou compare les résultats à divers régimes de prétraitement et de validation4. De ce fait, il existe souvent un dilemme de savoir si les augmentations de performance résultent d’un modèle véritablement supérieur, d’une division souhaitable, d’une augmentation vigoureuse ou de disparités dans la formulation de la tâche sous-jacente.
La mpox reste l’une des maladies infectieuses majeures ayant des conséquences négatives sur la santé publique, car ses lésions impliquant des infections cutanées peuvent sembler être confondues avec d’autres lésions vésiculaires et pustulaires à l’interface lors du dépistage oculaire lors de l’examen primaire5. En pratique, les cliniciens ne posent pas leur diagnostic de móops sur la base de la morphologie : le schéma, la distribution, l’antécédent, l’épidémiologie et la confirmation en laboratoire sont des composantes de la décisionde diagnostic 6. Néanmoins, ils peuvent jouer un rôle bénéfique dans le processus de triage grâce à des outils informatiques qui reposent sur les images, en particulier lorsque l’expérience des dermatologues est insuffisante, lente ou insuffisante. Ils pourraient être applicables en télédermatologie, dans les cas où une épidémie doit être traitée par un dépistage, et dans des endroits où les cas suspects sur la liste des priorités doivent être rapidementtraités 7.
Les méthodes basées sur l’apprentissage profond, car elles permettent d’apprendre des représentations discriminantes des lésions, seraient attractives pour cette tâche car elles apprennent ces représentations sans descripteurs manuels, selon les caractéristiques des images d’entrée8. Il y a eu une frénésie dans le domaine des images dermatologiques d’utiliser les réseaux neuronaux convolutionnels (CNN) pour analyser les images, car ils possèdent la capacité d’encoder la texture locale, la périphérie des lésions et une signification morphologique exquise. Des études ultérieures ont permis de développer ce paradigme grâce à l’apprentissage par transfert, à l’attention et aux sous-modules basés sur les transformateurs pour apprendre des relations spatiales plus générales et des tendancescontextuelles 9. Néanmoins, la littérature sur l’imagerie par mpox reste hétérogène. Il n’est pas rare que la performance soit rapportée comme étant basée non seulement sur la sélection de l’architecture, mais aussi sur la structure du jeu de données, le plan d’augmentation, la définition des classes et la structurede validation 10. Ainsi, une bonne performance en gros titre n’indique pas nécessairement une généralisation accrue.
Dans les travaux actuels, ce problème est résolu en utilisant un benchmark de classification d’image mpox binaire plus perceptible et internementcohérent 11. Il ne discute pas de la contribution sous forme de la proposition d’une toute nouvelle architecture hybride, car les méthodes CNN-transformateurs ont déjà été dispersées dans lalittérature 12. Au contraire, l’expérience introduit une comparaison standard avec la décomposition binaire primaire explicite, où les éléments supplémentaires de preuve multiclasse, le prétraitement/entraînement et la performance du modèle sont considérés de manière compatible avec le protocole, et la performance du modèle est prise en compte de manière conservatrice par rapport à l’environnementexpérimental 13. Dans ce paradigme, un modèle CNN-transformateur peut toujours avoir une importance fonctionnelle puisque les CNN sont structurés de manière optimale pour capturer des informations locales sur les lésions, tandis que les représentations basées sur les transformateurs ont le potentiel de représenter une structure spatiale à longue portée d’intérêt en dermatologie.
Les recherches récentes sur la classification d’images sur les mpox peuvent être divisées en trois grandes branches de recherche fondées sur une méthodologie. Ce dernier est basé sur les CNN conventionnels et l’apprentissage par transfert en raison de sa maturité, de sa rapidité de calcul et de sa recréation de textures spécifiques à chaquelésion 14. Ce dernier explore des modèles basés sur l’attention ou des modèles transformateurs, mieux adaptés pour apprendre le contexte global des lésions. Le troisième intègre convolutionnel et attention dans les pipelines hybrides pour préserver la sensibilité locale tout en utilisant une modélisation contextuelle de plus grand corps. Plusieurs études rapportent des performances élevées qui ne peuvent pas être facilement comparées directement car elles diffèrent par la taille de leur jeu de données, la stratégie de curation, la structure de leurs classes, le protocole de prétraitement et de validation15. Ils sont orientés classification binaire, multiclasses et discrimination dermatologique, et tous n’ont pas les mêmes mesures d’évaluation. Les ensembles de données d’images mpox rendus accessibles au public peuvent également inclure des images quasi dupliquées ou très similaires, ce qui nécessitera une augmentation des performances apparentes si le contrôle fractionné n’est pas suffisant16.
L’analyse donnée repose sur un ensemble binaire contrôlé de 2 280 photographies de lésions cutanées, 1 020 photographies de mpox et 1 260 photographies d’autres étaient prévues. L’Autre catégorie recoupe les lésions non impox qui apparaissent à l’œil nu, ce qui fait de la tâche une formulation de triage précoce cliniquement intéressante, comparée à un système complet de localisationdermatologique 17. Les images ont toutes été redimensionnées, normalisées, standardisées, augmentées et évaluées dans un pipeline interne typique de validation d’entraînement. L’objectif principal était de comparer le comportement des modèles d’apprentissage profond conventionnels et hybrides dans un benchmark transparent et de conclure si l’architecture hybride suggérée offre un meilleur équilibre entre discrimination et interprétabilité, par rapport aux références populaires.
La lacune définie que la version révisée actuelle comble n’est donc pas la simple présentation du modèle hybride, puisque les stratégies du CNN-transformateur hybride ont déjà été abordées dans la littérature. Au contraire, la déconnexion est que ce qui était nécessaire était une métrique plus distincte, cohérente en interne, qui ignore les sorties principales de tâches binaires et multiclasses exploratoires, caractérise le pipeline de prétraitement et d’entraînement de manière reproductible, et présente la performance du modèle sans surestimer la nouveauté ni la préparation clinique18. À cet égard, une architecture hybride mérite néanmoins d’être envisagée, car les CNN excellent dans l’extraction locale de caractéristiques, et une attention de type transformateur peut, en théorie, modéliser les configurations globales de lésions et les connexions spatiales à plus longue portée pour faciliter le diagnosticvisuel 19. La question pratique n’est pas de savoir si un design hybride offrira un équilibre favorable entre discrimination, stabilité et interprétabilité par rapport aux références typiques sur le même aspect de données sélectionnées, mais plutôt de savoir si cela offre un bon équilibre entre fiscalité, stabilité et interprétabilité.
Les travaux les plus récents sur l’analyse d’images mpox peuvent être divisés en trois volets généraux de l’étude des méthodes. La première utilise des CNN traditionnelles et des architectures d’apprentissage par transfert en raison de leur maturité, de leur efficacité computationnelle et de leur capacité à apprendre des textures spécifiques à la lésion et des caractéristiques morphologiques locales20. Le second courant propose le transformateur de vision ou des modèles améliorés par l’attention pour pouvoir capturer les associations spatiales plus larges sur le champ de la lésion, en particulier lorsque les plaques de texture sont composées d’une distribution contextuelle des lésions, et donc elles peuvent être aussi importantes que les taches de texture individuelles. Le troisième courant ajoute le convolutionnel et l’attention pour soutenir les pipelines hybrides dans le but de maintenir la sensibilité locale des CNN tout en utilisant la modélisation contextuelle des blocs d’attention.
Bien que la plupart de ces travaux revendiquent une excellente précision, la comparaison entre études croisées n’est pas une tâche facile en raison des différences de taille, de stratégie de curation, de composition de classes et de conception de validation entre lesensembles de données 21. Il existe des publications qui évaluent la discrimination binaire, et celles qui évaluent la catégorisation dermatologique multiclasse, certaines sont également équilibrées dans la précision et la mémoire des rapports, tandis que d’autres se concentrent sur laprécision 22. De plus, les ensembles de données mpox rapportés peuvent être basés sur des collections d’images en ligne, des collections sélectionnées ou des sous-ensembles augmentés, ce qui peut améliorer les performances rapportées lorsque les fuites de validation de train ou les images quasi-doublées ne sont pas bien gérées. Le tableau 1 n’est donc pas conservé comme un simple compendium de travaux antérieurs, mais plutôt comme une carte schématique des familles de modèles, des contraintes de jeux de données et des opportunités offertes par les méthodes disponibles dans cette recherche.
La valeur méthodologique de l’œuvre donnée se reflète de manière plus limitée et plus défendable. Cet article discutera de la nécessité du benchmark binaire transparent à l’aide du jeu de données sélectionné fourni, fera un rapport sur la procédure de prétraitement et d’entraînement, et comparera directement le modèle hybride proposé avec les référencespopulaires 23. Ces changements séparent également l’expérience binaire principale et les preuves multiclasses de supplémentation d’une manière qui permet d’associer les revendications de performance au contexte expérimentalapproprié 24. Cette différence fait une différence décisive dans l’analyse discursive de la conduite des modèles, des mesures rapportées et de la praticité.
L’expérience principale de ce script est une expérience de classification binaire sur un ensemble plus restreint de 2280 images de lésions cutanées, qui a été sélectionnée à la main. Dans cet ensemble de données, le nombre d’images identifiées comme mpox était de 1 020, et celles catégorisées comme autres étaient de 1 260. L’autre catégorie concerne la présentation d’apparences dermatologiques non liées à la myéopée et de caractère visuel, principalement des lésions que le manuscrit désigne comme lésions ressemblant à la varicelleet à la rougeole 25. Cette nomenclature double rend ce groupe binaire cliniquement significatif en tant que formulation primitive de criblage car le modèle s’interroge sur la capacité de désagréger des mpox suspectés et des alternatives visuellement confuses, mais il est aussi moins complexe qu’un benchmark dermatologique multiclasse complet.
L’entraînement des modèles devait être standardisé, toutes les images étant prétraitées avant d’être entraînées. Le redimensionnement, la normalisation d’intensité, l’augmentation et la conversion des étiquettes catégoriques en binaires sont également mentionnées dans le manuscrit. Cependant, dans le sens actualisé, ces étapes sont considérées comme des composantes d’un pipeline reproductible et non comme des notes écrites en périphérie. Son tableau a ensuite été divisé en sous-ensembles d’entraînement et de validation composés de répertoires, et les indicateurs de performance mentionnés devaient alors être considérés comme des impacts internes sur la performance de validation plutôt que comme des indicateurs d’un groupe de test externe complètement indépendant. Pour être plus clair, cette collection de 2 280 images sera considérée comme les données officielles sur lesquelles l’analyse principale sera réalisée. Le cadrage binaire a été choisi car il reflète la question du triage précoce courante en pratique : l’image d’une lésion suspecte est-elle plus susceptible d’être un mox que d’autres affections visuellement similaires ? Ce cadre est limité par rapport à un diagnostic dermatologique étendu, mais il constitue un point de départ valide et techniquement interprétable pour un benchmarking comparé.
La description mise à jour de l’ensemble de données prend également en compte le fait que l’article inclut des résultats supplémentaires obtenus grâce à différentes structures de classes ou à certains sous-ensembles enrichis, qui sont illustrés dans les Figures 1A–I. Au lieu de supprimer ces documents, le manuscrit les contextualise désormais directement afin de permettre aux lecteurs de voir les résultats qui font partie du benchmark binaire et ceux qui font partie des expériences secondaires. Cette méthode conservera l’intégralité de la documentation de cette étude, mais n’autorisera pas l’intégration d’expériences incompatibles dans une seule assertion.