$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Résultats attendus et interprétation
Lorsque ce protocole est correctement implémenté, le modèle entraîné MVM-UNet devrait produire une performance de segmentation stable sur des exécutions répétées, avec seulement de faibles variations entre différentes graines aléatoires pour la plupart des métriques d’évaluation. Pour ISIC 2017 et ISIC 2018, les résultats positifs se reflètent par des valeurs élevées de DSC, mIoU, Acc, Sen et Spe, ainsi que des masques de lésion prédits qui suivent de près les limites de la réalité du terrain (Figures 6 et 7). Pour Synapse, les résultats positifs se reflètent par des valeurs moyennes élevées de DSC et de faibles valeurs de HD95 dans les organes du premier plan (Figure 8). Lors de l’exécution du protocole, les métriques quantitatives doivent être interprétées conjointement avec les résultats de segmentation qualitative correspondants. Un modèle qui atteint un DSC élevé mais présente une fuite de frontière, l’omission de petites structures ou des prédictions fragmentées doit être considéré comme seulement partiellement réussi, et la procédure de prétraitement, la sélection des points de contrôle et les paramètres d’inférence doivent être vérifiés.

Figure 6. Résultats représentatifs de segmentation qualitative sur le jeu de données ISIC 2017. Résultats représentatifs de segmentation qualitative obtenus sur le jeu de données de segmentation des lésions cutanées de l’International Skin Imaging Collaboration (ISIC) 2017. Chaque exemple montre l’image dermoscopique originale (Image), le masque de segmentation de vérité au sol (GT) correspondant, ainsi que la prédiction générée par MVM-UNet (Pred). Les cas de test représentatifs illustrent la performance de segmentation pour des lésions de taille, morphologie et complexité de frontière variables. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 7. Résultats représentatifs de segmentation qualitative sur le jeu de données ISIC 2018. Résultats représentatifs de segmentation qualitative obtenus sur le jeu de données de segmentation des lésions cutanées de l’International Skin Imaging Collaboration (ISIC) 2018. Chaque exemple montre l’image dermoscopique originale (Image), le masque de segmentation de vérité au sol (GT) correspondant, ainsi que la prédiction générée par MVM-UNet (Pred). Les cas tests représentatifs démontrent la performance de segmentation à travers diverses apparences de lésions et caractéristiques de limite. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 8. Résultats représentatifs de segmentation qualitative sur le jeu de données de tomographie multiorgane multiorgane Synapse. Résultats représentatifs qualitatifs de segmentation multiorgane obtenus sur le jeu de données Synapse Multi-Atlas Labeling Beyond the Cranial Vault. Chaque exemple montre l’image originale de tomodensitométrie (Image), les annotations d’organes de la vérité au sol (GT) correspondantes, ainsi que la prédiction générée par MVM-UNet (Pred). Des exemples représentatifs illustrent l’accord entre segmentations prédite et de référence entre plusieurs organes abdominaux. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Performance sur ISIC 2017
Pour évaluer la reproductibilité de MVM-UNet, toutes les principales expériences de comparaison ont été répétées en utilisant trois graines aléatoires indépendantes (1, 52 et 100), et les résultats sont rapportés en moyenne ± DS. La signification statistique a été évaluée à l’aide du test Wilcoxon signed-rank basé sur des résultats appariés par image pour ISIC 2017 et ISIC 2018, ainsi que par appariement par cas pour Synapse. L’analyse statistique a été réalisée à l’aide de valeurs métriques appariées plutôt que de moyennes au niveau de la graine. Pour une comparaison équitable, les résultats rapportés en moyenne ± SD ont été reproduits en utilisant les implémentations officielles sous les mêmes partitions de jeux de données, résolutions d’entrée et métriques d’évaluation lorsque cela était possible, tandis que les résultats à valeur unique ont été conservés à partir des publications originales correspondantes.
MVM-UNet a été évalué sur le jeu de données ISIC 2017 sur la segmentation des lésions cutanées et comparé avec des méthodes de segmentation représentatives, notamment UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36 et H2Former12 (Tableau 1)). MVM-UNet a obtenu un mIoU de 80,94 ± 1,01 %, un DSC de 91,32 % ± 0,68 %, une précision de 96,58 % ± 0,27 %, une spécificité de 98,31 % ± 0,23 %, et une sensibilité de 91,65 % ± 0,77 % sur trois séries indépendantes. Comparé aux méthodes évaluées, MVM-UNet a obtenu le mIoU, la DSC et la sensibilité les plus élevés. Les résultats représentatifs de segmentation qualitative sont présentés à la Figure 6, où les masques prédits suivent de près les limites de la lésion sur les images de test représentatives.
| Modèle | Arbitre. | mIoU ( %) | DSC ( %) | Acc ( %) | Spe ( %) | Sen ( %) |
| UNet | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| TransUNet | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| MaLUNet | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| UNeXt-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| RHesFormer | 34 | 79,89 ± 1,05 | 88,82 ± 0,65 | 96,25 ± 0,24 | 97,73 ± 0,22 | 87,72 ± 0,79 |
| H-vmunet | 28 | 80,34 ± 1,02 | 90,68 ± 0,55 | 96,42 ± 0,18 | 98,23 ± 0,32 | 88,97 ± 0,88 |
| MISSFormer | 30 | 80,16 ± 0,78 | 89,27 ± 0,61 | 94,36 ± 0,28 | 97,52 ± 0,38 | 87,71 ± 0,69 |
| H2Former | 12 | 80,35 ± 0,95 | 88,56 ± 0,72 | 96,61 ± 0,19 | 98,15 ± 0,14 | 88,21 ± 0,81 |
| MedScale-Former | 35 | 80,31 ± 0,82 | 89,11 ± 0,59 | 95,68 ± 0,33 | 98,24 ± 0,21 | 89,96 ± 0,92 |
| MCAFT | 36 | 80,59 ± 0,93 | 89,27 ± 0,63 | 96,42 ± 0,20 | 97,95 ± 0,17 | 90,05 ± 0,84 |
| MVM-UNet (La Nôtre) | — | 80,94 ± 1,01 | 91,32 ± 0,68 | 96,58 ± 0,27 | 98,31 ± 0,23 | 91,65 ± 0,77 |
Tableau 1 : Comparaison de performance sur le jeu de données ISIC 2017 sur la segmentation des lésions cutanées. Comparaison de MVM-UNet avec des méthodes de segmentation basées sur des réseaux neuronaux convolutionnels représentatifs (CNN), des modèles transformateurs et des modèles d’espace d’états (SSM) utilisant la moyenne d’intersection sur Union (mIoU), le coefficient de similarité de dés (DSC), la précision (Acc.), la spécificité (Spe.) et la sensibilité (Sen.). Les résultats de MVM-UNet sont rapportés en moyenne ± écart-type de trois expériences indépendantes de graines aléatoires. Les résultats rapportés comme des valeurs uniques ont été reproduits à partir des publications originales correspondantes.
Les exemples qualitatifs démontrent également que MVM-UNet a segmenté avec précision à la fois les petites lésions et les lésions plus grandes avec des frontières irrégulières. Dans ces exemples représentatifs, les masques prédits correspondaient étroitement aux annotations de base correspondantes et préservaient les limites des lésions avec un minimum de fuite ou de fragmentation.
Pour évaluer davantage si les améliorations observées étaient statistiquement significatives, des tests de Wilcoxon par rang signé ont été réalisés à l’aide de résultats de segmentation par image par paire. Pour l’indicateur mIoU, MVM-UNet a montré une amélioration statistiquement significative par rapport à MCAFT, avec une valeur p de 0,0114. Pour la métrique DSC, MVM-UNet a également nettement surpassé H-vmunet, avec une valeur p de 0,0031. Ces résultats confirment que les améliorations observées sur ISIC 2017 étaient peu susceptibles d’être attribuables à une variation aléatoire.
Dans l’ensemble, MVM-UNet a obtenu les meilleures performances parmi les méthodes comparées pour mIoU, DSC et sensibilité dans l’ensemble de données ISIC 2017 (Tableau 1). Les exemples de segmentation qualitative présentés à la Figure 6 sont cohérents avec ces résultats quantitatifs.
Performance à ISIC 2018
MVM-UNet a été ensuite évalué sur le jeu de données ISIC 2018 sur la segmentation des lésions cutanées et comparé avec des méthodes de segmentation représentatives, notamment UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 et MCAFT36 (Tableau 2)). MVM-UNet a obtenu un mIoU de 82,47 % ± 1,28 %, un DSC de 90,65 % ± 0,94 %, une précision de 96,02 % ± 0,36 %, une spécificité de 97,06 % ± 0,31 %, et une sensibilité de 91,80 % ± 0,82 % sur trois éditions indépendantes. Ces résultats démontrent que la performance de MVM-UNet est restée constante entre différentes graines aléatoires. Les résultats représentatifs de segmentation qualitative sont présentés à la Figure 7.
| Modèle | Arbitre. | mIoU ( %) | DSC ( %) | Acc ( %) | Spe ( %) | Sen ( %) |
| UNet | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| SANet | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| MaLUNet | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-vmunet | 28 | 81,93 ± 1,45 | 90,46 ± 0,62 | 95,19 ± 0,30 | 96,82 ± 0,21 | 88,37 ± 1,13 |
| MISSFormer | 30 | 80.27 ± 1.21 | 89,91 ± 0,46 | 94,76 ± 0,27 | 97,22 ± 0,15 | 90,84 ± 1,07 |
| H2Former | 12 | 80,40 ± 0,83 | 90,26 ± 0,73 | 94,89 ± 0,38 | 96,98 ± 0,25 | 91,57 ± 0,54 |
| RHesFormer | 34 | 81.12 ± 1.18 | 88,86 ± 0,84 | 94,96 ± 0,33 | 96,43 ± 0,22 | 91,86 ± 1,01 |
| MedScale-Former | 35 | 80,97 ± 0,74 | 90,47 ± 0,68 | 95,02 ± 0,41 | 95,89 ± 0,26 | 90,65 ± 0,92 |
| MCAFT | 36 | 81,46 ± 1,03 | 89,06 ± 0,76 | 95,23 ± 0,29 | 96,72 ± 0,17 | 91,82 ± 0,57 |
| MVM-UNet (La Nôtre) | — | 82,47 ± 1,28 | 90,65 ± 0,94 | 96,02 ± 0,36 | 97,06 ± 0,31 | 91,80 ± 0,82 |
Tableau 2 : Comparaison des performances sur le jeu de données ISIC 2018 sur la segmentation des lésions cutanées. Comparaison de MVM-UNet avec des méthodes de segmentation représentatives basées sur CNN, Transformer et SSM utilisant la moyenne d’intersection sur Union (mIoU), le coefficient de similarité de Dice (DSC), la précision (Acc.), la spécificité (Spe.) et la sensibilité (Sen.). Les résultats de MVM-UNet sont rapportés en moyenne ± écart-type de trois expériences indépendantes de graines aléatoires. Les résultats rapportés comme des valeurs uniques ont été reproduits à partir des publications originales correspondantes.
Comparé à H-vmunet, MVM-UNet a amélioré le mIoU de 0,54 %. Comparé à MedScale-Former, MVM-UNet a amélioré la DSC de 0,18 %. MVM-UNet a également obtenu la plus grande précision parmi les méthodes comparées. Les exemples qualitatifs représentatifs présentés à la Figure 7 démontrent une segmentation précise des lésions cutanées représentatives, y compris les petites régions de la lésion et les lésions à frontières irrégulières.
Pour ISIC 2018, la signification statistique a été évaluée à l’aide du test Wilcoxon signed-rank basé sur des résultats de segmentation par image par paire. Pour l’indicateur mIoU, MVM-UNet a obtenu une amélioration statistiquement significative par rapport au MCAFT, avec une valeur p de < 0,001. Ces résultats confirment que l’amélioration observée des performances sur ISIC 2018 était peu susceptible d’être attribuable à une variation aléatoire.
Dans l’ensemble, MVM-UNet a obtenu les plus grands mIoU, DSC et précision parmi les méthodes comparées dans le jeu de données ISIC 2018 (Tableau 2). Les exemples qualitatifs présentés à la Figure 7 sont cohérents avec ces améliorations quantitatives.
Performance sur Synapse
La méthode proposée a également été évaluée sur le jeu de données de segmentation multiorganiques Synapse et comparée à des méthodes représentatives, notamment UNet 8,21, AttentionU-Net 39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 et MCAFT36 (Tableau 3). L’ensemble de données Synapse comprenait huit organes abdominaux : l’aorte, la vésicule biliaire, la rate, le rein gauche, le rein droit, le foie, le pancréas et l’estomac. Suivant le protocole expérimental standard, 18 cas (2 212 tranches axiales) ont été utilisés pour l’entraînement et 12 cas (1 567 tranches axiales) ont été utilisés pour les tests. Aucun ensemble de validation distinct n’a été introduit. Les cas de test étaient utilisés exclusivement pour l’évaluation finale et n’étaient pas utilisés pour l’entraînement du modèle, l’ajustement des hyperparamètres ou la sélection du modèle. Les résultats représentatifs de segmentation qualitative multiorgane sont présentés à la Figure 8, et la comparaison quantitative est résumée dans le Tableau 3.
| Modèle | Arbitre. | DSC | HD95 | Aor. | Gal. | Gamin. (L) | Gamin. (R) | Liv. | Pan. | Spl. | Sto. |
| UNet | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| Att-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| TransUNet | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| TransNorm | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| Swin U-Net | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| TransDeepLab | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| MEW-UNet | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| MISSFormer | 30 | 80,92 ± 4,23 | 20,09 ± 1,89 | 86,43 ± 0,98 | 69,81 ± 4,56 | 84,29 ± 2,11 | 81.03 ± 3.34 | 93,85 ± 0,89 | 61.11 ± 4.67 | 90,05 ± 3,78 | 80,62 ± 1,02 |
| H2Former | 12 | 81,05 ± 2,56 | 20.13 ± 7.23 | 86,61 ± 3,21 | 69,32 ± 1,23 | 85.12 ± 4.78 | 82,01 ± 2,89 | 94.09 ± 2.45 | 61,16 ± 0,76 | 89,97 ± 4,12 | 80,94 ± 3,56 |
| RHesFormer | 34 | 80,65 ± 4,02 | 17.48 ± 6.89 | 89,16 ± 2,78 | 66,94 ± 0,78 | 84,61 ± 4,34 | 82,15 ± 2,56 | 93.11 ± 1.34 | 59,92 ± 4,12 | 91.08 ± 3.45 | 80,75 ± 2,01 |
| MedScale-Former | 35 | 80,78 ± 1,34 | 20.02 ± 3.78 | 88,79 ± 4,02 | 69,82 ± 2,56 | 85,13 ± 0,87 | 81,63 ± 4,78 | 94,10 ± 2,78 | 60,72 ± 1,89 | 90,14 ± 1,56 | 80,93 ± 4,56 |
| MCAFT | 36 | 81,03 ± 3,45 | 19.98 ± 5.12 | 89,76 ± 0,76 | 68,96 ± 3,89 | 84,54 ± 2,56 | 81,98 ± 3,12 | 94.32 ± 4.01 | 60,85 ± 3,67 | 89,06 ± 4,89 | 80,91 ± 1,78 |
| MVM-UNet (La Nôtre) | — | 81,26 ± 1,89 | 18.72 ± 2.16 | 88,53 ± 3,22 | 69,84 ± 4,23 | 85,37 ± 2,69 | 82,67 ± 1,67 | 94,41 ± 3,56 | 61,02 ± 2,78 | 90,19 ± 0,67 | 81,48 ± 3,12 |
Tableau 3 : Comparaison des performances sur le jeu de données de segmentation multi-organes Synapse. Comparaison du MVM-UNet avec les méthodes représentatives de segmentation basées sur CNN, Transformer et SSM utilisant le coefficient de similarité de Dice (DSC), la distance de Hausdorff au 95e percentile (HD95) et les scores de Dice spécifiques à chaque organe pour l’aorte (Aor.), la vésicule biliaire (Gal.), le rein gauche (Kid. (L)), le rein droit (Kid. (R)), foie (Liv.), pancréas (Pan.), rate (Spl.) et estomac (Sto.). Les résultats de MVM-UNet sont rapportés en moyenne ± écart-type de trois expériences indépendantes de graines aléatoires. Les résultats rapportés comme des valeurs uniques ont été reproduits à partir des publications originales correspondantes.
MVM-UNet a atteint un DSC moyen de 81,26 % ± 1,89 % et un HD95 moyen de 18,72 ± 2,16 sur trois séries indépendantes. Les résultats démontrent une performance stable de segmentation sur le jeu de données Synapse. Parmi les méthodes évaluées, MVM-UNet a obtenu la moyenne de DCS la plus élevée et la deuxième plus faible moyenne HD95.
Pour Synapse, la signification statistique a été évaluée à l’aide du test de rang signé de Wilcoxon basé sur des valeurs DSC par cas par paires. MVM-UNet a montré une amélioration statistiquement significative par rapport à H2Former, avec une valeur p de 0,026, indiquant que l’amélioration observée de la performance en segmentation était statistiquement significative.
Résultats représentatifs réussis et sous-optimaux
Des résultats qualitatifs représentatifs réussis sont présentés dans les figures 6 à 8. Les résultats réussis se caractérisent par des masques de segmentation prédits qui correspondent étroitement aux annotations de base et délimitent avec précision les limites primaires de la lésion ou des organes. Des résultats sous-optimaux représentatifs peuvent survenir pour des cibles très petites, des frontières à faible contraste, des formes irrégulières des lésions, des organes à faible intensité contrastante ou des frontières anatomiquement ambiguës, et apparaître généralement sous forme de sous-segmentation, de sur-segmentation, de fuite de frontière ou de fragments de masque discontinus. Lorsque de tels résultats sont observés, les utilisateurs doivent vérifier que le redimensionnement de l’image, la normalisation, l’interpolation du masque, la sélection des points de contrôle du modèle, le seuil d’inférence (pour les ensembles de données ISIC) ou la prédiction argmax (pour Synapse) et les procédures de calcul métrique sont cohérentes avec celles décrites dans le protocole.
Étude d’ablation du module MV4D
La contribution du module MV4D a été évaluée en ajoutant progressivement les paires de balayage en zigzag, hiérarchique, spirale et radiale, suivies du module SFusion Mamba (Tableau 4 ; Figure 9). Lorsque seule la paire de balayage en zigzag était utilisée, la performance de segmentation était limitée. L’ajout de la paire de balayage hiérarchique a considérablement amélioré les performances, indiquant l’avantage d’intégrer des informations multiéchelles. L’ajout ultérieur des paires de balayage spirale et radiale a encore amélioré les performances de segmentation en renforçant la représentation des contours et des frontières. L’intégration du module SFusion Mamba a permis d’obtenir les meilleures performances parmi les configurations évaluées.
| Modèle | Paire de balayage en zigzag | Paire de balayage hiérarchique | Paire de balayage en spirale | Paire de balayage radial | SFusion Mamba | ISIC 2017 mIoU ( %) | ISIC 2017 DSC ( %) | ISIC 2018 mIoU ( %) | ISIC 2018 DSC ( %) |
| MVM-UNet | ✓ | | | | | 56.75 | 72.46 | 58.03 | 73.45 |
| MVM-UNet | ✓ | ✓ | | | | 72.38 | 84.01 | 73.45 | 84.7 |
| MVM-UNet | ✓ | ✓ | ✓ | | | 75.69 | 86.20 | 76.94 | 86.94 |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | | 76.41 | 86.61 | 78.28 | 87.82 |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
Tableau 4 : Étude d’ablation du module Multi-View 4-Directional (MV4D). Performance obtenue en intégrant progressivement les paires de balayage hiérarchique, spirale et radiale ainsi que le module Spatial Fusion Mamba (SFusion Mamba) dans l’architecture de base à paires de balayage en zigzag. La performance est rapportée à l’aide de l’intersection moyenne sur Union (mIoU) et du coefficient de similarité de Dice (DSC) sur les ensembles de données ISIC 2017 et ISIC 2018.

Figure 9. Étude d’ablation du module Multi-View 4-Directional (MV4D). (A) Changement de l’intersection moyenne sur Union (mIoU) suite à l’intégration séquentielle de la paire de balayage hiérarchique, de la paire de balayage en spirale, de la paire de balayage radial et du Spatial Fusion Mamba (SFusion Mamba) dans l’architecture de base. (B) Modification du coefficient de similarité des dés (DSC) suite à l’intégration séquentielle de la paire de balayage hiérarchique, de la paire de balayage spirale, de la paire radiale et du Spatial Fusion Mamba (SFusion Mamba) dans l’architecture de base. (C) Changement de mIoU suite à l’incorporation séquentielle de la paire de balayage hiérarchique, de la paire de balayage spirale, de la paire de balayage radial et du Spatial Fusion Mamba (SFusion Mamba) dans l’architecture de base sous le second cadre expérimental. (D) Modification du DSC suite à l’incorporation séquentielle de la paire de balayage hiérarchique, de la paire de balayage en spirale, de la paire de balayage radial et du Spatial Fusion Mamba (SFusion Mamba) dans l’architecture de base sous le second cadre expérimental. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Sur le jeu de données ISIC 2017, le module MV4D complet a atteint un mIoU de 80,94 % et un DSC de 91,32 %. Les tendances de performance correspondantes pour le mIoU et le DSC sont montrées respectivement dans les figures 9A et 9B. Sur le jeu de données ISIC 2018, le module MV4D complet a atteint un mIoU de 82,47 % et un DSC de 90,65 %. Les tendances de performance correspondantes sont montrées respectivement dans la Figure 9C et la Figure 9D.
Sauf indication contraire, toutes les expériences d’ablation ont été menées avec une graine aléatoire fixe de 100, tandis que les principaux résultats de comparaison ont été rapportés en moyenne ± DS sur trois graines aléatoires indépendantes (1, 52 et 100). Par conséquent, les résultats de l’ablation visent à comparer les contributions relatives des composants individuels sous un cadre contrôlé à graine unique, plutôt qu’à reproduire la performance finale multiseed rapportée dans les principales expériences de comparaison.
Dans l’ensemble, l’intégration progressive des paires de balayage supplémentaires et du module SFusion Mamba a constamment amélioré les performances de segmentation, la configuration complète MV4D atteignant les meilleures performances sur les deux ensembles de données.
Étude d’ablation du bloc Multi-View Vision (MVV)
Le bloc MVV a été évalué en comparant l’architecture de base avec une version incorporant la branche de projection haut-bas (Tableau 5). Dans le jeu de données ISIC 2017, l’inclusion de la branche Up-Down Projection a augmenté le mIoU de 78,83 % à 80,96 % et le DSC de 88,15 % à 91,02 %. Sur le jeu de données ISIC 2018, le mIoU est passé de 80,32 % à 82,46 %, tandis que le DSC est passé de 89,15 % à 90,57 %.
| Modèle | Bloc MVV de base | Projection haut-bas | ISIC 2017 mIoU ( %) | ISIC 2017 DSC ( %) | ISIC 2018 mIoU ( %) | ISIC 2018 DSC ( %) |
| MVM-UNet | ✓ | | 78.83 | 88.15 | 80.32 | 89.15 |
| MVM-UNet | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
Tableau 5 : Étude d’ablation du bloc Multi-View Vision (MVV). Comparaison de performance du bloc de base Multi-View Vision (MVV) avec et sans la branche de projection haut-bas. La performance est rapportée à l’aide de l’intersection moyenne sur Union (mIoU) et du coefficient de similarité de Dice (DSC) sur les ensembles de données ISIC 2017 et ISIC 2018.
Les expériences d’ablation par blocs MVV ont été menées en utilisant la graine aléatoire fixe de 100. Par conséquent, la performance de la configuration contenant la branche de projection Up-Down reflète le réglage contrôlé de l’ablation à graine unique et peut différer légèrement de la performance moyenne à trois graines rapportée pour le modèle MVM-UNet complet dans les principales expériences de comparaison.
Dans l’ensemble, l’intégration de la branche Up-Down Projection a constamment amélioré les performances de segmentation sur les deux ensembles de données, avec des augmentations observées pour le mIoU et le DSC.
Étude d’ablation du module Multi-stage Fusion Mamba (MFusion Mamba)
Le module MFusion Mamba a été évalué en comparant différentes stratégies de fusion grossière avec la composante Fusion fine (Tableau 6 ; Figure 10). Sans MFusion Mamba, MVM-UNet a obtenu un mIoU de 75,47 % et un DSC de 86,01 % sur le jeu de données ISIC 2017, ainsi qu’un mIoU de 77,49 % et un DSC de 87,29 % sur le jeu ISIC 2018. Parmi les stratégies de fusion grossière évaluées, le produit de Hadamard a obtenu la plus grande amélioration. L’intégration du composant Fusion fine a encore amélioré les performances de segmentation. La configuration complète de MFusion Mamba a atteint un mIoU de 80,95 % et un DSC de 91,18 % sur ISIC 2017, ainsi qu’un mIoU de 82,51 % et un DSC de 90,58 % sur ISIC 2018.
| Modèle | Fusion grossièreMaximum élément par élément | Fusion grossière Addition par élément | Fusion grossière Produit Hadamard | Fine Fusion Module | ISIC 2017 mIoU ( %) | ISIC 2017 DSC ( %) | ISIC 2018 mIoU ( %) | ISIC 2018 DSC ( %) |
| MVM-UNet | | | | | 75.47 | 86.01 | 77.49 | 87.29 |
| MVM-UNet | ✓ | | | | 76.21 | 86.47 | 78.35 | 87.82 |
| MVM-UNet | | ✓ | | | 76.83 | 86.86 | 79.11 | 88.30 |
| MVM-UNet | | | ✓ | | 78.26 | 87.83 | 80.06 | 88.96 |
| MVM-UNet | | | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
Tableau 6 : Étude d’ablation du module Multi-stage Fusion Mamba (MFusion Mamba). Comparaison de performance de différentes stratégies de fusion grossière, incluant la fusion maximale (Max), l’addition élément par élément (⊕) et le produit de Hadamard (⊙), ainsi que le module complet de fusion fine. La performance est rapportée à l’aide de l’intersection moyenne sur Union (mIoU) et du coefficient de similarité de Dice (DSC) sur les ensembles de données ISIC 2017 et ISIC 2018.

Figure 10. Étude d’ablation du module Multi-stage Fusion Mamba (MFusion Mamba). (A) Variation de l’intersection moyenne sur Union (mIoU) obtenue en utilisant différentes stratégies de fusion grossière (addition maximale, élément par élément et produit de Hadamard) et le module complet de fusion fine. (B) Variation du coefficient de similarité de dés (DSC) obtenu en utilisant différentes stratégies de fusion grossière (addition maximale, élément par élément, et produit de Hadamard) et le module complet de fusion fine. (C) Variation du mIoU obtenue en utilisant différentes stratégies de fusion grossière (addition maximale, élément par élément et produit de Hadamard) et le module complet de fusion fine dans le second cadre expérimental. (D) Variation du DSC obtenu en utilisant différentes stratégies de fusion grossière (addition maximale, élément par élément et produit de Hadamard) et le module complet de fusion fine dans le second cadre expérimental. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Sur le jeu de données ISIC 2017, la configuration complète MFusion Mamba a atteint un mIoU de 80,95 % et un DSC de 91,18 %. Les tendances de performance correspondantes pour le mIoU et le DSC sont montrées respectivement dans les figures 10A et 10B. Sur le jeu de données ISIC 2018, la configuration complète MFusion Mamba a atteint un mIoU de 82,51 % et un DSC de 90,58 %. Les tendances de performance correspondantes sont montrées respectivement dans la Figure 10C et la Figure 10D. Les expériences d’ablation MFusion Mamba ont été menées en utilisant la graine aléatoire fixe de 100. Par conséquent, la configuration complète de MFusion Mamba représente le résultat contrôlé de l’ablation à graine unique et peut différer légèrement de la performance moyenne à trois graines rapportée pour le modèle MVM-UNet complet dans les principales expériences de comparaison.
Dans l’ensemble, l’intégration progressive de la stratégie de fusion grossière du produit Hadamard et du composant Fine Fusion a constamment amélioré les performances de segmentation, la configuration complète MFusion Mamba atteignant les performances les plus élevées sur les deux ensembles de données.
Résumé des études d’ablation
À travers les expériences d’ablation, en incorporant progressivement les branches hiérarchique, spirale et radiale de paires de balayage, ainsi que le module SFusion Mamba, a constamment amélioré les performances de segmentation (Tableau 4 ; Figure 9). De même, l’inclusion de la branche Up-Down Projection dans le bloc MVV a amélioré à la fois le mIoU et le DSC sur les ensembles de données ISIC 2017 et ISIC 2018 (Tableau 5). La configuration complète MFusion Mamba a également atteint la performance la plus élevée parmi les stratégies de fusion multi-étages évaluées (Tableau 6 ; Figure 10).
Étude d’ablation des hyperparamètres
Les effets de la taille des entrées et de la valeur de décrochage ont été évalués sur les ensembles de données ISIC 2017 et ISIC 2018 (Tableau 7). Trois résolutions d’entrée (256 × 256, 384 × 384 et 512 × 512) ont été comparées. Sous les paramètres évalués, la résolution d’entrée 256 × 256 a obtenu la performance de segmentation la plus élevée sur les deux ensembles de données.
| Modèle | Taille d’entrée 256 × 256 | Taille d’entrée 384 × 384 | Taille d’entrée 512 × 512 | Abandon 0.0 | Abandon 0.1 | Abandon 0.2 | Abandon 0.3 | ISIC 2017 mIoU ( %) | ISIC 2017 DSC ( %) | ISIC 2018 mIoU ( %) | ISIC 2018 DSC ( %) |
| MVM-UNet | | ✓ | | | | ✓ | | 80.02 | 88.91 | 81.76 | 89.92 |
| MVM-UNet | | | ✓ | | | ✓ | | 79.96 | 88.87 | 80.97 | 89.47 |
| MVM-UNet | ✓ | | | ✓ | | | | 77.48 | 87.28 | 78.76 | 88.11 |
| MVM-UNet | ✓ | | | | ✓ | | | 79.36 | 88.53 | 81.13 | 89.62 |
| MVM-UNet | ✓ | | | | | ✓ | | 80.94 | 90.15 | 82.49 | 90.50 |
| MVM-UNet | ✓ | | | | | | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
Tableau 7 : Étude d’ablation de la taille de l’image d’entrée et de la valeur de dropout. Comparaison des performances de MVM-UNet en utilisant différentes tailles d’image d’entrée et valeurs de dropout. La performance de segmentation est rapportée en utilisant la moyenne d’intersection sur Union (mIoU) et le coefficient de similarité de Dice (DSC) sur les ensembles de données ISIC 2017 et ISIC 2018.
Différentes valeurs d’abandon ont également été évaluées. Parmi les configurations testées, une valeur de dropout de 0,2 a permis d’obtenir la meilleure performance de segmentation sur les deux ensembles de données et a donc été utilisée dans les expériences principales.
Étude d’ablation de la configuration de la couche encodeur-décodeur
Différentes configurations de couches encodeur-décodeur ont été évaluées pour examiner l’effet de la profondeur réseau sur la performance de segmentation et le coût de calcul (Tableau 8). Parmi les configurations évaluées, l’architecture symétrique {2, 2, 2, 2}-{2, 2, 2, 2} a obtenu la performance globale de segmentation la plus élevée tout en maintenant une complexité de modèle relativement faible. Augmenter la profondeur du réseau à {2, 2, 9, 2}-{2, 9, 2, 2} produisait des performances de segmentation comparables mais augmentait à la fois le nombre de paramètres et le coût de calcul.
| Modèle | Configuration de la couche encodeur-décodeur | Paramètres (M) | FLOPs (G) | ISIC 2017 mIoU ( %) | ISIC 2017 DSC ( %) | ISIC 2018 mIoU ( %) | ISIC 2018 DSC ( %) |
| MVM-UNet | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-UNet | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-UNet | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-UNet | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-UNet | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
Tableau 8 : Étude d’ablation des configurations de couches encodeur-décodeur. Comparaison des performances de différentes configurations de couches encodeur-décodeur. Le tableau indique le nombre de paramètres du modèle (paramètres), les opérations en virgule flottante (FLOPs), la moyenne d’intersection sur Union (mIoU) et le coefficient de similarité de dés (DSC) sur les ensembles de données ISIC 2017 et ISIC 2018.
Comparaison des coûts de calcul
L’efficacité computationnelle du modèle final MVM-UNet a été comparée à des méthodes de référence représentatives, incluant HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former et MCAFT, sous le même environnement matériel et la même résolution d’entrée (Tableau 9). Les métriques évaluées comprenaient le temps d’entraînement par époque, le temps d’inférence par image, l’utilisation maximale de la mémoire GPU pendant l’entraînement, le nombre de paramètres entraînables (Params) et les FLOPs. Le temps d’entraînement était mesuré comme le temps nécessaire pour compléter une époque d’entraînement, le temps d’inférence comme le temps moyen de traitement par image de test, et les FLOPs calculés pour un seul passage avant.
| Méthode | Arbitre. | Temps d’entraînement (s/époque) | Temps d’inférence (ms/image) | Mémoire GPU de pic (GB) | Paramètres (M) | FLOPs (G) |
| RHesFormer | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-vmunet | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| MISSFormer | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2Former | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| MedScale-Former | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (La Nôtre) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
Tableau 9 : Comparaison des coûts computationnels entre MVM-UNet et méthodes de référence représentatives. Comparaison de l’efficacité computationnelle sous le même environnement matériel et la même résolution d’entrée. Les métriques rapportées incluent le temps d’entraînement par époque, le temps d’inférence par image, l’utilisation maximale de la mémoire en unités de traitement graphique (GPU) pendant l’entraînement, le nombre de paramètres de modèle (Paramètres) et les opérations en virgule flottante (FLOP). Les méthodes avec des implémentations disponibles ont été évaluées en utilisant le même environnement expérimental dans la mesure du possible.
Comme résumé dans le tableau 9, MVM-UNet nécessitait 104 s par époque d’entraînement, 26,8 ms par image pour l’inférence, 7,9 Go de mémoire GPU de pic, 28,36 millions de paramètres entraînables et 4,39 GFLOPs. Comparé à HResFormer, MISSFormer, H2Former et MCAFT, MVM-UNet nécessitait un temps d’entraînement plus court, un temps d’inférence plus court, une utilisation de mémoire GPU de pic plus faible et moins de FLOPs. Comparé aux modèles légers H-vmunet et MedScale-Forter, MVM-UNet nécessitait un temps d’entraînement et une utilisation de mémoire plus importants tout en conservant une vitesse d’inférence comparable tout en conservant une complexité computationnelle relativement faible.
Disponibilité des données et du code
Les ensembles de données ISIC 2017 et ISIC 2018 sont disponibles publiquement via les archives de l’International Skin Imaging Collaboration (ISIC), et l’ensemble de données Synapse est accessible publiquement depuis le dépôt Synapse. Les détails de l’acquisition des ensembles de données sont fournis dans la déclaration d’éthique. En résumé, l’ensemble de données ISIC 2017 a été obtenu à partir du dépôt officiel de données ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), celui ISIC 2018 a été obtenu à partir du dépôt officiel de données ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), et l’ensemble de données Synapse a été obtenu à partir du dépôt Synapse sous l’identifiant d’accession syn3193805 (https://www.synapse.org/Synapse:syn3193805). Les dates de téléchargement correspondantes sont indiquées dans la déclaration d’éthique. Une version publique initiale du code source MVM-UNet est disponible à https://github.com/LIXUEGUANG002/MVM-UNet. Le dépôt comprend l’implémentation du modèle, les principaux modules réseau, les fichiers de configuration, les instructions d’organisation des ensembles de données, les scripts d’entraînement et les scripts d’évaluation. Le package complet de reproductibilité, incluant les fichiers de configuration finalisés, les scripts d’expérimentation complets, la documentation supplémentaire et les points de contrôle des modèles entraînés, sera rendu public dès sa publication.
Tableau supplémentaire 1. Architecture couche par couche de la Multi-view Vision Mamba UNet (MVM-UNet). Le tableau résume l’architecture réseau séquentielle de MVM-UNet, incluant la couche d’entrée, l’intégration des patchs, les étapes encodeur, les blocs Multi-View Vision (MVV), les opérations de fusion de patchs, le Multi-stage Fusion Mamba (MFusion Mamba), les étapes du décodeur, l’upsampling final et la tête de segmentation. Pour chaque étage, l’opération correspondante, les paramètres principaux et la taille de la caractéristique de sortie sont listés. E1–E4 désignent les cartes de caractéristiques de l’étage encodeur utilisées pour la fusion de caractéristiques en plusieurs étages. B, H et W désignent respectivement la taille du lot, la hauteur et la largeur de l’image, et K désigne le nombre de classes de sortie (K = 1 pour la segmentation binaire des lésions cutanées et K = 9 pour la segmentation multiclasse Synapse, comprenant une classe de fond et huit classes d’orgues au premier plan). MFusion Mamba génère des fonctionnalités d’encodeur multiétage fusionnées qui sont intégrées aux caractéristiques correspondantes lors de la reconstruction du décodeur. Veuillez cliquer ici pour télécharger ce fichier.
Fichier supplémentaire 1. Pseudocode du module Multi-View Four-Directional (MV4D) et du Multi-Stage Fusion Mamba (MFusion Mamba). Le fichier complémentaire présente le flux de travail algorithmique des deux modules principaux utilisés dans MVM-UNet. L’algorithme 1 décrit l’ensemble du pipeline de traitement du module Multi-View Four-Directional (MV4D), incluant l’aplatissement des caractéristiques, la construction de quatre séquences de paires de balayage (zigzag, hiérarchique, spirale et radiale), le traitement sélectif en espace d’états (S6), le Scan-view Fusion Mamba (SFusion Mamba), et la reconstruction de la carte des caractéristiques de sortie. L’algorithme 2 décrit le module Multi-stage Fusion Mamba (MFusion Mamba), incluant l’alignement des caractéristiques des encodeurs multi-étages, la fusion grossière, la fusion fine, l’intégration des décodeurs et la génération de la fonction d’entrée du décodeur fusionné. Les variables et les dimensions tensorielles sont définies dans les algorithmes. Veuillez cliquer ici pour télécharger ce fichier.
Fichier de codage supplémentaire 1. Paquet de code source pour MVM-UNet (MVM-UNet-master). L’archive ZIP supplémentaire contient l’implémentation complète du code source MVM-UNet utilisée dans cette étude. Le package comprend l’architecture réseau, les modules Multi-View Four-Directional (MV4D) et Multi-stage Fusion Mamba (MFusion Mamba), des fichiers de configuration, des scripts d’entraînement et d’évaluation pour ISIC 2017, ISIC 2018, ainsi que des ensembles de données Synapse, des fonctions utilitaires et la documentation du projet nécessaires pour reproduire les expériences décrites dans ce protocole. Le package inclut également le fichier README avec les instructions d’installation, les dépendances logicielles, l’organisation des ensembles de données, ainsi que les flux de travail d’entraînement et d’inférence. Veuillez cliquer ici pour télécharger ce fichier.