$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Considérations éthiques et population étudiée
Cette étude rétrospective a été approuvée par le comité d’éthique institutionnel. Le consentement éclairé a été renoncé car toutes les informations de santé protégées ont été anonymisées. La population étudiée comprenait des patients récupérés dans la base de données d’imagerie du First People’s Hospital de Nantong, qui ont subi une IRM de la colonne lombaire en raison de douleurs lombaires entre janvier 2022 et décembre 2023. Les caractéristiques cliniques des patients ont également été recueillies (tableau 1).
Critères d’inclusion et d’exclusion
La norme diagnostique actuelle pour la DLBP suit la méthode de discographie de l’International Association for the Study of Pain de 1995, qui provoque la douleur par une pression accrue mais n’est pas largement acceptée en raison de sa forte intensitéd’invasion 8. Par conséquent, cette étude a adopté un test restrictif de provocation de douleur discale intraopératoire comme méthode diagnostique pour la DLBP, conforme aux principes de la discographie tout en minimisant les dommages et complications ultérieursdes disques 31. La procédure impliquait des patients en position allongée sous anesthésie rachidienne, avec le disque lombaire cible localisé selon la radiographie du bras C. Une aiguille de 18 G (<22 G) a été insérée par une approche postérolatérale dans le noyau pulposeux central, évitant les racines nerveuses et le sac dural. Après confirmation du placement de l’aiguille, une solution saline ou un contraste non ionique (par exemple, iohexol) a été injecté à un taux ne dépassant pas 0,5 mL/min, avec une pression inférieure à 50 psi et un volume total d’injection inférieur à 3 mL, afin de simuler une pression intradiscale accrue et de provoquer des symptômes familiers de douleur lombaire, avec un score d’échelle analogique visuelle (VAS) ≥ 7.
Critères d’inclusion dans les groupes DLBP : Les patients inclus ici ont subi une IRM, présentent des douleurs lombaires récurrentes depuis plus de 3 mois, avec un traitement conservateur infructueux, avec ou sans engourdissement ou douleur irradiante des membres inférieurs, et sont positifs au test de provocation de douleur discale intraopératoire.
Critères d’inclusion des groupes non liés au DLBP : Les patients inclus ici ont subi une IRM ; n’ont aucun antécédent de douleurs lombaires depuis 3 mois ou des personnes en bonne santé subissent un examen physique ; n’a aucune anomalie IRM ; et disposent d’une évaluation standardisée avec l’Indice de Handicap (ODI) d’Oswestry <10 et le VAS ≤2.
Critères d’exclusion : Excluez les patients ayant d’autres causes de douleurs lombaires, telles que des hernies discales importantes des nerfs compressants, des fractures, des infections vertébrales, une spondylolisthésis, des tumeurs, de l’ostéoporose ou des maladies métaboliques des os ; antécédents de chirurgie avant l’examen ; des images peu claires ou de mauvaise qualité ; incapacité à identifier la région d’intérêt (ROI).
Au total, 243 patients ont été inclus, comprenant 81 patients atteints de PLD et 162 témoins.
Paramètres IRM
Tous les patients inclus dans cette étude ont subi des IRM en 3,0 T, utilisant des séquences incluant l’imagerie sagittale et axiale pondérée en T1 (T1WI) ainsi que l’imagerie pondérée en T2 (T2WI). Trois appareils IRM différents ont été utilisés dans l’étude : Siemens Verio, Siemens Prisma et Philips Ingenia CX. Les paramètres de balayage étaient définis comme suit : pour le T2WI sagittal, TR variait de 2000 à 4597 ms, TE de 90 à 120 ms, épaisseur de tranche de 4,0 à 4,8 mm, avec 15 tranches incluses, bande passante de 250 Hz à 340 Hz, matrice de 384 × 384 ou 512 × 512, pourcentage de champ de vision de phase de 100 %, et un champ de vision de 300 mm.
Mesure et statistiques des caractéristiques d’imagerie HIZ
Cette étude a utilisé le logiciel 3D Slicer (version 5.6.1, https://download.slicer.org/?version=5.6.1) pour analyser manuellement les images IRM lombaires pondérées en T2 de 243 patients et témoins. Le flux de traitement des données était le suivant : les images étaient importées en utilisant la fonction Ajouter des données DICOM dans 3D Slicer. Les mesures ont été réalisées à l’aide de la fonction Markups par deux étudiants en recherche sur la colonne vertébrale sous la direction de radiologues et de chirurgiens de la colonne vertébrale ayant plus de 10 ans d’expérience clinique. Les écarts dans les mesures ont été résolus par consultation avec les deux médecins. Toutes les valeurs de mesure ont été moyennées par deux statisticiens pour garantir leur exactitude. Sur les images sagittales, les deux diamètres maximaux mutuellement perpendiculaires de la zone d’intensité élevée (HIZ) ont été mesurés, définis comme Hizh (direction quasi verticale) et Hizw (direction quasi horizontale). La fonction de segmentation était utilisée pour délimiter la région HIZ, et l’aire du HIZ le plus proéminent sur le plan sagittal était calculée, notée Hizarea. Sur les images axiales, la longueur maximale du HIZ était mesurée, appelée Hizl. De plus, trois variables binaires ont été définies : Hiz (présence de HIZ), Autre (présence d’HI multisegmentaire) et Position (si le HIZ traverse la ligne médiane postérieure) (Tableau 2).
Radiomics caractéristiques d’extraction et de normalisation
Pour intégrer le fonctionnement spécifique du volume scalaire de rééchantillonnage dans le contexte du traitement des images IRM lombaires pondérées T2 de 243 patients et témoins à l’aide de 3D Slicer, les étapes détaillées suivantes ont été suivies : Le processus a commencé par l’importation d’images pondérées en IRM lombaire T2 dans 3D Slicer. Pour assurer la cohérence et réduire le biais d’hétérogénéité, toutes les images ont été rééchantillonnées à une taille voxel de 0,6 × 0,6 × 0,6 mm en utilisant le module Resampling Scalar Volume . Les étapes spécifiques étaient : naviguer dans la section Modules et sélectionner Volume scalaire de rééchantillonnage. Dans Paramètres Ensemble, assurez-vous que le volume scalaire de rééchantillonnage est sélectionné. Dans la section Paramètres de rééchantillonnage , réglez l’espacement à 0,6, 0,6, 0,6 pour définir les dimensions cibles des voxels. Sélectionnez une méthode d’interpolation appropriée parmi des options telles que linéaire, voisin le plus proche, bspline, hamming, cosinus, welch, lanczos ou blackman, avec linéaire comme valeur par défaut. Pour le volume de sortie, sélectionnez ou créez un nouveau volume pour stocker les données rééchantillonnées. Après vérification des paramètres, cliquez sur Appliquer pour exécuter le processus de rééchantillonnage.
Après un rééchantillonnage, deux étudiants en recherche sur la colonne vertébrale, encadrés par des radiologues et des chirurgiens de la colonne vertébrale ayant plus de 10 ans d’expérience, ont réalisé une délimitation semi-automatique de la région d’intérêt (ROI). Les divergences ont été résolues par consultation. Les étapes spécifiques étaient : sélectionner le calque (rééchantillonner un nouveau volume), créer un nouveau calque de segmentation, et utiliser la fonction Dessin pour la délimitation couche par couche. Utilisez la fonction Remplir entre les tranches pour le remplissage entre les couches. Lisser le ROI formé en utilisant la méthode de lissage médiane avec une taille de grain de 3,0 mm, 5 x 5 pixels. À l’aide de la bibliothèque PyRadiomics, 107 caractéristiques radiomiques ont été extraites des images rééchantillonnées, incluant des caractéristiques de forme, des caractéristiques statistiques du premier ordre, la matrice de cooccurrence de niveau gris (GLCM), la matrice de longueur de course de niveau gris (GLRLM), la matrice de zone de taille de niveau gris (GLSZM), la matrice de différence de tonalité de gris voisine (NGTDM) et les caractéristiques de la matrice de dépendance des niveaux de gris (GLDM) (Tableau supplémentaire 1). Enfin, les données extraites des caractéristiques ont été standardisées à l’aide de la méthode Z-score pour transformer leur plage naturelle en une plage standardisée.
Regroupement basé sur les caractéristiques
Les groupes étaient répartis comme suit :
d0 (Groupe de base) : Caractéristiques cliniques incluses, n(d0) = 5.
d1 (Groupe de fin de base) : Caractéristiques cliniques incluses et caractéristiques d’imagerie HIZ, n(d1) = 12.
d2 (Groupe de modèles) : Caractéristiques cliniques et radiomiques incluses, n(d2) = 112.
D (Groupe de finure modèle) : Caractéristiques cliniques incluses, caractéristiques d’imagerie HIZ et caractéristiques radiomique, n(D) = 119.
Lecture et prétraitement des données
Les données des groupes respectifs étaient lues à l’aide de la fonction read_excel dans le logiciel R (version 4.3.1, https://www.r-project.org/, plateforme : x86_64-w64-mingw32/x64 [64 bits]) avec codage UTF-8 (par défaut système), qui prend en charge la plupart des langages écrits au monde. La fonction select servait à séparer la variable cible des variables de caractéristiques.
Sélection des fonctionnalités
Pour garantir la reproductibilité de la division des données, les quatre ensembles de données (D, d2, d1, d0) ont suivi le même flux de traitement, avec une graine aléatoire fixe de 80. Une colonne d’étiquettes était ajoutée à la trame de données, convertie en type de facteur, et des étiquettes aléatoires (1 et 0) étaient générées à l’aide d’une distribution binomiale pour diviser les données en ensembles d’entraînement et de test dans un ratio de 8:2 (probabilité de 80 % pour l’ensemble d’entraînement). En raison du nombre limité de fonctionnalités, les groupes d0 et d1 ne nécessitaient pas de sélection de caractéristiques, tandis que les groupes d2 et D subissaient une sélection de caractéristiques :
Premièrement, le test Mann-Whitney U a été appliqué à l’ensemble d’entraînement pour sélectionner des caractéristiques avec des valeurs p <0,05. Ensuite, une régression Lasso avec validation croisée 10 fois et régularisation L1 a été réalisée pour déterminer le coefficient de pénalité optimal et sélectionner des caractéristiques issues d’une seule itération. Une graine aléatoire de 1 à 100 était posée, et les étapes ci-dessus (division des données, test Mann-Whitney U et régression de lasso) étaient répétées dans une boucle. Les caractéristiques apparaissant plus de 50 fois en 100 itérations ont été sélectionnées pour la modélisation ultérieure afin d’assurer la fiabilité de la construction du modèle et de la prédiction diagnostique. Les caractéristiques de modélisation pour chaque groupe sont listées dans le tableau 3.
Recherche de grille et réglage du modèle
Pour optimiser les modèles, la recherche en grille a été appliquée afin d’explorer et d’évaluer systématiquement différentes combinaisons d’hyperparamètres. Grâce à l’ajustement itératif et à l’évaluation des performances, cette étude a identifié l’ensemble d’hyperparamètres fournissant les meilleures valeurs AUC ROC pour les ensembles de train et de test, optimisant ainsi les performances du modèle.
Développement et évaluation du modèle
Tout le développement du modèle et l’analyse des données ont été réalisés en R (version 4.3.1). Cette étude a appliqué divers algorithmes d’apprentissage automatique, notamment la Forêt Aléatoire (RF), la Machine à Vecteurs de Soutien (SVM), l’Arbre de Décision (TREE), les K-Voisins les Plus Proches (KNN) et la Régression Logistique (LOG), pour développer 20 modèles répartis sur les quatre groupes (d0, d1, d2 et D) pour prédire le diagnostic de la DLBP. La performance du modèle a été évaluée à l’aide des indicateurs suivants : ROC AUC, PR AUC, précision, sensibilité, spécificité, valeur prédictive positive (PPV), valeur prédictive négative (NPV) et score F1.
Les valeurs ROC AUC et PR AUC ont été directement générées à partir des courbes ROC et PR, tandis que les autres métriques (précision, sensibilité, spécificité, PPV, NPV et score F1) ont été calculées et analysées statistiquement à l’aide de fonctions correspondantes dans R. Parmi les 20 modèles développés, cette étude a sélectionné 8 modèles représentatifs pour une évaluation basée sur les indicateurs de performance ci-dessus.
Les formules pour chaque métrique sont les suivantes :




Q

TP : Vrai positif ; TN : True Negative ; FP : Faux positif ; FN : Faux négatif.
Analyse de l’interprétabilité SHAP
Le modèle Random Forest du groupe D a démontré la meilleure performance dans l’évaluation du modèle. Pour mieux interpréter les prédictions du modèle, cette étude a reconstruit le modèle en Python (version 3.7.9) et a réalisé une analyse d’interprétabilité SHAP. Pour maintenir la cohérence, les hyperparamètres de train du modèle Random Forest en Python étaient identiques à ceux utilisés dans R, et le flux de traitement des données était également cohérent. Plus précisément, nous avons utilisé l’interpréteur de modèle arbre pour analyser la contribution de chaque caractéristique aux prédictions diagnostiques du modèle dans les ensembles de train et de test. Pour une meilleure visualisation, nous avons généré des graphiques de distribution de valeurs SHAP, des graphiques d’importance des caractéristiques et des graphiques de force SHAP pour des prédictions individuelles.
Analyse statistique
Toutes les analyses de données ont été réalisées avec R (version 4.3.1, https://www.r-project.org/, plateforme : x86_64-w64-mingw32/x64 (64 bits)) et Python (version 3.7.9, https://www.python.org/downloads/release/python-379/). Les variables continues étaient décrites comme moyenne ± écart-type, tandis que les variables catégorielles étaient exprimées en fréquence et en pourcentage. La comparaison entre DLBP et non-DLBP a été analysée à l’aide du test U, avec une valeur P inférieure à 0,05 considérée comme statistiquement significative.