Method Article

Sélection des caractéristiques radiomiques utilisant la perte de gradient d’un réseau de neurones profond pour la détection des stades du cancer du poumon

DOI:

10.3791/70181

April 30th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Voici une méthode de sélection de caractéristiques basée sur l’apprentissage profond qui exploite les gradients d’une fonction de perte d’un réseau de neurones par rapport aux caractéristiques d’entrée pour identifier et prioriser celles qui influencent le plus fortement la détection du stade du cancer du poumon.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La radiomique permet d’extraire des biomarqueurs d’imagerie quantitative à partir d’images médicales et est devenue un outil important pour le diagnostic assisté par ordinateur du cancer. Cependant, les ensembles de données radiométriques sont généralement de haute dimension avec des tailles d’échantillon limitées, ce qui fait de la sélection des caractéristiques une étape cruciale pour construire des modèles prédictifs fiables. Cette étude propose un cadre d’élimination des caractéristiques récursives par perte de gradient (GL-RFE) qui intègre une analyse de sensibilité au gradient à partir d’un réseau neuronal profond afin d’identifier les caractéristiques radiomiques les plus influentes pour la détection des stades du cancer du poumon. Un total de 106 caractéristiques radiomiques ont été extraites à partir de scanners de tomodensitométrie thoracique utilisant l’extension PyRadiomics de la plateforme 3D Slicer. La méthode proposée évalue l’importance des caractéristiques en calculant les gradients de la perte réseau par rapport aux caractéristiques d’entrée et élimine récursivement les caractéristiques avec une contribution minimale. Les 15 principales caractéristiques radiomiques ainsi obtenues sont utilisées pour entraîner un classificateur de réseau neuronal profond afin de distinguer le cancer du poumon à un stade précoce du cancer du poumon avancé. Le cadre proposé obtient une solide performance de classification, avec une précision de 90,22 %, une précision de 90,10 %, une mémoire de 90,24 % et un score F1 de 90,16 % sur l’ensemble de données test. Les analyses de visualisation, incluant les cartes de chaleur de corrélation et les graphiques de distribution, confirment également une réduction de la redondance des caractéristiques et une meilleure séparabilité des classes. Comparé aux techniques conventionnelles de sélection de caractéristiques, GL-RFE capture efficacement les interactions non linéaires entre caractéristiques et améliore la généralisation du modèle. Le protocole présenté propose une méthodologie reproductible et interprétable pour la détection du stade du cancer basée sur la radiomique. Il est particulièrement adapté aux ensembles de données biomédicales de haute dimension et de petits échantillons et a des applications potentielles dans d’autres domaines, tels que la génomique et l’analyse clinique multimodale.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cancer du poumon reste l’un des principaux types de cancer, entraînant de graves problèmes de santé, souvent endécès. La radiomique permet la caractérisation quantitative des images médicales en extrayant de grands ensembles de caractéristiques décrivant la forme, la texture et l’intensité destumeurs 2,3. Ces caractéristiques, également appelées caractéristiques artisanales, servent de biomarqueurs potentiels pour le diagnostic, le pronostic et la réponse thérapeutique du cancer du poumon. Cependant, les ensembles de données radiomique sont généralement de haute dimension et limités par échantillon, ce qui entraîne des fonctionnalités redondantes et bruyantes qui dégradent la performance dumodèle 4,5,6,7. Ainsi, une sélection efficace et explicable des caractéristiques est cruciale pour développer des modèles prédictifs robustes basés sur la radiomique.

Les approches traditionnelles de sélection de caractéristiques telles que les méthodes de filtrage (par exemple, analyse de corrélation, analyse de variance [ANOVA], information mutuelle) et les méthodes d’enveloppe (par exemple, sélection séquentielle des caractéristiques, élimination récursive des caractéristiques) sont largement utilisées pour les modèles de détection du cancer basés sur la radiomique 4,8,9. Cependant, ils échouent souvent à capturer les interactions non linéaires entre caractéristiques et les dépendances contextuelles profondes inhérentes aux donnéesradiomiques 9,10,11. Les techniques d’apprentissage des traits d’ensemble ont été explorées pour la classification médicale des images, mais ont atteint une précision modérée, qui pourrait être encoreaméliorée 12.

Les méthodes d’apprentissage profond, en particulier les réseaux de neurones profonds (DNN), ont démontré une capacité supérieure à modéliser des relations non linéaires et hiérarchiques entre les caractéristiques et les résultats, ce qui les rend idéales pour guider la sélection des caractéristiques et fournir des modèles précis de détectiondu cancer 13,14. Dans ce contexte, le potentiel d’utilisation d’un réseau de neurones convolutionnel, de techniques d’IA multimodales et du VCG-16, un modèle pré-entraîné pour le diagnostic du cancer, estexploré 1,15,16. Un modèle hybride d’apprentissageprofond 17, incluant le modèle VGG-19 pré-entraîné et les réseaux de mémoire à long terme (LSTM), a été proposé, entraîné et testé sur un grand nombre d’images, atteignant une précision supérieure à 99 %.

Outre la détection du cancer, des recherches ont également été menées sur la stadification du cancer. Hugo et al.18 ont conçu un modèle de réseau de neurones à avance sur la base de données NSCLC de 300 patients pour classer les stades I, II et III du cancer avec une précision de 74,52 % dans les tests modèles. Une méthode d’inversionbayésienne basée sur la radiomique 3 a été présentée pour la détection du stade du cancer du poumon en utilisant le jeu de données NLST sur une taille d’échantillon de 200. La méthode proposée a atteint une précision de 86 %. La revue de la littérature a révélé que la plupart des études sur la détection du cancer se sont concentrées uniquement sur la classification des tumeurs bénignes et malignes, et que seules quelques-unes ont abordé la classification des stades du cancer, avec des précisions inférieures à 90 % qui peuvent être améliorées. Cet article de recherche répond à la lacune de recherche mentionnée et propose un cadre robuste de classification radiomique basé sur les caractéristiques pour une détection précise du stade du cancer du poumon.

Un cadre d’élimination des caractéristiques récursives basé sur la perte de gradient (GL-RFE) a été introduit dans cette étude, intégrant la rétropropagation des gradients des réseaux de neurones dans le processus RFE. Contrairement aux méthodes RFE conventionnelles qui reposent sur des métriques d’importance des caractéristiques statiques, GL-RFE exploite les gradients de la fonction de perte par rapport à chaque caractéristique d’entrée pour mesurer à quel point chaque caractéristique influence fortement les prédictions du modèle. En retirant itérativement des caractéristiques avec des contributions minimales au gradient, le modèle présenté effectue la sélection des 15 principales caractéristiques diagnostiques optimisées pour la détection des stades du cancer du poumon sur 2 classes (stade I et stade II combinés et stades IIIa et IIIb combinés). Le diagramme de flux de travail du travail effectué est présenté à la Figure 1. L’ensemble de données choisi pour le cancer du poumon pour le modèle présenté est NSCLC Radiomics19, qui comprend 411 volumes au format appelé imagerie numérique et communications en médecine (DICOM) avec des informations sur le stade clinique du cancer. Un total de 106 fonctionnalités radiomiques 3D de chaque volume DICOM pour le cancer du poumon sont extraites à l’aide de PyRadiomics20, une extension d’un logiciel open source, 3D Slicer21. Ces caractéristiques appartiennent à sept classesde caractéristiques : 22, incluant la forme, la méthode de différence de niveau de gris (GLDM), la matrice de cooccurrence de niveau de gris (GLCM), le premier ordre, la matrice de longueur de course de niveau de gris (GLRLM), la matrice de zone de taille des niveaux de gris (GLSZM), la matrice de différence de tonalité de gris de voisinage (NGTDM). Les données radiomiques de la classe minoritaire (stade I et stade II) ont été suréchantillonnées en utilisant la technique de suréchantillonnage synthétique des minorités (SMOTE)23.

La nouveauté du cadre GL-RFE proposé réside dans l’intégration de l’analyse de sensibilité basée sur le gradient, issue de l’entraînement des réseaux neuronaux, dans le processus d’élimination des caractéristiques récursives. Contrairement aux approches RFE conventionnelles qui reposent sur des mesures d’importance statiques, GL-RFE évalue dynamiquement la pertinence des caractéristiques à travers des gradients rétropropagés de la fonction de perte. Cela permet d’identifier des caractéristiques qui influencent directement les prédictions du modèle pour le stade du cancer tout en maintenant l’interprétabilité et la faisabilité computationnelle pour des ensembles de données médicaux relativement petits.

L’ensemble de données utilisé pour la formation et les tests du cadre proposé est un ensemble de données d’images CT publiquement accessible de 422 patients atteints d’un cancer du poumon, connu sous le nom de NSCLC Radiomics17. Pour chaque patient, le jeu de données comprend un volume CT, un ensemble de structures de radiothérapie DICOM (RTSTRUCT) ainsi qu’un fichier de segmentation DICOM (SEG). Ces fichiers contiennent des délimitations manuelles effectuées par un radio-oncologue du volume tridimensionnel du volume macroscopal primaire de la tumeur (GTV-1), ainsi que de l’image pulmonaire. L’ensemble de données est un ensemble pré-traité, et les dimensions des images sont de 512 x 512 pixels.

En raison de la nature non linéaire des caractéristiques radiomiques fabriquées à la main, ces caractéristiques ne peuvent pas être utilisées directement avec des modèles d’apprentissage profond pour le diagnostic du cancer, et leurs schémas de données inhérents doivent être capturés à l’aide de techniques d’IA. GL-RFE classe les caractéristiques en fonction de la magnitude du gradient de perte du modèle L par rapport à chaque caractéristique d’entrée xi.

Pour chaque caractéristique d’entrée xi, le gradient absolu moyen est calculé comme suit :

figure-introduction-1(1)

Ici, N est le nombre total d’échantillons. Lj est la perte pour jième échantillon. xij est la ième caractéristique de l’échantillonj-ième . figure-introduction-2 représente la sensibilité de la perte par rapport à la caractéristique d’entrée.

Les caractéristiques avec de faibles magnitudes de gradient ont un impact minimal sur les mises à jour des modèles et sont supprimées récursivement. Le flux de travail proposé pour éliminer les caractéristiques radiomiques à faible gradient en utilisant un perceptron multicouche (MLP) et entraîner un réseau de neurones d’apprentissage profond (DNN) sur les 15 principales caractéristiques est présenté à la Figure 1. La performance de la méthode GL-RFE pour la sélection des caractéristiques est ensuite évaluée.

Le modèle d’apprentissage profond mentionné plus haut avec la méthode GL–RFE est implémenté dans un notebook Jupyter sur Google Colab, ce qui permet d’écrire et d’exécuter du code Python dans un environnement en ligne. Différents paquets, inclus dans les étapes du protocole et les documents, doivent être téléchargés pour compiler le code. En utilisant la méthode décrite dans la section Protocole, les 15 principales caractéristiques radiomiques pour la détection du cancer du poumon sont identifiées et utilisées pour obtenir une détection précise du cancer dans les ensembles de données test.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Extraction des caractéristiques radiomiques à l’aide de l’extension pyradiomics 3D Slicer

REMARQUE : Les étapes suivantes sont conçues pour calculer les caractéristiques radiomiques d’un fichier DICOM CT pulmonaire en utilisant l’extension 3D Slicer PyRadiomics et pour les enregistrer dans un fichier au format de valeurs séparées par virgule (csv).

  1. Installez et ouvrez 3D Slicer (utilisez la dernière version stable de https://download.slicer.org/.
  2. Installez l’extension PyRadiomics et RT Slicer.
    1. Dans la barre de menu, allez dans Voir > Gestionnaire d’extensions. Ensuite, cherchez Radiomics ou SlicerRadiomics et RT Slicer.
    2. Cliquez sur Installer pour installer les bibliothèques RT Slicer et PyRadiomics. Redémarrez 3D Slicer après l’installation.
  3. Téléchargez NSCLC RADIOMICS.
    1. Téléchargez les ensembles de données DICOM du scanner pulmonaire ainsi que les fichiers SEG et RTSTRUCT de 422 patients de https://www.cancerimagingarchive.net/collection/nsclc-radiomics/
  4. Chargez les données DICOM du scanner pulmonaire.
    1. Allez dans le module DICOM. Cliquez sur Importer et sélectionnez le dossier contenant les tranches DICOM CT et leur fichier SEG dans la modalité RTSTRUCT.
    2. Après l’importation, double-cliquez sur le patient/étude/série pour le charger dans la scène du Slicer. Le volume 3D CT devrait être visible dans le panneau de visualisation comme montré à la Figure 2.
  5. Vérifiez l’alignement de la géométrie.
    1. Dans le module Données , développez à la fois le volume CT et la segmentation. Assurez-vous que la segmentation se situe exactement au-dessus du CT (sans désalignement).
  6. Ouvre le module de radiomics .
    1. Sélectionnez le module Radiomique dans la section module (ou cherchez-le dans la barre de recherche du module). Dans le volume de l’image d’entrée, sélectionnez le volume CT désiré.
    2. Dans Étiquette d’entrée/Segmentation, sélectionnez le nœud de segmentation (le ROI).
  7. Ajustez les paramètres de personnalisation de l’extraction.
    1. Définir Espacement des pixels rééchantillonnés = [1,1,1] (assure des voxels isotropes) et Largeur du bin = 25 (standard pour CT). Définir la taille du noyau LoG = 2.0, 3.0, 4.0, 5.0.
  8. Faites une extraction de caractéristiques.
    1. Cliquez sur Postuler. Le logiciel calculera désormais des caractéristiques 3D de premier ordre, de forme et de texture (GLCM, GLRLM, GLSZM, GLDM et NGTDM). Affichez le tableau pour vérifier les tables calculées comme montré à la Figure 3. Sortez un fichier csv avec toutes les fonctionnalités extraites.
    2. Répétez le processus ci-dessus pour tous les volumes DICOM téléchargés depuis le jeu de données NSCLC RADIOMICS et enregistrez-le sous forme d’un seul fichier « radiomics.csv ».

2. Développement d’un modèle de détection du cancer basé sur la radiomique utilisant des bibliothèques Python

REMARQUE : Les étapes suivantes sont résumées pour permettre à un utilisateur de développer, entraîner et tester un modèle de détection du cancer à l’aide de bibliothèques Python avec des caractéristiques radiomiques des ensembles de données CT.

  1. Formatez le jeu de données radiomique enregistré en format csv de manière à ce que chaque ligne représente un patient/échantillon, et chaque colonne représente une caractéristique. Incluez une colonne d’étiquette pour les étiquettes de classe.
  2. Ouvrez un nouveau carnet Jupyter dans l’environnement Colab et commencez à écrire du code en déclarant les définitions de fonctions et fonctions Python intégrées ci-dessous à l’étape 2.3.
  3. Donne la commande pour installer Pytorch, torchvision, scikit-learn, numpy, pandas matplotlib et imbalanced-learn sur le carnet Jupyter.
  4. Écrivez une fonction files.upload() pour prendre un fichier csv d’entrée de l’utilisateur et le stocker dans x et y variables.
  5. Normaliser les données stockées à l’aide du scaler de fonction = StandardScaler() et scaler.fit_transform().
  6. Définissons une fonction Perceptron multi-couches MLP(nn. Module()) avec des couches cachées configurables.
  7. Définissez une fonction d’entraînement def train_epoch() pour calculer la perte de rétropropagation à partir du modèle MLP avec des entrées.
  8. Pour plusieurs époques, on définit une fonction def compute_input_gradients() pour calculer les gradients moyens de la perte par rapport aux caractéristiques d’entrée et supprimer itérativement la caractéristique avec le gradient le plus faible, c’est-à-dire ayant moins d’importance, jusqu’à ce qu’il reste 15 caractéristiques.
  9. Divisez les données dans un ratio de 80 % 20 % à l’aide de la fonction train_test_split() avec 15 caractéristiques sélectionnées. Appliquez une validation croisée en 5 branches en utilisant StratifiedKFold(n_splits=5) sur les données d’entraînement pour garantir la robustesse.
  10. Créer un grand réseau de neurones MLP final_model = DNN().
  11. Évaluer les performances du modèle entraîné à l’aide de données de test avec les fonctions suivantes : def plot_confusion_matrix(), accuracy_score(), precision_score(), recall_score(), f1_score(), carte thermique().

3. Exécuter le notebook Jupyter pour construire et tester le modèle

  1. Exécutez le code Python dans un carnet Jupyter. Une invite est reçue pour télécharger le fichier csv radiomics, comme montré à la Figure 4.
  2. Téléchargez le radiomics.csv.
  3. Sauvegardez les résultats de classification et les graphiques générés.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Résumé du jeu de données
L’ensemble de données de radiomique du NSCLC comprend 422 volumes de CT de patients atteints de cancer du poumon de stade I, II et III. Alors que le nombre de jeux de données CT pour le cancer à un stade précoce (I, II) est de 134, les échantillons de données pour un cancer à un stade avancé (IIIa, IIIb) sont de 288. L’ensemble de données présentait un déséquilibre de classe significatif, avec un nombre plus élevé de cas de phase avancée (stad...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La robustesse et la fiabilité du cadre proposé sont évidentes grâce aux valeurs élevées des indicateurs d’évaluation, notamment la précision, la mémoire, la précision et le scoreF-1 24. Tous les scores ont obtenu plus de 90 % de performance sur les données du test, avec un CV à 5 fois utilisé lors de la formation MLP.

Les performances et la validité du cadre GL-RFE proposé ont été renforcées par des techniques de visu...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont pas d’intérêts financiers concurrents.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Non applicable

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Logiciel de trancheur 3DSite officiel5.xVisualisation d’images médicales, segmentation et extraction de ROI pour l’analyse radiomique
Paquet d’apprentissage déséquilibréPyPI0.11+Gestion du déséquilibre de classe (par exemple, SMOTE)
Matplotlib  ; PackagePyPI3.xTracé des courbes d’entraînement et de l’importance des caractéristiques
Paquet NumPyPyPI1.26.xOpérations numériques et gestion de la matrice de caractéristiques
Pandas PackagePyPI2.xPrétraitement des données et gestion structurée des ensembles de données
Paquet PyRadiomicsPyPI3.xExtraction des caractéristiques radiomiques à partir d’images CT
PyTorch  ; PackagePyPI2.xCadre d’apprentissage profond pour le calcul MLP et gradient
Paquet Scikit-learnPyPI1.3.xÉvaluation du modèle (précision, précision, rappel, score F1)
SciPy  ; PackagePyPI1.11+Analyse statistique et validation
Seaborn  ; PackagePyPI0.13.xCartes thermiques pour l’analyse de corrélation des caractéristiques
Torch.nn Module  ;PyPI2.xArchitecture des réseaux neuronaux (couches, activations)
Torch.optim ModulePyPI2.xAlgorithmes d’optimisation (par exemple, Adam)

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Radiomic Feature SelectionGradient LossDeep Neural NetworkLung Cancer DetectionCancer Stage DetectionRecursive Feature EliminationQuantitative Imaging BiomarkersComputed TomographyFeature ImportanceModel Generalization

Related Articles