Method Article

Radiomische featureselectie met behulp van gradiëntverlies van diep neurale netwerk voor het opsporen van longkankerstadium

DOI:

10.3791/70181

April 30th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier wordt een op deep learning gebaseerde feature-selectiemethode gepresenteerd die gebruikmaakt van gradiënten van een neuraal netwerkverliesfunctie ten opzichte van inputfeatures om die functies te identificeren en te prioriteren die het meest invloed hebben op de detectie van longkankerfase.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Radiomics maakt het mogelijk om kwantitatieve beeldvormende biomarkers uit medische beelden te extraheren en is een belangrijk hulpmiddel geworden voor computerondersteunde kankerdiagnose. Radiomics-datasets zijn echter doorgaans hoogdimensionaal met beperkte steekproefgroottes, waardoor het selecteren van kenmerken een cruciale stap is voor het bouwen van betrouwbare voorspellende modellen. Deze studie stelt een gradient-loss recursive feature elimination (GL-RFE) raamwerk voor dat gradiëntgevoeligheidsanalyse integreert vanuit een diep neuraal netwerk om de meest invloedrijke radiomische kenmerken voor de detectie van longkankerstadium te identificeren. In totaal werden 106 radiomische kenmerken extraherd uit borstkas computertomografie (CT)-scans met behulp van de PyRadiomics-uitbreiding van het 3D Slicer-platform. De voorgestelde methode evalueert het belang van kenmerken door gradiënten van het netwerkverlies ten opzichte van invoerkenmerken te berekenen en elimineert recursief kenmerken met minimale bijdrage. De resulterende top 15 radiomische kenmerken worden gebruikt om een classifier voor diep neuraal netwerk te trainen voor het onderscheiden van vroege en gevorderde longkanker. Het voorgestelde kader behaalt sterke classificatieprestaties, met een nauwkeurigheid van 90,22%, precisie van 90,10%, herinnering van 90,24% en een F1-score van 90,16% op de testdataset. Visualisatie-analyses, waaronder correlatie-warmtekaarten en distributiegrafieken, bevestigen verder verminderde feature-redundantie en verbeterde klassenscheiding. In vergelijking met conventionele featureselectietechnieken vangt GL-RFE effectief niet-lineaire feature-interacties vast en verbetert het de generalisatie van het model. Het gepresenteerde protocol biedt een reproduceerbare en interpreteerbare methodologie voor radiomic-gebaseerde kankerstadiumdetectie. Het is bijzonder geschikt voor hoogdimensionale, kleine steekproef biomedische datasets en heeft potentiële toepassingen in andere domeinen, zoals genomica en multimodale klinische analyse.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Longkanker blijft een van de belangrijkste soorten kanker, wat leidt tot ernstige gezondheidsproblemen en vaak tot de doodleidt 1. Radiomic maakt kwantitatieve karakterisering van medische beelden mogelijk door grote sets kenmerken te extraheren die tumorvorm, textuur en intensiteitspatronen beschrijven 2,3. Deze kenmerken, ook wel handgemaakte kenmerken genoemd, dienen als potentiële biomarkers voor diagnose, prognose en behandelingsrespons van longkanker. Radiomic datasets zijn echter doorgaans hoogdimensionaal en sample-gelimiteerd, wat leidt tot redundante en ruisachtige kenmerken die de modelprestatiesverslechteren 4,5,6,7. Daarom is efficiënte en verklaarbare feature-selectie cruciaal voor het ontwikkelen van robuuste, op radiomics gebaseerde voorspellende modellen.

Traditionele feature-selectiebenaderingen zoals filtermethoden (bijv. correlatieanalyse, variantieanalyse [ANOVA], wederzijdse informatie) en wrapper-methoden (bijv. Sequential Feature Selection, Recursive Feature Elimination) worden veel gebruikt voor radiomic-gebaseerde kankerdetectiemodellen 4,8,9. Ze slagen er echter vaak niet in niet-lineaire kenmerkinteracties en diepe contextuele afhankelijkheden die inherent zijn aan radiomicsgegevens 9,10,11. Ensemble-feature-leertechnieken zijn onderzocht voor medische beeldclassificatie, maar hebben matige nauwkeurigheid bereikt, die verder verbeterd kanworden 12.

Deep learning-methoden, met name diepe neurale netwerken (DNN's), hebben aangetoond een superieure capaciteit om niet-lineaire en hiërarchische relaties tussen kenmerken en uitkomsten te modelleren, waardoor ze ideaal zijn voor het sturen van featureselectie en het leveren van nauwkeurige kankerdetectiemodellen13,14. In deze context wordt het potentieel van het gebruik van een convolutioneel neuraal netwerk, multimodale AI-technieken en VCG-16, een vooraf getraind model voor kankerdiagnose, onderzocht 1,15,16. Een hybride deep learning-model17, inclusief het vooraf getrainde VGG-19-model en long short-term memory networks (LSTM's), werd voorgesteld, getraind en getest op een groot aantal beelden, met een nauwkeurigheid van meer dan 99%.

Naast kankerdetectie is er ook onderzoek gedaan naar kankerstadiering. Hugo et al.18 ontwierpen een feed-forward neuraal netwerkmodel op de NSCLC-database van 300 patiënten om kanker stadium I, II en III te classificeren met een nauwkeurigheid van 74,52% in modeltesten. Een op radiomiciek gebaseerde Bayesiaanse inversiemethode3 werd gepresenteerd voor longkankerstadium detectie met behulp van de NLST-dataset op een steekproefgrootte van 200. De voorgestelde methode behaalde een nauwkeurigheid van 86%. De literatuurstudie heeft aangetoond dat de meeste studies naar kankerdetectie zich uitsluitend richten op het classificeren van goedaardige en kwaadaardige tumoren, en slechts enkele hebben zich gericht op de classificatie van kankerstadia, met nauwkeurigheden van minder dan 90% die verder verbeterd kunnen worden. Dit onderzoeksartikel behandelt de eerder genoemde onderzoekskloof en stelt een robuust, op radiomische kenmerken gebaseerde classificatiekader voor nauwkeurige detectie van longkankerstadia.

In deze studie is een gradient-loss-based recursive feature elimination (GL-RFE) framework geïntroduceerd, waarbij gradiënt-backpropagatie van neurale netwerken wordt geïntegreerd in het RFE-proces. In tegenstelling tot conventionele RFE-methoden die vertrouwen op statische feature-importance metrics, maakt GL-RFE gebruik van de gradiënten van de verliesfunctie ten opzichte van elke invoerfunctie om te meten hoe sterk elke eigenschap de modelvoorspellingen beïnvloedt. Door iteratief kenmerken met minimale gradiëntbijdragen te verwijderen, voert het gepresenteerde model featureselectie uit van de top 15 diagnostische kenmerken die geoptimaliseerd zijn voor de detectie van longkanker in 2 klassen (stadium I en stadium II gecombineerd en stadium IIIa en IIIb gecombineerd). Het workflowdiagram van het uitgevoerde werk is weergegeven in Figuur 1. De gekozen longkankerdataset voor het gepresenteerde model is NSCLC Radiomics19, met 411 volumes format aangeduid als digitale beeldvorming en communicatie in geneeskunde (DICOM) met klinische kankerstadia-informatie. In totaal worden 106 3D-radiomics-functies van elk longkanker-DICOM-volume geëxtraheerd met behulp van PyRadiomics20, een uitbreiding van een open source-software, 3D Slicer21. Deze kenmerken behoren tot zeven featureklassen22, waaronder shape, gray level difference method (GLDM), gray-level co-appearance matrix (GLCM), first order, gray level run length matrix (GLRLM), gray level size zone-matrix (GLSZM) en neighborhood gray-tone difference matrix (NGTDM). De radiomic data van de minderheidsklasse (stadium I en stadium II) werden oversampled met behulp van de synthetische minderheids-overbemonsteringstechniek (SMOTE)23.

De nieuwigheid van het voorgestelde GL-RFE-framework ligt in het integreren van gradiëntgebaseerde gevoeligheidsanalyse, afgeleid van neurale netwerktraining, in het recursieve proces van het elimineren van kenmerken. In tegenstelling tot conventionele RFE-benaderingen die vertrouwen op statische belangrijkheidsmaten, evalueert GL-RFE dynamisch de relevantie van kenmerken via terugverbrede gradiënten van de verliesfunctie. Dit maakt het mogelijk om kenmerken te identificeren die direct de modelvoorspellingen voor het kankerstadium beïnvloeden, terwijl interpreteerbaarheid en computationele haalbaarheid behouden blijven voor relatief kleine medische datasets.

De dataset die wordt gebruikt voor de training en het testen van het voorgestelde raamwerk is een openbaar beschikbare CT-beeldenset van 422 longkankerpatiënten, bekend als NSCLC Radiomics17. Voor elke patiënt bevat de dataset een CT-volume en een DICOM-radiotherapiestructuurset (RTSTRUCT) en een DICOM-segmentatiebestand (SEG). Deze bestanden bevatten handmatige afbakeningen die door een radiotherapeut zijn uitgevoerd van het driedimensionale volume van het primaire bruto tumorvolume (GTV-1), evenals het longbeeld. De dataset is een vooraf bewerkte set en de afmetingen van de afbeeldingen zijn 512 x 512 pixels.

Vanwege het niet-lineaire karakter van handgemaakte radiomische functies kunnen deze functies niet direct worden gebruikt met deep learning-modellen voor kankerdiagnose, en moeten hun inherente datapatronen worden vastgelegd met AI-technieken. GL-RFE rangschikt kenmerken op basis van de grootte van de gradiënt van het modelverlies L ten opzichte van elk invoerkenmerk xi.

Voor elke invoerkenmerk xi wordt de gemiddelde absolute gradiënt als volgt berekend:

figure-introduction-1(1)

Hier is N het totale aantal monsters. Lj is het verlies voor jde steekproef. xij is het i-de kenmerk van het j-de monster. figure-introduction-2 geeft de gevoeligheid van het verlies aan ten opzichte van de invoerkenmerk.

De kenmerken met lage gradiëntmagnitudes hebben minimale invloed op modelupdates en worden recursief geëlimineerd. De voorgestelde workflow voor het elimineren van de low gradient radiomic features met behulp van een multi-layer perceptron (MLP) en het trainen van een deep learning neural network (DNN) op de top 15 features is weergegeven in Figuur 1. De prestaties van de GL-RFE-methode voor featureselectie worden vervolgens geëvalueerd.

Het eerder genoemde deep learning-model met de GL–RFE-methode is geïmplementeerd in een Jupyter-notebook op Google Colab, waarmee Python-code in een online omgeving geschreven en uitgevoerd kan worden. Verschillende pakketten, opgenomen in de protocolstappen en de materialen, moeten worden gedownload om de code te compileren. Met de methode beschreven in het Protocolgedeelte worden de top 15 radiomische kenmerken voor longkankerdetectie geïdentificeerd en gebruikt om nauwkeurige kankerdetectie op testdatasets te bereiken.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Extractie van radiomic-functies met behulp van de 3D Slicer PyRadiomics-extensie

OPMERKING: De volgende stappen zijn ontworpen om radiomische kenmerken van een long CT DICOM-bestand te berekenen met behulp van de 3D Slicer PyRadiomics-extensie en om op te slaan in een bestand van het coma separated value (csv)-formaat.

  1. Installeer en open 3D Slicer (gebruik de nieuwste stabiele release van https://download.slicer.org/.
  2. Installeer de PyRadiomics-extensie en RT-slicer.
    1. Ga in de menubalk naar Weergave > Extensie Manager. Zoek vervolgens op Radiomics of SlicerRadiomics en RT Slicer.
    2. Klik op Installeren om de RT Slicer- en PyRadiomics-bibliotheken te installeren. Reset 3D Slicer na installatie.
  3. Download NSCLC RADIOMICS.
    1. Download de CT-long-DICOM-datasets samen met SEG- en RTSTRUCT-bestanden van 422 patiënten uit https://www.cancerimagingarchive.net/collection/nsclc-radiomics/
  4. Laad long CT DICOM-gegevens.
    1. Ga naar de DICOM-module. Klik op Importeren en selecteer de map met DICOM CT-slices en hun SEG-bestand in RTSTRUCT-modaliteit.
    2. Na import dubbelklik je op de patiënt/studie/serie om deze in de Slicer-scène te laden. Het 3D CT-volume zou zichtbaar moeten zijn in het kijkerpaneel zoals weergegeven in Figuur 2.
  5. Controleer de geometrie-uitlijning.
    1. In de Data-module breid je zowel het CT-volume als de segmentatie uit. Zorg ervoor dat de segmentatie precies boven de CT zit (geen misalignment).
  6. Open de Radiomics-module .
    1. Selecteer de Radiomics-module in het modulegedeelte (of zoek ernaar in de module-zoekbalk). Selecteer in het Input Image Volume het gewenste CT-volume.
    2. Selecteer in Input Label/Segmentation de segmentatienode (de ROI).
  7. Pas de parameters voor aanpassing van extracties aan.
    1. Stel de afstand tussen geresamplede pixels in = [1,1,1] (zorgt voor isotrope voxels) en binbreedte = 25 (standaard voor CT). Stel de grootte van de LoG-kernel in = 2,0, 3,0, 4,0, 5,0.
  8. Voer feature extraction uit.
    1. Klik op Aanvullen. Software zal nu 3D-eerste-orde, vorm- en textuurkenmerken berekenen (GLCM, GLRLM, GLSZM, GLDM en NGTDM). Toon de tabel om de berekende tabellen te verifiëren zoals weergegeven in Figuur 3. Voer een csv-bestand uit met alle uitgepakte functies.
    2. Herhaal het bovenstaande proces voor alle DICOM-volumes die zijn gedownload uit de NSCLC RADIOMICS-dataset en sla het op als één enkel bestand "radiomics.csv".

2. Het ontwikkelen van een op radiomics gebaseerd kankerdetectiemodel met behulp van Python-bibliotheken

OPMERKING: De volgende stappen worden samengevat voor een gebruiker om een kankerdetectiemodel te ontwikkelen, trainen en testen met behulp van Python Libraries en radiomische functies van CT-datasets.

  1. Formatteren de radiomics-dataset die in csv-formaat is opgeslagen zodanig dat elke rij één patiënt/monster vertegenwoordigt, en elke kolom een kenmerk. Voeg één labelkolom toe voor klasselabels.
  2. Open een nieuw Jupyter-notebook in de Colab-omgeving en begin met het schrijven van code door de onderstaande functiedefinities en ingebouwde Python-functies in stap 2.3 te declareren.
  3. Geef het commando om Pytorch, torchvision, scikit-learn, numpy, pandas matplotlib en imbalanced-learn bovenop het Jupyter-notebook te installeren.
  4. Schrijf een functie files.upload() om een invoer-csv-bestand van de gebruiker te nemen en op te slaan in x- en y-variabelen.
  5. Normaliseer de opgeslagen gegevens met de functieschaal = StandardScaler() en scaler.fit_transform().
  6. Definieer een Multi-Layer Perceptronfunctie MLP(nn. Module()) met configureerbare verborgen lagen.
  7. Definieer een trainingsfunctie def train_epoch() om het terugpropagatieverlies van het MLP-model met input te berekenen.
  8. Definieer voor een aantal epochs een functie def compute_input_gradients() om de gemiddelde gradiënten van het verlies ten opzichte van inputfeatures te berekenen en laat iteratief het kenmerk met de laagste gradiënt vallen, dat wil zeggen minder belangrijk, totdat er nog 15 features over zijn.
  9. Splits de gegevens in de verhouding 80% 20% met behulp van train_test_split() -functie en geselecteerde 15 kenmerken. Pas een 5-voudige kruisvalidatie toe met StratifiedKFold(n_splits=5) op de trainingsdata om robuustheid te waarborgen.
  10. Maak een groot MLP-neuraal netwerk final_model = DNN().
  11. Evalueer de prestaties van het getrainde model met behulp van testgegevens met de volgende functies: def plot_confusion_matrix(), accuracy_score(), precision_score(), recall_score(), f1_score(), heatmap().

3. Het draaien van het Jupyter-notebook om een model te bouwen en te testen

  1. Voer de Python-code uit in een Jupyter-notebook. Er wordt een prompt ontvangen om het radiomics csv-bestand te uploaden, zoals weergegeven in Figuur 4.
  2. Upload de radiomics.csv.
  3. Sla de classificatieresultaten en gegenereerde grafieken op.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Datasetoverzicht
De NSCLC Radiomics-dataset omvat 422 CT-volumes van longkankerpatiënten in stadium I, II en III. Hoewel het aantal CT-datasets met vroege kanker (I, II) 134 bedraagt, zijn de datasteekproeven met gevorderd stadium kanker (IIIa, IIIb) 288. De dataset vertoonde een significante klasse-onevenwichtigheid, met een hoger aantal gevorderde (stadium III) gevallen vergeleken met vroege fase (stadium I en stadium II). Om deze onbalans aan te pakken, werd oversa...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De robuustheid en betrouwbaarheid van het voorgestelde kader blijkt uit de hoge waarden van evaluatiemetrics, waaronder nauwkeurigheid, herinnering, precisie en F-1 score24. Alle scores behaalden meer dan 90% prestaties op de testgegevens met een vijfvoudig cv dat werd gebruikt tijdens de MLP-training.

De prestaties en geldigheid van het voorgestelde GL-RFE-framework werden verder ondersteund door visualisatietechniek...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen concurrerende financiële belangen hebben.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niet van toepassing

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D Slicer SoftwareOfficiële Website5.xVisualisatie van medische beelden, segmentatie en extractie van ROI voor radiomics-analyse
Imbalanced-learn PakketPyPI0.11+Omgaan met klassenonbalans (bijv. SMOTE)
Matplotlib  PakketPyPI3.xPlotten van trainingscurves en belangrijkheid van kenmerken
NumPy PakketPyPI1.26.xNumerieke bewerkingen en beheer van kenmerkmatrix
Pandas PakketPyPI2.xVoorbereiding van gegevens en beheer van gestructureerde datasets
PyRadiomics PakketPyPI3.xExtractie van radiomics-kenmerken uit CT-beelden
PyTorch  PakketPyPI2.xDeep learning-framework voor MLP en gradiëntberekeningen
Scikit-learn PakketPyPI1.3.xModelevaluatie (nauwkeurigheid, precisie, recall, F1-score)
SciPy  PakketPyPI1.11+Statistische analyse en validatie
Seaborn  PakketPyPI0.13.xHeatmaps voor analyse van kenmerkcorrelatie
Torch.nn Module PyPI2.xNeurale netwerkarchitectuur (lagen, activeringen)
Torch.optim ModulePyPI2.xOptimalisatiealgoritmen (bijv. Adam)

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Radiomic Feature SelectionGradient LossDeep Neural NetworkLung Cancer DetectionCancer Stage DetectionRecursive Feature EliminationQuantitative Imaging BiomarkersComputed TomographyFeature ImportanceModel Generalization

Related Articles