Method Article

Auswahl radiomischer Merkmale unter Verwendung des Gradientenverlusts eines tiefen neuronalen Netzwerks zur Entdeckung von Lungenkrebsstadium

DOI:

10.3791/70181

April 30th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier wird eine auf Deep-Learning-Basis basierende Merkmalsauswahlmethode präsentiert, die Gradienten einer neuronalen Netzverlustfunktion in Bezug auf Eingabemerkmale nutzt, um diejenigen zu identifizieren und zu priorisieren, die die Erkennung des Lungenkrebsstadiums am stärksten beeinflussen.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Radiomik ermöglicht die Extraktion quantitativer Bildgebungsbiomarker aus medizinischen Bildern und ist zu einem wichtigen Werkzeug für computergestützte Krebsdiagnostik geworden. Radiomik-Datensätze sind jedoch typischerweise hochdimensional mit begrenzten Stichprobengrößen, weshalb die Auswahl von Merkmalen ein entscheidender Schritt für den Aufbau zuverlässiger prädiktiver Modelle ist. Diese Studie schlägt ein Gradient-Loss Rekursives Merkmalselimination (GL-RFE)-Framework vor, das die Analyse der Gradientensensitivität aus einem tiefen neuronalen Netzwerk integriert, um die einflussreichsten radiomischen Merkmale für die Erkennung des Lungenkrebsstadiums zu identifizieren. Insgesamt wurden 106 radiomische Merkmale aus der Thorax-Computertomographie (CT) extrahiert, wobei die PyRadiomics-Erweiterung der 3D-Slicer-Plattform verwendet wurde. Die vorgeschlagene Methode bewertet die Merkmalswichtigkeit, indem sie Gradienten des Netzwerkverlusts in Bezug auf Eingabemerkmale berechnet und rekursiv Merkmale mit minimalem Beitrag eliminiert. Die resultierenden Top 15 radiomischen Merkmale werden verwendet, um einen tiefen neuronalen Netzwerk-Klassifikator zur Unterscheidung von Lungenkrebs im Frühstadium und im fortgeschrittenen Stadium zu trainieren. Der vorgeschlagene Rahmen erzielt eine starke Klassifikationsleistung mit einer Genauigkeit von 90,22 %, einer Genauigkeit von 90,10 %, einem Abruf von 90,24 % und einem F1-Wert von 90,16 % im Testdatensatz. Visualisierungsanalysen, einschließlich Korrelations-Wärmekarten und Verteilungsdiagrammen, bestätigen zudem eine reduzierte Merkmalredundanz und eine verbesserte Klassentrennbarkeit. Im Vergleich zu herkömmlichen Merkmalsauswahltechniken erfasst GL-RFE nichtlineare Merkmalsinteraktionen effektiv und verbessert die Modellverallgemeinerung. Das vorgestellte Protokoll bietet eine reproduzierbare und interpretierbare Methodik für die radiomisch-basierte Krebsstadienerkennung. Es eignet sich besonders für hochdimensionale, kleine Stichproben biomedizinische Datensätze und hat potenzielle Anwendungen in anderen Bereichen wie Genomik und multimodaler klinischer Analyse.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Lungenkrebs bleibt eine der Hauptkrebsarten und führt zu ernsthaften Gesundheitsproblemen, die oft zum Tod führen1. Radiomik ermöglicht die quantitative Charakterisierung medizinischer Bilder, indem große Merkmale extrahiert werden, die Tumorform, Textur und Intensitätsmuster beschreiben 2,3. Diese Merkmale, auch handgefertigte Merkmale genannt, dienen als potenzielle Biomarker für Diagnose, Prognose und Behandlungsreaktion bei Lungenkrebs. Radiomikrofon-Datensätze sind jedoch typischerweise hochdimensional und stichprobenbegrenzt, was zu redundanten und rauschen Funktionen führt, die die Modellleistung 4,5,6,7 beeinträchtigen. Daher ist eine effiziente und erklärbare Merkmalsauswahl entscheidend für die Entwicklung robuster, radiomisch-basierter Prädiktionsmodelle.

Traditionelle Ansätze zur Merkmalsauswahl wie Filtermethoden (z. B. Korrelationsanalyse, Varianzanalyse [ANOVA], gegenseitige Informationen) und Wrapper-Methoden (z. B. sequentielle Merkmalsauswahl, rekursive Merkmals-Eliminierung) werden für radiomisch-basierte Krebsnachweismodelle 4,8,9 weit verbreitet verwendet. Allerdings gelingt es ihnen oft nicht, nichtlineare Merkmalswechselwirkungen und tiefe kontextuelle Abhängigkeiten zu erfassen, die in radiomischen Dateninnewohnen 9,10,11. Ensemble-Feature-Lerntechniken wurden für die medizinische Bildklassifikation erforscht, haben jedoch eine moderate Genauigkeit erreicht, die sich weiter verbessern könnte12.

Deep-Learning-Methoden, insbesondere tiefe neuronale Netze (DNNs), haben eine überlegene Fähigkeit gezeigt, nichtlineare und hierarchische Beziehungen zwischen Merkmalen und Ergebnissen zu modellieren, was sie ideal macht, um die Auswahl von Merkmalen zu steuern und genaue Krebsnachweismodellebereitzustellen 13,14. In diesem Zusammenhang wird das Potenzial eines konvolutionalen neuronalen Netzwerks, multimodaler KI-Techniken und VCG-16, eines vortrainierten Modells für die Krebsdiagnose, untersucht (1,15,16). Ein hybrides Deep-Learning-Modell17, einschließlich des vortrainierten VGG-19-Modells und Long Short-Term Memory Networks (LSTMs), wurde vorgeschlagen, trainiert und an einer großen Anzahl von Bildern getestet, wobei eine Genauigkeit von über 99 % erreicht wurde.

Neben der Krebserkennung wurde auch Forschung zur Krebsstadieneinteilung durchgeführt. Hugo et al.18 entwarfen ein Feed-forward-Modell für neuronale Netzwerke in der NSCLC-Datenbank von 300 Patienten, um Krebsstadium I, II und III mit einer Genauigkeit von 74,52 % im Modelltest zu klassifizieren. Eine radiomisch-basierte Bayessche Inversionsmethode3 wurde zur Erkennung von Lungenkrebs mit dem NLST-Datensatz auf einer Stichprobengröße von 200 vorgestellt. Die vorgeschlagene Methode erreichte eine Genauigkeit von 86 %. Die Literaturübersicht hat gezeigt, dass sich die meisten Studien zur Krebserkennung ausschließlich auf die Klassifizierung gutartiger und bösartiger Tumore konzentriert haben und nur wenige die Klassifikation des Krebsstadiums behandelt haben, mit Genauigkeiten von weniger als 90 %, die weiter verbessert werden können. Diese Forschungsarbeit behandelt die oben genannte Forschungslücke und schlägt einen robusten, auf radiomischen Merkmalen basierenden Klassifikationsrahmen für eine präzise Erkennung von Lungenkrebsstadien vor.

In dieser Studie wurde ein gradientverlustbasiertes, rekursives Merkmalseliminierungssystem (GL-RFE) eingeführt, das die Gradientenrückpropagation von neuronalen Netzen in den RFE-Prozess integriert. Im Gegensatz zu herkömmlichen RFE-Methoden, die auf statischen Merkmalswichtigkeitsmetriken basieren, nutzt GL-RFE die Gradienten der Verlustfunktion bezüglich jedes Eingabemerkmals, um zu messen, wie stark jedes Merkmal die Modellvorhersagen beeinflusst. Durch iterative Entfernung von Merkmalen mit minimalen Gradientenbeiträgen führt das präsentierte Modell die Merkmalsauswahl der 15 wichtigsten diagnostischen Merkmale durch, die für den Nachweis des Lungenkrebsstadiums in 2 Klassen optimiert sind (Stadium I und Stadium II zusammen sowie Stadium IIIa und IIIb kombiniert). Das Workflow-Diagramm der durchgeführten Arbeit ist in Abbildung 1 dargestellt. Der gewählte Lungenkrebs-Datensatz für das vorgestellte Modell ist NSCLC Radiomics19 mit 411 Bänden des Formats, das als Digital Imaging and Communications in Medicine (DICOM) bezeichnet wird, mit klinischen Krebsstadien-Informationen. Insgesamt werden 106 3D-Radiomikrofonfunktionen jedes Lungenkrebs-DICOM-Volumens mit PyRadiomics20, einer Erweiterung der Open-Source-Software, 3D Slicer21, extrahiert. Diese Merkmale gehören zu sieben Merkmalsklassen22, darunter Form-, Graustufendifferenzmethode (GLDM), Graustufen-Ko-Auftretensmatrix (GLCM), Erstordnungsmatrix, Graustufen-Laufzeitlängenmatrix (GLRLM), Graustufen-Größenzonenmatrix (GLSZM) und Nachbarschafts-Grautondifferenzmatrix (NGTDM). Die radiomischen Daten der Minderheitenklasse (Stadium I und Stadium II) wurden mit der synthetischen Minderheiten-Übersampling-Technik (SMOTE)23 überbetastet.

Die Neuheit des vorgeschlagenen GL-RFE-Frameworks liegt in der Integration der gradientenbasierten Sensitivitätsanalyse, die aus dem Training neuronaler Netzwerke abgeleitet ist, in den Prozess der rekursiven Feature-Elimination. Im Gegensatz zu herkömmlichen RFE-Ansätzen, die auf statischen Wichtigkeitsmaßen basieren, bewertet GL-RFE die Merkmalsrelevanz dynamisch durch rückpropagierte Gradienten der Verlustfunktion. Dies ermöglicht die Identifikation von Merkmalen, die die Modellvorhersagen für die Krebsphase direkt beeinflussen, während die Interpretierbarkeit und rechnerische Machbarkeit für relativ kleine medizinische Datensätze erhalten bleiben.

Der für die Ausbildung und Erprobung des vorgeschlagene Rahmens verwendete Datensatz ist ein öffentlich zugänglicher CT-Bilddatensatz von 422 Lungenkrebspatienten, bekannt als NSCLC Radiomics17. Für jeden Patienten enthält der Datensatz ein CT-Volumen, ein DICOM-Strahlentherapie-Strukturset (RTSTRUCT) und eine DICOM-Segmentierungsdatei (SEG). Diese Akten enthalten manuelle Abgrenzungen, die von einem Strahlenonkologen des dreidimensionalen Volumens des primären Bruttotumorvolumens (GTV-1) sowie des Lungenbildes durchgeführt wurden. Der Datensatz ist ein vorverarbeiteter Satz und die Abmessungen der Bilder betragen 512 x 512 Pixel.

Aufgrund der nichtlinearen Natur handgefertigter radiomischer Funktionen können diese Funktionen nicht direkt mit Deep-Learning-Modellen für die Krebsdiagnose verwendet werden, und ihre inhärenten Datenmuster müssen mit KI-Techniken erfasst werden. GL-RFE ordnet Merkmale anhand des Betrags des Gradienten des Modellverlusts L bezüglich jeder Eingabefunktion xi ein.

Für jedes Eingabemerkmal xi wird der durchschnittliche absolute Gradient wie folgt berechnet:

figure-introduction-1(1)

Hier ist N die Gesamtzahl der Stichproben. Lj ist der Verlust für j-te Stichprobe. xij ist das i-te Merkmal der j-ten Probe. figure-introduction-2 stellt die Empfindlichkeit des Verlusts bezüglich des Eingangsmerkmals dar.

Die Merkmale mit niedrigen Gradientenmagnituden haben minimale Auswirkungen auf Modellupdates und werden rekursiv eliminiert. Der vorgeschlagene Arbeitsablauf zur Eliminierung der radiomischen Merkmale mit niedrigem Gradienten mittels eines mehrschichtigen Perzeptrons (MLP) und zum Training eines Deep-Learning-Neuralnetzwerks (DNN) auf den Top 15 Merkmalen ist in Abbildung 1 dargestellt. Die Leistung der GL-RFE-Methode zur Merkmalsauswahl wird anschließend bewertet.

Das bereits erwähnte Deep-Learning-Modell mit der GL–RFE-Methode wird in einem Jupyter-Notebook auf Google Colab implementiert, das das Schreiben und Ausführen von Python-Code in einer Online-Umgebung ermöglicht. Verschiedene Pakete, die in den Protokollschritten enthalten sind, und die Materialien müssen heruntergeladen werden, um den Code zu kompilieren. Mit der im Abschnitt Protokoll beschriebenen Methode werden die 15 wichtigsten radiomischen Merkmale zur Erkennung von Lungenkrebs identifiziert und verwendet, um eine genaue Krebserkennung in Testdatensätzen zu erreichen.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Extraktion von radiomischen Funktionen mit der 3D Slicer PyRadiomics-Erweiterung

HINWEIS: Die folgenden Schritte dienen dazu, radiomische Merkmale einer Lungen-CT-DICOM-Datei mit der 3D-Slicer-PyRadiomics-Erweiterung zu berechnen und in einer Datei im Komma-getrennten Wert (CSV)-Format zu speichern.

  1. Installiere und öffne den 3D-Slicer (verwende die neueste stabile Version von https://download.slicer.org/).
  2. Installiere die PyRadiomics-Erweiterung und den RT-Slicer.
    1. In der Menüleiste gehen Sie zum Anzeigen > Erweiterungs-Manager. Dann suche nach Radiomics oder SlicerRadiomics und RT Slicer.
    2. Klicken Sie auf Installieren, um die RT Slicer- und PyRadiomics-Bibliotheken zu installieren. Starte den 3D-Slicer nach der Installation neu.
  3. Laden Sie NSCLC RADIOMICS herunter.
    1. Laden Sie die CT-Lungen-DICOM-Datensätze zusammen mit SEG- und RTSTRUCT-Dateien von 422 Patienten von https://www.cancerimagingarchive.net/collection/nsclc-radiomics/
  4. Lade Lungen-CT, DICOM-Daten.
    1. Geh zum DICOM-Modul. Klicken Sie auf Import und wählen Sie den Ordner aus, der DICOM CT-Slices und deren SEG-Datei in RTSTRUCT-Modalität enthält.
    2. Nach dem Import doppelklicke ich auf den Patienten/die Studie/Serie, um ihn in die Slicer-Szene zu laden. Das 3D-CT-Volumen sollte im Viewer-Panel sichtbar sein, wie in Abbildung 2 gezeigt.
  5. Überprüfe die Ausrichtung der Geometrie.
    1. Im Datenmodul erweitern Sie sowohl das CT-Volumen als auch die Segmentierung. Stellen Sie sicher, dass die Segmentierung genau über dem CT sitzt (keine Fehlausrichtung).
  6. Öffnen Sie das Radiomics-Modul .
    1. Wählen Sie das Radiomics-Modul im Modulbereich aus (oder suchen Sie es in der Suchleiste des Moduls). Wählen Sie im Eingabebildvolumen das gewünschte CT-Volumen aus.
    2. In Eingabelabel/Segmentierung wählen Sie den Segmentierungsknoten (den ROI) aus.
  7. Anpassungsparameter für die Extraktion anpassen.
    1. Setze Resampled Pixel Spacing = [1,1,1] (sorgt für isotrope Voxels) und Bin Breite = 25 (Standard für CT). Setze die LoG-Kernelgröße = 2,0, 3,0, 4,0, 5,0.
  8. Führe die Feature-Extraktion aus.
    1. Klicken Sie auf Anwenden. Software berechnet nun 3D-First-Order-, Form- und Texturmerkmale (GLCM, GLRLM, GLSZM, GLDM und NGTDM). Zeigen Sie die Tabelle an, um die berechneten Tabellen wie in Abbildung 3 zu überprüfen. Geben Sie eine CSV-Datei mit allen extrahierten Funktionen aus.
    2. Wiederholen Sie den oben genannten Vorgang für alle DICOM-Volumes, die aus dem NSCLC RADIOMICS-Datensatz heruntergeladen wurden, und speichern Sie sie als eine einzelne Datei "radiomics.csv".

2. Entwicklung eines radiomisch-basierten Krebsnachweismodells unter Verwendung von Python-Bibliotheken

HINWEIS: Die folgenden Schritte werden für einen Benutzer zusammengefasst, um ein Krebserkennungsmodell mit Python-Bibliotheken und radiomischen Eigenschaften von CT-Datensätzen zu entwickeln, zu trainieren und zu testen.

  1. Formatieren Sie den gespeicherten Radiomics-Datensatz im CSV-Format so, dass jede Zeile einen Patienten/Probe repräsentiert und jede Spalte ein Merkmal. Fügen Sie eine Label-Spalte für Klassenlabels hinzu.
  2. Öffnen Sie ein neues Jupyter-Notebook in der Colab-Umgebung und beginnen Sie mit dem Schreiben von Code, indem Sie die unten angegebenen Funktionsdefinitionen und integrierten Python-Funktionen in Schritt 2.3 deklarieren.
  3. Gib den Befehl, Pytorch, torchvision, scikit-learn, numpy, pandas matplotlib und imbalanced-learn auf das Jupyter-Notizbuch zu installieren.
  4. Schreibe eine Funktion files.upload(), um eine Eingabe-CSV-Datei vom Benutzer zu nehmen und sie in x- und y-Variablen zu speichern.
  5. Normalisieren Sie die gespeicherten Daten mit dem Funktionsskalierer = StandardScaler() und scaler.fit_transform().
  6. Definiere eine Multi-Layer-Perzeptronfunktion MLP(nn. Modul()) mit konfigurierbaren versteckten Schichten.
  7. Definiere eine Trainingsfunktion def train_epoch(), um den Rückverbreitungsverlust aus dem MLP-Modell mit Eingaben zu berechnen.
  8. Für mehrere Epochen definiert man eine Funktion def compute_input_gradients(), um mittlere Gradienten des Verlusts bezüglich der Eingabemerkmale zu berechnen, und lässt iterativ das Merkmal mit dem niedrigsten Gradienten, d. h. mit geringerer Bedeutung, weg, bis 15 Merkmale übrig sind.
  9. Teilen Sie die Daten im Verhältnis 80 % zu 20 % mit der train_test_split()- Funktion mit ausgewählten 15 Merkmalen auf. Wenden Sie eine fünffache Kreuzvalidierung mit StratifiedKFold(n_splits=5) auf den Trainingsdaten an, um die Robustheit sicherzustellen.
  10. Erstelle ein großes MLP-neuronales Netzwerk final_model = DNN().
  11. Bewerten Sie die Leistung des trainierten Modells anhand von Testdaten mit folgenden Funktionen: def plot_confusion_matrix(), accuracy_score(), precision_score(), recall_score(), f1_score(), Heatmap().

3. Das Jupyter-Notebook ausführen, um ein Modell zu erstellen und zu testen

  1. Führe den Python-Code in einem Jupyter-Notizbuch aus. Es wird eine Aufforderung empfangen, die Radiomics-CSV-Datei hochzuladen, wie in Abbildung 4 gezeigt.
  2. Lade die radiomics.csv hoch.
  3. Speichere die Klassifikationsergebnisse und generierten Graphen.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Datensatzübersicht
Der NSCLC Radiomics-Datensatz umfasst 422 CT-Bände von Patienten mit Lungenkrebs im Stadium I, II und III. Während die Anzahl der CT-Datensätze mit Krebs im Frühstadium (I, II) 134 beträgt, liegen die Datenstichproben bei fortgeschrittenem Krebs (IIIa, IIIb) bei 288. Der Datensatz zeigte ein signifikantes Klassenungleichgewicht, mit einer höheren Anzahl fortgeschrittener Fälle (Stadium III) im Vergleich zu frühen Phasen (Stadium I und Stadium II). U...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Robustheit und Zuverlässigkeit des vorgeschlagenen Rahmens zeigen sich an den hohen Werten der Bewertungskennzahlen, darunter Genauigkeit, Rückruf, Präzision und F-1-Score24. Alle Ergebnisse erzielten auf den Testdaten eine Leistung von über 90 %, wobei während der MLP-Ausbildung ein fünffacher Lebenslauf verwendet wurde.

Die Leistung und Validität des vorgeschlagenen GL-RFE-Frameworks wurden durch Visualisierungs...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären, dass sie keine konkurrierenden finanziellen Interessen haben.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nicht anwendbar

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D-Slicer-SoftwareOffizielle Website5.xMedizinische Bildvisualisierung, Segmentierung und ROI-Extraktion für die Analyse von Radiomik
Imbalanced-Learn-PaketPyPI0.11+Umgang mit Klassenungleichgewicht (z. B. SMOTE)
Matplotlib  PaketPyPI3.xDarstellung von Trainingskurven und Merkmalsbedeutung
NumPy-PaketPyPI1.26.xNumerische Operationen und Handhabung von Merkmalsmatrixen
Pandas-PaketPyPI2.xDatenvorverarbeitung und Verwaltung strukturierter Datensätze
PyRadiomics-PaketPyPI3.xExtraktion radiomischer Merkmale aus CT-Bildern
PyTorch  PaketPyPI2.xDeep-Learning-Framework für MLP und Gradientenberechnung
Scikit-learn-PaketPyPI1.3.xModellbewertung (Genauigkeit, Präzision, Abruf, F1-Score)
SciPy  PaketPyPI1.11+Statistische Analyse und Validierung
Seaborn  PaketPyPI0.13.xHeatmaps für die Analyse der Merkmalskorrelation
Torch.nn Modul PyPI2.xNeuronale Netzwerkarchitektur (Schichten, Aktivierungen)
Torch.optimis-ModulPyPI2.xOptimierungsalgorithmen (z. B. Adam)

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Radiomic Feature SelectionGradient LossDeep Neural NetworkLung Cancer DetectionCancer Stage DetectionRecursive Feature EliminationQuantitative Imaging BiomarkersComputed TomographyFeature ImportanceModel Generalization

Related Articles