Forschungsartikel

Die integrierte bioinformatische Analyse menschlicher transkriptomischer Daten identifiziert drei zentrale diagnostische und prognostische Biomarker im Lungenadenokarzinom

DOI:

10.3791/71214

30. Juni 2026

* These authors contributed equally

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie identifizierte diagnostische und prognostische Biomarker für Lungenadenokarzinom anhand von TCGA-LUAD- und GEO-GSE115002 Transkriptomdaten. B3GNT3, FERMT1 und SPP1 wurden hochreguliert und unterschieden Tumore von normalem Gewebe. Diese Gene sind mit dem epithelial-mesenchymalen Übergang und der Immunsuppression verbunden. Ein Nomogramm, das Genexpression mit der TNM-Stufe kombiniert, zeigte einen zuverlässigen Prädiktionswert.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das Lungenadenokarzinom (LUAD) ist weltweit die Hauptursache für krebsbedingte Todesfälle. Trotz Fortschritten in der Chirurgie, gezielten Therapie und Immuntherapie bleibt die 5-Jahres-Überlebensrate von fortgeschrittenem LUAD unter 20 %, was auf einen dringenden Bedarf an zuverlässigen molekularen Biomarkern für frühzeitige Erkennung und Prognose hinweist. In dieser Studie stellten die Autoren die Hypothese auf, dass drei konsequent hochregulierte Gene als wirksame diagnostische und prognostische Biomarker für LUAD wirken könnten. Die Autoren analysierten transkriptomische Daten von zwei unabhängigen Kohorten, TCGA-LUAD (535 Tumore, 59 normale Proben) und GSE115002 (52 Tumore, 52 übereinstimmende normale Proben), um differenziell exprimierte Gene zu screenen. Drei Kerngene – B3GNT3, FERMT1 und SPP1 – wurden in beiden Datensätzen in LUAD-Tumoren konstant überexprimiert. Diese Gene zeigten eine ausgezeichnete diagnostische Leistung, mit AUC-Werten über 0,95 bei TCGA-LUAD und hoher Genauigkeit in GSE115002. Die Überlebensanalyse zeigte, dass eine hohe Expression jedes Gens signifikant mit einem kürzeren Gesamt- und krankheitsfreien Überleben assoziiert war, und die multivariate Cox-Regression bestätigte ihren unabhängigen prognostischen Wert. Die Analyse der funktionellen Anreicherung zeigte, dass diese drei Gene am epithelial-mesenchymalen Übergang, der Remodellierung der extrazellulären Matrix und der Immunsuppression beteiligt sind, die alle eng mit der Invasion und Metastasierung von LUAD verbunden sind. Die Autoren entwickelten zudem ein prognostisches Nomogramm, das die drei Gene und die TNM-Stufe kombiniert, erreichte einen Konkordanzindex von 0,743 und zeigte eine gute prädiktive Leistung. Diese Ergebnisse bestätigen, dass B3GNT3, FERMT1 und SPP1 vielversprechende diagnostische und prognostische Biomarker für LUAD sind, was die klinische Anwendung in der Risikostratifizierung und -steuerung unterstützt.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Lungenkrebs ist die Hauptursache für die weltweite Krebssterblichkeit und verursachte im Jahr 2020 etwa 1,8 Millionen Todesfälle. Lungenadenokarzinom (LUAD) macht fast 40 % aller Lungenkrebsfälleaus 2. Trotz Fortschritten in der Chirurgie, gezielten Therapie und Immuntherapie bleibt die 5-Jahres-Überlebensrate für fortgeschrittenes LUAD unter 20 %. Zuverlässige molekulare Biomarker für die Früherkennung und präzise Prognose werden dringend benötigt. Hochdurchsatzsequenzierung und öffentliche Datenbanken wie The Cancer Genome Atlas (TCGA) und Gene Expression Omnibus (GEO) ermöglichen systematische transkriptomische Profilierung von Krebserkrankungen 5,6. Integrative kohortenübergreifende Bioinformatik verbessert die Zuverlässigkeit der Entdeckung von Kandidaten-Biomarkern5.

Viele Gene und Signalwege sind mit LUAD in Verbindung gebracht, darunter Zellproliferation, EGFR-Signalübertragung und Immunentkommen7. Allerdings wurden nur wenige in die klinische Anwendung übertragen. Risikomodelle, die Gensignaturen und klinisch-pathologische Merkmale – insbesondere Nomogramme – kombinieren, verbessern die prognostische Genauigkeit bei LUAD8. Obwohl B3GNT3, FERMT1 und SPP1 einzeln mit dem Krebsfortschreiten in Verbindung gebracht wurden, wurde ihr kombinierter diagnostischer, prognostischer und immun-mikroumweltregulatorischer Wert in LUAD nicht systematisch über unabhängige Kohorten hinweg validiert. Diese Studie bietet die erste integrierte plattformübergreifende Analyse dieser drei Gene als einheitliches Biomarkerpanel für LUAD, mit einem klinisch anwendbaren prognostischen Nomogramm.

B3GNT3 kodiert eine Glykosyltransferase, die PD-L1 stabilisiert und die Immunausweichung 9,10 fördert. FERMT1 (Kindlin-1) reguliert die Integrinaktivierung und treibt Metastasen bei nicht-kleinzelligem Lungenkrebs (NSCLC) voran. SPP1 (Osteopontin) vermittelt die Remodellierung der extrazellulären Matrix, den epithelial-mesenchymalen Übergang (EMT) und Chemoresistenz 13,14,15. Auch zirkadiane Uhren-bezogene Gene haben gezeigt, dass sie die Prognose und Diagnose von LUADvorhersagen 16, während Geschlechtsunterschiede in LUAD über multi-omische integrative Protein-Signalnetzwerke17 entdeckt wurden. B3GNT3 und SPP1 werden ausgesezernt oder membranlokalisiert, was eine mögliche Nutzung als minimalinvasive Biomarker unterstützt. Eine effektive LUAD-Klassifikation und Biomarker-Identifikation können ebenfalls durch überlappende Merkmalsauswahlmethoden erreicht werden.18, und multi-omische Interaktionen spielen eine wichtige funktionelle Rolle beim Fortschreiten von Lungenkrebs19. Mitochondriale Gensignaturen, die durch umfassende Multi-Omics-Integration identifiziert wurden, haben ebenfalls Wert für die LUAD-Prognose und die personalisierte Therapie20. B3GNT3 und SPP1 werden ausgesezernt oder membranlokalisiert, was eine mögliche Nutzung als minimalinvasive Biomarker unterstützt. Diese Studie zielte darauf ab, robuste LUAD-Biomarker mittels integrativer Bioinformatik zu identifizieren, deren diagnostische und prognostische Leistung zu bewerten, ihre biologischen Funktionen und Immunassoziationen zu erforschen und ein klinisch nützliches prognostisches Nomogramm zu erstellen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Datenquellen und Vorverarbeitung

  1. Rohdaten in R verarbeiten (Version 4.1.3; Windows 10 Pro).
  2. Für GSE115002 wenden Sie die Quantilnormalisierung mit Limma an (Version 3.52.3).
  3. Filter von Gene mit niedriger Expression für TCGA: Gene mit CPM > 0,5 in ≥50 % der Proben behalten.
  4. Gene mit niedriger Expression filtern auf GSE115002: Gene mit durchschnittlichem Signal >50 behalten.
  5. log2Transformationsausdruckswerte mit einem Pseudocount von +1.
    HINWEIS: LUAD-Genexpressions- und klinische Daten wurden von TCGA-LUAD (Version 33.0, GDC Portal, heruntergeladen am 7. August 2025) und GSE115002 (Agilent Microarray, GEO, heruntergeladen am 7. August 2025) gewonnen. TCGA-LUAD umfasste 535 Tumore und 59 normale Proben. GSE115002 umfasste 52 Tumore und 52 übereinstimmende normale Proben.

2. Identifikation unterschiedlich exprimierter Gene

  1. Verwenden Sie DESeq2 (Version 1.36.0) für TCGA RNA-seq und Limma (Version 3.52.3) für GSE115002 für die Analyse der differenziellen Expression. Berechnen Sie angepasste P-Werte (FDR) mit der Benjamini–Hochberg-Methode.
  2. Um die Vergleichbarkeit von Datensätzen zu gewährleisten, wird ein einheitliches |log₂FC| ≥ 1,0 wurde für beide Kohorten angewendet. DEGs wurden als FDR < 0,05 und |log₂FC| ≥ 1.0. Überlappende DEGs wurden mit VennDiagram (Version 1.7.3) identifiziert. B3GNT3, FERMT1 und SPP1 wurden als konsequent hochregulierte Kandidaten mit bekannter Krebsrelevanz ausgewählt.

3. Bewertung des diagnostischen Werts

  1. Konstruiere ROC-Kurven für jedes Kandidatengen.
  2. Bestimme optimale Cutoff-Werte mit dem Youden-Index.
  3. Berechnen Sie AUC, Sensitivität und Spezifität für jedes Gen.
  4. Baue ein kombiniertes Diagnosepanel mit multivariater logistischer Regression auf.
    HINWEIS: Das pROC-Paket v1.18.0 wurde für die ROC-Analyse verwendet. Die glm-Funktion mit der Binomialfamilie wurde verwendet, um das diagnostische Modell zu konstruieren.

4. Überlebensanalyse

  1. Schichten Sie Patienten in Gruppen mit hoher und niedriger Expression anhand der median Expression.
  2. Erzeugen Sie Kaplan–Meier-Überlebenskurven für jedes Gen.
  3. Führen Sie Log-Rank-Tests durch, um Überlebensunterschiede zu vergleichen.
  4. Führen Sie eine Univariate Cox-Regressionsanalyse durch.
  5. Durchführung einer multivariaten Cox-Regressionsanalyse.
  6. Klinische Kovariaten in Regressionsmodelle einbeziehen.
  7. Verifizieren Sie die Annahme der proportionalen Gefahren mit Schoenfeld-Residuen.
  8. Berechnen Sie einen Drei-Gen-Risikoscore.
    HINWEIS: Survival v3.3.1 und survminer v0.4.9 wurden verwendet. Kovariaten umfassten Alter, Geschlecht, T-Stadium, N-Stadium und M-Stadium. Der Risikoscore wurde wie folgt berechnet:
    Risiko-Score = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)

5. Genmengenanreicherung und funktionale Annotation

  1. Führen Sie eine GO-Anreicherungsanalyse mit DEGs durch.
  2. Führen Sie eine KEGG-Signalweganreicherungsanalyse mit DEGs durch.
  3. Führen Sie eine Gensatzanreicherungsanalyse (GSEA) durch.
  4. Ranken Sie Gene anhand der Pearson-Korrelation mit der Kandidatengenexpression.
  5. Identifizieren Sie signifikante Terme mit bereinigtem P < 0,05.
    HINWEIS: clusterProfiler v4.6.2 wurde für GO- und KEGG-Analysen verwendet. FGSEA v1.22.0 und MSigDB Hallmark v7.5 wurden für GSEA verwendet.

6. Korrelation und Netzwerkanalyse

HINWEIS: Pearson-Korrelation wurde für die normal verteilte Genexpression verwendet; Spearman-Korrelation für Immunzellfraktionen. PPI-Netzwerke wurden mit STRING (Version 11.5, Konfidenz > 0.7) generiert und in Cytoscape (Version 3.9.1) visualisiert. Die Immuninfiltration wurde mit CIBERSORT (absoluter Modus, 100 Permutationen) geschätzt. Die Einzelzell-RNA-Sequenzierung hat gezeigt, dass sie Nischenübergänge im NSCLC-Mikroumfeld aufzeigt, was für die Immuninfiltrationsanalyserelevant ist 21,22, und die integrative Einzelzellanalyse kann die Rolle von Immunzellen, wie CD8+-Gedächtniszellen, in LUAD 23,24,25 weiter analysieren.

7. Nomogrammkonstruktion und Validierung

HINWEIS: Die Variablen für das Nomogramm wurden basierend auf der multivariaten Cox-Signifikanz (P < 0,05) ausgewählt: T-Stufe, N-Stufe, B3GNT3, FERMT1 und SPP1. Das Nomogramm wurde mit RMS (Version 6.5.0) gebaut. Die interne Validierung nutzte 1000 Bootstrap-Resampling mit Ersatz. Kalibrierungskurven und Entscheidungskurvenanalyse (DCA) wurden mit RMDA (Version 1.7) durchgeführt. Die rechnerische Umgebung umfasste R 4.1.3, Windows 10 Pro und Bioconductor 3.15. Analyseskripte sind auf angemessener Anfrage unter https://github.com/[redacted]/LUAD-biomarker-2025 verfügbar.

8. Statistische Analyse

HINWEIS: Alle statistischen Tests waren zweiseitig; P < 0,05 wurde als signifikant angesehen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Globale Genexpressionsänderungen bei LUAD

Transkriptomische Vergleiche zwischen Adenokarzinomgeweben der Lunge und normalen Lungengeweben zeigten weit verbreitete Veränderungen in der Genexpression. Abbildung 1A zeigt Vulkandiagramme unterschiedlich exprimierter Gene im TCGA-LUAD-Datensatz, und Abbildung 1B zeigt diese im GSE115002-Datensatz. In der TCGA-LUAD-Kohorte (Abbildung 1A) wu...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das Nomogramm wurde mittels multivariater Cox-Regressionsanalyse auf Basis der TCGA-LUAD-Kohorte konstruiert. Prädiktoren sind das pathologische T-Stadium, das pathologische N-Stadium und der Genexpressionsstatus von B3GNT3, FERMT1 und SPP1 (kategorisiert als High vs. Low basierend auf medianer Expression). Für jeden Patienten werden die individuellen Werte für jede Variable summiert, um einen "Gesamtpunkt"-Wert zu erzeugen, der den geschätzten Überlebenswahrsc...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären keine konkurrierenden Interessen.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit wurde 2024 vom Universitätsprojekt der Fujian University of Traditional Chinese Medicine (Fördernummer: XB2024012) unterstützt, geleitet von Yuhui Lin vom Affiliated People's Hospital der Fujian University of Traditional Chinese Medicine. und gemeinsame Mittel für die Innovation von Wissenschaft und Technologie, Provinz Fujian (Zuschussnummer: 2025Y9530), geleitet von Xiaoting Chen vom Jinjiang Municipal Hospital (Shanghai Sixth People's Hospital, Fujian).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Publicly Available DatasetsTCGA-LUAD DatasetThe Cancer Genome Atlas (TCGA) Portal (https://portal.gdc.cancer.gov/); 535 LUAD-Tumorproben, 59 angrenzende normale Lungengewebeproben (RNA-Sequenzierungszählung/FPKM-Werte + klinische Daten: Überleben, TNM-Stadieneinteilung)Transkriptomische und klinische Daten für Differentialexpressions-, Überlebens- und Nomogrammanalyse; primäre Studienkohorte
GSE115002 DatasetGene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE115002); Agilent-Mikroarray, 52 LUAD-Tumorgewebe, 52 passende angrenzende normale Lungengewebe (behandlungsnaive Primärtumoren)Unabhängige Validierungskohorte für Differentialexpression, diagnostische Leistung und Analyse der Immuninfiltration
Bioinformatics Software & Programming EnvironmentR Programming LanguageVersion 4.1Kernplattform für alle transkriptomischen, statistischen und grafischen Analysen
R Packages (Differential Expression)DESeq2, limmaDESeq2: TCGA RNA-seq Rohzählungs-Differentialexpressionsanalyse; limma: GSE115002 Mikroarray-Normalisierung und Differentialexpressionsanalyse (Benjamini–Hochberg FDR-Korrektur)
R Packages (Diagnostic Analysis)pROCKonstruktion von ROC-Kurven, Berechnung von AUC (95% CI), optimale Cutoff-Bestimmung (Youden’s Index) für die Beurteilung der diagnostischen Leistung
R Packages (Survival Analysis)survival, survminerKaplan–Meier-Überlebenskurvengenerierung, Log-Rank-Test, univariate/multivariate Cox-proportionale Hazards-Regression (HR + 95% CI); Patientenstratifizierung nach medianer Genexpression
R Packages (Functional Enrichment)clusterProfiler, fgseaclusterProfiler: GO (BP/CC/MF) und KEGG-Weganalyse (angepasstes P < 0,05); fgsea: GSEA für MSigDB-Hallmark/KEGG-Gensets (FDR < 0,25)
R Packages (Nomogram Construction & Validation)rmsEntwicklung eines prognostischen Nomogramms (Integration von Genexpression + TNM-Stadium); Harrell’s C-Index-Berechnung, Bootstrap-Resampling (1000 Wiederholungen) zur Bias-Korrektur, Generierung von Kalibrierplots
R Packages (Statistical & Visualization)ggplot2, ComplexHeatmap, corrplotGenerierung von Vulkanplots, Blasenplots (Anreicherung), Heatmaps (Immuninfiltrationskorrelierung), Streudiagrammen (Genkoexpression); Pearson/Spearman-Korrelationsanalyse
Bioinformatics Databases & Tools (Network/Immune Analysis)STRING DatabaseKonfidenzscore > 0,7Aufbau von Protein-Protein-Interaktionsnetzwerken (PPI) für B3GNT3/FERMT1/SPP1 und Interaktoren ersten Grades
Cytoscape-Visualisierung von PPI- und Genkoexpressionsnetzwerken (Kantengewichtung nach Korrelationsstärke, Hub-Gen-Identifizierung)
Immune Deconvolution AlgorithmCIBERSORTSchätzung der Immunzellinfiltrationshäufigkeit (M2-Makrophagen, CD8+ T-Zellen, Neutrophile, NK-Zellen usw.) in LUAD-Proben; Korrelation mit der Kandidatengenexpression
Other ToolsMicrosoft Office/LaTeX-Manuskriptvorbereitung, Figurenmontage und Tabellenformatierung; statistische Ergebniszusammenstellung

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Cancer ResearchB3GNT3FERMT1SPP1biomarkerprognosisgene expressionnomogram

Verwandte Artikel