Article de recherche

L’analyse bioinformatique intégrée des données transcriptomiques humaines identifie trois biomarqueurs diagnostiques et pronostiques clés dans l’adénocarcinome pulmonaire

DOI :

10.3791/71214

30 juin 2026

* These authors contributed equally

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a identifié des biomarqueurs diagnostiques et pronostiques de l’adénocarcinome pulmonaire en utilisant TCGA-LUAD et GEO GSE115002 des données transcriptomiques. B3GNT3, FERMT1 et SPP1 étaient régulés à la hausse, distinguant les tumeurs des tissus normaux. Ces gènes sont liés à la transition épithéliale-mésenchymatose et à l’immunosuppression. Un nomogramme combinant l’expression génique avec le stade TNM a montré une valeur prédictive fiable.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’adénocarcinome pulmonaire (LUAD) est la principale cause de décès liés au cancer dans le monde. Malgré les avancées en chirurgie, thérapie ciblée et immunothérapie, le taux de survie à 5 ans du LUAD avancé reste inférieur à 20 %, indiquant un besoin urgent de biomarqueurs moléculaires fiables pour la détection précoce et le pronostic. Dans cette étude, les auteurs ont émis l’hypothèse que trois gènes constamment augmentés pourraient agir comme des biomarqueurs diagnostiques et pronostiques efficaces pour la LUAD. Les auteurs ont analysé les données transcriptomiques de deux cohortes indépendantes, TCGA-LUAD (535 tumeurs, 59 échantillons normaux) et GSE115002 (52 tumeurs, 52 échantillons normaux correspondants), afin de dépister les gènes exprimés différiellement. Trois gènes principaux — B3GNT3, FERMT1 et SPP1 — étaient systématiquement surexprimés dans les tumeurs LUAD dans les deux ensembles de données. Ces gènes ont montré d’excellentes performances diagnostiques, avec des valeurs d’AUC supérieures à 0,95 dans TCGA-LUAD et une grande précision en GSE115002. L’analyse de survie a montré qu’une forte expression de chaque gène était significativement associée à une survie globale plus courte et sans maladie, et la régression de Cox multivariée a confirmé leur valeur pronostique indépendante. L’analyse d’enrichissement fonctionnel a indiqué que ces trois gènes participent à la transition épithéliale-mésenchymate, au remodelage de la matrice extracellulaire et à la suppression immunitaire, tous étroitement liés à l’invasion et à la métastase des LUAD. Les auteurs ont également construit un nomogramme pronostique combinant les trois gènes et le stade TNM, atteignant un indice de concordance de 0,743 et démontrant de bonnes performances prédictives. Ces résultats confirment que B3GNT3, FERMT1 et SPP1 sont des biomarqueurs diagnostiques et pronostiques prometteurs pour le LUAD, soutenant leur application clinique en stratification et gestion du risque.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cancer du poumon est la principale cause de mortalité mondiale par cancer, représentant environ 1,8 million de décès en 2020. L’adénocarcinome pulmonaire (LUAD) représente près de 40 % de tous les cas de cancer dupoumon 2. Malgré les avancées en chirurgie, thérapie ciblée et immunothérapie, le taux de survie à 5 ans pour les LUAD avancés reste inférieur à 20 %3,4. Des biomarqueurs moléculaires fiables pour une détection précoce et une pronostication précise sont urgemment nécessaires. Le séquençage à haut débit et les bases de données publiques telles que The Cancer Genome Atlas (TCGA) et Gene Expression Omnibus (GEO) permettent un profilage transcriptomique systématique descancers 5,6. La bioinformatique intégrative inter-cohortes améliore la fiabilité de la découverte de biomarqueurscandidats 5.

De nombreux gènes et voies ont été impliqués dans la LUAD, notamment la prolifération cellulaire, la signalisation EGFR et l’évasionimmunitaire 7. Cependant, peu ont été adaptés en usage clinique. Les modèles de risque combinant signatures géniques et caractéristiques clinicopathologiques — en particulier les nomogrammes — améliorent la précision pronostique dansLUAD 8. Bien que B3GNT3, FERMT1 et SPP1 aient été individuellement liés à la progression du cancer, leur valeur combinée diagnostique, pronostique et régulatrice du microenvironnement immunitaire dans le LUAD n’a pas été systématiquement validée entre les cohortes indépendantes. Cette étude fournit la première analyse intégrée multiplateforme de ces trois gènes en tant que panel unifié de biomarqueurs pour LUAD, avec un nomogramme pronostique cliniquement applicable.

B3GNT3 code pour une glycosyltransférase qui stabilise -L1 et favorise l’évasionimmunitaire 9,10. FERMT1 (kindlin-1) régule l’activation de l’intégrine et favorise la métastase dans le cancer du poumon non à petites cellules (NSCLC)11,12. SPP1 (ostéopontine) assure la médiation du remodelage de la matrice extracellulaire, de la transition épithéliale-mésenchymatose (EMT) et de la chimiorésistance 13,14,15. Les gènes liés à l’horloge circadienne ont également démontré la possibilité de prédire le pronostic et le diagnostic duLUAD 16, tandis que les différences entre sexes dans le LUAD ont été découvertes via des réseaux de signalisation protéique intégrativemulti-omiques 17. B3GNT3 et SPP1 sont sécrétés ou localisés dans la membrane, ce qui soutient une utilisation potentielle comme biomarqueurs mini-invasifs. Une classification efficace des LUAD et l’identification des biomarqueurs peuvent également être réalisées grâce à des méthodes de sélection des caractéristiques qui sechevauchent 18, et les interactions multi-omiques jouent un rôle fonctionnel important dans la progression du cancer dupoumon 19. Les signatures géniques mitochondriales, identifiées via une intégration multi-omique complète, ont également une valeur pour le pronostic LUAD et la thérapiepersonnalisée 20. B3GNT3 et SPP1 sont sécrétés ou localisés dans la membrane, ce qui soutient une utilisation potentielle comme biomarqueurs mini-invasifs. Cette étude visait à identifier des biomarqueurs LUAD robustes à l’aide de la bioinformatique intégrative, à évaluer leur performance diagnostique et pronostique, à explorer leurs fonctions biologiques et leurs associations immunitaires, et à construire un nomogramme pronostique cliniquement utile.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Sources de données et prétraitement

  1. Traiter les données brutes dans R (version 4.1.3 ; Windows 10 Pro).
  2. Pour GSE115002, appliquer la normalisation en quantile à l’aide de limma (version 3.52.3).
  3. Filtrer les gènes à faible expression pour les TCGA : conserver les gènes avec CPM > 0,5 dans ≥50 % des échantillons.
  4. Filtrer les gènes à faible expression pour GSE115002 : conserver les gènes avec un signal moyen >50.
  5. log2Transformer les valeurs d’expression avec un pseudo-compte de +1.
    REMARQUE : L’expression génique et les données cliniques du LUAD ont été obtenues à partir de TCGA-LUAD (version 33.0, portail GDC, téléchargée le 7 août 2025) et GSE115002 (microarray Agilent, GEO, téléchargée le 7 août 2025). TCGA-LUAD comprenait 535 tumeurs et 59 échantillons normaux. GSE115002 comprenaient 52 tumeurs et 52 échantillons normaux appariés.

2. Identification des gènes exprimés différenciellement

  1. Utilisez DESeq2 (version 1.36.0) pour TCGA RNA-seq et limma (version 3.52.3) pour GSE115002 pour l’analyse d’expression différentielle. Calculez les valeurs p ajustées (FDR) en utilisant la méthode de Benjamini–Hochberg.
  2. Pour garantir la comparabilité entre ensembles de données, un |log₂FC| unifié ≥ 1,0 a été appliqué pour les deux cohortes. Les DEG étaient définis comme FDR < 0,05 et |log₂FC| ≥ 1.0. Les DEG chevauchants ont été identifiés à l’aide de VennDiagram (version 1.7.3). B3GNT3, FERMT1 et SPP1 ont été sélectionnés comme candidats constamment surélevés et ayant une pertinence connue pour le cancer.

3. Évaluation de la valeur diagnostique

  1. Construisez des courbes ROC pour chaque gène candidat.
  2. Déterminer les valeurs de seuil optimales à l’aide de l’indice de Youden.
  3. Calculez l’AUC, la sensibilité et la spécificité pour chaque gène.
  4. Construisez un panel diagnostique combiné en utilisant la régression logistique multivariée.
    REMARQUE : Le package pROC v1.18.0 a été utilisé pour l’analyse ROC. La fonction glm avec la famille binomiale a été utilisée pour construire le modèle diagnostique.

4. Analyse de la survie

  1. Stratifiez les patients en groupes à haute et basse expression en utilisant l’expression médiane.
  2. Générez des courbes de survie de Kaplan–Meier pour chaque gène.
  3. Effectuer des tests log-rang pour comparer les différences de survie.
  4. Réalisez une analyse de régression de Cox univariée.
  5. Réaliser une analyse de régression de Cox multivariée.
  6. Inclure les covariables cliniques dans les modèles de régression.
  7. Vérifier l’hypothèse des aléas proportionnelles à l’aide des résidus de Schoenfeld.
  8. Calculez un score de risque sur trois gènes.
    REMARQUE : Survival v3.3.1 et survminer v0.4.9 ont été utilisés. Les covariables comprenaient l’âge, le sexe, le stade T, le stade N et le stade M. Le score de risque était calculé comme suit :
    Score de risque = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)

5. Enrichissement des ensembles géniques et annotation fonctionnelle

  1. Effectuez une analyse d’enrichissement GO à l’aide de DEG.
  2. Effectuer une analyse d’enrichissement des voies KEGG à l’aide de DEG.
  3. Réaliser une analyse d’enrichissement des ensembles géniques (GSEA).
  4. Classez les gènes par corrélation de Pearson avec l’expression génique candidate.
  5. Identifier les termes significatifs en utilisant un P ajusté < 0,05.
    REMARQUE : clusterProfiler v4.6.2 a été utilisé pour les analyses GO et KEGG. FGSEA v1.22.0 et MSigDB Hallmark v7.5 ont été utilisés pour GSEA.

6. Corrélation et analyse de réseaux

REMARQUE : La corrélation de Pearson était utilisée pour l’expression génique normalement distribuée ; Corélation de Spearman pour les fractions des cellules immunitaires. Les réseaux PPI ont été générés à l’aide de STRING (version 11.5, confiance > 0.7) et visualisés dans Cytoscape (version 3.9.1). L’infiltration immunitaire a été estimée à l’aide de CIBERSORT (mode absolu, 100 permutations). Le séquençage à ARN unicellulaire a montré qu’il révèle des transitions de niche dans le microenvironnement NSCLC, ce qui est pertinent pour l’analyse d’infiltrationimmunitaire 21,22, et l’analyse intégrative unicellulaire peut approfondir le rôle des cellules immunitaires, telles que les cellules mémoire CD8+, dans LUAD 23,24,25.

7. Construction et validation du nomogramme

REMARQUE : Les variables pour le nomogramme ont été sélectionnées en fonction de la signification multivariée de Cox (P < 0,05) : Stade T, Stade N, B3GNT3, FERMT1 et SPP1. Le nomogramme a été construit avec rms (version 6.5.0). La validation interne utilisait un rééchantillonnage de 1000 bootstraps avec remplacement. Les courbes d’étalonnage et l’analyse des courbes de décision (DCA) ont été réalisées à l’aide de la RMDA (version 1.7). L’environnement informatique comprenait R 4.1.3, Windows 10 Pro et Bioconductor 3.15. Les scripts d’analyse sont disponibles à https://github.com/[censuré]/LUAD-biomarker-2025 sur demande raisonnable.

8. Analyse statistique

REMARQUE : Tous les tests statistiques étaient bidirectionnels ; P < 0,05 était considéré comme significatif.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Altérations globales de l’expression génique dans LUAD

Des comparaisons transcriptomiques entre les tissus adénocarcinomes pulmonaires et les tissus pulmonaires normaux ont identifié des changements généralisés dans l’expression génique. La figure 1A montre les graphiques volcaniques des gènes différenciellement exprimés dans le jeu de données TCGA-LUAD, et la figure 1B montre ceux du jeu de données GSE115002. Dan...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le nomogramme a été construit à l’aide d’une analyse de régression de Cox multivariée basée sur la cohorte TCGA-LUAD. Les prédicteurs incluent le stade T pathologique, le stade N pathologique, et l’état d’expression génique de B3GNT3, FERMT1 et SPP1 (catégorisés en Élevé vs. Faible selon l’expression médiane). Pour chaque patient, les scores individuels de chaque variable sont additionnés afin de générer une valeur de « Total Points », qui correspond aux probab...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs ne déclarent aucun intérêt concurrent.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été soutenu par le projet universitaire 2024 de l’Université de médecine traditionnelle chinoise du Fujian (numéro de subvention : XB2024012), dirigé par Yuhui Lin de l’Hôpital Populaire affilié de l’Université de médecine traditionnelle chinoise du Fujian. et fonds conjoints pour l’innovation en science et technologie, province du Fujian (Subvention n° 2025Y9530), dirigés par Xiaoting Chen de l’hôpital municipal de Jinjiang (Sixième hôpital populaire de Shanghai, Fujian).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Publicly Available DatasetsTCGA-LUAD DatasetThe Cancer Genome Atlas (TCGA) Portal (https://portal.gdc.cancer.gov/); 535 échantillons de tumeurs LUAD, 59 échantillons de tissus pulmonaires normaux adjacents (comptage de séquençage d'ARN/valeurs FPKM + données cliniques: survie, mise en scène TNM)Données transcriptomiques et cliniques pour l'expression différentielle, la survie et l'analyse de la nomogramme; cohorte d'étude primaire
GSE115002 DatasetGene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE115002); Microarray Agilent, 52 tissus tumoraux LUAD, 52 tissus pulmonaires normaux adjacents appariés (tumeurs primaires non traitées)Cohorte de validation indépendante pour l'expression différentielle, les performances diagnostiques et l'analyse de l'infiltration immunitaire
Logiciels de bioinformatique et environnement de programmationLangage de programmation RVersion 4.1Plateforme de base pour toutes les analyses transcriptomiques, statistiques et graphiques
Paquets R (expression différentielle)DESeq2, limmaDESeq2: analyse d'expression différentielle du comptage brut TCGA RNA-seq; limma: normalisation des puces GSE115002 et analyse d'expression différentielle (correction Benjamini-Hochberg FDR)
Paquets R (analyse diagnostique)pROCConstruction de courbes ROC, calcul de l'AUC (IC à 95 %), détermination du seuil optimal (indice de Youden) pour l'évaluation des performances diagnostiques
Paquets R (analyse de survie)survival, survminerGénération de courbes de survie Kaplan-Meier, test de log-rank, régression de risques proportionnels de Cox univariée/multivariée (HR + IC à 95 %); stratification des patients par expression médiane des gènes
Paquets R (enrichissement fonctionnel)clusterProfiler, fgseaclusterProfiler: analyse d'enrichissement des voies GO (BP/CC/MF) et KEGG (P ajusté < 0,05); fgsea: GSEA pour les ensembles de gènes MSigDB Hallmark/KEGG (FDR < 0,25)
Paquets R (construction et validation de nomogramme)rmsDéveloppement d'un nomogramme pronostique (intégration de l'expression génique + stade TNM); calcul de l'indice de C de Harrell, rééchantillonnage par bootstrap (1000 répétitions) pour la correction des biais, génération d'un graphique d'étalonnage
Paquets R (statistique et visualisation)ggplot2, ComplexHeatmap, corrplotGénération de graphiques volcaniques, de graphiques à bulles (enrichissement), de heatmaps (corrélation d'infiltration immunitaire), de graphiques de dispersion (cocher-cher); analyse de corrélation de Pearson/Spearman
Bases de données et outils de bioinformatique (analyse de réseau/immunitaire)Base de données STRINGScore de confiance > 0,7Construction de réseaux d'interaction protéine-protéine (PPI) pour B3GNT3/FERMT1/SPP1 et les interacteurs de premier degré
Cytoscape-Visualisation des réseaux PPI et de cocher-cher de gènes (pondération des arêtes par la force de corrélation, identification des gènes pivots)
Algorithme de déconvolution immunitaireCIBERSORTEstimation de l'abondance de l'infiltration cellulaire immunitaire (macrophages M2, cellules T CD8+, neutrophiles, cellules NK, etc.) dans les échantillons LUAD; corrélation avec l'expression des gènes candidats
Autres outilsMicrosoft Office/LaTeX-Préparation du manuscrit, assemblage des figures et formatage des tableaux; compilation des résultats statistiques

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Cancer ResearchB3GNT3FERMT1SPP1biomarkerprognosisgene expressionnomogram

Articles connexes