Cette étude a été approuvée par le comité d’éthique institutionnelle du premier hôpital affilié de l’Université médicale de Bengbu (Numéro d’approbation : 2023YJS162). Un consentement éclairé écrit a été obtenu de tous les participants avant la collecte de l’échantillon.
Collecte de données
Les données transcriptomiques utilisées dans cette étude ont été obtenues à partir de la base de données Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/ ; RRID : SCR_005012). Le jeu de données d’entraînement principal, GSE150910, a été généré à l’aide de la plateforme Illumina NovaSeq 6000 (GPL24676) et comprenait 103 échantillons IPF et 103 échantillons de tissu pulmonaire normal. Pour valider les résultats, des ensembles de données indépendants GSE24206, GSE110147, GSE93606 et GSE38958 ont été utilisés. Des informations détaillées sur chaque ensemble de données sont fournies dans le Tableau 1. De plus, un total de 636 GRG ont été sélectionnés parmi une étude14 précédemment publiée.
Analyse de l’expression différentielle et caractérisation fonctionnelle des DEG liés à la glycosylation
L’analyse d’expression différentielle entre les échantillons de tissu pulmonaire IPF et de tissu pulmonaire normal issus du jeu de données GSE150910 a été réalisée à l’aide du package R DESeq2 (RRID : SCR_015687). Gènes avec une valeur P ajustée (padj) < 0,05 et |log2FoldChange| > 0,5 ont été considérés comme des gènes différenciellement exprimés (DEG). Les DEG liés à la glycosylation (GR-DEG) ont été identifiés en les intersectant avec un ensemble prédéfini de 636 GRG. Pour approfondir les rôles biologiques de ces gènes, une analyse d’enrichissement par Ontologie Génique (GO) et une analyse des voies de la Kyoto Encyclopedia of Genes and Genomes (KEGG) ont été réalisées afin d’élucider leurs rôles fonctionnels et leur implication dans les voies. Un réseau d’interaction protéine-protéine (PPI) a été généré à l’aide de la base de données STRING (RRID : SCR_005223)15 avec un seuil de score de confiance en interaction de > 0,7, afin d’élucider les interactions moléculaires et les mécanismes potentiels de régulation des GR-DEG dans l’IPF.
Dépistage des gènes clés et construction d’un modèle diagnostique
Pour dépister les gènes clés de l’IPF à partir des GR-DEG, nous avons utilisé plusieurs algorithmes d’apprentissage automatique. Initialement, la régression LASSO (RRID : SCR_003418) était équipée d’une régression logistique binaire (famille = « binomiale ») et le paramètre de pénalité optimal λ était sélectionné via une validation croisée à 10 fois (nfold = 10). Les résultats de sélection finaux étaient les caractéristiques aux coefficients non nuls correspondant à λ_(min) (0,01700442). Pour SVM-RFE, la fonction rfe du caret du package R était utilisée. L’élimination récursive des caractéristiques a été effectuée par validation croisée 10 fois (méthode = « cv », nombre = 10), filtrant progressivement les caractéristiques de 1 à 126, avec la précision utilisée pour déterminer le sous-ensemble optimal des caractéristiques. Dans XGBoost, la fonction objectif était réglée sur régression logistique binaire (objectif = « binaire : logistique »), avec la métrique d’évaluation réglée sur la perte logarithmique (eval_metric = « logloss »), le nombre d’itérations (nrounds) fixé à 100, et le taux d’apprentissage (eta) fixé à 0,1. Les 20 meilleurs gènes ont été sélectionnés en fonction de leurs scores d’importance des caractéristiques (gain). En croisant les résultats de ces méthodes, un ensemble affiné de gènes clés a été identifié. Sur la base de cet ensemble de gènes, un modèle diagnostique XGBoost a été construit à l’aide du jeu de données d’entraînement (GSE150910), et sa performance prédictive a été évaluée à l’aide d’une analyse des caractéristiques opérationnelles du récepteur (ROC) sur des jeux de données de validation externes (GSE110147, GSE24206, GSE93606 et GSE38958). De plus, un nomogramme a été développé pour visualiser la contribution de chaque gène sélectionné à la probabilité de la maladie, et l’utilité clinique du modèle a été évaluée davantage grâce à des courbes d’étalonnage et à l’analyse des courbes de décision (DCA).
Exploration des voies biologiques des gènes clés
Explorer le contexte biologique des gènes clés identifiés par l’apprentissage automatique. L’analyse d’enrichissement des ensembles de gènes (GSEA)16 a été réalisée sur la base des listes de gènes de la Molecular Signatures Database (MSigDB) (RRID : SCR_016863)17et les voies ont été dépistées pour le NES > 1. Les voies enrichies par le dessus ont été visualisées à l’aide de la fonction enrichissement.
Exploration des différences de fonction biologique et de paysage immunitaire dans les sous-types IPF basées sur les scores clés des gènes
Sur la base des profils d’expression des gènes clés identifiés, les scores de l’Analyse d’Enrichissement des Ensembles de Gènes à échantillon unique (ssGSEA) ont été calculés et utilisés pour stratifier les patients IPF en groupes à scores élevés et faibles selon le score médian. Une analyse d’expression différentielle a été réalisée entre les deux groupes, suivie par GSEA (RRID : SCR_003199)18 pour réaliser des analyses d’enrichissement des processus biologiques GO (GOBP) et des voies KEGG sur les DEG.
Analyse de l’infiltration des cellules immunitaires et des différences clés d’expression génique
Après une stratification des sous-groupes basée sur les scores ssGSEA, les différences d’infiltration immunitaire entre les groupes à score élevé et faible ont été évaluées. Tout d’abord, nous avons calculé les abondances relatives de 22 types de cellules immunitaires dans les échantillons à l’aide de l’algorithme CIBERSORT (RRID : SCR_016955)19 en combinaison avec la matrice de caractéristiques LM22. Plus précisément, la fonction deconv_tme dans le paquet R IOBR (paramètres : méthode = « cibersort », tableaux = FAUX, perm = 200) a été utilisée pour les calculs, et des diagrammes de boîte ont été générés à l’aide du package ggpubr (RRID : SCR_021139) pour évaluer les différences d’infiltration des cellules immunitaires entre les groupes à score élevé et à score bas. De plus, la fonction gsva dans le package R GSVA (en utilisant la méthode ssGSEA) a été utilisée pour calculer les scores d’enrichissement de 28 types de cellules immunitaires. Ces scores ont ensuite été normalisés à l’aide d’un ajustement Min-Max pour les mapper à l’intervalle [0, 1], facilitant ainsi les comparaisons entre types cellulaires. Enfin, des tests de Wilcoxon à somme de rangs ont été réalisés pour comparer l’expression des gènes clés entre des échantillons normaux et des patients IPF dans les ensembles de données GSE150910 et GSE110147, fournissant une analyse complète de l’infiltration des cellules immunitaires et des différences d’expression génique entre les sous-groupes IPF.
Validation des gènes clés chez les patients IPF à l’aide d’une analyse RT-qPCR
Pour valider la pertinence diagnostique des gènes identifiés, six gènes ayant les scores d’importance les plus élevés selon l’algorithme XGBoost ont été sélectionnés pour validation des niveaux d’expression chez les patients IPF et chez les témoins sains utilisant la PCR quantitative par transcription inversée (RT-qPCR). Un total de 20 échantillons de sang, dont 9 de patients atteints de FPI et 11 de personnes en bonne santé, ont été prélevés au Premier Hôpital Affilié de l’Université Médicale de Bengbu. L’ARN total a été extrait des échantillons sanguins, et la concentration d’ARN a été mesurée à l’aide d’un lecteur multifonction de microplaques. La qualité de l’ARN a été évaluée avant les analyses en aval. L’ADN génomique a été retiré lors de la transcription inverse, et les séquences d’amorce utilisées pour la RT-qPCR sont listées dans le tableau 2. La spécificité de l’amorce a été vérifiée par analyse de la courbe de fusion. Le GAPDH a été utilisé comme gène de référence interne. Les niveaux relatifs d’expression génique ont été calculés à l’aide de la méthode 2-ΔΔCt . Cette étape de validation fournit un soutien expérimental préliminaire pour l’expression différentielle et la pertinence diagnostique potentielle des gènes identifiés dans l’IPF.
Analyse statistique
Les données ont été analysées en R, et le test de Wilcoxon a été utilisé pour détecter les différences entre les deux groupes. L’analyse d’enrichissement GSEA, GO et KEGG a été réalisée à l’aide du clusterProfiler du paquet R (RRID : SCR_016884). Une valeur p < 0,05 était considérée comme significative sauf indication contraire.