Identification de gènes chevauchants, analyse d'enrichissement et construction du réseau PPI
À partir du jeu de données GSE54837, 3 371 gènes différentiellement exprimés (DEG) ont été identifiés, dont 1 675 gènes surexprimés et 1 696 gènes sous-exprimés. Les 10 gènes présentant la surexpression et la sous-expression la plus significative sont indiqués dans Figure 1A. Une analyse de regroupement hiérarchique des données GSE54837 a été réalisée (Figure supplémentaire 1A), et une puissance de seuil doux de 10 a été appliquée afin d'assurer une topologie de réseau sans échelle (Figure 1B). Des modules de co-expression génique ont été construits à l'aide de la méthode de découpage dynamique en arbre avec une taille minimale de module fixée à 50 gènes, et chaque module s'est vu attribuer une couleur distincte (Figure supplémentaire 1B). Modules présentant des corrélations entre les gènes propres > 0,75 ont ensuite été fusionnés (Figure supplémentaire 1C, Figure 1C), ce qui donne 14 modules distincts. Sur la base de l'analyse de corrélation de Pearson entre les eigengènes des modules et les caractéristiques cliniques, le module MEsalmon (composé de 5 226 gènes) présentait la corrélation positive la plus significative avec la BPCO (r = 0,35, p = 7 x 10⁻8, Figure 1D). L'analyse de Venn a identifié 160 gènes communs parmi les 3 371 gènes différentiellement exprimés (DEG), les 5 226 gènes du module MEsalmon et les 2 118 gènes associés à l'ac4C (ac4C-RG)Figure 1E). L'analyse d'enrichissement fonctionnel de ces 160 gènes a révélé que les termes GO significatifs incluaient la liaison à l'ARN simple brin, la régulation du processus métabolique des ARNm et la voie de signalisation RIG-I (Figure 1F). De plus, l'analyse KEGG a montré que ces gènes étaient principalement enrichis dans la phagocytose médiée par les récepteurs Fc gamma R, la voie de surveillance de l'ARNm et l'adhésion focale (Figure 1G). Le réseau PPI des gènes chevauchants comprenait 118 nœuds et 196 arêtes (Figure 1H).
Identification de six gènes clés dans la BPCO
Afin d'identifier davantage les gènes clés potentiels parmi les 160 candidats communs, trois algorithmes d'apprentissage automatique ont été appliqués. Une régression LASSO a d'abord été utilisée, la validation croisée permettant de déterminer le paramètre de pénalité optimal (λ) ≈ 0,091 (Figure 2A). Le tracé du profil des coefficients a indiqué que 17 gènes ont été conservés à la valeur optimale de λ (Figure 2B). L'analyse XGBoost a identifié les 30 gènes ayant le gain le plus élevé, parmi lesquels PTRF, WBP11 et LDOC1L présentaient une forte valeur prédictive (Figure 2C). L'algorithme RF a classé de manière similaire les 30 gènes les plus importants selon leurs scores d'importance de Gini, PTRF, RFX5 et PRKCDBP figurant parmi les plus prédictifs (Figure 2D). Une analyse d'intersection des gènes sélectionnés par les trois méthodes a permis d'identifier six gènes clés communs : PTRF, PRKCDBP, UPP1, TOR3A, FAM168B et B4GALT2 (Figure 2E).
Construction du modèle diagnostique et analyse d'expression des gènes clés
En utilisant 70 % du jeu de données GSE54837 comme ensemble d'apprentissage, un modèle de régression logistique a été établi, intégrant les six gènes clés. L'analyse de la courbe ROC a indiqué une performance diagnostique modérée, avec des AUC de 0,766 (IC 95 % : 0,691–0,8417), 0,759 (IC 95 % : 0,6368–0,8817) et 0,723 (IC 95 % : 0,6085–0,8596) respectivement pour les ensembles d'apprentissage, de test interne et de validation externe (Figure 3A–C). L'analyse de calibration a confirmé une forte fiabilité, et l'analyse DCA a montré un bénéfice clinique net clair sur une large gamme de probabilités seuils, tant pour les ensembles d'apprentissage (Figure 3D–E) que de validation (Figure 3F–G). Un nomogramme a été construit afin de visualiser la contribution de chaque gène et de faciliter l'estimation personnalisée du risque (Figure 3H). L'analyse d'expression a révélé que B4GALT2, PRKCDBP et UPP1 étaient significativement surexprimés dans les échantillons de BPCO, tandis que FAM168B, PTRF et TOR3A étaient sous-exprimés (Figure 3I).
Réseau régulateur et analyse fonctionnelle des gènes clés dans la BPCO
Un réseau d'interaction fonctionnelle comprenant les 20 gènes les plus associés aux gènes centraux identifiés a été construit à l'aide de l'analyse GeneMANIA (Figure 4A). Les interactions physiques représentaient la majorité des connexions, suivies par les corrélations de co-expression et les domaines protéiques partagés. L'annotation fonctionnelle a révélé un enrichissement significatif dans des processus tels que le métabolisme des petites molécules contenant une base azotée, le catabolisme des nucléosides et les radeaux de la membrane plasmique. La régulation post-transcriptionnelle a été étudiée en croisant les prédictions de miARN provenant des bases de données DIANA-microT et miRanda, permettant d'identifier huit miARN communs (Figure 4B). Un axe régulateur lncARN-miARN-mARN a ensuite été construit. Selon le diagramme de Sankey, deux des miARN identifiés, tous deux associés à la régulation de FAM168B, étaient prédits comme ciblés par sept lncARN ; aucune interaction régulatrice de ce type n'a été identifiée pour les cinq autres gènes centraux (Figure 4C). La régulation transcriptionnelle a été approfondie à l'aide de la plateforme ChEA3, qui a prédit les facteurs de transcription (FT) en amont pour B4GALT2, UPP1, FAM168B et TOR3A. Les dix premiers FT pour chaque gène ont été sélectionnés afin de construire un réseau régulateur FT-cible (Figure 4D). Une analyse GSEA a été réalisée pour étudier les fonctions biologiques des six gènes clés. UPP1 était significativement enrichi dans des processus biologiques tels que le métabolisme du diacylglycérol et la biosynthèse des purine nucléosides triphosphate, ainsi que dans des voies incluant le protéasome et le métabolisme des xénobiotiques par le cytochrome P450 (Figure 4E–F). Les résultats d'enrichissement pour les cinq autres gènes clés sont fournis dans la Figure supplémentaire 2A–J.
Infiltration immunitaire de UPP1 et prédiction de cibles médicamenteuses dans la BPCO
Les niveaux d'infiltration immunitaire de 28 types de cellules immunitaires ont été évalués dans les groupes témoins et BPCO à l'aide de l'algorithme ssGSEA. Chez les patients atteints de BPCO, les lymphocytes B mémoire, les cellules myéloïdes suppressives et les cellules dendritiques activées présentaient des scores d'enrichissement significativement plus élevés. En revanche, les lymphocytes T helper de type 1, les lymphocytes B activés et les lymphocytes B immatures présentaient des scores d'enrichissement significativement plus faibles (Figure 5A). Il convient de noter que la ssGSEA fournit des estimations relatives de l'enrichissement en cellules immunitaires basées sur des données transcriptomiques, plutôt que des mesures directes des proportions de cellules immunitaires. Une analyse de corrélation a révélé que les six gènes clés présentaient des profils d'association différents avec les sous-ensembles de cellules immunitaires. Plus précisément, UPP1, PRKCDBP et B4GALT2 étaient positivement corrélés avec les niveaux d'infiltration des lymphocytes B mémoire, des cellules dendritiques activées et des cellules myéloïdes suppressives (ρ de Spearman > 0,4, p < 0,05), tandis que PTRF, TOR3A et FAM168B présentaient des corrélations négatives avec les lymphocytes T helper de type 1 et les lymphocytes B activés (ρ de Spearman < −0,3, p < 0,05). La matrice complète des corrélations est présentée dans la carte thermique (Figure 5B). Une analyse de prédiction de médicaments a identifié UPP1 comme le seul gène parmi les six candidats présentant des interactions prédites avec des petites molécules. Trois composés, notamment le fluorouracile, la capécitabine et la 5-benzylacyclouridine, ont été identifiés dans la base de données comme des composés pouvant interagir avec UPP1 (Figure 5C). Ces composés sont principalement utilisés en oncologie ou dans des contextes expérimentaux, et leur pertinence dans la BPCO nécessite des investigations supplémentaires. Les calculs d'énergie libre de liaison ont révélé que la 5-benzylacyclouridine présentait l'affinité de liaison la plus forte, suggérant une affinité de liaison prédite relativement plus élevée (Table 3). Les visualisations du dockage moléculaire pour les trois composés indiquaient des conformations de liaison prédites favorables avec UPP1, conformément à des prédictions de dockage computationnelles plutôt qu'à une validation expérimentale (Figure 5D–F). De plus, l'analyse CTD a indiqué que les six gènes clés étaient fortement associés à divers phénotypes de maladies, notamment des effets retardés d'une exposition prénatale, une perte de poids, une hépatomégalie et une inflammation (Figure 5G–L).
Validation par RT-qPCR de gènes diagnostiques clés dans des échantillons cliniques
Afin de valider les niveaux d'expression de gènes clés, des échantillons sanguins ont été recueillis auprès de huit patients atteints de BPCO et de huit sujets témoins, et cette analyse a été considérée comme une validation préliminaire en raison de la taille limitée de l'échantillon. Comme illustré dans la Figure 6A–F, PTRF, TOR3A et FAM168B étaient significativement sous-régulés, tandis que PRKCDBP et UPP1 étaient significativement sur-régulés dans les échantillons de BPCO, ce qui est conforme aux tendances observées dans l'analyse bioinformatique. En revanche, aucune différence significative n'a été observée pour l'expression de B4GALT2 entre les deux groupes. Cette divergence pourrait être attribuée à la taille limitée de l'échantillon ou à des différences entre les types d'échantillons utilisés dans les jeux de données et les prélèvements cliniques.
DÉCLARATION DE DISPONIBILITÉ DES DONNÉES :
Toutes les données de séquençage de l'ARN ont été obtenues à partir de la base de données Gene Expression Omnibus (GEO, https://www.ncbi.nlm.nih.gov), le jeu de données GSE54837 ayant été sélectionné comme ensemble d'apprentissage et le jeu de données GSE112811 comme ensemble de validation. Le code utilisé dans cette analyse peut être obtenu à partir de https://doi.org/10.5281/zenodo.21771476.

Figure 1 : Identification des gènes communs, analyse d'enrichissement et construction du réseau PPI. (A) Tracé volcanique des gènes différentiellement exprimés (DEGs) dans le jeu de données GSE54837. (B) Sélection du seuil doux. (C) Dendrogramme de regroupement des modules (après fusion). (D) Carte thermique de la corrélation entre les modules et les caractères. (E) Diagramme de Venn pour l'identification des gènes communs. (F) Diagramme en mûrier de l'analyse d'enrichissement GO, montrant les principaux résultats d'enrichissement des gènes d'intersection dans MF, CC et BP. (G) Diagramme en sucette de l'analyse d'enrichissement des voies de signalisation KEGG, la taille des bulles représentant le nombre de gènes enrichis. (H) Réseau PPI des gènes communs ; les nœuds représentent les protéines, et les arêtes représentent les interactions protéine-protéine. Abréviations : DEGs = gènes différentiellement exprimés ; PPI = interaction protéine-protéine ; GO = Ontologie génétique (Gene Ontology) ; MF = fonction moléculaire ; CC = composant cellulaire ; BP = processus biologique ; KEGG = Encyclopédie de Kyoto des gènes et des génomes (Kyoto Encyclopedia of Genes and Genomes) ; ac4C-RGs = gènes liés à la N4-acétylcytidine. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Identification de six gènes clés dans la BPCO. (A) Courbe de validation croisée LASSO. (B) Diagramme du chemin des coefficients de régression LASSO. À mesure que λ augmente, les coefficients des gènes non importants convergent vers 0. (C) Classement de l'importance des caractéristiques selon XGBoost. L'axe des abscisses représente la valeur de gain, l'axe des ordonnées représente le nom du gène, et l'intensité de la couleur représente l'importance. (D) Classement de l'importance des caractéristiques selon RF. L'axe des abscisses représente la diminution moyenne de l'indice de Gini. (E) Diagramme de Venn des gènes communs obtenus par analyse croisée des trois algorithmes. Abréviations : LASSO = opérateur de réduction et de sélection par valeur absolue minimale ; XGBoost = boosting par gradient extrême ; RF = forêt aléatoire. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 3 : Construction d'un modèle diagnostique et analyse d'expression des gènes clés. (A) Courbe ROC du jeu d'apprentissage. (B) Courbe ROC du jeu de test interne. (C) Courbe ROC du jeu de validation externe. (D) Courbe de calibration du jeu d'apprentissage. (E) Analyse de courbe de décision (DCA) du jeu d'apprentissage. (F) Courbe de calibration du jeu de validation externe. (G) Analyse de courbe de décision (DCA) du jeu de validation externe. (H) Nomogramme des six gènes clés. Pour la prédiction du risque individuel de BPCO, chaque gène se voit attribuer un score correspondant. (I) Analyse d'expression des six gènes clés dans les échantillons de BPCO et les échantillons témoins du jeu de données GSE54837. Abréviations : ROC = caractéristique de fonctionnement du récepteur ; AUC = aire sous la courbe ; DCA = analyse de courbe de décision ; BPCO = maladie pulmonaire obstructive chronique. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Réseau régulateur et signification fonctionnelle des gènes clés dans la BPCO. (A) Résultats de l'analyse GeneMANIA pour 6 gènes clés. La couleur des lignes indique la corrélation entre les gènes, et la couleur des nœuds indique différentes catégories fonctionnelles. (B) Diagramme de Venn d'analyse croisée des bases de données DIANA-microT et miRanda. (C) Diagramme de mûrier du réseau régulateur ceRNA. (D) Réseau régulateur potentiel des facteurs de transcription. Les nœuds bleus représentent les facteurs de transcription, et les nœuds oranges représentent les gènes cibles. (E) Analyse d'enrichissement GSEA à gène unique pour UPP1, incluant GO. (F) Analyse d'enrichissement GSEA à gène unique pour UPP1, incluant KEGG. Abréviations : GO = Gene Ontology ; KEGG = Kyoto Encyclopedia of Genes and Genomes. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Infiltration immunitaire des gènes clés et prédiction de cibles médicamenteuses dans la BPCO. (A) Différences d'abondance des cellules immunitaires entre les groupes. (B) Carte thermique de la corrélation entre les cellules immunitaires et les gènes clés. (C) Réseau d'interaction entre les gènes clés et les médicaments prédits. (D) Docking moléculaire de la fluorouracile avec UPP1. (E) Docking moléculaire de la capécitabine avec UPP1. (F) Docking moléculaire du 5-benzylacyclouridine avec UPP1. Pour chaque composé, l'image de gauche montre la conformation globale du docking, et l'image de droite montre les interactions locales de liaison. (G) Analyse CTD de B4GALT2. (H) Analyse CTD de FAM168B. (I) Analyse CTD de PRKCDBP. (J) Analyse CTD de PTRF. (K) Analyse CTD de TOR3A. (L) Analyse CTD de UPP1. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Validation par RT-qPCR de l'expression de gènes clés dans des échantillons de MPOC et des échantillons témoins. (A) Expression relative de PTRF. (B) Expression relative de PRKCDBP. (C) Expression relative de UPP1. (D) Expression relative de TOR3A. (E) Expression relative de FAM168B. (F) Expression relative de B4GALT2. ns = non significatif, p > 0,05 ; * p < 0,05 ; ** p < 0,01 ; *** p < 0,001 ; **** p < 0,0001. Abréviation : RT-qPCR = réaction de transcription inverse suivie d'une amplification quantitative par polymérase en chaîne. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Figure supplémentaire 1 : Échantillons du jeu de données GSE54837 et regroupement en modules géniques. (A) Diagramme de regroupement des échantillons du jeu de données GSE54837. (B) Dendrogramme de regroupement des modules avant fusion. Les gènes ont été regroupés à l'aide de la méthode de coupe dynamique de l'arbre afin d'identifier des modules distincts. (C) Dendrogramme de regroupement hiérarchique des eigengènes des modules. Les modules présentant des profils d'expression similaires ont été regroupés en fonction de la similarité de leurs eigengènes.Veuillez cliquer ici pour télécharger ce fichier.
Figure supplémentaire 2 : Analyse d'enrichissement GSEA. (A) Analyse GO de PRKCDBP. (B) Analyse KEGG de PRKCDBP. (C) Analyse GO de PTRF. (D) Analyse KEGG de PTRF. (E) Analyse GO de TOR3A. (F) Analyse KEGG de TOR3A. (G) Analyse GO de FAM168B. (H) Analyse KEGG de FAM168B. (I) Analyse GO de B4GALT2. (J) Analyse KEGG de B4GALT2. Abréviations : GO = ontologie génétique ; KEGG = Encyclopédie de Kyoto des gènes et des génomes.Veuillez cliquer ici pour télécharger ce fichier.
| Jeu de données | Témoins | Patients | Plateforme de séquençage |
| GSE54837 | 90 | 136 | GPL570 |
| GSE112811 | 44 | 20 | GPL570 |
Tableau 1 : Jeux de données d'expression génique utilisés dans l'étude. Caractéristiques des jeux de données GSE54837 et GSE112811 utilisés respectivement pour le développement du modèle/test interne et la validation externe.
| Patiente | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| Sexe (F/M) | M | M | M | F | M | M | M | M |
| Âge (années) | 69 | 72 | 75 | 73 | 68 | 70 | 69 | 71 |
| Statut tabagique | Oui | Oui | Arrêt du tabac (2 ans) | Non | Oui | Oui | Oui | Arrêt du tabac (5 ans) |
| Paquets-années | 20 par jour / 30 ans | 15 par jour / 35 ans | 20 par jour / 50 ans | | 20 par jour / 40 ans | 30 par jour / 40 ans | 15 par jour / 40 ans | 20 par jour / 30 ans |
| Groupe BPCO | 2 | 3 | 3 | 2 | 2 | 3 | 2 | 3 |
Tableau 2 : Caractéristiques de base des participants à l'étude. Caractéristiques démographiques et cliniques de base des patients BPCO et des témoins sains inclus dans la validation par RT-qPCR.
| Nom moléculaire | Gène | Score (kcal/mol) |
| 5-Benzylacyclouridine | UPP1 | -9.6 |
| Capecitabine | UPP1 | -6.1 |
| Fluorouracile | UPP1 | -5.5 |
Tableau 3 : Résultats de docking moléculaire pour UPP1 et les composés candidats.
Résultats prévus de docking moléculaire concernant l'interaction entre UPP1 et le fluorouracile, la capécitabine et la 5-benzylacyclouridine, incluant leurs affinités de liaison.