$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Cette étude utilisait des données cliniques et transcriptomiques publiques, dé-identifiées, provenant de The Cancer Genome Atlas et de l’Omnibus sur l’expression génique. Toutes les études contributrices bénéficiaient d’une approbation préalable du comité d’examen institutionnel et d’un consentement éclairé. Comme seule une analyse secondaire des données anonymisées a été effectuée, aucune approbation éthique supplémentaire n’a été requise. Les bases de données et logiciels utilisés sont listés dans le tableau des matériaux.
1. Téléchargement de données
La recherche a utilisé l’ensemble de données EC (TCGA-Carcinome endométrial du corps utérin (TCGA-UCEC)), qui comprend 589 échantillons, dont 554 échantillons de tissus tumoraux provenant de patients UCEC (groupe UCEC) et des données de séquençage provenant de 35 tissus normaux adjacents (groupe normal). La base de données Xena de l’UCSC a été utilisée pour récupérer les données cliniquescorrespondantes 11, à l’exclusion de celles dépourvues d’informations cliniques complètes. Au total, 577 échantillons avec des données cliniques étaient disponibles pour analyse. Des informations de référence détaillées sont fournies dans le tableau 1.
D’autres ensembles de données liés à EC, GSE115810 et GSE6367812 ont été téléchargés via le paquetGEOquery 13. Le GSE115810 ensemble de données et GSE63678 ont été fusionnés pour créer les ensembles de données combinés pour une analyse approfondie (Tableau 2).
Les gènes liés au métabolisme (NMRG) du NAD+ se situent après le GeneCardsrecord14 et la littératurepertinente 15. En utilisant « Niacinamide metabolism » comme terme de recherche dans GeneCards, 345 NMRG ont été identifiés avec des scores de pertinence supérieurs à 4. La combinaison et la suppression des doublons des 42 NMRG trouvés dans la littérature ont compilé un total de 371 NMRG (Tableau Supplémentaire 1). Les données cliniques ont été obtenues sous forme de fichiers phénotypiques tsv ; les données étaient téléchargées au format HTSeq-FPKM. Les échantillons exclus avaient plus de 20 % de leurs données cliniques manquantes. FPKM a été transformé enlogarithmithmide 2 et converti en TPM (transcriptions par million). Les identifiants des sondes ont été mappés sur des symboles de gènes pour les ensembles de données GEO, et les sondes dupliquées ont été moyennées.
2. Gènes différenciés du métabolisme de la nicotinamide
La recherche a commencé par l’application de l’ensembleR sva16 pour éliminer les possessions de l’ensemble après les jeux de données GSE115810 et GSE63678, aboutissant à un ensemble mutuel contenant 31 échantillons EC (UCEC) et 8 échantillons normaux adjacents. Ensuite, l’utilisation de l’ensembleLimma 17 pour effectuer un examen de l’expression génique des divergences sur le jeu de données TCGA-UCEC.
L’intersection des DEG issues de l’analyse TCGA-UCEC avec 337 NMRG permet de localiser précisément les DEG liés au métabolisme de la nicotinamide. Cela a produit une liste de gènes différemment exprimés par le métabolisme de la niacinamide (NMRDEG), qui ont été illustrés par une illustration de Venn. Les résultats de l’examen d’apparence des divergences ont été illustrés par le package ggplot2 R18, tandis qu’une carte thermique des NMRDEG a été générée à l’aide de l’ensemble pheatmap19. La variance entre ensembles de données est éliminée par correction par lots à l’aide de ComBat (Bayes empirique). Le cadre linéaire empirique de Bayes de la limme a été utilisé dans l’analyse DEG. Seuils d’expression différentiels appliqués explicitement :
|log2FC| ≥ 1
FDR moins de 0,05.
La liste NMRG ne croisait que les DEG qui répondaient aux deux critères. Des graphiques de volcans et des cartes thermiques réalisées avec ggplot2 et pheatmap.
3. Fonction des NMRDEG (GO), examen d’amélioration des voies (KEGG)
Les examens d’amélioration GO20 et KEGG21ont été réalisés par l’ensembleclusterProfiler 22. Pour les deux analyses, des seuils de signification ont été identifiés à p. ajuster< 0,05 et FDR (valeur q) < 0,25. La recherche a également intégré les valeurs logFC dans l’analyse d’enrichissement, représentant les résultats dans des diagrammes circulaires et de cordes. Seuils de signification d’enrichissement : valeur p ajustée < 0,05 FDR < 0,25 (valeur q). Le profileur de cluster a été utilisé pour les études GO et KEGG. La directionnalité génétique est affichée à l’aide de diagrammes de cordes et de cercles qui intègrent des données de variationlogaritmique 2 fois.
4. Analyse d’enrichissement des ensembles de gènes (GSEA)
Le type d’ensembles de facteurs héréditaires qui ont le plus contribué au phénotype peut être identifié à l’aide de GSEA23. Pour cette analyse, l’ensemble de données TCGA-UCEC a été classé en fonction des valeurs logFC, et un examen d’amélioration a été réalisé à l’aide du package clusterProfiler . Les restrictions clés comprenaient une valeur de départ de 2022 et 10 000 permutations. L’ensemble de gènes MSigDB « c2.all.v2022.1.Hs.symbols.gmt » a été utilisé24. Les voies les plus enrichies, incluant les gènes induits par l’hypoxie de Manalo, la sénescence induite par le stress oxydatif, la glycolyse et l’apoptose, ont été visualisées à l’aide d’un graphique de montagne. Avant GSEA, les gènes étaient ordonnés par changementde log 2 multipliés. 10 000 permutations étaient utilisées dans l’analyse. c2.all.v2022.1.Hs.symbols.gmt est la collection MSigDB utilisée. Pour la reproductibilité, une graine aléatoire fixe (2022) a été employée. Les parcours significatifs étaient ceux avec p < 0,05 et q < 0,25.
5. Construction du modèle Cox et examen pronostic associé
Pour déterminer la valeur prédictive des gènes différentiels-exprimés liés au métabolisme de la nicotinamide (NMRDEG) dans le carcinome endométrial (UCEC), les chercheurs ont utilisé l’analyse de régression de Cox univariée pour classer d’abord les facteurs héréditaires des candidats ; ceux présentant une proportion de danger (HR) > 1 et une valeur p < 0,1 ont été jugés appropriés au cadre des risques relatifs multivariés de Cox.
Critères pour la sélection univariée de Cox : p < 0,10 et HR > 1. Des valeurs d’expressionnormalisées à 2 TPM ont été utilisées dans le modèle multivarié de Cox. Une combinaison linéaire des coefficients de Cox ×'expression génique est utilisée pour déterminer le score de risque. Des probabilités OSO sur 1, 3 et 5 ans ont été employées lors de l’étalonnage par nomogramme. Les valeurs d’AUC sur 1, 3 et 5 ans ont été employées dans les ROC dépendantes du temps. L’approche surv_cutpoint statistique maximale a été utilisée pour trouver les valeurs de seuil de survie. Les analyses KM et ROC utilisaient les mêmes seuils.
Un nomographe a été construit à partir du modèle multivarié de Cox pour évaluer sa précision ou sa capacité prédictive et pour calculer les chances d’existence totale sur 1, 3 et 5 ans. Des arcs de normalisation sont utilisés pour évaluer la stabilité entre les perspectives prévues et les effets réels, et l’analyse de la courbe de décision (DCA) a été utilisée pour mesurer l’efficacité médicale de lastructure 25.
Les niveaux d’expression de l’ARNm ont été déterminés sous forme de valeurs normalisées de log₂ transformées par enregistrement par million (TPM) au moyen du package DESeq2. Les TPM prenaient en compte la complexité du séquençage et la mesure des gènes afin de fournir des estimations robustes et non biaisées des niveaux d’expression entre échantillons.
En utilisant les coefficients du modèle Cox multivarié, l’évaluation pronostique de chaque patient a été déterminée comme suit :
riskScore = Σi Coefficient (gènei) *Expression d’ARNm (gènei) (1)
Des arcs d’existence de Kaplan-Meier (KM) ont été préparés pour évaluer l’endurance générale des groupes de haut et faible risque créés sur des évaluations de danger déterminées. Des arcs de caractéristiques de fonctionnement du récepteur (ROC) dépendantes du temps ont été réalisés pour évaluer la routine des systèmes aux périodes de 1, 3 et 5 ans26,27.
Pour catégoriser l’expression génique par collections à haute et faible expression pour la stratification de survie, l’utilisation du rôle de point surv_cut après le package R de survminer est utilisée. Cette fonction détermine la plus grande valeur de coupure en maximisant la statistique standardisée de rang logarithmique, fournissant un point de coupure optimal et non biaisé.
Les valeurs de seuil obtenues pour chaque gène pronostique sont indiquées dans les courbes ROC sous forme de pointillés. La recherche a appliqué les mêmes seuils pour toutes les analyses de survie et ROC.
TCGA RNA-seq a été téléchargé au format HTSeq-FPKM ; les données cliniques étaient importées sous forme de fichiers de phénotype TSV ; FPKM a été converti en TPM et transformé en log₂ ; Les ensembles de données GEO ont été mappés à partir des identifiants de sonde vers des symboles de gènes à l’aide d’annotations de plateforme ; les sondes dupliquées ont été moyennées pour une seule valeur de gène ; des échantillons avec plus de 20 % d’informations cliniques manquantes ont été exclus ; ComBat (Bayes empirique) était utilisé pour la correction par lots des ensembles de données GSE ; L’ACP et les boxplots ont été utilisés pour vérifier que la correction par lots était réussie. normalisation TPM en utilisant des techniques standard de transformation d’expression ; correction de lot en utilisant ComBat avec l’origine du jeu de données comme variable de lot ; expression différentielle calculée à l’aide de la modélisation linéaire Limma (matrice de conception tumeur vs. normale) ; listes de gènes classées générées à partir des changements de pliage log₂ pour l’entrée GSEA ; et des régressions de Cox univariées et multivariées réalisées à l’aide d’outils d’analyse de la survie
6. Analyse des variations de l’ensemble génétique (GSVA)
Le GSVA28 a été utilisé pour mesurer la croissance des clusters. Dans l’ensemble de données TCGA-UCEC, 50 voies caractéristiques ont été enrichies, dont 41 ont montré d’importantes modifications parmi les assemblages binaires. Le GSVA a été utilisé avec des ensembles de gènes caractéristiques pour obtenir l’activité des voies par échantillon ; Les données d’interaction protéique STRING ont été importées dans Cytoscape ; l’algorithme MCC a été utilisé pour identifier les gènes hubs ; les scores de risque étaient calculés comme la somme des valeurs d’expression génique multipliées par leurs coefficients de Cox ; des courbes ROC dépendantes du temps étaient générées à l’aide de routines ROC à durée de survie. Pour chaque échantillon, la GSVA a calculé les scores d’enrichissement au niveau des voies. Le test Wilcoxon de somme de rangs est utilisé pour évaluer les différences dans l’activité des voies caractéristiques. Sur les cinquante voies signatures, quarante-et-une étaient significativement différentes (ajusté p < 0,05).
7. Système d’interaction protéine-protéine (IPP)
Un système PPI contenant les gènes importants (AURKA, CDKN3, FOXM1, CDKN2A, TK1 et CDK1) a été créé en utilisant le fichierSTRING 29 et un seuil de valeur de communication de 0,70, indiquant une confiance élevée. Ce réseau a été créé à l’aide de Cytoscape30, mettant en lumière des interactions pouvant jouer un rôle crucial dans la pathogenèse de l’UCEC. La méthode31 de centralité maximale de clique (MCC) était utile pour classer le facteur héréditaire créé sur leurs scores de communication dans le net. La séquence protéique des 10 supérieures avec les scores d’interface les plus élevés a été reconnue, incluant CDK2, CDK4, CCNA2, CCNB1, CCNE1, CDK1, TP53 et FOXM1. Ces gènes ont été analysés davantage pour leur implication dans des processus biologiques critiques. La plateformeGeneMANIA 32 a également été utilisée pour prédire d’autres interactions protéiques et fournir un contexte plus large sur les rôles clés de ces gènes dans la progression de l’UCEC. Seuil pour le score de confiance STRING : >0,70 (haute confiance). Cytoscape affiche le réseau. La technique de centralité maximale de clique (MCC) est utilisée pour classer les gènes hub. Le classement MCC a été utilisé pour identifier les gènes interactifs les plus importants (CDK2, CCNA2, TP53, etc.). Des prédictions d’interaction supplémentaires sont réalisées à l’aide de GeneMANIA.
8. Feuille de route technologique
Le flux de travail global et les méthodes utilisés dans cette étude sont résumés dans la feuille de route technologique présentée à la Figure 1. Cette feuille de route décrit les étapes allant de l’acquisition de jeux de données et de l’analyse différentielle des expressions à la construction de modèles pronostiques et d’analyses d’enrichissement.
9. Analyse statistique
Le traitement des données et l’estimation statistique étaient effectués à l’aide du programme R (v4.3.0). Le test Mann-Whitney U ou test t de l’étudiant indépendant était utilisé pour des comparaisons en deux groupes ; le test de Kruskal-Wallis a été utilisé pour trois assemblages ou plus. Les données descriptives ont été évaluées à l’aide du chi-carré ou du test exact de Fisher. De plus, une corrélation de Spearman et une analyse de survie de Kaplan-Meier ont été réalisées ; p < 0,05 était considéré comme significatif.
Application des tests statistiques selon la distribution des données : données normales utilisant le test t de l’élève. Test Mann-Whitney U pour des données qui ne sont pas normales. Kruskal-Wallis testent pour plus de trois groupes. L’exact de Fisher et le chi-carré pour les données catégorielles. La signification statistique est définie comme p < 0,05.
La fiabilité des données est maintenue par les points de contrôle de prétraitement, où les diagrammes de boîte doivent montrer une variance d’expression cohérente entre les échantillons, et les graphiques PCA doivent démontrer l’absence de clusters spécifiques à chaque lot après ajustement ComBat. Des cartes thermiques qui montrent le groupement tumoral-normal et des graphiques volcaniques illustrant clairement la régulation génétique sont nécessaires pour la validation de la DEG. Pour le modèle de Cox de projection, les graphiques d’étalonnage doivent correspondre à la survie prédite et réelle, les valeurs AUC du ROC doivent être supérieures à 0,65, et les arcs KM doivent montrer une différence de survie substantielle. Les différentes activités de routes entre groupes de risque devraient être démontrées par l’analyse GSVA, conformément aux mécanismes établis comme l’expansion ou les routes à cycle cellulaire. Pour vérifier la résilience du réseau, les nœuds fortement couplés du réseau PPI doivent apparaître centralement, et les gènes centrals déterminés par MCC doivent correspondre à des régulateurs physiologiquement significatifs.