$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo utilizou dados clínicos e transcriptômicos públicos e desidentificados do The Cancer Genome Atlas e do Gene Expression Omnibus. Todos os estudos contribuintes tinham aprovação prévia do conselho de revisão institucional e consentimento informado. Como apenas a análise secundária dos dados anonimizados foi realizada, não foi necessária aprovação ética adicional. Os bancos de dados e softwares utilizados estão listados na Tabela de Materiais.
1. Download de dados
A pesquisa utilizou o conjunto de dados EC (TCGA-Uterine Corpus Endometrial Carcinoma (TCGA-UCEC)), que consiste em 589 amostras, incluindo 554 amostras de tecido tumoral de pacientes UCEC (grupo UCEC) e dados de sequenciamento de 35 tecidos normais adjacentes (grupo normal). O banco de dados Xena da UCSC foi utilizado para recuperar os dados clínicoscorrespondentes 11, excluindo aqueles que não possuíam informações clínicas completas. No total, 577 amostras com dados clínicos estavam disponíveis para análise. Informações detalhadas de referência são fornecidas na Tabela 1.
Conjuntos de dados adicionais relacionados ao EC, GSE115810 e GSE6367812 foram baixados usando o pacoteGEOquery 13. O conjunto de dados GSE115810 e GSE63678 foram combinados para criar os Conjuntos de Dados Combinados para análise posterior (Tabela 2).
Genes relacionados ao metabolismo (NMRGs) do NAD+ estão situados após o GeneCardsrecord14 e a literaturarelevante 15. Usando "metabolismo da niacinamida" como termo de busca no GeneCards, identificaram 345 NMRGs com pontuações de relevância acima de 4. A combinação e remoção de duplicados dos 42 NMRGs encontrados na literatura compilou um total de 371 NMRGs (Tabela Suplementar 1). Os dados clínicos foram adquiridos como arquivos fenotípicos em tsv; os dados eram baixados no formato HTSeq-FPKM. Amostras excluídas tinham mais de 20% de seus dados clínicos faltando. O FPKM foi transformadologaritaritar-2 e convertido em TPM (transcrições por milhão). Os IDs das sondas foram mapeados para símbolos gênicos para conjuntos de dados GEO, e sondas duplicadas foram mediadas.
2. Genes diferencialmente expressos do metabolismo da nicotinamida
A pesquisa começou aplicando o conjunto Rsva16 para eliminar posses conjuntas após os conjuntos de dados GSE115810 e GSE63678, resultando em um conjunto mútuo contendo 31 amostras EC (UCEC) e 8 amostras normais adjacentes. Em seguida, a utilização do conjunto limma17 para realizar exame de expressão gênica de discrepância no conjunto de dados TCGA-UCEC.
A interseção dos DEGs da análise TCGA-UCEC com 337 NMRGs para identificar os DEGs conectados ao metabolismo da nicotinamida. Isso produziu uma lista de genes diferencialmente expressos pelo metabolismo da niacinamida (NMRDEGs), que foram ilustrados por uma ilustração de Venn. Os resultados do exame de aparência de discrepância foram ilustrados pelo pacote ggplot2 R18, enquanto um mapa de calor dos NMRDEGs foi gerado usando o conjunto de pheatmap19. A variância entre conjuntos de dados é eliminada por correção em lote usando ComBat (Bayes empírico). O modelo linear empírico de Bayes foi empregado na análise DEG. Limiares de expressão diferenciais aplicados explicitamente:
|log 2FC| ≥ 1
FDR menos de 0,05.
A lista do NMRG só se cruzava com DEGs que atendiam a ambos os requisitos. Plots de vulcões e mapas de calor feitos com ggplot2 e pheatmap.
3. Exame de função dos NMRDEGs (GO), aprimoramento do caminho (KEGG)
Os exames de aprimoramento do GO20 e KEGG21foram concluídos pelo conjunto 22 do clusterProfiler. Para ambas as análises, limiares de significância foram reconhecidos em p. ajustar< 0,05 e FDR (valor q) < 0,25. A pesquisa também integrou os valores logFC na análise de enriquecimento, representando os resultados em diagramas circulares e de cordas. Limiares para significância de enriquecimento: valor p ajustado < 0,05 FDR < 0,25 (valor q). O Cluster Profiler foi utilizado para estudos GO e KEGG. A direcionalidade genética é exibida usando gráficos de corda e círculo que incorporam dados de mudançalogarítmica 2 vezes.
4. Análise de Enriquecimento de Conjuntos Gênicos (GSEA)
O tipo de conjuntos de fatores hereditários que mais contribuíram para o fenótipo pode ser identificado usando GSEA23. Para essa análise, o conjunto de dados TCGA-UCEC foi classificado com base nos valores logFC, e um exame de melhoria foi realizado usando o pacote clusterProfiler . Restrições principais incluíam um valor semente de 2022 e 10.000 permutações. O conjunto genético MSigDB "c2.all.v2022.1.Hs.symbols.gmt" foi utilizadoem 24. As vias mais enriquecidas, incluindo genes induzidos por hipóxia de Manalo, senescência induzida por estresse oxidativo, glicólise e apoptose, foram visualizadas usando um gráfico de montanha. Antes do GSEA, os genes eram ordenados por log2 vezes de variação. 10.000 permutações foram usadas na análise. c2.all.v2022.1.Hs.symbols.gmt é a coleção do MSigDB que foi utilizada. Para reprodutibilidade, uma semente aleatória fixa (2022) foi empregada. Caminhos significativos foram aqueles com p < 0,05 e q < 0,25.
5. Construção do modelo Cox e exame prognóstico relacionado
Para determinar o valor preditivo dos genes diferencialmente expressos ligados ao metabolismo da nicotinamida (NMRDEGs) no carcinoma endometrial (UCEC), os pesquisadores utilizaram a análise de regressão de Cox univariada para primeiro classificar os fatores hereditários dos candidatos; aqueles com proporção de perigo (HR) > 1 e < de valor p de 0,1 foram considerados adequados para o quadro multivariado de riscos relativos de Cox.
Critérios para seleção univariada de Cox: p < 0,10 e HR > 1. Valores de expressãonormalizados com 2-TPM foram empregados no modelo multivariado de Cox. Uma combinação linear de coeficientes de Cox × expressão gênica é usada para determinar a pontuação de risco. Probabilidades de OS de 1, 3 e 5 anos foram empregadas na calibração de nomogramas. Valores de AUC de 1, 3 e 5 anos foram empregados em ROC dependente do tempo. A abordagem surv_cutpoint max-statistic foi usada para encontrar valores de corte de sobrevivência. Tanto as análises KM quanto as ROC usaram os mesmos limiares.
Um nomografo foi construído a partir do modelo multivariado de Cox para avaliar sua precisão ou capacidade preditiva e calcular as chances de existência total de 1, 3 e 5 anos. Arcos de padronização são empregados para avaliar a estabilidade entre os futuros resultados e os resultados reais, e a análise da curva de decisão (DCA) foi utilizada para medir a eficacia médica daestrutura 25.
Os níveis de expressão de mRNA foram determinados como valores normalizados de registros por milhão (TPM) transformados em log₂ por meio do pacote DESeq2. As TPMs levaram em conta a complexidade do sequenciamento e a medição de genes para fornecer estimativas robustas e não tendenciosas dos níveis de expressão entre amostras.
Usando os coeficientes do modelo Cox multivariado, a avaliação prognóstica de risco de cada paciente foi determinada da seguinte forma:
riskScore = Σi Coeficiente (genei) *Expressão de mRNA (genei) (1)
Arcos de existência Kaplan-Meier (KM) foram preparados para avaliar a resistência geral de agrupamentos de alto e baixo risco criados com base em determinadas classificações de risco. Arcos de características operacionais dependentes do tempo do receptor (ROC) foram produzidos na avaliação da rotina de estruturas em períodos de 1, 3 e 5anos 26,27.
Para categorizar a expressão gênica por coleções de alta e baixa expressão para estratificação de sobrevivência, utiliza-se a utilização do papel de ponto surv_cut após o pacote R do survminer. Essa função determina o maior valor de corte maximizando a estatística padronizada de classificação logarítmica, fornecendo um ponto de corte imparcial e estatisticamente ótimo.
Os valores de corte obtidos para cada gene prognóstico são indicados nas curvas ROC como linhas tracejadas. A pesquisa aplicou os mesmos limiares para todas as análises de sobrevivência e ROC.
O RCGA RNA-SEQ foi baixado no formato HTSeq-FPKM; os dados clínicos eram importados como arquivos de fenótipo TSV; O FPKM foi convertido para TPM e transformado em log₂; Conjuntos de dados GEO foram mapeados de IDs de sonda para símbolos de genes usando anotações de plataforma; sondas duplicadas foram médias para um único valor do gene; Amostras com mais de 20% de informação clínica ausente foram excluídas; ComBat (Bayes empírico) foi usado para correção em lote para conjuntos de dados GSE; PCA e boxplots foram usados para verificar se a correção por lote foi bem-sucedida. Normalização de TPM usando técnicas padrão de transformação de expressões; correção por lote usando ComBat com origem do conjunto de dados como variável por lote; expressão diferencial calculada usando modelagem linear limma (matriz de desenho tumoral vs. normal); listas geneais ranqueadas geradas a partir de alterações de fold log₂ para entrada GSEA; e regressões de Cox univariadas e multivariadas realizadas usando ferramentas de análise de sobrevivência
6. Análise de variação de conjuntos gênicos (GSVA)
OGSVA 28 foi utilizado para medir o aumento de processos entre os clusters. No conjunto de dados TCGA-UCEC, 50 vias características foram enriquecidas, com 41 apresentando alterações importantes entre as assembleias binárias. O GSVA foi usado com conjuntos genéticos característicos para obter atividade de vias por amostra; Dados de interação com proteínas STRING foram importados para o Cytoscape; o algoritmo MCC foi usado para identificar genes hub; as pontuações de risco foram calculadas como a soma dos valores de expressão gênica multiplicada por seus coeficientes de Cox; curvas ROC dependentes do tempo foram geradas usando rotinas ROC de tempo de sobrevivência. Para cada amostra, a GSVA calculou as pontuações de enriquecimento em nível de caminho. O teste de soma de ranks de Wilcoxon é usado para avaliar diferenças na atividade do caminho característico. Dos cinquenta caminhos de assinatura, quarenta e um foram significativamente diferentes (p ajustado < 0,05).
7. Sistema de interação proteína-proteína (PPI)
Um sistema PPI contendo os genes importantes (AURKA, CDKN3, FOXM1, CDKN2A, TK1 e CDK1) foi criado usando o arquivoSTRING 29 e um limiar de valor de comunicação de 0,70, indicando alta confiança. Essa rede foi criada usando o Cytoscape30, destacando interações que podem desempenhar papéis cruciais na patogênese do UCEC. O método31 da Centralidade Máxima da Clique (MCC) foi útil para classificar o fator hereditário criado nas pontuações de interação deles na rede. A sequência proteica superior 10 com as pontuações de interface mais altas foi reconhecida, incluindo CDK2, CDK4, CCNA2, CCNB1, CCNE1, CDK1, TP53 e FOXM1. Esses genes foram posteriormente analisados quanto ao seu envolvimento em processos biológicos críticos. A plataformaGeneMANIA 32 também foi usada para prever interações proteicas adicionais e fornecer um contexto mais amplo para os papéis dos genes-chave na progressão do UCEC. Limiar para a pontuação de confiança STRING: >0,70 (alta confiança). O Cytoscape exibe a rede. A técnica de Centralidade Máxima da Clique (MCC) é usada para classificar genes centrais. A classificação MCC foi usada para identificar os genes que mais interagem (CDK2, CCNA2, TP53, etc.). Previsões adicionais de interação são feitas usando o GeneMANIA.
8. Roteiro tecnológico
O fluxo de trabalho geral e os métodos empregados neste estudo são resumidos no roteiro tecnológico exibido na Figura 1. Este roteiro descreve os passos desde a aquisição de conjuntos de dados e análise de expressões diferenciais até a construção de modelos prognósticos e análises de enriquecimento.
9. Análise estatística
O processamento de dados e a estimativa estatística foram realizados usando o programa R (v4.3.0). O teste Mann-Whitney U ou teste t do Estudante Independente foi usado para comparações em dois grupos; o teste de Kruskal-Wallis foi empregado para três ou mais montagens. Os dados descritivos foram avaliados usando qui-quadrado ou teste exato de Fisher. Além disso, foram realizadas análises de correlação de Spearman e de sobrevivência de Kaplan-Meier; p < 0,05 foi considerado significativo.
Aplicação de testes estatísticos de acordo com a distribuição de dados: Dados normais usando o teste t do aluno. Teste Mann-Whitney U para dados que não são normais. Kruskal-Wallis testam para mais de três grupos. Exato de Fisher e qui-quadrado para dados categóricos. A significância estatística é definida como p < 0,05.
A confiabilidade dos dados é mantida pelos checkpoints de pré-tratamento, onde os boxplots devem mostrar variância consistente de expressão entre amostras, e os gráficos PCA devem demonstrar a ausência de clusters específicos de lote após o ajuste ComBat. Mapas de calor que demonstrem agrupamento tumor-normal e gráficos vulcânicos que ilustram claramente a regulação genética para cima e para baixo são necessários para validação da DEG. Para o modelo de projeção de Cox, os gráficos de calibração devem corresponder à sobrevivência prevista e real, os valores de AUC do ROC devem ser maiores que 0,65, e os arcos KM devem mostrar uma diferença substancial de sobrevivência. Diferentes atividades de rotas entre grupos de risco devem ser demonstradas por análise GSVA, em linha com mecanismos estabelecidos como rotas de expansão ou ciclo celular. Para verificar a resiliência da rede, nós altamente acoplados na rede PPI devem aparecer centralmente, e genes hub determinados pelo MCC devem corresponder a reguladores fisiologicamente significativos.