$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio utilizó datos clínicos y transcriptómicos desidentificados y disponibles públicamente del Atlas del Genoma del Cáncer y del Ómnibus de Expresión Génica. Todos los estudios contribuyentes contaron con la aprobación previa del comité de revisión institucional y el consentimiento informado. Como solo se realizó un análisis secundario de datos anonimizados, no se requirió una aprobación ética adicional. Las bases de datos y el software utilizados se enumeran en la Tabla de Materiales.
1. Descarga de datos
La investigación utilizó el conjunto de datos EC (TCGA-Uterine Corpus Endometrial Carcinoma (TCGA-UCEC)), que consta de 589 muestras, incluyendo 554 muestras de tejido tumoral de pacientes UCEC (grupo UCEC) y datos de secuenciación de 35 tejidos normales adyacentes (grupo normal). Se utilizó la base de datos Xena de UCSC para recuperar los datos clínicoscorrespondientes 11, excluyendo aquellos que carecían de información clínica completa. En total, se disponían de 577 muestras con datos clínicos para su análisis. La información de referencia detallada se proporciona en la Tabla 1.
Se descargaron conjuntos de datos adicionales relacionados con EC, GSE115810 y GSE6367812 utilizando el paquete13 de GEOquery. El conjunto de datos GSE115810 y GSE63678 se fusionaron para crear los Conjuntos de Datos Combinados para un análisis posterior (Tabla 2).
Los genes relacionados con el metabolismo (NMRG) de NAD+ están situados después del GeneCardrecord14 y la literaturarelevante 15. Usando "metabolismo de la niacinamida" como término de búsqueda en GeneCards, identificamos 345 NMRGs con puntuaciones de relevancia superiores a 4. Combinando y eliminando duplicados de los 42 NMRGs encontrados en la literatura, se compiló un total de 371 NMRGs (Tabla Suplementaria 1). Se adquirieron datos clínicos como archivos fenotípicos de TSV; los datos se descargaron en formato HTSeq-FPKM. Las muestras excluidas tenían más del 20% de sus datos clínicos faltantes. FPKM fue transformadologaritmicamente 2 y convertido a TPM (transcripciones por millón). Los identificadores de las sondas se asignaron a símbolos génicos para conjuntos de datos GEO, y se promediaron las sondas duplicadas.
2. Genes diferencialmente expresados del metabolismo de la nicotinamida
La investigación comenzó aplicando el conjunto Rsva16 para eliminar las posesiones del conjunto tras los conjuntos de datos GSE115810 y GSE63678, resultando en un conjunto de datos mutuo que contiene 31 muestras EC (UCEC) y 8 muestras normales adyacentes. A continuación, se utilizó el conjunto Limma17 para realizar un examen de expresión génica de discrepancia en el conjunto de datos TCGA-UCEC.
La intersección de DEGs del análisis TCGA-UCEC con 337 NMRG para localizar los DEGs relacionados con el metabolismo de la nicotinamida. Esto produjo una lista de genes diferencialmente expresados por el metabolismo de la niacinamida (NMRDEGs), que se mostraron en una ilustración de Venn. Los resultados del examen de apariencia de discrepancias se ilustraron con el paquete ggplot2 R18, mientras que se generó un mapa de calor de los NMRDEG usando el conjunto de mapas de pheatmap19. La varianza entre conjuntos de datos se elimina mediante corrección por lotes usando ComBat (Bayes empírico). El marco empírico del modelo lineal bayesiano limma se empleó en el análisis DEG. Umbrales de expresión diferenciales aplicados explícitamente:
|log 2FC| ≥ 1
FDR menos de 0,05.
La lista NMRG solo se cruzaba con DEGs que cumplían ambos requisitos. Gráficos de volcanes y mapas de calor hechos con ggplot2 y pheatmap.
3. Función de NMRDEGs (GO), examen de mejora de vía (KEGG)
Los análisis de mejoraGO 20 y KEGG21se completaron con el conjunto 22 de clusterProfiler. Para ambos análisis, se reconocieron umbrales de significancia en p. ajustar< 0,05 y FDR (valor q) < 0,25. La investigación también integró los valores de logFC en el análisis de enriquecimiento, representando los resultados en diagramas circulares y de acordes. Umbrales para la significación del enriquecimiento: valor p ajustado < 0,05 FDR < 0,25 (valor q). Cluster Profiler se utilizó para estudios GO y KEGG. La direccionalidad génica se muestra mediante diagramas de cuerdas y círculos que incorporan datos de cambiologarítmico de 2 veces.
4. Análisis de Enriquecimiento de Conjuntos Génicos (GSEA)
El tipo de conjuntos de factores heredables que más contribuyeron al fenotipo puede identificarse usando GSEA23. Para este análisis, el conjunto de datos TCGA-UCEC se clasificó en función de los valores logFC, y se realizó un examen de mejora utilizando el paquete clusterProfer. Las restricciones clave incluían un valor semilla de 2022 y 10.000 permutaciones. El conjunto de genes MSigDB "c2.all.v2022.1.Hs.symbols.gmt" seempleó en 24. Las vías más enriquecidas, incluyendo genes inducidos por hipoxia de Manalo, senescencia inducida por estrés oxidativo, glucólisis y vías de apoptosis, se visualizaron utilizando un gráfico de montaña. Antes de GSEA, los genes se ordenaban por un cambiolog de 2 veces. Se usaron 10.000 permutaciones en el análisis. C2.all.v2022.1.Hs.symbols.gmt es la colección de MSigDB que se utilizó. Para la reproducibilidad, se empleó una semilla aleatoria fija (2022). Las vías significativas fueron las con p < 0,05 y q < 0,25.
5. Construcción del modelo de Cox y examen pronóstico relacionado
Para determinar el valor predictivo de los genes diferencialmente expresados por metabolismo vinculados al nicotinamida (NMRDEGs) en el carcinoma endometrial (UCEC), los investigadores utilizaron el análisis de regresión de Cox univariante para clasificar primero los factores hereditarios de los candidatos; se determinó que aquellos con una proporción de peligro (HR) > 1 y un valor p < 0,1 eran apropiados para el marco multivariante de riesgos relativos de Cox.
Criterios para la selección univariante de Cox: p < 0,10 y HR > 1. Valores de expresiónnormalizados 2-TPM se emplearon en el modelo multivariante de Cox. Se utiliza una combinación lineal de coeficientes de Cox × expresión génica para determinar la puntuación de riesgo. Se emplearon probabilidades de OS a 1, 3 y 5 años en la calibración de nomogramas. Se emplearon valores de AUC a 1, 3 y 5 años en ROC dependiente del tiempo. Se utilizó el enfoque de estadística máxima surv_cutpoint para encontrar valores de corte de supervivencia. Tanto los análisis de KM como los ROC utilizaron los mismos umbrales.
Se construyó un nomògrafo a partir del modelo multivariante de Cox para evaluar su precisión o capacidad predictiva y calcular las probabilidades de existencia total de 1, 3 y 5 años. Se emplean arcos de estandarización para evaluar la estabilidad entre las perspectivas proyectadas y los resultados reales, y se empleó análisis de la curva de decisión (DCA) para medir la eficacia médica delsistema 25.
Los niveles de expresión de ARNm se determinaron como valores normalizados de registros por millón (TPM) transformados en log₂ mediante el paquete DESeq2. Las MTP tuvieron en cuenta la complejidad de la secuenciación y la medición génica para proporcionar estimaciones robustas y sesgadas de los niveles de expresión entre muestras.
Utilizando los coeficientes del modelo multivariante de Cox, la valoración pronóstica de riesgo de cada paciente se determinó de la siguiente manera:
riskScore = Σi Coeficiente (geni) *Expresión de ARNm (geni) (1)
Se prepararon arcos de existencia Kaplan-Meier (KM) para evaluar la resistencia general de grupos de alto y bajo riesgo creados sobre determinaciones de peligro. Se produjeron arcos de características de funcionamiento del receptor dependientes del tiempo (ROC) al evaluar la rutina de sistemas en periodos de 1, 3 y 5 años26,27.
Para categorizar la expresión génica por colecciones de alta y baja expresión para la estratificación de supervivencia, se utiliza el papel de punto surv_cut después del paquete R de Survminer. Esta función determina el valor de corte máximo maximizando la estadística logarítmica estandarizada, proporcionando un punto de corte estadísticamente óptimo y sesgado.
Los valores de corte obtenidos para cada gen pronóstico se indican en las curvas ROC como líneas discontinuas. La investigación aplicó los mismos umbrales para todos los análisis de supervivencia y ROC.
TCGA RNA-seq se descargó en formato HTSeq-FPKM; los datos clínicos se importaban como archivos de fenotipos TSV; FPKM se convirtió a TPM y se transformó en log₂; Los conjuntos de datos GEO se mapearon desde los identificadores de las sondas a los símbolos génicos usando anotaciones de plataforma; las sondas duplicadas se promediaron para un solo valor génico; Se excluyeron muestras con más del 20% de información clínica faltante; ComBat (Bayes empírico) se utilizó para la corrección por lotes de conjuntos de datos GSE; Se utilizaron PCA y diagramas de caja para verificar que la corrección por lotes fue exitosa. Normalización de TPM utilizando técnicas estándar de transformación de expresiones; corrección por lotes usando ComBat con el origen del conjunto de datos como variable por lotes; expresión diferencial calculada mediante modelado lineal limma (matriz de diseño tumoral vs. normal); listas genéticas clasificadas generadas a partir de cambios de pliegue log₂ para la entrada GSEA; y regresiones de Cox univariantes y multivariantes realizadas mediante herramientas de análisis de supervivencia
6. Análisis de variación de conjuntos génicos (GSVA)
Se empleóGSVA 28 para medir el desarrollo de la mejora entre los cúmulos. En el conjunto de datos TCGA-UCEC, se enriquecieron 50 rutas distintivas, con 41 que mostraron alteraciones importantes entre los ensamblajes binarios. El GSVA se utilizó junto con conjuntos génicos característicos para obtener la actividad de las vías por muestra; Los datos de interacción con proteínas STRING se importaron a Cytoscape; se utilizó el algoritmo MCC para identificar genes hub; las puntuaciones de riesgo se calcularon como la suma de los valores de expresión génica multiplicada por sus coeficientes de Cox; las curvas ROC dependientes del tiempo se generaban usando rutinas ROC de tiempo de supervivencia. Para cada muestra, GSVA calculó las puntuaciones de enriquecimiento a nivel de vía. La prueba de suma de rangos de Wilcoxon se utiliza para evaluar diferencias en la actividad de las vías características. De las cincuenta vías de firma, cuarenta y una fueron significativamente diferentes (ajustado p < 0,05).
7. Sistema de interacción proteína-proteína (PPI)
Se ha creado un sistema PPI que contiene los genes importantes (AURKA, CDKN3, FOXM1, CDKN2A, TK1 y CDK1) utilizando el archivoSTRING 29 y un umbral de valor de comunicación de 0,70, lo que indica alta confianza. Esta red ha sido creada utilizando Cytoscape30, destacando interacciones que pueden desempeñar un papel crucial en la patogénesis de UCEC. El método31 de Centralidad Máxima de Clique (MCC) fue útil para clasificar el factor heredable creado en sus puntuaciones de interacción dentro de la red. Se reconoció la secuencia proteica de las 10 superiores con las puntuaciones de interfaz más altas, incluyendo CDK2, CDK4, CCNA2, CCNB1, CCNE1, CDK1, TP53 y FOXM1. Estos genes fueron analizados posteriormente para determinar su implicación en procesos biológicos críticos. La plataformaGeneMANIA 32 también se utilizó para predecir interacciones proteicas adicionales y proporcionar un contexto más amplio sobre los roles clave de estos genes en la progresión de UCEC. Umbral para la puntuación de confianza STRING: >0,70 (alta confianza). Cytoscape muestra la red. La técnica de Centralidad Maximal de Clique (MCC) se utiliza para clasificar genes centrales. La clasificación MCC se utilizó para identificar los genes que interactuan más (CDK2, CCNA2, TP53, etc.). Se realizan predicciones adicionales de interacción utilizando GeneMANIA.
8. Hoja de ruta tecnológica
El flujo de trabajo general y los métodos empleados en este estudio se resumen en la hoja de ruta tecnológica que se muestra en la Figura 1. Esta hoja de ruta describe los pasos desde la adquisición de conjuntos de datos y el análisis de expresiones diferenciales hasta la construcción de modelos pronósticos y análisis de enriquecimiento.
9. Análisis estadístico
El procesamiento de datos y la estimación estadística se realizaron utilizando el programa R (v4.3.0). Se utilizó la prueba Mann-Whitney U o prueba t de Estudiante Independiente para comparaciones de dos grupos; la prueba de Kruskal-Wallis se ha empleado para tres o más ensamblajes. Los datos descriptivos se evaluaron utilizando el qui-cuadrado o la prueba exacta de Fisher. Además, se realizaron análisis de correlación de Spearman y de supervivencia de Kaplan-Meier; P < 0,05 se consideró significativo.
Aplicación de pruebas estadísticas según la distribución de datos: datos normales usando el test t del estudiante. Prueba Mann-Whitney U para datos que no son normales. Kruskal-Wallis examina para más de tres grupos. Fisher exacto y chi-cuadrado para datos categóricos. La significación estadística se define como p < 0,05.
La fiabilidad de los datos se mantiene mediante los puntos de control previos al tratamiento, donde los diagramas de caja deben mostrar una varianza de expresión consistente entre muestras, y los gráficos PCA deben demostrar la ausencia de agrupaciones específicas de lotes tras el ajuste ComBat. Para la validación de DEG son necesarios mapas de calor que demuestren agrupaciones tumorales normales y gráficos volcánicos que ilustren claramente la regulación alza/baja de los genes. Para el modelo de Cox de proyección, los gráficos de calibración deben coincidir con la supervivencia predicha y real, los valores de AUC del ROC deben ser superiores a 0,65 y los arcos KM deben mostrar una diferencia sustancial de supervivencia. Las diferentes actividades de rutas entre grupos de riesgo deben mostrarse mediante análisis GSVA, en línea con mecanismos establecidos como la expansión o las rutas de ciclo celular. Para verificar la resiliencia de la red, los nodos altamente acoplados en la red de PPI deben aparecer centralmente, y los genes hub determinados por MCC deben coincidir con reguladores fisiológicamente significativos.