$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Evaluación de la vista mqTrans del conjunto de datos transcriptómicos
El código de prueba utiliza once algoritmos de selección de características (FS) y siete clasificadores para evaluar cómo la vista mqTrans generada del conjunto de datos transcriptómicos contribuye a la tarea de clasificación (Figura 6). El conjunto de datos de prueba consta de 317 adenocarcinomas de colon (COAD) de la base de datos The Cancer Genome Atlas (TCGA)29. Los pacientes con COAD en estadios I o II se consideran las muestras negativas, mientras que los pacientes en estadios III o IV son las positivas.
Se implementan once algoritmos FS en el código de prueba. Hay tres algoritmos de FS basados en filtros, que incluyen, seleccionar K mejores características por MIC (SK_mic), seleccionar K características por el FPR de MIC (SK_fpr) y seleccionar K características por el FDR más alto de MIC (SK_fpr). Tres algoritmos FS basados en árboles evalúan las características individuales mediante un árbol de decisión con índice de Gini (DT_gini), los árboles de decisión potenciados adaptativos (AdaBoost) y el bosque aleatorio (RF_fs), respectivamente. El grupo de servicios fijos del código de prueba también evalúa dos contenedores: eliminación de características recursivas (RFE) con el clasificador de vectores de soporte lineal (SVC)(RFE_SVC) y RFE con el clasificador de regresión logística (RFE_LR), y dos algoritmos de incrustación: clasificador SVC lineal con los valores de importancia de características L1 mejor clasificados (lSVC_L1) y clasificador de regresión logística con los valores de importancia de características L1 mejor clasificados (LR_L1).
El código de prueba construye los modelos de clasificación utilizando siete clasificadores, que incluyen máquina de vectores de soporte lineal (SVC), Bayes naïve gaussiano (GNB), clasificador de regresión logística (LR), k-vecino más cercano, k-5 por defecto (KNN), XGBoost, bosque aleatorio (RF) y árbol de decisión (DT).
La Figura 6 muestra la precisión máxima de la prueba de las características de mqTrans, las características originales de ARNm y el subconjunto combinado de las características de ARNm y mqTrans recomendadas por cada algoritmo FS.
Los subconjuntos de características combinadas (ARNm+mqTrans) han logrado la mayor precisión de 0,7656 en el método FS "SK_fpr", mejor que los tipos de características individuales mqTrans (0,7188) y ARNm original (0,7188). Se pueden observar patrones similares para los otros algoritmos del servicio fijo. El usuario puede comprobar las entidades seleccionadas en el archivo de salida Output-SelectedFeatures.csv.
Detección de los biomarcadores oscuros
Estudios previos mostraron la existencia de genes expresados indiferencialmente con valores de mqTrans significativamente representados diferencialmente entre los grupos fenotípico y control 26,38,39. Estos genes se denominan biomarcadores oscuros porque los estudios tradicionales de detección de biomarcadores los ignoran por sus expresiones no diferenciales. La función de análisis estadístico t.test en Microsoft Excel se puede utilizar para definir una característica que se expresa diferencialmente si su valor p estadístico es menor que 0,05.
Entre las 3062 características con los valores de mqTrans generados, se detectaron 221 biomarcadores oscuros (Figura 7). El gen ENSG00000163697 de tercer rango (APBB2, Amyloid Beta Precursor Protein Binding Family B Member 2) muestra valores de mqTrans significativamente representados diferencialmente (mqTrans.P = 2,03 x 10-4), mientras que su nivel de expresión original no muestra expresión diferencial (mRNA.P = 3,80 x 10-1). La palabra clave APBB2 llegó a 27 publicaciones en la base de datos PubMed40, pero no se detectaron conexiones con el colon o el intestino.
Otro gen ENSG00000048052 (HDAC9, histona desacetilasa 9) tiene los valores de mqTrans representados diferencialmente (mqTrans.P = 6,09 x 10-3) manteniendo prácticamente las mismas distribuciones normales entre los grupos fenotípico y control (mRNA.P = 9,62 x 10-1). La palabra clave HDAC9 alcanzó las 417 publicaciones en la base de datos PubMed. Tres estudios también mencionaron las palabras clave "colon" o "intestino" en los resúmenes 41,42,43. Sin embargo, ninguno de ellos investigó el papel de HDAC9 en el cáncer de colon.
Los datos sugirieron la necesidad de realizar más evaluaciones de estos biomarcadores oscuros a partir de sus actividades de posttranscripción, por ejemplo, los niveles de proteínas traducidas44,45.
Distribuciones pancancerosas de biomarcadores oscuros y tradicionales relacionados con el metabolismo
Los biomarcadores tradicionales relacionados con el metabolismo se examinaron y compararon con biomarcadores oscuros en 26 tipos de cáncer en el conjunto de datos de TCGA38. Ambas categorías de biomarcadores se sometieron a una evaluación estadística para discernir los niveles de significación en los estadios de cáncer temprano (estadios I y II) y tardío (estadios III y IV). En esta evaluación se emplearon las pruebas t de Student para los valores p, posteriormente corregidos para múltiples pruebas utilizando tasas de falso descubrimiento (FDR). En la Figura 8 se proporcionan datos detallados para cada uno de los 26 tipos de cáncer.
Los genes que arrojaron valores de p corregidos por FDR por debajo de 0,05 se clasificaron como biomarcadores tradicionales. Por el contrario, los biomarcadores oscuros se definieron como aquellos con valores p corregidos por FDR por debajo de 0,05 en la vista mqTrans y, al mismo tiempo, no mostraron diferencias estadísticamente significativas en los niveles de expresión.
La figura 9 revela una escasez general de biomarcadores oscuros en comparación con los biomarcadores tradicionales en la mayoría de los tipos de cáncer. Entre las excepciones destacables se encuentran BRCA, MESO y TGCT, que manifiestan una mayor prevalencia de biomarcadores oscuros. Se revela que varios factores, incluidos los factores de transcripción, los patrones de metilación, las mutaciones genéticas y las condiciones ambientales, podrían modular la desregulación transcripcional de estos biomarcadores oscuros. Puede surgir una mayor complejidad debido a la superposición de transcripciones de ARN no codificantes que podrían confundir los niveles de expresión de los biomarcadores oscuros. Las desregulaciones de la transcripción de algunos biomarcadores oscuros fueron apoyadas por sus niveles diferenciales de proteínas44,45. Los biomarcadores oscuros a menudo se pasan por alto en los estudios tradicionales y presentan vías intrigantes para futuras investigaciones mecanicistas.

Figura 1: Descripción general de los módulos HealthModel y de selección de características de este protocolo. Reemplace los algoritmos específicos en el grupo de selección de características y el grupo de clasificadores si el usuario está familiarizado con la programación de Python. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Flujo de código completo para este protocolo. (A) Preparar el entorno de Python. Para empezar, cree un entorno virtual e instale los paquetes esenciales. Para obtener instrucciones completas, consulte la Sección 1. (b) Generar características de mqTrans. Obtenga las características de mqTrans ejecutando el código proporcionado paso a paso. Se pueden encontrar explicaciones detalladas en la Sección 2. (c) Seleccione las características de mqTrans. Esta sección se centra en la evaluación de las características de mqTrans. Consulte la Sección 3 para obtener detalles detallados. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Preparar el entorno para Python. (A) El comando para crear healthmodel. (B) Introduzca y durante el proceso de creación de VE. (C) El comando más común para activar el VE. (D) El comando para instalar la antorcha 1.13.1. (E) Instale bibliotecas adicionales para el paquete antorcha-geométrica . (F) Instale el paquete geométrico de la antorcha . Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Ejecute HealthModel para obtener la función mqTrans. (A) Descargue el código. (B) El ejemplo del archivo de datos. Cada columna tiene todos los valores de un factor regulador, y el primer elemento es la identificación del gen. Cada fila proporciona los valores de una muestra determinada, siendo el primer elemento el nombre de la muestra. (C) El ejemplo de un archivo de etiquetas. La primera columna proporciona los nombres de las muestras y la etiqueta de clase de cada muestra se proporciona en la columna titulada etiqueta. El valor 0 en la columna de etiqueta significa que esta muestra está viva, 1 significa que está muerta. (D) las salidas de mqTrans. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Ejecute el algoritmo de selección de características para la función mqTrans. Los resultados del algoritmo de selección de características se muestran al usuario. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: La precisión máxima del conjunto de pruebas de cada algoritmo de selección de características. El eje horizontal enumera los algoritmos de selección de entidades y el eje vertical proporciona los valores de precisión. Los histogramas muestran los datos experimentales de las tres configuraciones, es decir, mqTrans, mRNA, mRNA+mqTrans. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Los 50 principales biomarcadores oscuros con los valores p más pequeños en la vista mqTrans. La columna "Biomarcador oscuro" da los nombres de los biomarcadores oscuros. Las columnas "mRNA.P" y "mqTrans.P" son los valores p estadísticos de la prueba t entre los grupos fenotípico y control. Los colores de fondo de los valores p están coloreados entre los valores p 1,00 (azul) y 0,00 (rojo), y el color blanco representa el valor p = 0,05. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Los detalles de los 26 cánceres en el Atlas del Genoma del Cáncer (TCGA) en diferentes etapas. Las columnas "Cohorte" y "Tejido de la enfermedad" describen el grupo de pacientes y los tejidos con enfermedad para cada conjunto de datos. Las últimas cuatro columnas dan el número de muestras en las etapas de desarrollo I, II, III y IV, respectivamente. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Número de biomarcadores oscuros y biomarcadores tradicionales en 26 cánceres. El eje horizontal enumera los 26 tipos de cáncer. El eje vertical muestra el número de biomarcadores oscuros y biomarcadores tradicionales para estos tipos de cáncer. Haga clic aquí para ver una versión más grande de esta figura.
Archivo de codificación suplementario 1: HealthModel-mqTrans-v1-00.tar Haga clic aquí para descargar este archivo.