Este protocolo describe una herramienta útil para identificar cambios moleculares significativos en el cáncer y conduce al desarrollo de nuevos enfoques diagnósticos y terapéuticos para el carcinoma de células escamosas de esófago.
Artículo de método
Este protocolo describe una herramienta útil para identificar cambios moleculares significativos en el cáncer y conduce al desarrollo de nuevos enfoques diagnósticos y terapéuticos para el carcinoma de células escamosas de esófago.
El cáncer de esófago (CE) se sitúa como la8ª neoplasia maligna más agresiva, y su tratamiento sigue siendo un reto debido a la falta de biomarcadores que faciliten la detección precoz. La CE se manifiesta en dos formas histológicas principales: adenocarcinoma (EAD) y carcinoma de células escamosas (ESCC), ambas con variaciones en la incidencia en poblaciones geográficamente distintas. Las tecnologías de alto rendimiento están transformando la comprensión de las enfermedades, incluido el cáncer. Un reto importante para la comunidad científica es tratar con datos dispersos en la literatura. Para abordar esto, se propone una tubería simple para el análisis de conjuntos de datos de microarrays disponibles públicamente y la colección de moléculas reguladas diferencialmente entre el cáncer y las condiciones normales. La tubería puede servir como un enfoque estándar para el análisis de expresión génica diferencial, identificando genes expresados diferencialmente entre tejidos cancerosos y normales o entre diferentes subtipos de cáncer. El proceso implica varios pasos, incluido el preprocesamiento de datos (que implica el control de calidad y la normalización de los datos brutos de expresión génica para eliminar las variaciones técnicas entre las muestras), el análisis de expresión diferencial (identificación de genes expresados diferencialmente entre dos o más grupos de muestras mediante pruebas estadísticas como las pruebas t, ANOVA o modelos lineales), análisis funcional (uso de herramientas bioinformáticas para identificar vías y funciones biológicas enriquecidas en genes expresados diferencialmente) y validación (que implica la validación utilizando conjuntos de datos independientes o métodos experimentales como qPCR o inmunohistoquímica). Con este tubería, se puede generar una colección de moléculas expresadas diferencialmente (DEM) para cualquier tipo de cáncer, incluido el cáncer de esófago. Este compendio se puede utilizar para identificar posibles biomarcadores y dianas farmacológicas para el cáncer y mejorar la comprensión de los mecanismos moleculares subyacentes a la enfermedad. Además, el cribado poblacional específico del cáncer de esófago mediante este proceso ayudará a identificar dianas farmacológicas específicas para distintas poblaciones, lo que conducirá a tratamientos personalizados para la enfermedad.
Es alarmante que el AE sea el octavo cáncer más común en todo el mundo y la sexta causa de muerte en todo el mundo. China, India e Irán tienen tasas de incidencia y mortalidad alarmantemente altas. Existen dos tipos principales de CE: el adenocarcinoma de esófago (EAC o EAD) y el carcinoma de células escamosas de esófago (ESCC)1. La EAC es más común en el mundo occidental, mientras que la ESCC es más común en los países orientales, especialmente en China e Irán2. Varios factores de riesgo están asociados con la AE, incluyendo el consumo de tabaco y alcohol, la obesidad y la enfermedad por reflujo gastroesofágico (ERGE). Además, los factores dietéticos, como la falta de frutas y verduras y el consumo de bebidas y alimentos calientes, se asocian con el riesgo de ESCC en áreas de alto riesgo. El diagnóstico y el tratamiento tempranos son importantes para mejorar los resultados de los pacientes con CE 3,4. Por lo tanto, es importante crear conciencia sobre los factores de riesgo, los signos y los síntomas de la AE, y fomentar el cribado regular de las personas de alto riesgo. Además, los esfuerzos para abordar los factores de riesgo modificables, como el consumo de tabaco y alcohol y los hábitos dietéticos poco saludables, pueden ayudar a reducir la incidencia de AE. La EAD se produce en las células de las glándulas productoras de moco en la parte inferior del esófago, cerca del estómago. A menudo se asocia con la enfermedad por reflujo gastroesofágico, en la que el ácido y el contenido del estómago regresan al esófago. Por el contrario, la ESCC surge de células planas y delgadas que recubren la parte superior del esófago5. Es más común en áreas donde el consumo de tabaco y alcohol está muy extendido, como China e Irán.
Entre las diversas afecciones relacionadas con el esófago, el esófago de Barrett (EB), una afección en la que el revestimiento del esófago es reemplazado por células glandulares, es un precursor conocido de EAC6. Vale la pena señalar que el EB puede desarrollarse sin ERGE, pero la presencia de ERGE aumenta el riesgo de desarrollar EBE de 3 a 5 veces. Además, la presencia de EB aumenta el riesgo de desarrollar EAC entre 50 y 100 veces7. Además, los alimentos y líquidos calientes o picantes se han relacionado con la ESCC, pero no con la EAC. Comprender los factores de riesgo de la AE es importante para su prevención y detección temprana. Los esfuerzos para abordar los factores de riesgo modificables, como el consumo de tabaco, el consumo de alcohol, la obesidad y los hábitos dietéticos poco saludables, pueden ayudar a reducir la incidencia de AE. Además, el cribado y la vigilancia rutinarios de las personas de alto riesgo, como las que tienen disfagia o EB, pueden mejorar los resultados al permitir la detección y el tratamiento tempranos.
Es cierto que los estudios basados en ómicas, como la genómica, la transcriptómica, la proteómica, la metilomática, la miRNAomics y la metabolómica, han contribuido en gran medida a nuestra comprensión de las CE, especialmente de las ESCC 8,9,10,11,12,13. Estos estudios han permitido identificar nuevos biomarcadores, potenciales dianas terapéuticas y nuevas vías implicadas en el desarrollo y progresión de las ESCC. Sin embargo, los datos generados a partir de estos estudios se encuentran dispersos por toda la literatura, lo que dificulta el acceso y uso de esta información por parte de la comunidad científica. Por lo tanto, es importante crear un repositorio o base de datos que recopile los datos obtenidos de estudios de alto o bajo rendimiento sobre cánceres específicos. Un paquete de este tipo puede simplificarse y elaborarse mediante la aplicación de algunas directrices básicas. Estas directrices incluyen la selección de estudios relevantes, la extracción y organización de datos de estos estudios y la garantía de la calidad y coherencia de los datos. Además, el compendio debe actualizarse periódicamente para incluir nuevos estudios y datos a medida que estén disponibles. Los investigadores pueden usar una sola plataforma para recuperar y analizar datos sobre un cáncer específico mediante la creación de un compendio o base de datos que combine datos de diferentes estudios. Esto ayudará a acelerar los esfuerzos de investigación y, en última instancia, conducirá a tratamientos más efectivos y mejores resultados para los pacientes con cáncer.
El desarrollo del compendio de cáncer incorpora datos de estudios de bajo y alto rendimiento. Este compendio será un recurso valioso para los investigadores que buscan identificar posibles objetivos diagnósticos o terapéuticos para el cáncer. Una forma de construir esta colección es mediante la revisión de estudios de microarrays disponibles en repositorios de acceso público como Gene Expression Omnibus (GEO). Los estudios de microarrays pueden proporcionar información sobre los niveles de expresión génica en las células cancerosas, y estos datos se pueden utilizar para identificar genes expresados diferencialmente (DEG) que pueden desempeñar un papel en el desarrollo y la progresión del cáncer.
Sin embargo, debe tenerse en cuenta que diferentes estudios pueden haber utilizado diferentes métodos para analizar sus datos, lo que puede haber llevado a la identificación de diferentes DEG. Por lo tanto, es importante revisar cuidadosamente cada estudio y considerar cualquier posible sesgo o limitación al agrupar los datos para el compendio. Una vez que los datos se recopilan en una plataforma común, los investigadores pueden usarlos para identificar posibles objetivos moleculares para estudios posteriores. Estos incluyen el examen de la expresión de un gen en particular en muestras clínicas o la realización de estudios mecanicistas para comprender cómo un gen o proteína en particular está involucrado en el desarrollo y la progresión del cáncer. En general, la creación de un conjunto de datos sobre el cáncer será un recurso valioso para los investigadores del cáncer y ayudará a identificar nuevos objetivos para el diagnóstico y las intervenciones terapéuticas.
1. Curación manual de las moléculas reguladas diferencialmente en ESCC
2. Encontrar estudios relevantes usando PubMed
3. Búsqueda de estudios relevantes utilizando el ómnibus de expresión génica (GEO)
NOTA: Gene expression omnibus (GEO) es un repositorio disponible gratuitamente para almacenar datos en microarrays de ADN. La gran cantidad de datos disponibles en GEO es un buen recurso para la minería de datos con el fin de identificar moléculas reguladas diferencialmente entre el cáncer/enfermedades y las condiciones normales.
4. Análisis de microarrays con GEO2R
NOTA: Lo primero es encontrar estudios relevantes utilizando operadores booleanos (AND, OR, NOT). Se utilizarán en combinación con las palabras clave 'carcinoma de células escamosas de esófago', 'ESCC' o 'carcinoma de células escamosas de esófago'. GEO2R (ver Tabla de Materiales) es un paquete de lenguaje R de libre acceso que está integrado con GEO, lo que permite a los usuarios analizar datos de estudios de microarrays de una manera fácil de usar. Interactúa con los ID de entrada GEO y proporciona una interfaz para realizar análisis complejos basados en R para identificar DEG utilizando paquetes Bioconductor R para el back-end. Este paquete no solo transforma los datos GEO, sino que también presenta su salida en forma de tablas .txt, que pueden modificarse aún más según las necesidades de los usuarios16. El paquete GEO2R presenta los genes en un orden de significación estadística basado en el valor p, pero el orden se puede ordenar en función del cambio logarítmicode 2 veces. Además, los usuarios pueden ver los perfiles de expresión génica como imágenes de perfil GEO. A diferencia de otras herramientas de análisis, GEO2R es independiente de los registros de conjuntos de datos seleccionados y puede interrogar datos reales enviados directamente por los investigadores. Más del 90% de los estudios GEO pueden ser analizados utilizando este método17. En la Figura 1 se muestra el flujo de trabajo de GEO2R con los pasos involucrados en el análisis de datos de microarrays utilizando GEO2R.
5. Encontrar un alias para un gen/proteína
6. Encontrar el símbolo genético oficial de los DEG
7. Encontrar el locus genético de los DEG
8. Búsqueda de información sobre los DEGs en OMIM Pagegene locus de los DEGs
9. Encontrar la localización de la proteína, el dominio y el motivo, y la naturaleza secretora de la proteína codificada por el gen
10. Selección selectiva de la proteína para su validación y evaluación posterior para el diagnóstico o pronóstico de la neoplasia maligna de interés
NOTA: Una vez que se identifican las moléculas únicas, el mayor desafío es cómo validarlas. Por lo general, el estudio de microarrays proporciona expresión a los niveles de ARNm, pero para el diagnóstico o pronóstico de la enfermedad, la lectura de los niveles de proteínas es crucial. Para el mismo, se deben examinar las muestras o líneas celulares de los pacientes o pacientes derivados del mismo cáncer para saber si la molécula se expresa realmente allí y si es capaz de discriminar entre cáncer vs. pronóstico normal, o bueno vs. malo, o diferenciar entre etapas tempranas y tardías de las enfermedades. Para validar la molécula candidata, el Western blot, los ensayos de inmunoadsorción enzimática, es decir, ELISA, inmunoprecipitación, inmunohistoquímica, inmunocitoquímica o ensayo son técnicas útiles 18,19,20. Al mismo tiempo, todos estos ensayos requieren anticuerpos para detectar el antígeno presente en las muestras. Los anticuerpos son artículos costosos, por lo que siempre es mejor seleccionar los anticuerpos en función de los siguientes puntos:
A modo de ejemplo, se utilizó el GSE161533 de acceso GEO para estudiar genes explorados diferencialmente en ESCC. Los resultados representativos del análisis se han mostrado en la Figura 3. GEO2R genera un diagrama de volcanes que es útil para identificar eventos que difieren significativamente entre dos grupos de sujetos experimentales. El gráfico del volcán presenta la distribución general de genes con una significación transformada de -log 10 (valor p) en el eje y, y cambios de pliegue (con un cambio de pliegue transformado log2 ) en el eje x (Figura 3A), y es útil para visualizar los genes que se expresan diferencialmente. Los genes resaltados se expresan significativamente de manera diferencial en un valor de corte p ajustado predeterminado de 0,05 (azul = regulado a la baja, rojo = regulado al alza).
Un gráfico de diferencia de medias (MD) muestra un cambio logarítmico de2 veces frente a valores promedio de expresión de log2 y es útil para visualizar los genes que se expresan diferencialmente. En el diagrama MD, los genes en los que el pliegue transformado log2 cambia en el eje y y registra la expresión del valor promedio en el eje x (Figura 3B). Los genes resaltados se expresan significativamente diferencialmente en un valor de corte de p ajustado predeterminado de 0,05 (azul = regulado a la baja, rojo = regulado al alza). Las parcelas de volcanes encuentran los mismos problemas que las parcelas MA en términos de mostrar información de solo dos tratamientos a la vez21.
Además, se utilizó la Aproximación y Proyección Uniforme de Colectores (UMAP)22 para evaluar la relación entre las muestras ESCC y normales (Figura 3C). Aunque la mayoría de las muestras estaban en las categorías respectivas, se encontraron dos muestras de ESCC en las muestras normales.
GEO2R presentó un gráfico de densidad de expresión interactivo en 2D (Figura 3D), que demostró de manera efectiva la densidad de expresión en el conjunto de datos. Esta gráfica es útil para determinar si la normalización es necesaria para los DEG. En este gráfico, el eje Y denota densidad, mientras que el eje X denota intensidad tanto para ESCC (color verde) como para normal (color violeta).
La distribución de los valores en diferentes muestras, incluidas ESCC y normales, se ha mostrado en el diagrama de caja. Estas distribuciones dan una pista sobre si las muestras son realmente adecuadas para el análisis de expresión diferencial. Los valores centrados en la mediana indican claramente que los datos están normalizados y son comparables entre sí (Figura 3E).
Los genes identificados se filtran en función de p < 0,05 y criterios de cambio de pliegue. Los genes inalterados (con cambio de plegamiento entre <2,0 y >0,50) se eliminaron del análisis. Además, cuando se compara con un estudio publicado anteriormente, los genes comunes encontrados son solo 514, pero el número único de genes obtenidos es 1193. Es importante tener en cuenta que la identificación de genes únicos mediante GEO2R puede ayudar no solo a disminuir la redundancia, sino también a enriquecer el compendio.
En la Tabla 1 se ha mencionado una lista parcial de DEGs, mientras que en el Archivo Suplementario 1 se proporciona una lista completa de DEGs. Algunos de los genes regulados al alza pertenecen a la matriz extracelular, como MMP1 8,23,24, MMP1223,25, SPP1 8,26, POSTN9 y VCAN 8,27. Entre otros genes que se enumeran en la Tabla 1 se incluyen CMPK2, A,URKA28,29, CHEK127 y CDK130 están regulados al alza y EMP127, PTK631,32, GPX327, DPT33, FHL1 34,35 y CRNN 8,36 están regulados a la baja en ESCC en comparación con los epitelios normales. La POSTN (periostina) se ha regulado al alza en la ESCC y también se ha descrito en el caso del adenocarcinoma de esófago. Un estudio previo sobre ESCC informó que la expresión de la proteína POSTN no solo se observó en la región estromal, sino también en las células tumorales, lo que sugiere que existe una interacción entre el tumor y el microambiente9. La periostina es una proteína secretada principalmente por las células mesenquimales y desempeña un papel crucial en la regulación, adhesión y diferenciación de los osteoblastos, así como en la reparación de heridas. Además, la periostina se ha implicado en la progresión tumoral y la metástasis en varios tipos de cáncer, incluido el ESCC. Los estudios han demostrado que la periostina participa en la transición epitelial a mesenquimal (EMT) en cánceres y angiogénesis tumoral, promoviendo la migración celular, la motilidad, la adhesión y el crecimiento celular metastásico de los tumores. En el esófago de Barrett, una condición precancerosa del esófago, hay una regulación positiva significativa de POSTN, el gen que codifica para el periostina, en comparación con el tejido esofágico normal37. En la esofagitis eosinofílica, una enfermedad inflamatoria del esófago, tanto el ARNm de la periostina como los niveles de expresión de proteínas están regulados al alza en comparación con el epitelio esofágico normal. De manera similar, en ESCC, se encontró que POSTN está 11 veces regulado al alza en el análisis de expresión génica9. Estos hallazgos sugieren que POSTN puede servir como un biomarcador potencial para ESCC y otros cánceres. Además, el aumento de los niveles séricos de POSTN se ha reportado en pacientes con cáncer de mama diagonalizadas con metástasis óseas, lo que refleja que POSTN también podría investigarse más a fondo como un posible biomarcador metastásico en los sueros de pacientes con ESCC. En general, las POSTN parecen desempeñar funciones importantes en la progresión tumoral y pueden tener posibles implicaciones clínicas para el diagnóstico, el pronóstico y el tratamiento del cáncer.
La distribución cromosómica de los DEG en los cromosomas individuales muestra que el número máximo de genes procedía de los cromosomas 1-6 y X (Figura 4). El análisis de vías basado en ShinyGO mostró que una serie de vías cruciales aparecen cuando se analizan los DEP. Algunos de estos fueron la vía de señalización de IL-17, la digestión y absorción de proteínas, la interacción entre el receptor ECM, la vía de señalización del TNF, la vía de señalización del receptor tipo Toll, la vía de señalización de quimiocinas, la interacción del receptor de citocinas-citocinas, la enfermedad hepática del alcohol, los microARN en el cáncer, la desregulación transcripcional en el cáncer, el ciclo celular y la vía de señalización del receptor similar a NONO en ESCC. Además, el enriquecimiento de los términos GO en los DEG se realizó mediante el análisis g: Profiler. Se enriquecieron diferentes términos de GO para la función molecular (GO: MF), los componentes celulares (GO: CC) y los procesos biológicos (GO: BP) (Figura 5). La lista de estos términos de GO se ha proporcionado en la Tabla 2.

Figura 1: Representación esquemática para el procesamiento de los estudios sobre carcinoma escamoso de esófago disponible en ómnibus de expresión génica utilizando el programa GEO2R. En el esquema se han mostrado diferentes pasos involucrados en la identificación de genes regulados diferencialmente (DEGs) o moléculas reguladas diferencialmente (DEMs) incluyendo criterios de selección para los DEGs basados en el cambio de pliegue >2.0 veces y p < 0.05 para los regulados al alza, y <0.5 y el valor p <0.05 para los regulados a la baja. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Representación esquemática para encontrar información adicional sobre genes regulados diferencialmente en el carcinoma de células escamosas de esófago disponible utilizando otros recursos disponibles públicamente. Además, la información sobre los DEG es crucial para decidir sobre los DEG que deben seleccionarse para su posterior validación y evaluación en el entorno clínico. En diferentes recursos en línea se puede obtener información como la extracción del alias, el símbolo oficial del gen, la ubicación del cromosoma/locus del gen, el OMIM, el dominio/motivo, la naturaleza secretora de la proteína y la disponibilidad de anticuerpos adecuados para la validación a niveles de proteína. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Distribución del estudio con GSE161533 de acceso GEO utilizando el programa GEO2R para la identificación de DEGs entre ESCC vs. normal. Se utilizó el programa GEO2R con parámetros predeterminados que dan lugar a (A) gráfico de volcán que representa la distribución de genes con significación transformada de -log 10 (valor p) en el eje y, y cambios de pliegue (con cambio de pliegue transformado logarítmicode 2 ) en el eje x, (B) gráfico MD que muestra un cambio de log2 veces frente a los valores de expresión promedio de log2 para visualizar genes expresados diferencialmente, (C) UMAP (Uniform Manifold Approximation and Projection) muestra la segregación de muestras en función de sus tipos, (D) Complementos del gráfico de densidad de expresión, ya que verifica la normalización de los datos antes del análisis de expresión diferencial, (E) Diagrama de caja que muestra valores centrados en la mediana en las muestras para indicar que la normalización de los datos es comparable entre sí. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Distribución de DEGs en diferentes loci cromosómicos utilizando la herramienta de enriquecimiento ShinyGO. (A) Se identificaron genes únicos mediante la generación de un diagrama de Venn para comparar los estudios actuales con los publicados anteriormente . (B) La distribución de DEGs en los diferentes cromosomas del genoma. (C) Enriquecimiento de la vía para DEG utilizando el análisis de enriquecimiento basado en ShinyGO. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Gráficos de Manhattan para ilustrar los enriquecimientos de los términos GO de los genes objetivo utilizando g: Profiler. Los genes diferencialmente expresados se analizaron mediante g: Profiler y el enriquecimiento en términos GO (MF: función molecular; BP: proceso biológico; CC: componente celular) y las vías KEGG a través de las vías del reactoma (REAC), las vías WiKi (WP), el factor de transcripción (TF) y la base diana de microARN (MIRNA) se representaron gráficamente en el gráfico de Manhattan donde el eje x son los términos funcionales GO coloreados por categoría. Cada punto de color representa un término GO. El eje Y muestra los valores p ajustados de -log10. Los términos GO que son estadísticamente significativos para ESCC se muestran en el eje x. MF: Función Molecular; BP: Proceso biológico; CC: Componente celular; MIRNA: MicroARN; HP: Fenotipo humano. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 1: Lista parcial de genes expresados diferencialmente en ESCC. Haga clic aquí para descargar esta tabla.
Tabla 2: Enriquecimiento de los términos GO en ESCC utilizando g: Profiler. Haga clic aquí para descargar esta tabla.
Archivo Suplementario 1: Lista completa de genes expresados diferencialmente en ESCC. Haga clic aquí para descargar este archivo.
Desde la participación de las técnicas OMICS de alto rendimiento en la biología del cáncer, la tasa de generación de datos ha aumentado significativamente. Esto plantea un desafío para los investigadores, especialmente para aquellos que no tienen conocimientos informáticos. Para superar el paso de los años, a los bioinformáticos se les ocurre la idea de desarrollar una base de datos para proporcionar datos de manera organizada. Esto generó una respuesta positiva de los investigadores, especialmente de aquellos que no están interesados en la tecnología. Además, los datos dispersos de OMICS aquí y allá en la literatura no son de utilidad para nadie. Por lo tanto, para hacer un uso adecuado de eso, siempre ha existido la necesidad de una plataforma común donde los investigadores con intereses especializados puedan ir y acceder a los datos. Existe una serie de bases de datos sobre diferentes tipos de cáncer, como ONCOMINE38, ESCC ATLAS39, base de datos de cáncer de páncreas (PCD)40 y DDEC41.
El concepto de genes expresados diferencialmente (DEG) surge del análisis de los datos de secuenciación de ARN, donde se identifican los genes que tienen cambios significativos en los niveles de expresión en dos o más afecciones (como cáncer frente a cáncer normal , o tratamiento frente a control). Se han desarrollado varias herramientas para determinar los DEGs, que realizan pruebas estadísticas basadas en cuantificaciones de los genes expresados a partir de los análisis computacionales de lecturas de RNA-seq en bruto o proporciones de intensidad generadas entre la sonda y la secuencia objetivo en el grupo de cáncer frente a normal. Estas herramientas proporcionan información relacionada con el nivel de expresión y la magnitud de la diferencia por pares para cada gen. Los análisis de expresión génica diferencial (DGE) son útiles para comprender los mecanismos genéticos que contribuyen a las diferencias fenotípicas en los organismos. Los análisis DGE se han aplicado para estudiar una variedad de procesos biológicos, incluida la detección del origen tumoral y/o el análisis del microbioma. Al identificar los DEGs, estos análisis pueden proporcionar información sobre los factores genéticos subyacentes que contribuyen a estos procesos biológicos implicados en la tumorigénesis ESCC21.
El método de la herramienta GEO2R, que está disponible públicamente y es el método preferido porque la mayoría de los estudios disponibles en la literatura se han analizado utilizando diferentes algoritmos, lo que llevó a grandes diferencias en el análisis de datos; Por lo tanto, para evitar estas diferencias, se utilizó esta plataforma fácil de usar porque es gratuita y fácil de usar. Esto permite comparaciones entre condiciones como 'Cáncer vs. Normal' o 'Tratamiento vs. Ningún Tratamiento'.
En este caso, se eligió ESCC porque es un cáncer emergente del tracto gastrointestinal (GI) en India y China. Elegimos GSE161533 de acceso GEO para analizar utilizando GEO2R para identificar DEG entre ESCC vs. normal. Se eligió el estudio porque no incluía pacientes con ESCC que habían recibido previamente tratamiento de quimioterapia o radioterapia. Es preferible utilizar muestras pareadas si están disponibles (ESCC y normales adyacentes del mismo paciente) para cualquier análisis. Esto se debe a que se espera que el genoma de la ESCC y los tejidos normales del mismo paciente sean muy similares, ya que provienen del mismo fondo genético y porque los tejidos están en el mismo entorno. El uso de muestras emparejadas ayuda a evitar sesgos en el análisis que podrían introducirse si se compararan tejidos ESCC y normales de diferentes pacientes con diferentes antecedentes genéticos. El uso de muestras pareadas permite una identificación más precisa de las diferencias en la expresión génica entre ESCC y tejidos normales dentro del mismo paciente, lo que puede ayudar a mejorar la especificidad de los resultados. Este enfoque se utiliza con frecuencia en los estudios de expresión génica para controlar la variabilidad individual y mejorar la potencia analítica.
Tomamos todos los datos de la muestra de los sujetos involucrados en el estudio y utilizamos la plataforma GEO2R para analizar los datos de expresión génica. Primero, asignamos muestras de cáncer, seguidas de muestras normales. Después de asignar estas muestras, se utilizaron los parámetros predeterminados disponibles en la base de datos GEO2R para identificar las muestras de cáncer o tratamiento y las muestras normales o de control. Para diferenciar entre muestras cancerosas y normales, se estableció un umbral de valor p ajustado (ajustado P Val) de menos de 0,05 y un umbral de cambio de pliegue de >2,0 para los genes regulados al alza, y un umbral de valor p ajustado (ajustado P Val) de menos de 0,05 menos y un umbral de cambio de pliegue de <0,5 para los genes regulados a la baja. Estos umbrales se han utilizado comúnmente en estudios de expresión génica para identificar genes expresados diferencialmente entre el cáncer y el normal. Es importante tener en cuenta que la elección de umbrales de significación puede afectar el número y la identidad de los genes identificados como expresados diferencialmente. Además, es importante evaluar cuidadosamente la relevancia biológica de los genes identificados y realizar más estudios de validación para confirmar los resultados.
En la literatura, ha habido una tendencia a reportar solo los genes con un cambio de al menos 2 veces para los genes regulados al alza y de <0,5 veces para los genes regulados a la baja, especialmente en estudios de microarrays y proteómica42. En estudios anteriores, un cambio de plegamiento de >1,5 veces se consideró como un cambio regulado al alza y de <0,67 veces para los genes regulados a la baja43,44, pero las tendencias de la literatura en la última década muestran claramente que se prefiere un cambio de plegamiento más alto, en gran medida porque cuando se realizan experimentos de validación en candidatos con un valor de plegamiento bajo, estos son débiles o no se encuentran correlación entre los niveles de ARNm y proteínas45. Hay un lado oscuro de elegir un cambio de pliegue más alto y es que a veces se omiten algunas moléculas que son biológicamente relevantes en la enfermedad o el cáncer, pero que simplemente se omiten debido al corte preferido para hacer la lista de DEGs/DEMs. Además, la literatura está sesgada hacia el informe de que los DEG prefieren especialmente las moléculas reguladas al alza o sobreexpresadas en lugar de las subexpresadas. Además, si la expresión de moléculas se ajusta a los mismos patrones de regulación positiva o sobreexpresión en múltiples estudios, independientemente de si son para el mismo cáncer o enfermedad, es un enfoque favorito entre los científicos. Además, si se observa el mismo patrón de sobreexpresión en múltiples enfermedades y se informa en la literatura, vuelve a ser ampliamente aceptado en la comunidad científica.
Además, la similitud de las enfermedades depende de si se emplean datos de microarrays o literatura para la comparación. Por último, las descripciones vagamente definidas de las magnitudes de expresión diferencial en la literatura exhiben solo una correlación limitada con los datos de cambio de pliegue de microarrays46.
Además, un compendio puede proporcionar información adicional de bases de datos como NCBI Entrez gene47, HGNC48, OMIM49, HPRD50,51, Ensemble52, KEGG53, WikiPathways54, GO55, miRBase56 y DGV57. Al utilizar GEO2R, una evaluación de UMAP muestra cómo se relacionan las muestras. En el análisis actual, dos muestras de ESCC se llenan con muestras normales, lo que sugiere que hay un error de muestreo o que las muestras de ESCC son lo suficientemente heterogéneas como para aparecer en el grupo de muestras normales.
La herramienta GEO2R es fácil de usar y de fácil acceso, pero tiene algunas limitaciones. GEO2R carece de la capacidad de generar gráficos de PCA y mapas de calor o filtrar muestras después del control de calidad. Solo proporciona un único diagrama de Venn para comparaciones de muestra dentro de la misma serie. GEO2R está limitado a archivos de matriz de serie, lo que evita las comparaciones entre series. Además, GEO2R solo analiza datos de microarrays y no tiene controles de calidad para la normalidad de la muestra o la comparabilidad cruzada. GEO2R no permite un número ilimitado de resultados de búsqueda y solo muestra los 250 genes principales para cualquier comparación por pares dentro de un conjunto de datos. También analiza conjuntos de datos con réplicas de muestra insuficientes para un análisis estadístico sólido. GEO2R proporciona datos en el cambio de plegado logarítmico, que requería que se convirtiera en cambio de plegamiento, ya sea usando r o en una hoja de Excel. Además, para representar genes regulados hacia arriba y hacia abajo, uno tiene que usar otro software o herramienta en línea para hacer el mapa de calor 58,59,60.
En resumen, en este artículo se proporciona una tubería simple, que se puede utilizar para hacer un compendio para cualquier tipo de neoplasia maligna con modificaciones menores. El compendio es necesario para apoyar a los científicos biomédicos, especialmente para el descubrimiento de biomarcadores, proporcionando las moléculas candidatas para su validación en el entorno clínico para su uso, ya sea para el pronóstico o el diagnóstico.
Los autores no tienen nada que revelar.
MKK es beneficiario de la beca TARE (Subvención # TAR/2018/001054) (Subvención # 5/13/55/2020/NCD-III) de la Junta de Investigación en Ciencia e Ingeniería (SERB), Departamento de Ciencia y Tecnología, y el Consejo Indio de Investigación Médica (ICMR), Gobierno de la India, Nueva Delhi, respectivamente.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| NCBI-PUBMED | NCBI | Refiriéndose a la sección 1. requerido para buscar en la literatura | |
| Una computadora portátil / macbook o computadora personal con acceso a Internet y un navegador web. | |||
| g:Profiler | ELIXIR | infrastructure https://biit.cs.ut.ee/gprofiler/gost | Se refiere a la sección 4.10. requerido para el enriquecimiento de GO:MF, GO:BP y GO:CC |
| Expresión génica ómnibus | NCBI | https://www.ncbi.nlm.nih.gov/geo/ | Se refiere a la sección 3.1. requerido para buscar en la base de datos de estudio de microarrays |
| GEO2R | NCBI | https://www.ncbi.nlm.nih.gov/geo/geo2r/ | Refiriéndose a la sección 3.2. requerido para analizar los datos utilizando la herramienta GEO2R |
| Google https://www.google.com | Refiriéndose a la sección 1.1. requerido para buscar en la literatura | ||
| HGNC HGNC | es un comité de la Organización del Genoma Humano (HUGO) | https://www.genenames.org | Refiriéndose a la sección 6.1 requerido para conocer el símbolo genético oficial de los DEG |
| Instituto de Bioinformática HPRD, Bangluru | http://hprd.org | Referencia a la sección 5.1 requerida para obtener información sobre la arquitectura de las proteínas | |
| OMIM | Universidad Johns Hopkins, Baltimore | http://www.omim.org/entry | Refiriéndose a la sección 8.1 requerido para conocer el ID OMIM de un gen en particular / DEG |
| Pangloss Program | Desarrollado por Chris Seidel | http://www.pangloss.com/seidel/Protocols/venn.cgi | Refiriéndose a la sección 4.9. requerido para generar el diagrama de Venn |
| PANTHER | Laboratorio Thomas de la Universidad del Sur de California | http://www.pantherdb.org/geneListAnalysis.do | Referencia a la sección 4.10. requerido para el enriquecimiento de GO:MF, GO:BP y GO:CC |
| ShinyGO | Universidad Estatal de Dakota del Sur | http://bioinformatics.sdstate.edu/go | Refiriéndose a la sección 4.10. requerida para la asignación de DEG en los cromosomas |