El estudio fue aprobado por el Comité Ético de la Universidad Médica de Hainan (número de aprobación HMC1984.24) y se realizó de acuerdo con la Declaración de Helsinki (revisada en 2013).
Sujetos del estudio
Se realizó un estudio con 50 pacientes con cáncer de pulmón diagnosticados entre 2017 y 2024 en el Hospital Central de Sanya, en la provincia de Hainan, utilizando las Guías Clínicas de la Asociación Médica China para el Diagnóstico y Tratamiento del Cáncer de Pulmón (Edición 2024). La estadificación CSCO (2024) se alineó con la 8.ª edición del AJCC para permitir la comparabilidad entre estudios, tal como se ha validado en cohortes chinas12, con revisiones independientes por dos oncólogos para garantizar la consistencia. El proceso de selección de pacientes, la disponibilidad de tejidos, la evaluación de la calidad del ARN y la inclusión final de muestras para el análisis mediante qRT-PCR se resumen en la Figura 1.
Datos del estudio
Este estudio utilizó bioinformática para analizar los niveles de expresión de YTHDC2 en el CPHN y su relación con características clínico-patológicas, aportando información sobre posibles mecanismos. Los análisis bioinformáticos se realizaron exclusivamente utilizando datos públicos de secuenciación de ARN del Atlas del Genoma del Cáncer (TCGA), incluyendo muestras de adenocarcinoma de pulmón (LUAD), carcinoma de células escamosas de pulmón (LUSC) y tejidos pulmonares normales correspondientes descargados a través del Portal de Datos GDC (https://portal.gdc.cancer.gov/). El conjunto de datos descargado incluyó datos de expresión de ARN por secuenciación junto con variables clínicas disponibles (identificador del paciente, identificador de la muestra, edad, sexo, estadio patológico, estado de supervivencia y tiempo de supervivencia global) para los casos elegibles de TCGA-LUAD y TCGA-LUSC. Las muestras que carecían de información sobre expresión génica o supervivencia fueron excluidas de los análisis posteriores de supervivencia y ROC. El conjunto de datos utilizado en este estudio se proporciona como Archivo Suplementario 1. No se utilizaron especímenes clínicos recolectados en el Hospital Central de Sanya para los análisis bioinformáticos. Los procedimientos detallados para los análisis GEPIA, Kaplan-Meier Plotter y survivalROC se proporcionan en la sección Análisis bioinformático a continuación. El flujo de trabajo completo de bioinformática, que incluye la adquisición de datos, preprocesamiento, análisis de expresión génica, análisis de supervivencia y análisis ROC, se resume en Figura 2.
Criterios de inclusión y exclusión
Los criterios de inclusión y exclusión de los pacientes se presentan en la Tabla 1. Un análisis de potencia realizado con software de análisis estadístico determinó que al menos 26 casos por grupo proporcionarían una potencia del 80 % para detectar un tamaño del efecto moderado (d = 0,8, α = 0,05, bilateral). Aunque la inscripción inicial tenía como objetivo incluir 50 pares en el grupo de cáncer de pulmón, el análisis final de qRT-PCR incluyó 30 muestras tumorales y 19 muestras de tejido adyacente normal tras las exclusiones por calidad del tejido o del ARN. Esta reducción en el tamaño de la muestra refleja las limitaciones clínicas del mundo real y resalta la importancia de la integridad del ARN y la disponibilidad del tejido en estudios traslacionales. Con n = 19 para las comparaciones, el tamaño mínimo del efecto detectable es d = 1,0 (80 % de potencia, α = 0,05). Por lo tanto, el experimento tuvo potencia suficiente para detectar diferencias grandes, pero no pequeñas a moderadas, en la expresión de YTHDC2.
Espécimenes de tejido y PCR cuantitativa en tiempo real (qRT-PCR)
Los diagnósticos patológicos se determinaron de forma doble ciega por dos patólogos diferentes. La pureza tumoral fue estimada por los patólogos (>70% de células malignas) y confirmada mediante ESTIMATE (TCGA). Los tejidos normales adyacentes se macrodisectaron para minimizar la contaminación estromal. Los tipos histológicos de cáncer de pulmón incluyeron adenocarcinoma de pulmón y carcinoma de células escamosas, con 26 casos de adenocarcinoma de pulmón y 4 casos de carcinoma de células escamosas. La estadificación clínica de los 50 pacientes con cáncer de pulmón se realizó según los criterios de estadificación descritos en las "Guías Clínicas de la Asociación Médica China para el Cáncer de Pulmón (Edición 2024)". Los especímenes de CPHN confirmados patológicamente (n = 50) representaron distribuciones clínicas típicas (véase Tabla 2). De los 50 pacientes inicialmente incluidos, 30 muestras de tejido tumoral y 19 muestras apareadas de tejido normal adyacente cumplieron con los criterios de calidad del ARN. Dado que el análisis estadístico apareado requiere especímenes apareados del mismo paciente, la comparación de la expresión en tejido tumoral frente al tejido normal adyacente se realizó utilizando los 19 pares apareados disponibles. Estos especímenes clínicos se utilizaron exclusivamente para la validación experimental mediante qRT-PCR y se analizaron independientemente de los conjuntos de datos públicos de TCGA empleados para el análisis bioinformático. Estos especímenes seleccionados se procesaron inmediatamente después de la confirmación patológica y se manipularon en condiciones libres de RNasas antes de la extracción de ARN. Este subconjunto refleja los casos en los que se pudo obtener tanto una cantidad adecuada de tejido como ARN total de alta calidad (número de integridad del ARN, RIN >7,0). La concentración y pureza del ARN total se midieron antes de la transcripción inversa, y solo se incluyeron para el análisis posterior las muestras con calidad adecuada de ARN (RIN >7,0). Cantidades iguales de ARN total se transcribieron inversamente a ADN complementario (ADNc) según el protocolo del fabricante antes de la PCR cuantitativa. Este proceso aseguró la validez de los datos de expresión génica analizados. Los experimentos de qRT-PCR se llevaron a cabo en un termociclador de PCR en tiempo real utilizando un ensayo de PCR cuantitativa basado en sondas. Todas las reacciones se realizaron por triplicado, junto con controles sin plantilla para garantizar la reproducibilidad analítica. La amplificación por PCR se realizó bajo las siguientes condiciones de ciclado: una etapa inicial de activación/desnaturalización de la enzima a 95 °C durante 10 min, seguida de 40 ciclos de desnaturalización a 95 °C durante 15 s y hibridación/extensión a 60 °C durante 60 s. Las señales de fluorescencia se adquirieron al final de cada ciclo de amplificación. Todos los reactivos y materiales desechables se obtuvieron de proveedores comerciales (véase Tabla de Materiales). Las secuencias de los cebadores y sondas utilizadas en la qRT-PCR se proporcionan en la Tabla 3.
Análisis de bioinformática
Análisis de la expresión del gen YTHDC2 mediante la base de datos GEPIA
Se utilizó la base de datos GEPIA para analizar la expresión de YTHDC2 en el CPHN. Se accedió al servidor web de GEPIA (http://gepia.cancer-pku.cn/) mediante un navegador web. Se seleccionó el módulo Expression DIY, se introdujo el símbolo del gen "YTHDC2", se seleccionaron los conjuntos de datos LUAD y LUSC, se mantuvieron los parámetros de normalización predeterminados y se generaron directamente mediante la interfaz de GEPIA los diagramas de caja de expresión diferencial. La significancia estadística se definió como p < 0,05.
Base de datos del trazador de Kaplan-Meier para el análisis de supervivencia de pacientes con cáncer de pulmón
El estudio analizó la relación entre la expresión de YTHDC2 y el pronóstico en pacientes con cáncer de pulmón utilizando la base de datos Kaplan-Meier Plotter. Se seleccionó el conjunto de datos de cáncer de pulmón, se introdujo el símbolo del gen "YTHDC2", se aplicó la opción de corte óptimo seleccionada automáticamente y se generaron curvas de Kaplan-Meier para la supervivencia global y la supervivencia tras la progresión utilizando la configuración predeterminada del análisis. Los pacientes se estratificaron automáticamente en grupos de alta y baja expresión mediante el valor de corte óptimo determinado por la plataforma Kaplan-Meier Plotter, y se calcularon riesgos relativos con sus intervalos de confianza del 95 % correspondientes utilizando la configuración predeterminada de la plataforma.
Ejecución de paquetes de R en el software R para la elaboración de curvas ROC
Se descargaron del Portal de Datos GDC los datos de expresión de secuenciación de ARN y los metadatos clínicos correspondientes para los casos elegibles de TCGA-LUAD y TCGA-LUSC. Los conjuntos de datos descargados se fusionaron por identificador de paciente e importados a R para análisis posteriores. Se utilizó el paquete survivalROC para generar curvas ROC dependientes del tiempo en puntos de predicción a 1, 3 y 5 años, y se calcularon los valores correspondientes del área bajo la curva (AUC) para evaluar el desempeño pronóstico de la expresión de YTHDC2. Solo se incluyeron en el análisis de ROC de supervivencia los pacientes con datos disponibles de expresión por ARN-seq e información de supervivencia de TCGA-LUAD y TCGA-LUSC. La cohorte clínica local no se utilizó para la predicción de supervivencia porque no había datos disponibles de seguimiento a largo plazo.
Expresión tisular de YTHDC2 mediante qRT-PCR
Para analizar los niveles de expresión génica, se realizó una qRT-PCR. Se agregaron volúmenes iguales de ADNc a cada reacción según las condiciones recomendadas por el fabricante. La amplificación se llevó a cabo utilizando un ensayo de PCR cuantitativa basado en sondas, y los datos de fluorescencia se recopilaron automáticamente al final de cada ciclo de amplificación. Brevemente, el proceso de extracción de ARN incluyó varios pasos, entre ellos la preparación de la muestra, desparafinización, eliminación del líquido residual, digestión con proteinasa K, incubación, centrifugación, tratamiento con DNasa, adición de DNasa I y precipitación con etanol. Luego, la muestra se unió a una columna de purificación de ARN basada en sílice y se centrifugó a 8.000 × g durante 30 s. A continuación, la columna se lavó con tampón de lavado 1, tampón de lavado 2 y tampón de lavado 2 diluido con etanol, y se secó a 13.000 × g durante 2 min. El ARN se eluyó entonces añadiendo 70 µL de Agua Libre de RNasa al centro de la membrana de la columna, seguido de una centrifugación a 13.000 × g durante 1 min. Cada par de cebadores mostró un único producto de amplificación, lo cual se confirmó mediante análisis de la curva de fusión antes de calcular la expresión génica relativa. La eficiencia de los cebadores (90–110 %) se validó utilizando curvas estándar antes del análisis de las muestras. Los análisis de la curva de fusión confirmaron la presencia de amplicones únicos y la ausencia de dímeros de cebadores. La expresión relativa de YTHDC2 se calculó mediante el método 2-ΔCt, en el cual los valores de Ct se normalizaron respecto al gen de referencia endógeno GAPDH. Dado que los valores de expresión se presentaron como niveles de expresión normalizados en lugar de cambios en el número de copias respecto a una muestra calibradora, los resultados se reportan como valores de 2−ΔCt. Se seleccionó GAPDH como gen de referencia porque su expresión mostró una variabilidad mínima (CV < 5 %) en comparación con las alternativas evaluadas (ACTB, CV = 12 %; 18S ARNr, CV = 18 %), lo cual es consistente con los criterios de selección de genes de referencia en estudios de m6A.
Análisis estadístico
Los análisis estadísticos se realizaron utilizando software estadístico, incluida la creación de gráficos y diagramas. Para analizar los datos cuantitativos y categóricos sobre la expresión del gen YTHDC2 en pacientes con carcinoma de pulmón de células no pequeñas (NSCLC), se utilizó el software R para los análisis bioinformáticos y la generación de curvas ROC. Las curvas ROC y el área bajo la curva (AUC) se utilizaron para evaluar el rendimiento diagnóstico de la expresión de YTHDC2 en la predicción de la supervivencia. En los análisis basados en regresión, se informaron las estimaciones del efecto (razones de momios) junto con sus intervalos de confianza del 95 % correspondientes, cuando fue aplicable. Se utilizó la prueba de Wilcoxon de rangos con signo para comparar la expresión de YTHDC2 entre muestras pareadas de tejido tumoral y tejido normal adyacente, mientras que el análisis de correlación de Pearson se empleó para evaluar la asociación entre la expresión de YTHDC2 y las características clínico-patológicas. Se informaron los coeficientes de correlación (r) y los valores p correspondientes. Dado que los datos de qRT-PCR consistían en muestras pareadas de tejido tumoral y tejido normal adyacente provenientes de los mismos pacientes, y que los datos de expresión génica no presentaban distribución normal, se utilizó la prueba de Wilcoxon de rangos con signo para comparar los niveles de expresión de YTHDC2 entre los tejidos pareados. Esta prueba no asume normalidad de los datos y se utiliza comúnmente con datos biológicos asimétricos. Todas las pruebas estadísticas fueron bilaterales, y se consideró estadísticamente significativo un valor de p <0,05. Las variables continuas se evaluaron previamente para determinar su normalidad antes del análisis. Las variables continuas se presentan como media ± desviación estándar o mediana (rango intercuartílico), según correspondiera.