Este estudio utilizó conjuntos de datos públicos y desidentificados del Atlas del Genoma del Cáncer (TCGA) y el Gene Expression Omnibus (GEO), así como líneas celulares comerciales establecidas. No participaron participantes humanos recién reclutados, ni información identificable del paciente ni muestras derivadas de ellos. Todos los análisis se realizaron de acuerdo con las directrices institucionales pertinentes y los términos de uso de las bases de datos públicas. Por lo tanto, no se requirió una aprobación ética institucional adicional ni consentimiento informado para este estudio.
Fuente de datos
Los datos RNA-seq para las cohortes IBD (GSE179285; plataforma: GPL6480 y GSE24287; plataforma: GPL6480), cohortes CRC (TCGA-CRC; plataforma: Illumina HiSeq 2000 y GSE87211; plataforma: GPL13497) y cohortes PAAD (GSE128735; plataforma: GPL20301 y GSE62452; plataforma: GPL6244) se descargaron de TCGA y la GEO. Todos los conjuntos de datos fueron consultados el 5 de diciembre de 2025.
Para cada conjunto de datos, las muestras se dividieron estrictamente en dos subgrupos, siendo los tejidos de la lesión/tumor de la enfermedad el grupo de caso y los tejidos normales no lesionados correspondientes como grupo de control. Concretamente, la cohorte de EII contenía 297 muestras de mucosa intestinal de pacientes con EII y 56 muestras de mucosa intestinal normal de individuos sanos; la cohorte de CRC incluyó 841 tejidos tumorales colorrectales primarios y 211 tejidos epiteliales colorectales normales adyacentes compatibles; y la cohorte de PAAD consistía en 114 tejidos tumorales de PAAD y 106 tejidos parenquimatosos pancreáticos normales.
Todos los conjuntos de datos dentro de la misma categoría de enfermedad se integraron de forma uniforme. La función normalizeBetweenArrays del paquete limma se aplicó para realizar la normalización de cuantiles entre muestras, eliminando efectivamente los efectos de lotes entre plataformas y estandarizando los valores de expresión génica entre diferentes conjuntos de datos para análisis de expresión diferencial posteriores.
Cribado de genes relacionados con EII, CRC y PAAD, así como genes comunes
Primero, se analizaron genes diferencialmente expresados (DEGs) de las cohortes IBD, CRC y PAAD utilizando el paquete limma, y los valores originales de P se corrigieron mediante el método de tasa de falsos descubrimientos (FDR) de Benjamini-Hochberg. En las cohortes IBD, CRC y PAAD, los criterios de cribado se establecieron en |logFC| > 0,4 y P < 0,05. Además, se realizó WGCNA en todos los genes, con un umbral mínimo de módulo de 100 (potencia de umbral suave = 0,90; tipo de red = firmado). En consecuencia, se identificaron DEGs comunes y genes de módulo en las tres cohortes. Los genes identificados consistentemente por ambos métodos se definieron como genes comunes, mientras que los genes restantes se categorizaron como genes relacionados.
IBP y Análisis de Enriquecimiento Funcional
Estos análisis se realizaron sobre los genes asociados a la enfermedad. El análisis de interacción proteína-proteína (IBP) se realizó utilizando la base de datos STRING (puntuación de interacción > 0,40). El análisis de enriquecimiento funcional incluyó análisis de Gene Ontology (GO) y Kyoto Encyclopedia of Genes and Genomes (KEGG), que se realizaron utilizando clusterProfiler, enrichplot y org. Hs.eg.db paquetes (P < 0,05 y valor q ajustado FDR [método Benjamini–Hochberg] < 0,05).
Perfilado del microambiente inmune
CIBERSORT es un algoritmo fiable para estimar los niveles de infiltración de células inmunitarias a partir de datos de expresión génica utilizando la matriz de firma por defecto deLM22 7. En este estudio, se utilizó el algoritmo CIBERSORT para estimar el grado de infiltración de células inmunitarias en muestras de las cohortes IBD, CRC y PAAD, con el fin de explorar las características compartidas del microambiente inmune entre las tres enfermedades. El análisis se realizó con 1.000 permutaciones para calcular valores P para cada muestra, y se aplicó la normalización cuantilística (QN = TRUE) al archivo de expresión de mezcla. Solo se conservaron muestras con un valor CIBERSORT P < 0,05 para análisis posteriores, asegurando la fiabilidad de los resultados de la deconvolución.
Evaluación del valor diagnóstico de los genes comunes
El valor diagnóstico de los genes comunes en las cohortes IBD, CRC y PAAD se evaluó mediante análisis de características de operación del receptor (ROC) con el paquete pROC en R. El equilibrio óptimo entre sensibilidad y especificidad se visualizó utilizando curvas ROC.
qRT-PCR, transfección celular y ensayo de formación de colonias
Según estudios previos se realizaron qRT-PCR y transfección celular 8,9,10. La transfección transitoria se realizó utilizando el reactivo de transfección jetPRIME (Polyplus, China) según las instrucciones del fabricante. Las células se incubaban con la mezcla de transfección durante 6 horas, tras lo cual el medio se reemplazaba por DMEM completo. Los experimentos posteriores se realizaron 48 horas después de la transfección.
En resumen, se extrajo ARN celular total utilizando reactivo TRIzol. El ARN se transcribió inversamente en ADNc usando PrimeScript RT Master Mix. La PCR cuantitativa se realizó utilizando la qPCR TB Green. La β-actina se utilizó como gen de referencia interno para la normalización de la expresión. Se realizaron experimentos biológicos en triplicado. Las secuencias de cebadores y la secuencia siS100P pueden encontrarse en un estudio anterior 11.
Se obtuvieron las celdas NCM460, FHC, HCT116, SW116, PANC1 y BXPC2 según la lista de la Tabla de Materiales. Todas las líneas celulares fueron identificadas y analizadas por micoplasmas.
Durante los experimentos, todas las células pasaron durante 3–5 generaciones. Todas las células se cultivaron en DMEM completo que contenía un 10% de suero fetal bovino y un 1% de penicilina-estreptomicina.
El ensayo de formación de colonias se realizó tal y como se describió en un estudioanterior 12. Brevemente, se sembraron 1.000 células en cada pozo de una placa de 6 pozos y se cultivaron durante 10 días antes de que el experimento terminara. Las células se fijaron con un 4% de paraformaldehído, se teñieron con 0,1% de violeta cristalino y se contaron las colonias usando ImageJ.
Análisis de genes comunes basados en datos de scRNA-seq
Los datos de scRNA-seq del conjunto de datos IBD (GSE214695), CRC dataset (GSE166555) y PAAD dataset (GSE154778) fueron preprocesados como se describió en estudiosprevios 8,13. Las matrices de recuento en bruto se colapsaron mediante la expresión media para símbolos génicos duplicados usando limma::avereps. El filtrado inicial retuvo genes detectados en al menos tres células y células que contenían al menos 50 transcritos únicos. Se eliminaron células con una fracción de transcrito mitocondrial >5% o menos de 50 genes detectados. La normalización logarítmica se realizó con un factor de escala de 10.000, seguida de una transformación estabilizadora de varianzas para identificar los 1.500 genes más variables que fueron estandarizados con puntuación Z antes del análisis de componentes principales (PCA). Los genes marcadores definidores de conglomerados se filtraron usandologarítmic 2 (cambio de multiplicación) > 0,5, una fracción de detección ≥0,25 en los grupos objetivo y un valor P ajustado <0,05.
Brevemente, el preprocesamiento de datos se realizó usando el paquete Serat, y la anotación por tipo de celda se realizó usando el paquete SingleR (versión 2.6.0). El agrupamiento de celdas se realizó en Seurat usando construcción de grafos k-vecinos más cercanos y incrustación t-SNE basada en las dimensiones PCA 1–20. A continuación, se examinaron la distribución y los niveles de expresión de los genes comunes entre diferentes tipos celulares.
Construcción del modelo IBD
Según estudiosprevios, 14 lipopolisacáridos (LPS) se utilizaron para inducir inflamación en células epiteliales del colon humano normal (FHC y NCM460), generando así un modelo de EII que imita la inflamación. Se realizaron experimentos biológicos en triplicado. Las células se cultivaban rutinariamente en una incubadora humidificada a 37°C con un 5% deCO2. Cuando la confluencia celular alcanzó aproximadamente el 50%–70%, el medio de cultivo se reemplazó por medio fresco y completo, y las células se trataron con 10 ng/mL LPS durante 12 horas. Se utilizó un volumen igual de solución salina estéril tamponada con fosfato (PBS) como control del vehículo. El volumen de cultivo era de 2 mL por pozo en placas de 6 pozos. Tras el tratamiento, se retiró el medio, se lavaron dos veces las células con PBS estéril preenfriado y se recogieron para análisis posteriores.
Análisis estadístico
Todos los análisis bioinformáticos se realizaron utilizando el software R (versión 4.1.2). Las comparaciones entre dos grupos se realizaron utilizando el test t de Student, mientras que las comparaciones entre varios grupos se realizaron mediante análisis unidireccional de la varianza (ANOVA). El análisis de correlación se realizó utilizando el método Spearman. Todos los experimentos celulares se repitieron al menos tres veces, y los datos se presentan como la media ± desviación estándar (DS). Un valor P o FDR < 0,05 se consideró estadísticamente significativo. NS, no significativo; P < 0,05 (*), P < 0,01 (**) y P < 0,001 (***).