DEGs en IBD, CRC y PAAD
En primer lugar, se integraron las cohortes de EII (GSE179285 y GSE24287), las cohortes de CRC (TCGA-CRC y GSE87211) y las cohortes de PAAD (GSE128735 y GSE62452), y la integración se evaluó utilizando gráficos de densidad de expresión génica y PCA. Los resultados mostraron que los efectos de lote entre los diferentes conjuntos de datos se eliminaron efectivamente tras la integración (Figura 1A–F).

Figura 1. Normalización de las cohortes de enfermedad inflamatoria intestinal (EII), cáncer colorrectal (CCR) y adenocarcinoma pancreático (PAAD). (A) El análisis de componentes principales (PCA) traza gráficos antes y después de la normalización de las cohortes de EII (GSE179285 y GSE24287). (B) Gráficos de distribución de la expresión génica antes y después de la normalización de las cohortes de EII. (C) Gráficos de PCA antes y después de la normalización de las cohortes de CRC (TCGA-CRC y GSE87211). (D) Gráficos de distribución de expresión génica antes y después de la normalización de las cohortes de CRC. (E) Gráficos de PCA antes y después de la normalización de las cohortes PAAD (GSE62452 y GSE128735). (F) Gráficos de distribución de expresión génica antes y después de la normalización de las cohortes PAAD. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Tras la integración del conjunto de datos y la corrección del efecto por lotes, se realizó un análisis diferencial de expresión en las cohortes IBD, CRC y PAAD. Dentro de cada cohorte, se compararon tejidos de lesiones o tumores de enfermedad con tejidos normales emparejados para identificar DEGs. En la cohorte de EII, se identificaron 183 DEGs, incluyendo 64 genes regulados a la baja y 119 genes regulados al alza (Figura 2A). En la cohorte de CRC, se identificaron 5.064 DEG, incluyendo 2.477 genes con regulación a la baja y 2.587 genes con regulación alza (Figura 2B). En la cohorte PAAD, se identificaron 2.293 DEGs, incluyendo 901 genes regulados a la baja y 1.392 genes regulados al alza (Figura 2C). En total, se identificaron 40 DEGs superpuestas entre las cohortes de EII, CRC y PAAD (Figura 2D).

Figura 2. Análisis diferencial de expresión de cohortes de EII, CCR y PAAD. (A) Mapa de calor y gráfico volcánico de genes diferencialmente expresados (DEGs) en la cohorte de EII. (B) Mapa de calor y gráfico volcánico de los DEGs en la cohorte CRC. (C) Mapa de calor y gráfico volcánico de los DEGs en la cohorte PAAD. (D) Diagrama de Venn que muestra los solapamientos de DEG entre las cohortes IBD, CRC y PAAD. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
WGCNA en IBD, CRC y PAAD
La WGCNA se realizó en las cohortes de EII, CRC y PAAD. En la cohorte de EII, se identificaron tres módulos estrechamente asociados con rasgos clínicos, siendo los módulos MEbrown y MEturquoise los que mostraron las correlaciones más fuertes (Figura 3A). De manera similar, en la cohorte de CRC, se identificaron ocho módulos estrechamente asociados con rasgos clínicos, siendo los módulos MEbrown y MEturquoise los que mostraron las correlaciones más fuertes (Figura 3B). En la cohorte PAAD, se identificó un módulo estrechamente asociado con rasgos clínicos, siendo los módulos MEblack y MEbrown las que mostraron las correlaciones más fuertes (Figura 3C).

Figura 3. Análisis ponderado de la red de coexpresión génica (WGCNA) de las cohortes de EII, CRC y PAAD. (A) Mapa de calor que muestra correlaciones entre los módulos de coexpresión génica y los rasgos clínicos en la cohorte de EII. (B) Mapa de calor que muestra correlaciones entre módulos de coexpresión génica y rasgos clínicos en la cohorte de CRC. (C) Mapa de calor que muestra correlaciones entre los módulos de coexpresión génica y los rasgos clínicos en la cohorte PAAD. (D) Diagrama de Venn que muestra genes superpuestos identificados a partir de módulos clave de coexpresión en las cohortes IBD, CRC y PAAD. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
A partir de genes de módulos significativamente correlacionados con rasgos clínicos, se identificaron 434 genes asociados a módulos potencialmente implicados en EII, CRC y PAAD (Figura 3D).
Análisis de enriquecimiento funcional de genes comunes en EII, CRC y PAAD
Combinando los resultados del análisis de expresión diferencial y el WGCNA, se identificaron 40 DEG comunes y 122 genes asociados a módulos comunes. Para investigar las características moleculares compartidas de la EII, la CRC y la PAAD, estos genes se integraron para un análisis posterior, resultando en 158 genes asociados a la enfermedad.
Primero, los 158 genes se analizaron utilizando la base de datos STRING para construir una red PPI (Figura 4A). Posteriormente, se realizaron análisis de enriquecimiento GO y KEGG. El análisis GO reveló un enriquecimiento significativo en procesos biológicos, incluido el proceso metabólico hormonal (Figuras 4B,C), mientras que el análisis KEGG mostró enriquecimiento en vías como la vía de señalización de la interleucina-17 (IL-17) y la vía de señalización del receptor activado por proliferadores de peroxisomas (PPAR) (Figuras 4D,E).

Figura 4. Análisis de enriquecimiento funcional de genes asociados a enfermedades identificados en EII, CRC y PAAD. (A) Red de genes asociados a enfermedades de interacción proteína-proteína (PPI). (B) Análisis de enriquecimiento de la Ontología Génica (GO) presentado como un gráfico de puntos de procesos biológicos enriquecidos, componentes celulares y términos de función molecular. (C) Red gen–concepto de GO que muestra las relaciones entre términos GO enriquecidos y genes asociados. (D) Análisis de enriquecimiento de vías de la Enciclopedia de Genes y Genomas de Kioto (KEGG) presentado como un gráfico de puntos. (E) Red gen–vía KEGG que muestra las relaciones entre las vías enriquecidas y los genes asociados. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Análisis de correlación de genes comunes con infiltración celular inmunitaria en EII, CRC y PAAD
CIBERSORT se utilizó para estimar los niveles de infiltración de células inmunitarias en las cohortes de EII, CRC y PAAD. En la cohorte de EII, se observaron diferencias en los niveles de infiltración de células inmunitarias entre muestras normales y de EII (Figura 5A), y se evaluaron correlaciones entre genes comunes y poblaciones de células inmunitarias (Figura 5B). De manera similar, se observaron diferencias en los niveles de infiltración de células inmunitarias entre muestras normales y de CRC en la cohorte de CRC (Figura 5C), y se evaluaron correlaciones entre genes comunes y poblaciones de células inmunitarias (Figura 5D). En la cohorte PAAD, también se observaron diferencias en los niveles de infiltración de células inmunitarias entre muestras normales y PAAD (Figura 5E), y se evaluaron correlaciones entre genes comunes y poblaciones de células inmunitarias (Figura 5F).

Figura 5. Análisis de infiltración de células inmunitarias en cohortes de EII, CRC y PAAD. (A) Gráficos de violín que muestran las proporciones estimadas de poblaciones de células inmunitarias en la cohorte de EII. (B) Análisis de correlación entre genes comunes y poblaciones de células inmunitarias en la cohorte de EII, incluyendo el mapa de calor de correlación de células inmunitarias y la red de asociación gen-célula inmune. (C) Gráficos de violín que muestran las proporciones estimadas de poblaciones de células inmunitarias en la cohorte de CRC. (D) Análisis de correlación entre genes comunes y poblaciones de células inmunitarias en la cohorte CRC, incluyendo el mapa de calor de correlación de células inmunitarias y la red de asociación gen-célula inmune. (E) Gráficos de violín que muestran las proporciones estimadas de poblaciones de células inmunitarias en la cohorte PAAD. (F) Análisis de correlación entre genes comunes y poblaciones de células inmunitarias en la cohorte PAAD, incluyendo el mapa de calor de correlación de células inmunitarias y la red de asociación gen-célula inmune. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Evaluación del valor potencial de genes comunes en EII, CRC y PAAD
Los patrones de expresión de los genes comunes se evaluaron más a fondo en las cohortes de EII, CRC y PAAD. S100P se sobreexpresó consistentemente en las tres cohortes (Figura 6A, D, G). Además, se evaluó el rendimiento diagnóstico de los genes comunes mediante análisis ROC.

Figura 6. Rendimiento diagnóstico de genes comunes en cohortes de EII, CRC y PAAD. (A) Niveles de expresión de FXYD3, S100P, PLA2G2A y MUC1 en la cohorte de EII. (B) Curvas de características de funcionamiento del receptor (ROC) que muestran el rendimiento diagnóstico de genes comunes individuales en la cohorte de EII. (C) Curva ROC que muestra el rendimiento diagnóstico del modelo diagnóstico combinado en la cohorte de EII. (D) Niveles de expresión de FXYD3, S100P, PLA2G2A y MUC1 en la cohorte CRC. (E) Curvas ROC que muestran el rendimiento diagnóstico de genes comunes individuales en la cohorte de CRC. (F) Curva ROC que muestra el rendimiento diagnóstico del modelo diagnóstico combinado en la cohorte de CRC. (G) Niveles de expresión de FXYD3, S100P, PLA2G2A y MUC1 en la cohorte PAAD. (H) Curvas ROC que muestran el rendimiento diagnóstico de genes comunes individuales en la cohorte PAAD. (I) Curva ROC que muestra el rendimiento diagnóstico del modelo diagnóstico combinado en la cohorte PAAD. Se muestran los valores de área bajo la curva (AUC) y los correspondientes intervalos de confianza del 95% cuando corresponde. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En la cohorte IBD, los valores del área bajo la curva (AUC) fueron 0,626 para FXYD3, 0,597 para S100P, 0,670 para PLA2G2A y 0,697 para MUC1, mientras que el modelo diagnóstico combinado arrojó un AUC de 0,815 (Figura 6B,C). De manera similar, en la cohorte de CRC, los valores de AUC fueron 0,839 para FXYD3, 0,738 para S100P, 0,716 para PLA2G2A y 0,672 para MUC1, mientras que el modelo diagnóstico combinado arrojó un AUC de 0,925 (Figura 6E,F). En la cohorte PAAD, los valores de AUC fueron 0,852 para FXYD3, 0,896 para S100P, 0,637 para PLA2G2A y 0,733 para MUC1, mientras que el modelo diagnóstico combinado arrojó un AUC de 0,901 (Figura 6H,I).
Análisis de scRNA-seq basado en genes comunes
Tras el preprocesamiento de los datos scRNA-seq del conjunto de datos de EII, se identificaron 17 clústeres celulares y 8 tipos celulares. A continuación, se evaluó la distribución de los genes comunes entre diferentes poblaciones celulares, y se encontró que los genes comunes se expresaban predominantemente en células epiteliales (Figura 7A). De manera similar, el preprocesamiento del conjunto de datos CRC identificó 20 clústeres celulares y 8 tipos celulares, con los genes comunes también predominantemente expresados en células epiteliales (Figura 7B). Finalmente, el preprocesamiento del conjunto de datos PAAD identificó 19 grupos celulares y 7 tipos celulares, y los genes comunes también se expresaron predominantemente en células epiteliales (Figura 7C).

Figura 7. Análisis de secuenciación de ARN unicelular (scRNA-seq) de genes comunes en TEJIs de EII, CRC y PAAD. (A) Visualización de aproximación y proyección uniforme de variedades (UMAP) de los clústeres celulares en el conjunto de datos IBD (GSE214695), anotaciones correspondientes por tipo celular y gráficos de características que muestran la expresión de FXYD3, S100P, PLA2G2A y MUC1 entre poblaciones celulares. (B) Visualización UMAP de los clústeres celulares en el conjunto de datos CRC (GSE166555), anotaciones correspondientes por tipos celulares y gráficos de características que muestran la expresión de FXYD3, S100P, PLA2G2A y MUC1 entre poblaciones celulares. (C) Visualización UMAP de los grupos celulares en el conjunto de datos PAAD (GSE154778), anotaciones correspondientes por tipos celulares y gráficos de características que muestran la expresión de FXYD3, S100P, PLA2G2A y MUC1 entre poblaciones celulares. Las escalas de color indican los niveles relativos de expresión génica. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Función biológica de S100P en la EII
Dada la sobreexpresión constante de S100P en las cohortes de EII, CRC y PAAD, junto con informes previos que describían su papel en la CRC yPAAD 15,16, este estudio investigó más a fondo la función biológica de S100P en la EII.
En primer lugar, la expresión de S100P aumentó significativamente en el modelo de EII inducida por LPS, y se confirmó la eficiencia de reducción de siS100P (Figura 8A,B). Además, el tratamiento con LPS redujo la proliferación celular, mientras que la inhibición de la expresión de S100P restauró parcialmente la proliferación celular (Figura 8C). Además, el knockdown de S100P redujo significativamente la expresión de IL-1β, IL-6 y TNF-α en las líneas celulares modelo de EII FHC y NCM460 (Figuras 8D,E). Finalmente, la regulación a la baja de S100P redujo la expresión de IL17RA en células epiteliales del colon, células CRC y células PAAD (Figura 8F).

Figura 8. La regulación a la baja de S100P atenúa las respuestas inflamatorias inducidas por lipopolisacáridos (LPS) en células epiteliales del colon. (A) Expresión relativa de ARNm de S100P en células FHC tras la estimulación de LPS y el knockdown de S100P. (B) Expresión relativa de ARNm de S100P en células NCM460 tras estimulación LPS y knockdown de S100P. (C) Imágenes representativas de formación de colonias y cuantificación de la proliferación celular en células FHC y NCM460 tras estimulación LPS y knockdown de S100P. (D) Medición ELISA de los niveles de IL-1β, IL-6 y TNF-α en células FHC tras la estimulación LPS y el knockdown de S100P. (E) Medición ELISA de los niveles de IL-1β, IL-6 y TNF-α en células NCM460 tras estimulación LPS y knockdown de S100P. (F) Expresión relativa de ARNm de IL-17RA tras el knockdown de S100P en células FHC, NCM460, HCT116, SW1116, PANC-1 y BxPC-3. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Disponibilidad de datos
Los conjuntos de datos analizados durante el estudio actual están disponibles públicamente en TCGA y en el repositorio GEO bajo los números de acceso TCGA-CRC, GSE179285, GSE24287, GSE87211, GSE128735, GSE62452, GSE214695, GSE166555 y GSE154778. No se generaron nuevos conjuntos de datos de secuenciación durante este estudio.