Questo studio ha utilizzato dataset pubblici e de-identificati dal Cancer Genome Atlas (TCGA) e dal Gene Expression Omnibus (GEO), oltre a linee cellulari commerciali consolidate. Non sono stati coinvolti partecipanti umani appena reclutati, né informazioni identificabili dei pazienti né campioni derivati dal paziente. Tutte le analisi sono state effettuate in conformità con le linee guida istituzionali pertinenti e i termini di utilizzo dei database pubblici. Pertanto, non era necessaria un'ulteriore approvazione etica istituzionale e un consenso informato per questo studio.
Fonte dei dati
I dati RNA-seq per le coorti IBD (GSE179285; piattaforma: GPL6480 e GSE24287; piattaforma: GPL6480), coorti CRC (TCGA-CRC; piattaforma: Illumina HiSeq 2000 e GSE87211; piattaforma: GPL13497) e coorti PAAD (GSE128735; piattaforma: GPL20301 e GSE62452; piattaforma: GPL6244) sono stati scaricati da TCGA e GEO. Tutti i dataset sono stati consultati il 5 dicembre 2025.
Per ogni dataset, i campioni sono stati rigidamente suddivisi in due sottogruppi, con i tessuti lesionistici/tumorali della malattia che fungevano da gruppo di caso e i tessuti normali non lesionistici corrispondenti come gruppo di controllo. In particolare, la coorte IBD conteneva 297 campioni di mucosa intestinale da pazienti con IBD e 56 campioni di mucosa intestinale normale da individui sani; la coorte CRC includeva 841 tessuti tumorali colorettali primari e 211 tessuti epiteliali colorettali normali adiacenti corrispondenti; e la coorte PAAD era composta da 114 tessuti tumorali PAAD e 106 tessuti parenchimali pancreatici normali.
Tutti i dataset all'interno della stessa categoria di malattia sono stati integrati in modo uniforme. La funzione normalizeBetweenArrays del pacchetto limma è stata applicata per eseguire la normalizzazione di quantili cross-campion, eliminando di fatto gli effetti batch interpiattaforme e standardizzando i valori di espressione genica tra diversi dataset per analisi differenziali successive.
Screening dei geni correlati a IBD, CRC e PAAD e dei geni comuni
Per prima cosa, i geni differenzialmente espressi (DEG) sono stati selezionati dalle coorti IBD, CRC e PAAD utilizzando il pacchetto limma, e i valori originali di P sono stati corretti con il metodo del tasso di falsa scoperta (FDR) di Benjamini-Hochberg. Nelle coorti IBD, CRC e PAAD, i criteri di screening sono stati stabiliti a |logFC| > 0,4 e P < 0,05. Inoltre, WGCNA è stato eseguito su tutti i geni, con una soglia minima di 100 (potenza soft-threshold = 0,90; tipo di rete = firmato). Di conseguenza, sono stati identificati DEG comuni e geni moduli tra le tre coorti. I geni identificati in modo coerente con entrambi i metodi sono stati definiti come geni comuni, mentre i geni restanti sono stati categorizzati come geni correlati.
PPI e analisi dell'arricchimento funzionale
Queste analisi sono state effettuate sui geni associati alla malattia. L'analisi dell'interazione proteina-proteina (PPI) è stata condotta utilizzando il database STRING (punteggio di interazione > 0,40). L'analisi di arricchimento funzionale includeva analisi Gene Ontology (GO) e Kyoto Encyclopedia of Genes and Genomes (KEGG), condotte utilizzando clusterProfiler, enrichplot e org. Hs.eg.db pacchetti (P < 0,05 e valore q corretto FDR [metodo Benjamini–Hochberg] < 0,05).
Profilazione del microambiente immunitario
CIBERSORT è un algoritmo affidabile per stimare i livelli di infiltrazione delle cellule immunitarie a partire dai dati di espressione genica utilizzando la matrice di firma implicita diLM22 7. In questo studio, l'algoritmo CIBERSORT è stato utilizzato per stimare l'entità dell'infiltrazione delle cellule immunitarie nei campioni delle coorti IBD, CRC e PAAD, al fine di esplorare le caratteristiche condivise del microambiente immunitario tra le tre malattie. L'analisi è stata eseguita con 1.000 permutazioni per calcolare i valori P per ogni campione, e la normalizzazione quantile (QN = TRUE) è stata applicata al file di espressione della miscela. Solo i campioni con valore CIBERSORT P < 0,05 sono stati mantenuti per le analisi successive, garantendo l'affidabilità dei risultati della deconvoluzione.
Valutazione del valore diagnostico dei geni comuni
Il valore diagnostico dei geni comuni nelle coorti IBD, CRC e PAAD è stato valutato utilizzando l'analisi delle caratteristiche operative del ricevitore (ROC) con il pacchetto pROC in R. Il compromesso ottimale tra sensibilità e specificità è stato visualizzato utilizzando curve ROC.
qRT-PCR, trasfezione cellulare e saggio sulla formazione della colonia
qRT-PCR e trasfezione cellulare sono state condotte secondo studiprecedenti 8,9,10. La trasfezione transitoria è stata eseguita utilizzando il reagente di trasfezione jetPRIME (Polyplus, Cina) secondo le istruzioni del produttore. Le cellule venivano incubate con la miscela di trasfezione per 6 ore, dopo di che il mezzo veniva sostituito con il DMEM completo. Esperimenti successivi furono eseguiti 48 ore dopo la trasfezione.
Brevemente, l'RNA cellulare totale è stato estratto utilizzando il reagente TRIzol. L'RNA veniva trascritto inversamente in cDNA utilizzando PrimeScript RT Master Mix. La PCR quantitativa è stata eseguita utilizzando la qPCR TB Green. β-actin veniva utilizzata come gene di riferimento interno per la normalizzazione dell'espressione. Sono stati condotti esperimenti biologici in triplice. Le sequenze di primer e la sequenza siS100P si trovano in uno studio precedente 11.
Le celle NCM460, FHC, HCT116, SW116, PANC1 e BXPC2 sono state ottenute come elencato nella Tabella dei Materiali. Tutte le linee cellulari sono state sottoposte a identificazione cellulare e test a micoplasmi.
Durante gli esperimenti, tutte le cellule sono state spedite per 3–5 generazioni. Tutte le cellule sono state coltivate in DMEM completo contenente il 10% di siero bovino fetale e l'1% di penicillina–estreptomicina.
Il saggio di formazione della colonia è stato eseguito come descritto in uno studio precedente12. Per un breve periodo, 1.000 cellule furono seminate in ciascun pozzo di una lastra a 6 pozzi e coltivate per 10 giorni prima che l'esperimento venisse terminato. Le cellule sono state fissate con il 4% di paraformaldeide, colorate con lo 0,1% di viola cristallina e le colonie sono state conteggiate usando ImageJ.
Analisi dei geni comuni basata sui dati scRNA-seq
I dati scRNA-seq provenienti dal dataset IBD (GSE214695), dal dataset CRC (GSE166555) e dal dataset PAAD (GSE154778) sono stati preprocessati come descritto negli studiprecedenti 8,13. Le matrici di conteggio grezzo venivano collassate tramite l'espressione media per simboli genici duplicati usando limma::avereps. Il filtraggio iniziale ha mantenuto i geni rilevati in almeno tre cellule e in cellule contenenti almeno 50 trascrizioni uniche. Le cellule con una frazione di trascrizione mitocondriale >5% o meno di 50 geni rilevati sono state rimaste. La normalizzazione logaritmica è stata eseguita con un fattore di scala di 10.000, seguita da una trasformazione stabilizzante della varianza per identificare i 1.500 geni più variabili, che sono stati standardizzati secondo lo Z-score prima dell'analisi dei componenti principali (PCA). I geni marker che definiscono il cluster sono stati filtrati usandologarittimate 2 (variazione di fold) > 0,5, una frazione di rilevamento ≥0,25 nei cluster target e un valore P aggiustato <0,05.
In breve, la preelaborazione dei dati veniva effettuata utilizzando il pacchetto Seurat, e l'annotazione dei tipi di celle veniva eseguita con il pacchetto SingleR (versione 2.6.0). Il clustering delle celle è stato eseguito in Seurat utilizzando la costruzione di grafi k-vicini più prossimi e l'incorporamento t-SNE basato sulle dimensioni PCA 1–20. Sono stati quindi esaminati i livelli di distribuzione ed espressione dei geni comuni tra i diversi tipi cellulari.
Costruzione del modello IBD
Secondo studiprecedenti, 14, lipopolisaccaridi (LPS) sono stati utilizzati per indurre infiammazione nelle cellule epiteliali coloniche umane normali (FHC e NCM460), generando così un modello IBD che imita l'infiammazione. Sono stati condotti esperimenti biologici in triplice. Le cellule venivano coltivate di routine in un incubatore umidificato a 37°C con il 5% diCO2. Quando la confluenza cellulare ha raggiunto circa il 50%–70%, il mezzo di coltura è stato sostituito con un mezzo fresco e completo e le cellule sono state trattate con 10 ng/mL LPS per 12 ore. Un volume uguale di soluzione salina sterile tamponata con fosfato (PBS) è stato utilizzato come controllo del veicolo. Il volume di coltura era di 2 mL per pozzo in piastre a 6 pozzi. Dopo il trattamento, il mezzo veniva rimosso, le cellule venivano lavate due volte con PBS sterile pre-raffreddato e venivano raccolte per analisi successive.
Analisi statistica
Tutte le analisi bioinformatiche sono state effettuate utilizzando il software R (versione 4.1.2). I confronti tra due gruppi sono stati effettuati utilizzando il test t di Student, mentre confronti tra più gruppi sono stati effettuati tramite analisi unidirezionale della varianza (ANOVA). L'analisi di correlazione è stata effettuata utilizzando il metodo Spearman. Tutti gli esperimenti cellulari sono stati ripetuti almeno tre volte e i dati sono presentati come la deviazione media ± standard (SD). Un valore P o FDR < 0,05 è stato considerato statisticamente significativo. NS, non significativo; P < 0,05 (*), P < 0,01 (**) e P < 0,001 (***).