Cette étude a utilisé des ensembles de données publiques et désidentifiées provenant du Cancer Genome Atlas (TCGA) et du Gene Expression Omnibus (GEO), ainsi que des lignées cellulaires commerciales établies. Aucun participant humain nouvellement recruté, aucune information identifiable sur les patients ou échantillons dérivés des patients n’a été impliqué. Toutes les analyses ont été réalisées conformément aux directives institutionnelles pertinentes et aux conditions d’utilisation des bases de données publiques. Par conséquent, une approbation éthique institutionnelle supplémentaire ni un consentement éclairé n’étaient pas nécessaires pour cette étude.
Source des données
Les données RNA-seq pour les cohortes IBD (GSE179285 ; plateforme : GPL6480 et GSE24287 ; plateforme : GPL6480), les cohortes CRC (TCGA-CRC ; plateforme : Illumina HiSeq 2000 et GSE87211 ; plateforme : GPL13497), et les cohortes PAAD (GSE128735 ; plateforme : GPL20301 et GSE62452 ; plateforme : GPL6244) ont été téléchargées depuis TCGA et la GEO. Tous les jeux de données ont été consultés le 5 décembre 2025.
Pour chaque jeu de données, les échantillons étaient strictement divisés en deux sous-groupes, les tissus de la lésion de la maladie/tumeurs servant de groupe de cas et les tissus normaux non lésionnaux correspondants comme groupe témoin. Plus précisément, la cohorte de la MII comprenait 297 échantillons de muqueuse intestinale provenant de patients atteints de MII et 56 échantillons de muqueuse intestinale normale chez des individus sains ; la cohorte CRC comprenait 841 tissus tumoraux colorrectaux primaires et 211 tissus épithéliaux colorrectaux normaux adjacents appariés ; et la cohorte PAAD comprenait 114 tissus tumoraux PAAD et 106 tissus parenchymeux pancréatique normaux.
Tous les ensembles de données d’une même catégorie de maladie ont été intégrés de manière uniforme. La fonction normalisée BetweenArrays du paquet limma a été appliquée pour effectuer la normalisation de quantiles croisés par échantillons, éliminant efficacement les effets de batch inter-plateformes et standardisant les valeurs d’expression génique entre différents ensembles de données pour des analyses d’expression différentielle ultérieures.
Dépistage des gènes et gènes courants liés à la MII, CRC et PAAD
D’abord, les gènes différenciellement exprimés (DEG) ont été dépistés parmi les cohortes IBD, CRC et PAAD à l’aide du package limma, et les valeurs P originales ont été corrigées à l’aide de la méthode du taux de fausse découverte (FDR) de Benjamini-Hochberg. Dans les cohortes IBD, CRC et PAAD, les critères de dépistage étaient fixés à |logFC| > 0,4 et P < 0,05. De plus, le WGCNA a été réalisé sur tous les gènes, avec un seuil minimal de module de 100 (puissance de seuil doux = 0,90 ; type de réseau = signé). Par conséquent, des DEG communs et des gènes modules ont été identifiés dans les trois cohortes. Les gènes identifiés de manière cohérente par les deux méthodes étaient définis comme des gènes communs, tandis que les gènes restants étaient catégorisés comme gènes apparentés.
IPP et analyse d’enrichissement fonctionnel
Ces analyses ont été réalisées sur les gènes associés à la maladie. L’analyse de l’interaction protéine-protéine (IPP) a été réalisée à l’aide de la base de données STRING (score d’interaction > 0,40). L’analyse d’enrichissement fonctionnel comprenait des analyses de Gene Ontology (GO) et de Kyoto Encyclopedia of Genes and Genomes (KEGG), réalisées à l’aide du clusterProfiler, de l’enrichplot et de l’org. Hs.eg.db paquets (P < 0,05 et valeur q ajustée FDR [méthode Benjamini–Hochberg] < 0,05).
Profilage du microenvironnement immunitaire
CIBERSORT est un algorithme fiable pour estimer les niveaux d’infiltration des cellules immunitaires à partir des données d’expression génique en utilisant la matrice de signatureLM22 par défaut 7. Dans cette étude, l’algorithme CIBERSORT a été utilisé pour estimer l’étendue de l’infiltration des cellules immunitaires dans des échantillons des cohortes IBD, CRC et PAAD afin d’explorer les caractéristiques communes du microenvironnement immunitaire entre les trois maladies. L’analyse a été réalisée avec 1 000 permutations pour calculer les valeurs P pour chaque échantillon, et une normalisation de quantiles (QN = TRUE) a été appliquée au fichier d’expression du mélange. Seuls les échantillons avec une valeur CIBERSORT P < 0,05 ont été conservés pour les analyses ultérieures, garantissant la fiabilité des résultats de déconvolution.
Évaluation de la valeur diagnostique des gènes communs
La valeur diagnostique des gènes communs dans les cohortes IBD, CRC et PAAD a été évaluée à l’aide d’une analyse des caractéristiques opérationnelles du récepteur (ROC) avec le package pROC dans R. Le compromis optimal entre sensibilité et spécificité a été visualisé à l’aide de courbes ROC.
qRT-PCR, transfection cellulaire et test de formation de colonie
qRT-PCR et transfection cellulaire ont été réalisées selon des étudesprécédentes 8,9,10. La transfection transitoire a été réalisée à l’aide du réactif jetPRIME (Polyplus, Chine) selon les instructions du fabricant. Les cellules étaient incubées avec le mélange de transfection pendant 6 heures, après quoi le milieu était remplacé par un DMEM complet. Des expériences ultérieures ont été réalisées 48 heures après la transfection.
En résumé, l’ARN cellulaire total a été extrait à l’aide d’un réactif TRIzol. L’ARN a été rétrotranscrit en ADNc à l’aide du PrimeScript RT Master Mix. La PCR quantitative a été réalisée à l’aide de la qPCR TB Green. β-actine était utilisée comme gène de référence interne pour la normalisation de l’expression. Des expériences biologiques ont été réalisées en triple exemplaire. Les séquences d’amorce et la séquence siS100P se trouvent dans une étude précédente 11.
Les cellules NCM460, FHC, HCT116, SW116, PANC1 et BXPC2 ont été obtenues comme indiqué dans le tableau des matériaux. Toutes les lignées cellulaires ont été identifiées et testées par les mycoplasmes.
Au cours des expériences, toutes les cellules ont été transmises pendant 3 à 5 générations. Toutes les cellules ont été cultivées dans un DMEM complet contenant 10 % de sérum fœtal bovin et 1 % de pénicilline-streptomycine.
Le test de formation de la colonie a été réalisé comme décrit dans une étude précédente12. En résumé, 1 000 cellules ont été ensemées dans chaque puits d’une plaque à 6 puits et cultivées pendant 10 jours avant la fin de l’expérience. Les cellules ont été fixées avec 4 % de paraformoldéhyde, colorées à 0,1 % de violet cristallin, et les colonies comptées à l’aide d’ImageJ.
Analyse des gènes communs basée sur les données scRNA-seq
Les données scRNA-seq issues des jeux de données IBD (GSE214695), CRC (GSE166555) et PAAD (GSE154778) ont été prétraitées comme décrit dans les étudesprécédentes 8,13. Les matrices de comptage brut ont été regroupées par expression moyenne pour les symboles de gènes dupliqués à l’aide de limma :avereps. Le filtrage initial a conservé des gènes détectés dans au moins trois cellules et des cellules contenant au moins 50 transcrits uniques. Les cellules présentant une fraction de transcript mitochondrial >5 % ou moins de 50 gènes détectés ont été retirées. La normalisation logarithmique a été réalisée avec un facteur d’échelle de 10 000, suivie d’une transformation stabilisatrice de variance pour identifier les 1 500 gènes les plus variables, qui ont été standardisés selon le Z-score avant l’analyse des composantes principales (PCA). Les gènes marqueurs définissant les grappes ont été filtrés à l’aide delogarthrite 2 (variation multipliée) > 0,5, une fraction de détection ≥0,25 dans les grappes ciblées, et une valeur P ajustée <0,05.
En résumé, le prétraitement des données était effectué via le package Seurat, et l’annotation par type de cellule était effectuée via le package SingleR (version 2.6.0). Le clustering de cellules a été réalisé en Seurat en utilisant la construction de graphes k-plus proches voisins et l’inclusion t-SNE basée sur les dimensions PCA 1 à 20. La distribution et les niveaux d’expression des gènes communs à travers différents types cellulaires ont ensuite été examinés.
Construction du modèle IBD
Selon des étudesantérieures, 14, le lipopolysaccharide (LPS) a été utilisé pour induire l’inflammation dans les cellules épithéliales du côlon humain normal (FHC et NCM460), générant ainsi un modèle de MII imitant l’inflammation. Des expériences biologiques ont été réalisées en triple exemplaire. Les cellules étaient régulièrement cultivées dans un incubateur humidifié à 37°C avec 5 % deCO2. Lorsque la confluence cellulaire atteignait environ 50 % à 70 %, le milieu de culture était remplacé par un nouveau milieu complet, et les cellules étaient traitées avec 10 ng/mL LPS pendant 12 heures. Un volume équivalent de solution stérile phosphate tamponnée (PBS) était utilisé comme témoin du véhicule. Le volume de culture était de 2 mL par puits dans des plaques à 6 puits. Après traitement, le milieu a été retiré, les cellules ont été lavées deux fois avec du PBS stérile pré-refroidi, puis les cellules ont été collectées pour des analyses ultérieures.
Analyse statistique
Toutes les analyses bioinformatiques ont été réalisées à l’aide du logiciel R (version 4.1.2). Les comparaisons entre deux groupes ont été réalisées à l’aide du test t de Student, tandis que les comparaisons entre plusieurs groupes ont été réalisées par l’analyse unidirectionnelle de la variance (ANOVA). L’analyse de corrélation a été réalisée selon la méthode Spearman. Toutes les expériences cellulaires ont été répétées au moins trois fois, et les données sont présentées comme la moyenne ± l’écart-type (DS). Une valeur P ou FDR < 0,05 était considérée comme statistiquement significative. NS, pas significatif ; P < 0,05 (*), P < 0,01 (**), et P < 0,001 (***).