Dit protocol integreert openbare transcriptomische datasets en validatie van colonepitheelcellen om S100P te identificeren als een gedeelde biomarker die geassocieerd is met inflammatoire darmziekte, colorectale kanker en pancreasadenocarcinoom.
Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.
Onderzoeksartikel
* These authors contributed equally
Dit protocol integreert openbare transcriptomische datasets en validatie van colonepitheelcellen om S100P te identificeren als een gedeelde biomarker die geassocieerd is met inflammatoire darmziekte, colorectale kanker en pancreasadenocarcinoom.
Inflammatoire darmziekte (IBD) wordt geassocieerd met een verhoogd risico op colorectale kanker (CRC) en pancreasadenocarcinoom (PAAD), maar de moleculaire kenmerken die deze ziekten delen blijven onvolledig begrepen. Deze studie had als doel gemeenschappelijke genen en biologische routes te identificeren die geassocieerd zijn met IBD, CRC en PAAD via geïntegreerde transcriptomische analyse en experimentele validatie. Genexpressiedatasets voor IBD, CRC en PAAD zijn verkregen uit de databases The Cancer Genome Atlas en Gene Expression Omnibus. Gewogen genco-expressienetwerkanalyse en differentiële expressieanalyse werden uitgevoerd om ziekte-geassocieerde en gedeelde genen te identificeren. Genontologie en de Kyoto Encyclopedia of Genes and Genomes (analyses werden gebruikt om verrijkte biologische functies en routes te onderzoeken. Infiltratie van immuuncellen werd geëvalueerd met behulp van celtype-identificatie door het schatten van relatieve subsets van RNA-transcripten. Analyse van de bedieningskenmerken van de ontvanger werd uitgevoerd om de diagnostische prestaties van gemeenschappelijke genen te beoordelen. Single-cell RNA-sequencinganalyse werd uitgevoerd om de cellulaire distributie van S100P te onderzoeken. Daarnaast werden de effecten van S100P-downregulatie geëvalueerd in lipopolysaccharide (LPS)-gestimuleerde colonale epitheelcellen. In totaal werden 162 ziekte-geassocieerde genen en vier gemeenschappelijke genen geïdentificeerd. Functionele verrijkingsanalyses gaven een significante verrijking aan van immuun- en ontstekingsgerelateerde routes, waaronder de interleukine-17 signaalroute. Immuno-infiltratieanalyse toonde vergelijkbare trends aan bij verschillende immuuncelpopulaties binnen IBD, CRC en PAAD. Eencelanalyse toonde een verhoogde S100P-expressie in epitheelcellen van alle drie de ziekten. Downregulatie van S100P herstelde het proliferatieve vermogen van door LPS gestimuleerde colonepitheelcellen en verminderde de expressie van inflammatoire cytokines. Geïntegreerde transcriptomische analyse identificeerde S100P als biomarker geassocieerd met IBD, CRC en PAAD en benadrukte gedeelde immuungerelateerde kenmerken over deze ziekten heen.
Inflammatoire darmziekte (IBD) vertegenwoordigt een spectrum van immuungerelateerde aandoeningen die het maagdarmkanaal aantasten, waaronder colitis ulcerosa en de ziekte van Crohn1. De etiologie van IBD is zeer complex en omvat mucosale immuunafwijkingen, dysbiose en genetische vatbaarheid2. IBD is een wereldwijd gezondheidsprobleem met stijgende incidentiecijfers en aanzienlijke economische lasten, en de toenemende prevalentie ervan heeftveel aandacht getrokken. Belangrijk is dat patiënten met IBD een significant verhoogd risico hebben op het ontwikkelen van colorectale kanker (CRC)3 en pancreasadenocarcinoom (PAAD)4. Hoewel deze associatie goed is gedocumenteerd, is de genetische kruisspraak tussen IBD, CRC en PAAD nog steeds onvolledig begrepen.
Eerdere studies suggereren sterk dat IBD, CRC en PAAD gemeenschappelijke pathogene processen delen; echter, specifieke en gevoelige diagnostische biomarkers blijven ontbreken, en de gedeelde pathogene mechanismen zijn nog niet volledig opgehelderd. Gelukkig zijn met de snelle vooruitgang en brede beschikbaarheid van high-throughput sequencingtechnologieën talrijke transcriptomische datasets van patiënten met IBD, CRC en PAAD openbaar beschikbaar geworden, waardoor systematisch onderzoek mogelijk is naar de moleculaire onderlinge verbanden tussen deze ziekten 2,5,6.
Deze studie maakte gebruik van high-throughput sequencinggegevens van patiënten met IBD, CRC en PAAD om ziekte-geassocieerde en gedeelde genen te identificeren met behulp van gewogen genco-expressienetwerkanalyse (WGCNA) en differentiële expressieanalyse. Deze genen werden verder onderzocht om potentiële gedeelde signaalroutes tussen IBD, CRC en PAAD te identificeren. Daarnaast hebben we de diagnostische waarde van deze gemeenschappelijke genen geëvalueerd. Single-cell RNA-sequencing (scRNA-seq) analyse toonde aan dat het sleutelgen S100P voornamelijk tot expressie kwam in epitheelcellen. Tot slot onderzochten we de biologische rol van S100P bij IBD.
Samenvattend was deze studie bedoeld om gemeenschappelijke diagnostische biomarkers en biologische routes te identificeren die geassocieerd zijn met IBD, CRC en PAAD, en zo waardevolle klinische inzichten te bieden in de gedeelde preventie en behandeling van deze ziekten.
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Deze studie maakte gebruik van publiek toegankelijke, gedeidentificeerde datasets van The Cancer Genome Atlas (TCGA) en de Gene Expression Omnibus (GEO), evenals gevestigde commerciële cellijnen. Er waren geen nieuw gerekruteerde menselijke deelnemers, identificeerbare patiëntinformatie of door patiënten afgeleide steekproeven betrokken. Alle analyses werden uitgevoerd in overeenstemming met relevante institutionele richtlijnen en de gebruiksvoorwaarden van de openbare databases. Daarom waren aanvullende institutionele ethische goedkeuring en geïnformeerde toestemming niet vereist voor deze studie.
Gegevensbron
RNA-seq-gegevens voor de IBD-cohorten (GSE179285; platform: GPL6480 en GSE24287; platform: GPL6480), CRC-cohorten (TCGA-CRC; platform: Illumina HiSeq 2000 en GSE87211; platform: GPL13497) en PAAD-cohorten (GSE128735; platform: GPL20301 en GSE62452; platform: GPL6244) werden gedownload van TCGA en de GEO. Alle datasets zijn op 5 december 2025 geraadpleegd.
Voor elke dataset werden de steekproeven strikt verdeeld in twee subgroepen, waarbij ziektelaesie/tumorweefsels de casusgroep vormden en overeenkomstige niet-laesie-normale weefsels de controlegroep. Specifiek bevatte de IBD-cohort 297 darmslijmvliesmonsters van patiënten met IBD en 56 normale intestindoornslijmvliezen van gezonde personen; de CRC-cohort omvatte 841 primaire colorectale tumorweefsels en 211 matchten aangrenzende normale colorectale epitheelweefsels; en de PAAD-cohort bestond uit 114 PAAD-tumorweefsels en 106 normale pancreasparenchymale weefsels.
Alle datasets binnen dezelfde ziektecategorie werden uniform geïntegreerd. De normalizeBetweenArrays-functie van het limma-pakket werd toegepast om cross-sample quantielnormalisatie uit te voeren, waardoor interplatform-batcheffecten effectief werden geëlimineerd en genexpressiewaarden over verschillende datasets werden gestandaardiseerd voor latere differentiële expressieanalyse.
Screening van IBD-, CRC- en PAAD-gerelateerde genen en veelvoorkomende genen
Eerst werden differentieel tot expressie gebrachte genen (DEGs) gescreend uit de IBD-, CRC- en PAAD-cohorten met behulp van het limma-pakket, en werden de oorspronkelijke P-waarden gecorrigeerd met de Benjamini-Hochberg false discovery rate (FDR)-methode. In de IBD-, CRC- en PAAD-cohorten werden de screeningscriteria vastgesteld op |logFC| > 0,4 en P < 0,05. Daarnaast werd WGCNA uitgevoerd op alle genen, met een minimale modulegendrempel van 100 (soft-threshold power = 0,90; netwerktype = ondertekend). Daardoor werden gemeenschappelijke DEG's en modulegenen geïdentificeerd over de drie cohorten. Genen die consequent door beide methoden werden geïdentificeerd, werden gedefinieerd als gemeenschappelijke genen, terwijl de overige genen als verwante genen werden gecategoriseerd.
PPI- en functionele verrijkingsanalyse
Deze analyses werden uitgevoerd op de ziekte-geassocieerde genen. Eiwit-eiwitinteractie (PPI) analyse werd uitgevoerd met behulp van de STRING-database (interactiescore > 0,40). Functionele verrijkingsanalyse omvatte Gene Ontology (GO) en Kyoto Encyclopedia of Genes and Genomes (KEGG) analyses, die werden uitgevoerd met behulp van clusterProfiler, enrichplot en org. Hs.eg.db pakketten (P < 0,05 en FDR-gecorrigeerde q-waarde [Benjamini–Hochberg-methode] < 0,05).
Profilering van immuunmicro-omgevingen
CIBERSORT is een betrouwbaar algoritme om immuuncelinfiltratieniveaus te schatten uit genexpressiegegevens met behulp van de standaard LM22-handtekeningmatrix7. In deze studie werd het CIBERSORT-algoritme gebruikt om de mate van immuuncelinfiltratie in monsters uit de IBD-, CRC- en PAAD-cohorten te schatten om de gedeelde kenmerken van het immuunmicro-milieu tussen de drie ziekten te onderzoeken. De analyse werd uitgevoerd met 1.000 permutaties om P-waarden per monster te berekenen, en kwantielnormalisatie (QN = TRUE) werd toegepast op het mengsel expressiebestand. Alleen monsters met een CIBERSORT P-waarde < 0,05 werden behouden voor latere analyses, wat de betrouwbaarheid van de deconvolutieresultaten waarborgde.
Beoordeling van de diagnostische waarde van gemeenschappelijke genen
De diagnostische waarde van de gemeenschappelijke genen in de IBD-, CRC- en PAAD-cohorten werd geëvalueerd met behulp van receiver operating characteristic (ROC)-analyse met het pROC-pakket in R. De optimale afweging tussen gevoeligheid en specificiteit werd gevisualiseerd met behulp van ROC-curves.
qRT-PCR, celtransfectie en kolonievormingsassay
qRT-PCR en celtransfectie werden uitgevoerd volgens eerdere studies 8,9,10. De transiënte transfectie werd uitgevoerd met jetPRIME transfectiereagens (Polyplus, China) volgens de instructies van de fabrikant. Cellen werden 6 uur geïncubeerd met het transfectiemengsel, waarna het medium werd vervangen door volledige DMEM. Vervolgexperimenten werden 48 uur na transfectie uitgevoerd.
Kort gezegd werd totaal cellulair RNA geëxtraheerd met behulp van Trizol-reagens. RNA werd omgekeerd getranscrcreerd in cDNA met behulp van PrimeScript RT Master Mix. Kwantitatieve PCR werd uitgevoerd met TB Green qPCR. β-actine werd gebruikt als het interne referentiegen voor expressienormalisatie. Biologische experimenten werden in drievoud uitgevoerd. De primersequenties en de siS100P-sequentie zijn te vinden in een eerdere studie 11.
NCM460, FHC, HCT116, SW116, PANC1 en BXPC2 cellen werden verkregen zoals vermeld in de Materiaaltabel. Alle cellijnen ondergingen celidentificatie en mycoplasma-testen.
Tijdens de experimenten werden alle cellen 3–5 generaties doorgevoerd. Alle cellen werden gekweekt in een complete DMEM met 10% foetaal rundserum en 1% penicilline–streptomycine.
De kolonievormingstest werd uitgevoerd zoals beschreven in een eerdere studie12. Kort gezegd werden 1.000 cellen in elke put van een 6-put plaat geplant en 10 dagen gekweekt voordat het experiment werd beëindigd. Cellen werden gefixeerd met 4% paraformaldehyde, gekleurd met 0,1% kristalviolet, en kolonies werden geteld met ImageJ.
Analyse van veelvoorkomende genen op basis van scRNA-seq gegevens
scRNA-seq-gegevens uit de IBD-dataset (GSE214695), CRC-dataset (GSE166555) en PAAD-dataset (GSE154778) werden voorbewerkt zoals beschreven in eerdere studies 8,13. Ruwe telmatrices werden ingestort door gemiddelde expressie voor duplicaatgensymbolen met behulp van limma::avereps. Initiële filtering behield genen die in ten minste drie cellen en cellen met minstens 50 unieke transcripten werden gedetecteerd. Cellen met een mitochondriale transcriptfractie >5% of minder dan 50 detecteerde genen werden verwijderd. Log-normalisatie werd uitgevoerd met een schaalfactor van 10.000, gevolgd door variantie-stabiliserende transformatie om de top 1.500 zeer variabele genen te identificeren, die vóór de principal component analysis (PCA) Z-score gestandaardiseerd waren. Clusterbepalende markergenen werden gefilterd met log2 (fold change) > 0,5, een detectiefractie ≥0,25 in doelclusters en een aangepaste P-waarde <0,05.
Kort gezegd werd gegevensvoorbewerking uitgevoerd met het Seurat-pakket, en celtype-annotatie werd uitgevoerd met het SingleR-pakket (versie 2.6.0). Celclustering werd uitgevoerd in Seurat met behulp van k-dichtstbijzijnde buurgraafconstructie en t-SNE-embedding gebaseerd op PCA-dimensies 1–20. De distributie en expressieniveaus van de gemeenschappelijke genen over verschillende celtypen werden vervolgens onderzocht.
Constructie van het IBD-model
Volgens eerdere studies14 werd lipopolysaccharide (LPS) gebruikt om ontsteking te induceren in normale menselijke colonepitheelcellen (FHC en NCM460), waardoor een ontstekings-nabootsend IBD-model ontstond. Biologische experimenten werden in drievoud uitgevoerd. Cellen werden routinematig gekweekt in een bevochtigde incubator bij 37°C met 5%CO2. Wanneer de celconfluentie ongeveer 50%–70% bereikte, werd het kweekmedium vervangen door een nieuw volledig medium, en werden de cellen behandeld met 10 ng/mL LPS gedurende 12 uur. Een gelijke hoeveelheid steriele fosfaatgebufferde zoutoplossing (PBS) werd gebruikt als voertuigcontrole. Het kweekvolume was 2 mL per put in 6-well platen. Na behandeling werd het medium verwijderd, werden de cellen twee keer gewassen met voorgekoelde steriele PBS en werden de cellen verzameld voor latere analyses.
Statistische analyse
Alle bio-informatica-analyses werden uitgevoerd met R-software (versie 4.1.2). Vergelijkingen tussen twee groepen werden uitgevoerd met behulp van de Student's t-test, terwijl vergelijkingen tussen meerdere groepen werden uitgevoerd met eenrichtingsvariantieanalyse (ANOVA). Correlatieanalyse werd uitgevoerd met behulp van de Spearman-methode. Alle cellulaire experimenten zijn minstens drie keer herhaald, en de gegevens worden gepresenteerd als het gemiddelde ± standaarddeviatie (SD). Een P-waarde of FDR < 0,05 werd als statistisch significant beschouwd. NS, niet significant; P < 0,05 (*), P < 0,01 (**), en P < 0,001 (***).
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
DEG's in IBD, CRC en PAAD
Eerst werden de IBD-cohorten (GSE179285 en GSE24287), CRC-cohorten (TCGA-CRC en GSE87211) en PAAD-cohorten (GSE128735 en GSE62452) geïntegreerd, en de integratie werd geëvalueerd met behulp van PCA- en genexpressiedichtheidsplots. De resultaten toonden aan dat batch-effecten tussen de verschillende datasets effectief werden geëlimineerd na integratie (Figuur 1A–F).
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Eerdere studies hebben de associatie aangetoond van IBD, een immuungerelateerde gastro-intestinale aandoening, met verschillende ziekten, waaronder neurodegeneratieve ziekten17, multiple sclerose18, amyotrofische laterale sclerose19, endometriose20, reumatoïde artritis2, Hodgkin-lymfoom21, CRC22 en PAAD23...
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Belangenconflict:
De auteurs verklaren geen concurrerende belangen.
De auteurs erkennen financiële steun uit het Nationaal Sleutel R&D-plan van China (Subsidienummer 2023YFB3210400).
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
| Naam | Bedrijf | Catalogusnummer | Opmerkingen |
|---|---|---|---|
| BXPC2 cell line | Cell Bank of the Chinese Academy of Sciences | N/A | Human pancreatic adenocarcinoma cell line |
| CIBERSORT | N/A | N/A | Immune cell infiltration analysis |
| clusterProfiler package | Bioconductor | v4.8.0 | Gene Ontology (GO) and Kyoto Encyclopedia of Genes and Genomes (KEGG) enrichment analyses |
| Dulbecco's Modified Eagle Medium (DMEM) | Thermo Fisher Scientific | 11965092 | Cell culture medium |
| Fetal bovine serum (FBS) | Thermo Fisher Scientific | A5256701 | Cell culture supplement |
| FHC cell line | Cell Bank of the Chinese Academy of Sciences | N/A | Human normal colonic epithelial cell line |
| GEO dataset (GSE128735) | Gene Expression Omnibus (GEO) | N/A | Public gene expression dataset for pancreatic adenocarcinoma |
| GEO dataset (GSE154778) | Gene Expression Omnibus (GEO) | N/A | Public single-cell RNA sequencing dataset for pancreatic adenocarcinoma |
| GEO dataset (GSE166555) | Gene Expression Omnibus (GEO) | N/A | Public single-cell RNA sequencing dataset for colorectal cancer |
| GEO dataset (GSE179285) | Gene Expression Omnibus (GEO) | N/A | Public gene expression dataset for inflammatory bowel disease |
| GEO dataset (GSE214695) | Gene Expression Omnibus (GEO) | N/A | Public single-cell RNA sequencing dataset for inflammatory bowel disease |
| GEO dataset (GSE24287) | Gene Expression Omnibus (GEO) | N/A | Public gene expression dataset for inflammatory bowel disease |
| GEO dataset (GSE62452) | Gene Expression Omnibus (GEO) | N/A | Public gene expression dataset for pancreatic adenocarcinoma |
| GEO dataset (GSE87211) | Gene Expression Omnibus (GEO) | N/A | Public gene expression dataset for colorectal cancer |
| ggplot2 package | CRAN | v3.4.2 | Data visualization |
| HCT116 cell line | Cell Bank of the Chinese Academy of Sciences | N/A | Human colorectal cancer cell line |
| ImageJ | National Institutes of Health (NIH) | v1.8.0 | Colony counting |
| jetPRIME Transfection Reagent | Polyplus | 101000046 | Cell transfection |
| Lipopolysaccharide (LPS) | Beyotime Co., Ltd | S1735 | Induction of an inflammation-mimicking IBD cell model |
| limma package | Bioconductor | v3.54.0 | Differential expression analysis |
| NCM460 cell line | Cell Bank of the Chinese Academy of Sciences | N/A | Human normal colonic epithelial cell line |
| org.Hs.eg.db package | Bioconductor | v3.23.1 | Gene annotation for enrichment analysis |
| PANC1 cell line | Cell Bank of the Chinese Academy of Sciences | N/A | Human pancreatic adenocarcinoma cell line |
| Penicillin–streptomycin | Thermo Fisher Scientific | 15140-122 | Antibiotic supplement for cell culture |
| pheatmap package | CRAN | v1.0.12 | Heatmap visualization |
| pROC package | CRAN | v1.19.0.1 | Receiver operating characteristic (ROC) analysis |
| PrimeScript RT Master Mix | Takara Bio | RR036A | Reverse transcription of RNA into cDNA |
| Primer sets for qRT-PCR | Tsingke Biotech Co., Ltd | N/A | Primer sequences reported in Reference 11 |
| R software | R Foundation for Statistical Computing | v4.1.2 | Statistical and bioinformatics analyses |
| Seurat package | CRAN | v4.0 | Single-cell RNA sequencing data preprocessing and analysis |
| siS100P | Tsingke Biotech Co., Ltd | N/A | Small interfering RNA targeting S100P |
| SingleR package | Bioconductor | v2.6.0 | Cell type annotation for single-cell RNA sequencing |
| STRING database | STRING Consortium | N/A | Protein-protein interaction analysis |
| SW1116 cell line | Cell Bank of the Chinese Academy of Sciences | N/A | Human colorectal cancer cell line |
| TB Green qPCR Mix | Takara Bio | RR430B | Quantitative real-time PCR |
| TCGA-CRC dataset | The Cancer Genome Atlas (TCGA) | N/A | Public colorectal cancer transcriptomic dataset |
| TRIzol reagent | Invitrogen | 15596-026 | Total RNA extraction |
| WGCNA package | CRAN | v1.73 | Weighted gene co-expression network analysis |
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.