Este estudo utilizou conjuntos de dados públicos e desidentificados do The Cancer Genome Atlas (TCGA) e do Gene Expression Omnibus (GEO), além de linhas celulares comerciais estabelecidas. Nenhum participante humano recém-recrutado, informações identificáveis do paciente ou amostras derivadas do paciente foram envolvidas. Todas as análises foram realizadas de acordo com as diretrizes institucionais relevantes e os termos de uso dos bancos de dados públicos. Portanto, não foram necessárias aprovações éticas institucionais adicionais nem consentimento informado para este estudo.
Fonte de Dados
Os dados RNA-seq para as coortes IBD (GSE179285; plataforma: GPL6480 e GSE24287; plataforma: GPL6480), coortes CRC (TCGA-CRC; plataforma: Illumina HiSeq 2000 e GSE87211; plataforma: GPL13497) e coortes PAAD (GSE128735; plataforma: GPL20301 e GSE62452; plataforma: GPL6244) foram baixados da TCGA e da GEO. Todos os conjuntos de dados foram acessados em 5 de dezembro de 2025.
Para cada conjunto de dados, as amostras foram estritamente divididas em dois subgrupos, com os tecidos da lesão/tumor da doença servindo como grupo de casos e os tecidos normais não lesionais correspondentes como grupo controle. Especificamente, a coorte de DII continha 297 amostras de mucosa intestinal de pacientes com DII e 56 amostras de mucosa intestinal normal de indivíduos saudáveis; a coorte CRC incluiu 841 tecidos tumorais colorretais primários e 211 tecidos epiteliais colorretais normais adjacentes correspondentes; e a coorte de PAAD consistia em 114 tecidos tumorais de PAAD e 106 tecidos parênquimatos pancreáticos normais.
Todos os conjuntos de dados dentro da mesma categoria de doença foram integrados de forma uniforme. A função normalizeBetweenArrays do pacote limma foi aplicada para realizar normalização de quantis entre amostras, eliminando efetivamente efeitos de lote entre plataformas e padronizando valores de expressão gênica em diferentes conjuntos de dados para análises diferenciais subsequentes.
Triagem de genes relacionados à DII, CRC e PAAD e genes comuns
Primeiro, genes diferencialmente expressos (DEGs) foram triados das coortes IBD, CRC e PAAD usando o pacote limma, e os valores P originais foram corrigidos usando o método da taxa de falsa descoberta (FDR) de Benjamini-Hochberg. Nas coortes IBD, CRC e PAAD, os critérios de triagem foram definidos em |logFC| > 0,4 e P < 0,05. Além disso, WGCNA foi realizada em todos os genes, com um limiar mínimo de módulo de 100 (potência soft-threshold = 0,90; tipo de rede = assinado). Consequentemente, DEGs comuns e genes módulos foram identificados entre as três coortes. Genes consistentemente identificados por ambos os métodos foram definidos como genes comuns, enquanto os genes restantes foram categorizados como genes relacionados.
IBP e Análise de Enriquecimento Funcional
Essas análises foram realizadas nos genes associados à doença. A análise de interação proteína-proteína (IBP) foi realizada usando o banco de dados STRING (escoragem de interação > 0,40). A análise de enriquecimento funcional incluiu análises da Gene Ontology (GO) e da Kyoto Encyclopedia of Genes and Genomes (KEGG), que foram realizadas usando o clusterProfiler, enrichplot e org. Hs.eg.db pacotes (P < 0,05 e valor q ajustado FDR [método Benjamini–Hochberg] < 0,05).
Perfilamento do Microambiente Imunológico
O CIBERSORT é um algoritmo confiável para estimar os níveis de infiltração de células imunes a partir de dados de expressão gênica usando a matriz padrão de assinaturaLM22 7. Neste estudo, o algoritmo CIBERSORT foi usado para estimar a extensão da infiltração de células imunes em amostras das coortes de DII, CRC e PAAD, a fim de explorar as características compartilhadas do microambiente imune entre as três doenças. A análise foi realizada com 1.000 permutações para calcular valores P para cada amostra, e a normalização de quantil (QN = TRUE) foi aplicada ao arquivo de expressão da mistura. Apenas amostras com valor CIBERSORT P < 0,05 foram mantidas para análises subsequentes, garantindo a confiabilidade dos resultados da deconvolução.
Avaliação do Valor Diagnóstico dos Genes Comuns
O valor diagnóstico dos genes comuns nas coortes IBD, CRC e PAAD foi avaliado usando análise de características operacionais do receptor (ROC) com o pacote pROC em R. A troca ótima entre sensibilidade e especificidade foi visualizada usando curvas ROC.
qRT-PCR, Transfecção Celular e Ensaio de Formação de Colônias
qRT-PCR e transfecção celular foram realizadas de acordo comestudos anteriores 8,9,10. A transfecção transitória foi realizada usando o reagente de transfecção jetPRIME (Polyplus, China) conforme as instruções do fabricante. As células eram incubadas com a mistura de transfecção por 6 horas, após as quais o meio era substituído por DMEM completo. Experimentos subsequentes foram realizados 48 horas após a transfecção.
Resumidamente, o RNA celular total foi extraído usando reagente TRIzol. O RNA foi transcrito reversamente em cDNA usando o PrimeScript RT Master Mix. A PCR quantitativa foi realizada usando qPCR TB Green. β-actina foi usada como gene de referência interno para a normalização da expressão. Experimentos biológicos foram realizados em triplicado. As sequências de primer e a sequência siS100P podem ser encontradas em um estudo anterior 11.
As células NCM460, FHC, HCT116, SW116, PANC1 e BXPC2 foram obtidas conforme listado na Tabela de Materiais. Todas as linhagens celulares passaram por identificação celular e testes de micoplasma.
Durante os experimentos, todas as células foram liberadas por 3 a 5 gerações. Todas as células foram cultivadas em DMEM completo contendo 10% de soro fetal bovino e 1% de penicilina–estreptomicina.
O ensaio de formação da colônia foi realizado conforme descrito em um estudoanterior 12. Brevemente, 1.000 células foram semeadas em cada poço de uma placa de 6 poços e cultivadas por 10 dias antes do fim do experimento. As células foram fixadas com 4% de paraformaldeído, coradas com 0,1% de violeta cristalino, e as colônias foram contadas usando ImageJ.
Análise de Genes Comuns Com Base em Dados de SCRNA-seq
Os dados de scRNA-seq dos conjuntos de dados IBD (GSE214695), CRC (GSE166555) e PAAD (GSE154778) foram pré-processados conforme descrito em estudosanteriores 8,13. Matrizes de contagem bruta foram colapsadas pela expressão média para símbolos duplicados de genes usando limma:avereps. A filtragem inicial reteve genes detectados em pelo menos três células e células contendo pelo menos 50 transcritos únicos. Células com fração de transcrito mitocondrial >5% ou menos de 50 genes detectados foram removidas. A normalização logarítmica foi realizada com um fator de escala de 10.000, seguida por transformação estabilizadora de variância para identificar os 1.500 genes mais variáveis que foram padronizados com escore Z antes da análise de componentes principais (PCA). Genes marcadores definidores de clusters foram filtrados usandologaritarítmic 2 (variação de duplicação) > 0,5, fração de detecção ≥0,25 em clusters-alvo e um valor P ajustado <0,05.
Brevemente, o pré-processamento de dados foi realizado usando o pacote Seurat, e a anotação de tipo de célula foi realizada usando o pacote SingleR (versão 2.6.0). O clustering de células foi realizado em Seurat usando construção de grafos k-vizinhos mais próximos e embedding t-SNE baseado nas dimensões PCA 1–20. A distribuição e os níveis de expressão dos genes comuns entre diferentes tipos celulares foram então examinados.
Construção do Modelo IBD
De acordo com estudos anteriores, 14 lipopolissacarídeos (LPS) foram usados para induzir inflamação em células epiteliais do cólon humano normais (FHC e NCM460), gerando assim um modelo de DII que imita inflamação. Experimentos biológicos foram realizados em triplicado. As células eram rotineiramente cultivadas em uma incubadora umidificada a 37°C com 5% de CO2. Quando a confluência celular atingiu aproximadamente 50%–70%, o meio de cultivo foi substituído por meio fresco e completo, e as células foram tratadas com 10 ng/mL LPS por 12 horas. Um volume igual de soro salino estéril tamponado com fosfato (PBS) foi usado como controle do veículo. O volume de cultura era de 2 mL por poço em placas de 6 poços. Após o tratamento, o meio era removido, as células eram lavadas duas vezes com PBS estéril pré-resfriado e as células eram coletadas para análises subsequentes.
Análise estatística
Todas as análises de bioinformática foram realizadas usando o software R (versão 4.1.2). Comparações entre dois grupos foram realizadas usando o teste t de Student, enquanto comparações entre múltiplos grupos foram realizadas usando análise unidirecional da variância (ANOVA). A análise de correlação foi realizada usando o método Spearman. Todos os experimentos celulares foram repetidos pelo menos três vezes, e os dados são apresentados como a média ± desvio padrão (DS). Um valor P ou FDR < 0,05 foi considerado estatisticamente significativo. NS, não significativo; P < 0,05 (*), P < 0,01 (**) e P < 0,001 (***).