Este estudo foi aprovado pelo Conselho de Revisão Institucional do Primeiro Hospital Afiliado da Universidade Médica de Bengbu (Número de Aprovação: 2023YJS162). Foi obtido consentimento informado por escrito de todos os participantes antes da coleta da amostra.
Coleta de dados
Os dados do transcriptoma usados neste estudo foram obtidos do banco de dados Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). O conjunto de dados primário de treinamento, GSE150910, foi gerado usando a plataforma Illumina NovaSeq 6000 (GPL24676) e compreendia 103 amostras de tecido pulmonar IPF e 103 de tecido pulmonar normal. Para validar os achados, foram utilizados conjuntos de dados independentes GSE24206, GSE110147, GSE93606 e GSE38958. Informações detalhadas sobre cada conjunto de dados são fornecidas na Tabela 1. Além disso, um total de 636 GRGs foram selecionados de um estudopreviamente publicado 14.
Análise diferencial de expressão e caracterização funcional de DEGs relacionados à glicosilação
A análise diferencial de expressão entre amostras de tecido pulmonar IPF e normal do conjunto de dados GSE150910 foi realizada usando o pacote R DESeq2 (RRID: SCR_015687). Genes com um valor P ajustado (padj) < 0,05 e |log2FoldChange| > 0,5 foram considerados genes diferencialmente expressos (DEGs). Os DEGs relacionados à glicosilação (GR-DEGs) foram identificados ao intersectar os DEGs com um conjunto pré-definido de 636 GRGs. Para investigar mais profundamente os papéis biológicos desses genes, foram realizadas análises de enriquecimento por Ontologia Gênica (GO) e análise de vias da Enciclopédia de Genes e Genomas de Kyoto (KEGG) para elucidar seus papéis funcionais e envolvimento das vias. Uma rede de interação proteína-proteína (PPI) foi gerada usando o banco de dados STRING (RRID: SCR_005223)15 , com um limiar de confiança de interação de > 0,7, para elucidar as interações moleculares e os potenciais mecanismos regulatórios dos GR-DEGs na IPF.
Triagem de genes-chave e construção de um modelo diagnóstico
Para triar genes-chave para IPF a partir de GR-DEGs, empregamos múltiplos algoritmos de aprendizado de máquina. Inicialmente, a regressão LASSO (RRID: SCR_003418) foi equipada com regressão logística binária (família = "binomial") e o parâmetro de penalização ótimo λ foi selecionado por meio de validação cruzada 10 vezes (nfold = 10). Os resultados finais da seleção foram as características com coeficientes diferentes de zero correspondentes a λ_(min) (0,01700442). Para SVM-RFE, a função rfe do caret do pacote R foi utilizada. A eliminação recursiva de características foi realizada por meio de validação cruzada 10 vezes (método = "cv", número = 10), filtrando progressivamente características de 1 a 126, com precisão usada para determinar o subconjunto ótimo de características. No XGBoost, a função objetivo era definida para regressão logística binária (objetivo = "binário: logístico"), com a métrica de avaliação definida para log loss (eval_metric = "logloss"), o número de iterações (nrounds) definido para 100 e a taxa de aprendizado (eta) definida para 0,1. Os 20 melhores genes foram selecionados com base em suas pontuações de importância de característica (Ganho). Ao intersectar os resultados desses métodos, foi identificado um conjunto refinado de genes-chave. Com base nesse conjunto de genes, um modelo diagnóstico XGBoost foi construído usando o conjunto de dados de treinamento (GSE150910), e seu desempenho preditivo foi avaliado usando análise de características operacionais do receptor (ROC) em conjuntos de dados externos de validação (GSE110147, GSE24206, GSE93606 e GSE38958). Além disso, foi desenvolvido um nomograma para visualizar a contribuição de cada gene selecionado para a probabilidade da doença, e a utilidade clínica do modelo foi avaliada por meio de curvas de calibração e análise de curvas de decisão (DCA).
Exploração das vias biológicas de genes-chave
Explorar o contexto biológico dos genes-chave identificados pelo aprendizado de máquina. A Análise de Enriquecimento de Conjuntos Genéticos (GSEA)16 foi realizada com base nas listas de genes do Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17e as vias foram rastreadas para NES > 1. As vias enriquecidas superiores foram visualizadas usando a função enrichplot.
Explorando a função biológica e as diferenças no cenário imunológico em subtipos de FPI com base em escores genéticos chave
Com base nos perfis de expressão dos genes-chave identificados, foram calculadas e usadas pontuações de Análise de Enriquecimento de Conjuntos de Genes de amostra única (ssGSEA) para estratificar pacientes com IPF em grupos de alta e baixa pontuação com base na mediana da pontuação. A análise diferencial de expressão foi realizada entre os dois grupos, seguida pelo GSEA (RRID: SCR_003199)18 para realizar análises de Processos Biológicos GO (GOBP) e enriquecimento de vias KEGG nos DEGs.
Análise da infiltração de células imunes e das principais diferenças de expressão gênica
Após a estratificação de subgrupos baseada nas pontuações ssGSEA, as diferenças na infiltração imune entre os grupos de pontuação alta e baixa foram avaliadas. Primeiro, calculamos as abundâncias relativas de 22 tipos de células imunes nas amostras usando o algoritmo CIBERSORT (RRID: SCR_016955)19 em combinação com a matriz de características LM22. Especificamente, a função deconv_tme no pacote R IOBR (parâmetros: método = "cibersort", arrays = FALSE, perm = 200) foi usada para os cálculos, e gráficos de caixa foram gerados usando o pacote ggpubr (RRID: SCR_021139) para avaliar diferenças na infiltração de células imunes entre os grupos de alta e baixa pontuação. Além disso, a função gsva no pacote R GSVA (usando o método ssGSEA) foi usada para calcular as pontuações de enriquecimento de 28 tipos de células imunológicas. Essas pontuações foram então normalizadas usando escala Min-Max para mapeá-las ao intervalo [0, 1], facilitando comparações entre tipos de células. Por fim, foram realizados testes de soma de ranks de Wilcoxon para comparar a expressão de genes-chave entre amostras normais e pacientes com IPF nos conjuntos de dados GSE150910 e GSE110147, fornecendo uma análise abrangente da infiltração celular imune e das diferenças de expressão gênica entre subgrupos de IPF.
Validação de genes-chave em pacientes com IPF usando análise RT-qPCR
Para validar a relevância diagnóstica dos genes identificados, seis genes com as maiores pontuações de importância do algoritmo XGBoost foram selecionados para validação do nível de expressão em pacientes com IPF e controles saudáveis usando transcrição reversa por PCR quantitativa (RT-qPCR). Um total de 20 amostras de sangue, incluindo 9 de pacientes com IPF e 11 de indivíduos saudáveis, foram coletadas no Primeiro Hospital Afiliado da Universidade Médica de Bengbu. O RNA total foi extraído das amostras de sangue, e a concentração de RNA foi medida usando um leitor multifuncional de microplacas. A qualidade do RNA foi avaliada antes das análises posteriores. O DNA genômico foi removido durante a transcrição reversa, e as sequências de primer usadas para RT-qPCR estão listadas na Tabela 2. A especificidade do primer foi verificada por análise da curva de fusão. O GAPDH foi usado como gene de referência interno. Os níveis relativos de expressão gênica foram calculados usando o método 2-ΔΔCt . Essa etapa de validação fornece suporte experimental preliminar para a expressão diferencial e a possível relevância diagnóstica dos genes identificados na IPF.
Análise estatística
Os dados foram analisados em R, e o teste de Wilcoxon foi usado para detectar diferenças entre os dois grupos. As análises de enriquecimento GSEA, GO e KEGG foram realizadas usando o cluster Profiler do pacote R (RRID: SCR_016884). Um valor-p < 0,05 era considerado significativo, salvo especificação em contrário.