Declaração do comitê de ética em pesquisa
Este estudo foi conduzido de acordo com a Declaração de Helsinque. O protocolo foi aprovado pelo Comitê de Ética do Hospital Shenzhen Luohu de Medicina Tradicional Chinesa (número de aprovação: 2024-LHQZYYYXLL-KY-039), e o consentimento informado por escrito foi obtido de todos os participantes antes da inscrição. Os detalhes das ferramentas e materiais de pesquisa utilizados neste protocolo estão fornecidos na Tabela de Materiais.
Fonte e processamento de dados
Conjuntos de dados de expressão gênica relacionados à DPOC foram obtidos no Gene Expression Omnibus (GEO). O conjunto de dados GSE54837 foi utilizado como conjunto de transcriptoma, e o conjunto de dados GSE112811 serviu como conjunto de validação (Tabela 1). Os genes regulados por ac4C (ac4C-RGs) foram coletados da literatura18. Genes diferencialmente expressos (DEGs) entre os grupos DPOC e controle foram identificados utilizando o pacote R limma. Consideraram-se estatisticamente significativos os DEGs com |log2FC| > 0 e p < 0,05. Foram gerados gráficos de vulcão para visualizar a distribuição geral das alterações na expressão gênica.
Construção do WGCNA
A WGCNA foi realizada no conjunto de dados GSE54837 utilizando o R para identificar módulos relacionados à DPOC. Antes da construção da rede, amostras discrepantes foram identificadas e removidas por meio de análise de agrupamento hierárquico utilizando a função hclust com o método de ligação média e uma métrica de distância euclidiana. A potência ótima de limiarização suave (β = 10) foi selecionada para alcançar um índice de ajuste à topologia livre de escala R2 ≥ 0,85, equilibrando topologia livre de escala e conectividade média. Uma matriz de adjacência foi construída e transformada em uma matriz de sobreposição topológica (TOM). Os módulos de genes foram identificados utilizando o algoritmo dinâmico de corte de árvore (deepSplit = 2, minClusterSize = 50). Módulos com correlações de eigengene > 0,75 foram posteriormente agrupados utilizando a função mergeCloseModules. Os eigengenes dos módulos foram então correlacionados com características clínicas (estado de DPOC, idade, sexo e status de tabagismo) utilizando coeficientes de correlação de Pearson para identificar módulos associados à DPOC para análises subsequentes.
Triagem, análise de enriquecimento e análise da rede de interação de proteínas (PPI) de genes sobrepostos
Um diagrama de Venn foi gerado utilizando o pacote R ggvenn para identificar os genes que se sobrepõem entre os DEGs, os genes do módulo MEsalmon e os ac4C-RGs. A análise de enriquecimento funcional dos genes sobrepostos foi realizada utilizando as bases de dados Gene Ontology (GO) e Kyoto Encyclopedia of Genes and Genomes (KEGG) com o pacote R clusterProfiler. Informações sobre interação proteína-proteína (PPI) foram obtidas a partir da base de dados STRING (https://string-db.org/) para analisar as interações ao nível proteico entre os genes sobrepostos. O software Cytoscape foi utilizado para visualizar a rede PPI resultante.
Identificação de genes-chave por meio de aprendizado de máquina
Três técnicas de aprendizado de máquina foram aplicadas: regressão com operador de encolhimento e seleção por mínimos absolutos (LASSO), gradiente de reforço extremo (XGBoost) e floresta aleatória (RF). A regressão LASSO foi implementada usando o pacote glmnet com validação cruzada de 10 dobras para determinar o parâmetro de penalidade ótimo λ. O parâmetro type.measure foi definido como "deviance", e o parâmetro family foi definido como "binomial". O valor ótimo de λ foi selecionado usando o critério λmin, que minimiza o desvio validado por cruzamento, resultando em 17 genes. O XGBoost foi realizado usando o pacote xgboost com os seguintes hiperparâmetros: nrounds = 100, max_depth = 6, eta = 0,3, subsample = 0,8, colsample_bytree = 0,8 e eval_metric = "logloss". A importância das características foi classificada pela métrica de ganho, e os 30 principais genes foram selecionados. A floresta aleatória foi implementada usando o pacote randomForest com ntree = 200. A importância das características foi classificada pela diminuição média na medida de Gini, e os 30 principais genes foram selecionados. Os genes selecionados pelos três métodos de aprendizado de máquina foram intersectados para identificar genes-chave para análises subsequentes.
Construção e avaliação do modelo de regressão logística para predição de risco
O conjunto de dados GSE54837 foi dividido aleatoriamente em um conjunto de treinamento (70%) e um conjunto de teste (30%). Um modelo de regressão logística foi construído com base no conjunto de treinamento utilizando a função glm do pacote MASS, com os níveis de expressão dos genes-chave como variáveis de entrada. O desempenho do modelo foi avaliado por meio de curvas ROC geradas com o pacote pROC. Os intervalos de confiança de 95% para a AUC foram calculados por meio de 2.000 réplicas bootstrap. A calibração do modelo foi avaliada utilizando curvas de calibração geradas com 1.000 reamostragens bootstrap (pacote rms). A análise de decisão clínica (DCA) foi realizada utilizando o pacote dca para avaliar o benefício clínico líquido em uma variedade de probabilidades limite. Um nomograma foi construído utilizando a função nomogram do pacote rms para facilitar a estimativa individualizada de risco.
A equação de regressão foi:
logit(P) = 0,5823 + 0,6010 × UPP1 - 0,6563 × PTRF + 0,3853 × B4GALT2 - 0,3972 × FAM168B + 0,1848 × PRKCDBP - 0,4787 × TOR3A. (1)
Aqui, P representa a probabilidade prevista de DPOC, e cada coeficiente representa a contribuição do valor correspondente de expressão gênica para o logaritmo das chances de DPOC.
Análise de expressão, rede GeneMANIA e rede regulatória molecular
Os níveis de expressão gênica entre os grupos com DPOC e controle no conjunto de dados GSE54837 foram comparados utilizando o teste de soma de postos de Wilcoxon. Gráficos de caixa foram gerados com o pacote ggplot2 para visualizar a distribuição dos níveis de expressão, com mediana, intervalo interquartil (IIQ) e pontos de dados individuais sobrepostos. O GeneMANIA foi utilizado para construir redes gênicas e prever interações funcionais. A busca foi realizada com parâmetros padrão: espécie = Homo sapiens, número máximo de genes relacionados = 20. A rede resultante foi baixada e visualizada, com as cores das arestas indicando os tipos de interação. Uma rede de RNA endógeno competitivo (ceRNA) foi construída para investigar mecanismos regulatórios pós-transcricionais. As miRNAs que visam os seis genes-chave foram previstas utilizando duas bases de dados independentes: DIANA-microT (pontuação ≥ 0,8) e miRanda (pontuação ≥ 140, energia ≤ −20 kcal/mol). A interseção de miRNAs identificadas por ambas as bases de dados foi utilizada para construir pares miRNA-mRNA. Posteriormente, as lncRNAs que visam essas miRNAs foram previstas utilizando a base de dados StarBase. Uma rede regulatória lncRNA-miRNA-mRNA foi construída e visualizada utilizando o Cytoscape. As relações regulatórias transcricionais foram previstas utilizando a Análise de Enriquecimento ChIP-X Versão 3 (ChEA3). Para cada gene-chave com fatores de transcrição previstos, os 10 principais fatores de transcrição com as maiores pontuações de enriquecimento foram selecionados. Uma rede regulatória TF-alvo foi construída no Cytoscape.
Análise de enriquecimento de conjuntos de genes e avaliação da infiltração de células imunes
A análise de enriquecimento de conjuntos de genes (GSEA) foi realizada utilizando o pacote clusterProfiler para investigar as funções biológicas de cada gene-chave. Para cada gene-chave, as amostras foram divididas em grupos de alta e baixa expressão com base no valor mediano. A análise de expressão diferencial entre os dois grupos foi realizada utilizando o limma, e a lista resultante de genes foi ordenada pelo log₂ da razão de expressão com sinal. O GSEA foi conduzido utilizando a função gseGO para termos do processo biológico da Ontologia Genética (GO) e a função gseKEGG para vias KEGG, com os seguintes parâmetros: minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0,05 e nPerm = 1.000. A abundância relativa de 28 tipos de células imunes foi estimada utilizando a análise de enriquecimento de conjuntos de genes por amostra única (ssGSEA) implementada no pacote GSVA. Uma matriz de assinatura de conjunto de genes curada, composta por genes marcadores para 28 tipos de células imunes, foi obtida da literatura anterior19. Para cada amostra, a função gsva foi aplicada com method = "ssgsea", ssgsea.norm = TRUE e kcdf = "Gaussian". Os coeficientes de correlação de Spearman entre os escores de enriquecimento do ssGSEA e os níveis de expressão dos seis genes-chave foram calculados utilizando a função cor.test. Os valores de p foram ajustados para testes múltiplos utilizando o método de Benjamini-Hochberg. A matriz de correlação foi visualizada como um mapa de calor utilizando o pacote pheatmap.
Previsão de fármacos, docking molecular e análise de associação com doenças
Compostos terapêuticos potenciais direcionados a genes-chave foram identificados utilizando a base de dados DrugBank. Uma rede de interação "fármaco direcionado ao gene-chave" foi construída no Cytoscape para visualizar as interações previstas entre fármacos e genes. O encaixe molecular foi realizado utilizando a plataforma CB-Dock2 para avaliar as afinidades de ligação. A estrutura tridimensional da proteína humana UPP1 foi obtida no Protein Data Bank (PDB ID: 7B8T). As estruturas moleculares dos fármacos (formato SMILES) foram obtidas do PubChem. O encaixe foi realizado utilizando o mecanismo AutoDock Vina, e os resultados foram classificados pela energia livre de ligação (ΔG, em kcal/mol). Os complexos de encaixe foram visualizados utilizando o PyMOL. As associações entre os genes-chave e doenças humanas relacionadas a exposições ambientais foram investigadas utilizando a base de dados Comparative Toxicogenomics Database (CTD). Cada gene foi pesquisado individualmente, e as dez doenças com associação mais forte foram extraídas e visualizadas utilizando gráficos de radar.
Protocolo de RT-qPCR
Amostras de sangue venoso periférico foram coletadas de oito pacientes com DPOC e oito controles saudáveis no Hospital Shenzhen Luohu de Medicina Tradicional Chinesa. A DPOC foi diagnosticada de acordo com os critérios da Iniciativa Global para Doença Pulmonar Obstrutiva Crônica (GOLD), definida como uma relação VEF1/CVF pós-broncodilatador inferior a 0,7. < 0,70. O grupo controle era composto por voluntários saudáveis pareados por idade e sexo, sem histórico de doenças respiratórias e com testes de função pulmonar normais (VEF1% previsto ≥ 80% e VEF1/CVF ≥ 0,70). As informações basais dos pacientes estão apresentadas em Tabela 2. O RNA total foi extraído de amostras de sangue de DPOC utilizando um kit de extração de RNA de sangue. Para a síntese de cDNA, 500 ng de RNA total foram transcritos reversamente utilizando um kit de síntese de cDNA com remoção de DNA genômico, conforme o protocolo fornecido. O cDNA resultante foi diluído para 150 ng/μL.
A RT-qPCR foi realizada utilizando uma mistura mestra de qPCR baseada em SYBR Green em um sistema de PCR em tempo real. Cada reação de 10 μL continha 5 μL de mistura mestra 2x de SYBR Green, 0,5 μL de cada iniciador (primers) direto e reverso (10 μM), 1 μL de cDNA diluído (15 ng/μL) e 3 μL de água livre de nucleases. As condições de ciclagem foram desnaturação inicial a 95 °C por 5 min, seguida por 40 ciclos de 95 °C por 10 s e 60 °C por 30 s, com uma análise final de curva de dissociação de 60 °C a 95 °C para verificar a especificidade da amplificação. Todas as reações foram realizadas em triplicatas técnicas. β-actina foi utilizada como gene de referência interno. A eficiência dos primers para cada gene alvo foi validada utilizando série de diluições em curva padrão e variou de 90% a 110%. Os níveis de expressão gênica foram normalizados em relação à β-actina, e a expressão relativa foi calculada pelo método 2-ΔΔCt. As comparações estatísticas entre os grupos com DPOC e controle foram realizadas utilizando o teste Mann-Whitney U.
Análise estatística
As visualizações de rede foram criadas usando o Cytoscape, e as análises estatísticas foram realizadas usando o software R. Salvo indicação em contrário, o teste U de Mann-Whitney foi utilizado para dados com distribuição não normal, e o teste t de Student foi utilizado para dados com distribuição normal para comparar dois grupos. Um valor de p < 0,05 foi considerado estatisticamente significativo.