Artigo de investigação

A análise integrada de bioinformática dos dados transcriptômicos humanos identifica três biomarcadores diagnósticos e prognósticos chave no adenocarcinoma pulmonar

DOI:

10.3791/71214

30 de junho de 2026

* These authors contributed equally

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo identificou biomarcadores diagnósticos e prognósticos para adenocarcinoma pulmonar usando TCGA-LUAD e GEO GSE115002 dados transcriptômicos. B3GNT3, FERMT1 e SPP1 foram regulados para cima, distinguindo tumores do tecido normal. Esses genes estão ligados à transição epitelial-mesenquimata e à imunossupressão. Um nomograma combinando expressão gênica com o estágio TNM mostrou valor preditivo confiável.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O adenocarcinoma pulmonar (LUAD) é a principal causa de mortes relacionadas ao câncer no mundo. Apesar dos avanços em cirurgia, terapia direcionada e imunoterapia, a taxa de sobrevivência avançada do LUAD em 5 anos permanece abaixo de 20%, indicando uma necessidade urgente de biomarcadores moleculares confiáveis para detecção precoce e prognóstico. Neste estudo, os autores levantaram a hipótese de que três genes consistentemente aumentados poderiam atuar como biomarcadores diagnósticos e prognósticos eficazes para a LUAD. Os autores analisaram dados transcriptômicos de duas coortes independentes, TCGA-LUAD (535 tumores, 59 amostras normais) e GSE115002 (52 tumores, 52 amostras normais correspondentes), para triar genes expressos diferencialmente. Três genes centrais — B3GNT3, FERMT1 e SPP1 — foram consistentemente superexpressos nos tumores LUAD em ambos os conjuntos de dados. Esses genes apresentaram excelente desempenho diagnóstico, com valores de AUC acima de 0,95 no TCGA-LUAD e alta precisão em GSE115002. A análise de sobrevivência mostrou que alta expressão de cada gene estava significativamente associada a uma sobrevivência geral mais curta e livre de doença, e a regressão multivariada de Cox verificou seu valor prognóstico independente. A análise de enriquecimento funcional indicou que esses três genes participam da transição epitelial-mesenquimal, remodelação da matriz extracelular e imunosupressão, todos intimamente relacionados à invasão e metástase do LUAD. Os autores ainda construíram um nomograma prognóstico combinando os três genes e o estágio TNM, alcançando um índice de concordância de 0,743 e demonstrando bom desempenho preditivo. Esses achados confirmam que B3GNT3, FERMT1 e SPP1 são biomarcadores diagnósticos e prognósticos promissores para o LUAD, apoiando a aplicação clínica na estratificação e manejo de riscos.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O câncer de pulmão é a principal causa de mortalidade global por câncer, representando aproximadamente 1,8 milhão de mortes em 2020. O adenocarcinoma pulmonar (LUAD) representa quase 40% de todos os casos de câncer depulmão 2. Apesar dos avanços em cirurgia, terapia direcionada e imunoterapia, a taxa de sobrevivência a 5 anos para LUAD avançado permanece abaixo de 20%3,4. Biomarcadores moleculares confiáveis para detecção precoce e prognóstica precisa são urgentemente necessários. Sequenciamento de alto rendimento e bancos de dados públicos como The Cancer Genome Atlas (TCGA) e Gene Expression Omnibus (GEO) permitem o perfilamento transcriptômico sistemático doscânceres 5,6. A bioinformática integrativa entre coortes melhora a confiabilidade da descoberta de biomarcadorescandidatos 5.

Muitos genes e vias foram implicados no LUAD, incluindo proliferação celular, sinalização de EGFR e fuga imune7. No entanto, poucos foram traduzidos para uso clínico. Modelos de risco que combinam assinaturas gênicas e características clinicopatológicas — especialmente nomogramas — melhoram a precisão prognóstica noLUAD 8. Embora B3GNT3, FERMT1 e SPP1 tenham sido individualmente ligados à progressão do câncer, seu valor diagnóstico combinado, prognóstico e regulatório imuno-microambiental no LUAD não foi validado sistematicamente entre coortes independentes. Este estudo fornece a primeira análise integrada multiplataforma desses três genes como um painel unificado de biomarcadores para LUAD, com um nomograma prognóstico clinicamente aplicável.

B3GNT3 codifica uma glicosiltransferase que estabiliza PD-L1 e promove a evasão imune 9,10. FERMT1 (kindlin-1) regula a ativação da integrina e impulsiona a metástase em câncer de pulmão de células não pequenas (NSCLC)11,12. SPP1 (osteopontina) media a remodelação da matriz extracelular, a transição epitelial-mesenquimatar (EMT) e a quimiorresistência 13,14,15. Genes relacionados ao relógio circadiano também demonstraram prever o prognóstico e o diagnósticodo LUAD 16, enquanto diferenças sexuais no LUAD foram descobertas por meio de redes integrativas de sinalização proteicamulti-ômicas 17. B3GNT3 e SPP1 são secretados ou localizados em membranas, apoiando o uso potencial como biomarcadores minimamente invasivos. A classificação eficaz do LUAD e a identificação de biomarcadores também podem ser alcançadas por meio de métodos sobrepostos de seleçãode características 18, e interações multiômicas desempenham papéis funcionais importantes na progressão do câncerde pulmão 19. Assinaturas genéticas mitocondriais, identificadas por meio de integração multi-ômica abrangente, também têm valor para o prognóstico do LUAD e para a terapiapersonalizada 20. B3GNT3 e SPP1 são secretados ou localizados em membranas, apoiando o uso potencial como biomarcadores minimamente invasivos. Este estudo teve como objetivo identificar biomarcadores robustos de LUAD usando bioinformática integrativa, avaliar seu desempenho diagnóstico e prognóstico, explorar suas funções biológicas e associações imunológicas, e construir um nomograma prognóstico clinicamente útil.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Fontes de dados e pré-processamento

  1. Processar dados brutos em R (versão 4.1.3; Windows 10 Pro).
  2. Para GSE115002, aplique normalização de quantil usando limma (versão 3.52.3).
  3. Filtrar genes de baixa expressão para TCGA: reter genes com CPM > 0,5 em ≥50% das amostras.
  4. Filtrar genes de baixa expressão para GSE115002: manter genes com sinal médio >50.
  5. log2Transforme valores de expressão com uma pseudocontagem de +1.
    NOTA: A expressão gênica e os dados clínicos do LUAD foram obtidos do TCGA-LUAD (versão 33.0, Portal GDC, baixado em 7 de agosto de 2025) e GSE115002 (Agilent microarray, GEO, baixado em 7 de agosto de 2025). O TGA-LUAD incluiu 535 tumores e 59 amostras normais. GSE115002 incluíram 52 tumores e 52 amostras normais correspondentes.

2. Identificação de genes diferencialmente expressos

  1. Use o DESeq2 (versão 1.36.0) para o RNA-seq do TCGA e o limma (versão 3.52.3) para GSE115002 para análise diferencial de expressão. Calcule os valores P ajustados (FDR) usando o método de Benjamini–Hochberg.
  2. Para garantir a comparabilidade entre conjuntos de dados, um |log₂FC| unificado ≥ 1,0 foi aplicado para ambas as turmas. Os DEGs foram definidos como FDR < 0,05 e |log₂FC| ≥ 1.0. DEGs sobrepostos foram identificados usando o VennDiagram (versão 1.7.3). B3GNT3, FERMT1 e SPP1 foram selecionados como candidatos consistentemente aumentados e com relevância conhecida para o câncer.

3. Avaliação do valor diagnóstico

  1. Construa curvas ROC para cada gene candidato.
  2. Determine os valores de corte ótimos usando o índice de Youden.
  3. Calcule AUC, sensibilidade e especificidade para cada gene.
  4. Construa um painel diagnóstico combinado usando regressão logística multivariada.
    NOTA: O pacote pROC v1.18.0 foi usado para análise ROC. A função glm com a família binomial foi usada para construir o modelo diagnóstico.

4. Análise de sobrevivência

  1. Estratificar os pacientes em grupos de alta e baixa expressão usando a expressão mediana.
  2. Gerar curvas de sobrevivência de Kaplan–Meier para cada gene.
  3. Realize testes log-rank para comparar as diferenças de sobrevivência.
  4. Realize uma análise de regressão de Cox univariada.
  5. Realize uma análise multivariada de regressão de Cox.
  6. Incluir covariáveis clínicas em modelos de regressão.
  7. Verifique a suposição de riscos proporcionais usando resíduos de Schoenfeld.
  8. Calcule uma pontuação de risco de três genes.
    NOTA: Foram usados Survival v3.3.1 e survminer v0.4.9. As covariáveis incluíam idade, sexo, estágio T, estágio N e estágio M. A pontuação de risco foi calculada como:
    Pontuação de risco = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)

5. Enriquecimento de conjuntos gênicos e anotação funcional

  1. Realize a análise de enriquecimento GO usando DEGs.
  2. Realize a análise de enriquecimento de vias KEGG usando DEGs.
  3. Realize a análise de enriquecimento do conjunto de genes (GSEA).
  4. Classifice genes pela correlação de Pearson com a expressão gênica candidata.
  5. Identifique termos significativos usando P ajustado < 0,05.
    NOTA: o clusterProfiler v4.6.2 foi usado para análises GO e KEGG. FGSEA v1.22.0 e MSigDB Hallmark v7.5 foram usados para GSEA.

6. Correlação e análise de redes

NOTA: A correlação de Pearson foi usada para expressão gênica normalmente distribuída; Correlação de Spearman para frações de células imunes. Redes PPI foram geradas usando STRING (versão 11.5, confiança > 0.7) e visualizadas no Cytoscape (versão 3.9.1). A infiltração imune foi estimada usando CIBERSORT (modo absoluto, 100 permutações). O sequenciamento de RNA unicelular demonstrou revelar transições específicas no microambiente NSCLC, relevantes para a análise de infiltraçãoimune 21,22, e a análise integrativa de célula única pode dissecar ainda mais os papéis das células imunes, como as células de memória CD8+, no LUAD 23,24,25.

7. Construção e validação de nomogramas

NOTA: As variáveis para o nomograma foram selecionadas com base na significância multivariada de Cox (P < 0,05): Estágio T, Estágio N, B3GNT3, FERMT1 e SPP1. O nomograma foi construído usando rms (versão 6.5.0). A validação interna usava 1000 reamostragem bootstrap com substituição. Curvas de calibração e análise de curvas de decisão (DCA) foram realizadas usando RMDA (versão 1.7). O ambiente computacional incluía R 4.1.3, Windows 10 Pro e Bioconductor 3.15. Os roteiros de análise estão disponíveis em https://github.com/[redacted]/LUAD-biomarker-2025 mediante solicitação razoável.

8. Análise estatística

NOTA: Todos os testes estatísticos foram bilaterais; P < 0,05 foi considerado significativo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alterações globais na expressão gênica no LUAD

Comparações transcriptômicas entre tecidos adenocarcinomas pulmonares e tecidos pulmonares normais identificaram mudanças generalizadas na expressão gênica. A Figura 1A mostra gráficos vulcânicos de genes diferencialmente expressos no conjunto de dados TCGA-LUAD, e a Figura 1B mostra aqueles do conjunto de dados GSE115002. Na coorte TCGA-LUAD (Fig...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O nomograma foi construído usando análise multivariada de regressão de Cox baseada na coorte TCGA-LUAD. Os preditores incluem o estágio patológico T, o estágio patológico N e o estado de expressão gênica de B3GNT3, FERMT1 e SPP1 (categorizados como Alto vs. Baixo com base na expressão mediana). Para cada paciente, as pontuações individuais de cada variável são somadas para gerar um valor de "Pontos Totais", que corresponde às probabilidades estimadas de sobrevi...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não haver interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse trabalho foi apoiado pelo Projeto Universitário de Nível Universitário da Universidade de Medicina Tradicional Chinesa de Fujian 2024 (Número da Bolsa: XB2024012), liderado por Yuhui Lin do Hospital Popular Afiliado da Universidade de Medicina Tradicional Chinesa de Fujian. e Fundos Conjuntos para a inovação em ciência e tecnologia, Província de Fujian (Subsídio nº 2025Y9530), liderados por Xiaoting Chen do Hospital Municipal de Jinjiang (Hospital Popular Sexto de Xangai, Fujian).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Publicly Available DatasetsTCGA-LUAD DatasetThe Cancer Genome Atlas (TCGA) Portal (https://portal.gdc.cancer.gov/); 535 amostras de tumores de LUAD, 59 amostras de tecido pulmonar normal adjacente (contagem de RNA-sequencing/valores FPKM + dados clínicos: sobrevivência, estadiamento TNM)Dados transcriptômicos e clínicos para análise de expressão diferencial, sobrevivência e análise de nomograma; coorte de estudo primário
GSE115002 DatasetGene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE115002); Microarray Agilent, 52 tecidos tumorais de LUAD, 52 tecidos pulmonares normais adjacentes correspondentes (tumores primários não tratados)Coorte de validação independente para análise de expressão diferencial, desempenho diagnóstico e infiltração imunológica
Bioinformatics Software & Programming EnvironmentLinguagem de Programação RVersão 4.1Plataforma central para todas as análises transcriptômicas, estatísticas e gráficas
Pacotes R (Expressão Diferencial)DESeq2, limmaDESeq2: análise de expressão diferencial de contagem bruta de RNA-seq do TCGA; limma: normalização de microarray GSE115002 e análise de expressão diferencial (correção FDR Benjamini–Hochberg)
Pacotes R (Análise Diagnóstica)pROCConstrução de curvas ROC, cálculo de AUC (IC 95%), determinação do corte ideal (índice de Youden’s) para avaliação de desempenho diagnóstico
Pacotes R (Análise de Sobrevivência)survival, survminerGeração de curva de sobrevivência Kaplan–Meier, teste log-rank, regressão de risco proporcional de Cox univariada/multivariada (HR + IC 95%); estratificação de pacientes pela mediana de expressão gênica
Pacotes R (Enriquecimento Funcional)clusterProfiler, fgseaclusterProfiler: análise de enriquecimento de vias GO (BP/CC/MF) e KEGG (P ajustado < 0,05); fgsea: GSEA para conjuntos de genes MSigDB Hallmark/KEGG (FDR < 0,25)
Pacotes R (Construção e Validação de Nomograma)rmsDesenvolvimento de nomograma prognóstico (integração de expressão gênica + estágio TNM); cálculo do índice C de Harrell’s, reamostragem por bootstrap (1000 repetições) para correção de viés, geração de gráfico de calibração
Pacotes R (Estatística & Visualização)ggplot2, ComplexHeatmap, corrplotGeração de gráficos de vulcão, gráficos de bolhas (enriquecimento), mapas de calor (correlação de infiltração imunológica), gráficos de dispersão (coexpressão gênica); análise de correlação Pearson/Spearman
Bioinformatics Databases & Tools (Análise de Rede/Imunológica)Banco de Dados STRINGPontuação de confiança > 0,7Construção de redes de interação proteína-proteína (PPI) para B3GNT3/FERMT1/SPP1 e interatores de primeiro grau
Cytoscape-Visualização de redes PPI e coexpressão gênica (ponderação das arestas pela força da correlação, identificação de genes hub)
Algoritmo de Deconvolução ImunológicaCIBERSORTEstimação da abundância de infiltração de células imunológicas (macrófagos M2, células T CD8+, neutrófilos, células NK, etc.) em amostras de LUAD; correlação com a expressão do gene candidato
Outras FerramentasMicrosoft Office/LaTeX-Preparação de manuscritos, montagem de figuras e formatação de tabelas; compilação de resultados estatísticos

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Cancer ResearchB3GNT3FERMT1SPP1biomarkerprognosisgene expressionnomogram

Artigos relacionados