$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Fontes de dados e pré-processamento
- Processar dados brutos em R (versão 4.1.3; Windows 10 Pro).
- Para GSE115002, aplique normalização de quantil usando limma (versão 3.52.3).
- Filtrar genes de baixa expressão para TCGA: reter genes com CPM > 0,5 em ≥50% das amostras.
- Filtrar genes de baixa expressão para GSE115002: manter genes com sinal médio >50.
- log2Transforme valores de expressão com uma pseudocontagem de +1.
NOTA: A expressão gênica e os dados clínicos do LUAD foram obtidos do TCGA-LUAD (versão 33.0, Portal GDC, baixado em 7 de agosto de 2025) e GSE115002 (Agilent microarray, GEO, baixado em 7 de agosto de 2025). O TGA-LUAD incluiu 535 tumores e 59 amostras normais. GSE115002 incluíram 52 tumores e 52 amostras normais correspondentes.
2. Identificação de genes diferencialmente expressos
- Use o DESeq2 (versão 1.36.0) para o RNA-seq do TCGA e o limma (versão 3.52.3) para GSE115002 para análise diferencial de expressão. Calcule os valores P ajustados (FDR) usando o método de Benjamini–Hochberg.
- Para garantir a comparabilidade entre conjuntos de dados, um |log₂FC| unificado ≥ 1,0 foi aplicado para ambas as turmas. Os DEGs foram definidos como FDR < 0,05 e |log₂FC| ≥ 1.0. DEGs sobrepostos foram identificados usando o VennDiagram (versão 1.7.3). B3GNT3, FERMT1 e SPP1 foram selecionados como candidatos consistentemente aumentados e com relevância conhecida para o câncer.
3. Avaliação do valor diagnóstico
- Construa curvas ROC para cada gene candidato.
- Determine os valores de corte ótimos usando o índice de Youden.
- Calcule AUC, sensibilidade e especificidade para cada gene.
- Construa um painel diagnóstico combinado usando regressão logística multivariada.
NOTA: O pacote pROC v1.18.0 foi usado para análise ROC. A função glm com a família binomial foi usada para construir o modelo diagnóstico.
4. Análise de sobrevivência
- Estratificar os pacientes em grupos de alta e baixa expressão usando a expressão mediana.
- Gerar curvas de sobrevivência de Kaplan–Meier para cada gene.
- Realize testes log-rank para comparar as diferenças de sobrevivência.
- Realize uma análise de regressão de Cox univariada.
- Realize uma análise multivariada de regressão de Cox.
- Incluir covariáveis clínicas em modelos de regressão.
- Verifique a suposição de riscos proporcionais usando resíduos de Schoenfeld.
- Calcule uma pontuação de risco de três genes.
NOTA: Foram usados Survival v3.3.1 e survminer v0.4.9. As covariáveis incluíam idade, sexo, estágio T, estágio N e estágio M. A pontuação de risco foi calculada como:
Pontuação de risco = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)
5. Enriquecimento de conjuntos gênicos e anotação funcional
- Realize a análise de enriquecimento GO usando DEGs.
- Realize a análise de enriquecimento de vias KEGG usando DEGs.
- Realize a análise de enriquecimento do conjunto de genes (GSEA).
- Classifice genes pela correlação de Pearson com a expressão gênica candidata.
- Identifique termos significativos usando P ajustado < 0,05.
NOTA: o clusterProfiler v4.6.2 foi usado para análises GO e KEGG. FGSEA v1.22.0 e MSigDB Hallmark v7.5 foram usados para GSEA.
6. Correlação e análise de redes
NOTA: A correlação de Pearson foi usada para expressão gênica normalmente distribuída; Correlação de Spearman para frações de células imunes. Redes PPI foram geradas usando STRING (versão 11.5, confiança > 0.7) e visualizadas no Cytoscape (versão 3.9.1). A infiltração imune foi estimada usando CIBERSORT (modo absoluto, 100 permutações). O sequenciamento de RNA unicelular demonstrou revelar transições específicas no microambiente NSCLC, relevantes para a análise de infiltraçãoimune 21,22, e a análise integrativa de célula única pode dissecar ainda mais os papéis das células imunes, como as células de memória CD8+, no LUAD 23,24,25.
7. Construção e validação de nomogramas
NOTA: As variáveis para o nomograma foram selecionadas com base na significância multivariada de Cox (P < 0,05): Estágio T, Estágio N, B3GNT3, FERMT1 e SPP1. O nomograma foi construído usando rms (versão 6.5.0). A validação interna usava 1000 reamostragem bootstrap com substituição. Curvas de calibração e análise de curvas de decisão (DCA) foram realizadas usando RMDA (versão 1.7). O ambiente computacional incluía R 4.1.3, Windows 10 Pro e Bioconductor 3.15. Os roteiros de análise estão disponíveis em https://github.com/[redacted]/LUAD-biomarker-2025 mediante solicitação razoável.
8. Análise estatística
NOTA: Todos os testes estatísticos foram bilaterais; P < 0,05 foi considerado significativo.