Este estudo utilizou apenas conjuntos de dados públicos e desidentificados, e não envolveu experimentação direta em humanos ou animais; portanto, não era necessário adicional aprovação do comitê de ética e consentimento informado.
Download e processamento de dados
Os dados de sequenciamento de RNA e as informações clínicas correspondentes para o carcinoma escamoso do pulmão (LUSC) foram obtidos do banco de dados The Cancer Genome Atlas (TCGA) por meio do portal de dados Genomic Data Commons no projeto TCGA-LUSC. A matriz de expressão TCGA-LUSC usada neste estudo foi baseada em valores FPKM. Os valores de expressão gênica foram transformados e normalizados antes das análises posteriores. As variáveis clínicas incluíram idade, sexo, estágio tumoral, estágio patológico da TNM, grau, tempo de sobrevivência e status de sobrevivência quando disponíveis. Um total de 489 casos de TCGA-LUSC foram inicialmente coletados, e 381 pacientes com perfis de expressão completa e informações de sobrevivência geral foram incluídos na construção do modelo prognóstico e avaliação interna.
Conjuntos de dados independentes de validação foram baixados do banco de dados Gene Expression Omnibus (GEO) em 3 de janeiro de 2026. GSE30219 foi baseada na plataforma GPL570 e incluiu 307 pacientes com LUSC com informações disponíveis de expressão e sobrevivência geral. GSE37745 também foi baseada na plataforma GPL570 e incluiu 196 pacientes com LUSC com informações disponíveis de expressão e sobrevivência geral. GSE57148 foi baseada na plataforma GPL11154 e incluiu 91 tecidos pulmonares normais e 98 tecidos pulmonares de pacientes com doença pulmonar obstrutiva crônica (DPOC), totalizando 189 amostras. GSE57148 foi usado para identificar genes diferencialmente expressos associados à DPOC, enquanto GSE30219 e GSE37745 foram usados como coortes independentes de validação externa.
Para conjuntos de dados GEO, a anotação de sonda era realizada usando o correspondente pacote de anotação R e arquivos de anotação da plataforma. Os identificadores da sonda foram convertidos em símbolos genéticos oficiais. Quando múltiplas sondas mapeavam para o mesmo gene, a sonda com o maior valor médio de expressão era mantida para representar esse gene. Nenhum gene modelo ausente foi detectado nos conjuntos de dados de validação após a correspondência entre símbolos de genes e símbolos. TCGA-LUSC, GSE30219 e GSE37745 foram analisados como coortes gerais de LUSC porque o status de comorbidade de DPOC em nível de paciente não foi confirmado nas anotações usadas nesta análise.
Como os conjuntos de dados TCGA e GEO foram gerados usando diferentes plataformas de expressão, a normalização multiplataforma e a correção de efeitos em lote foram realizadas usando métodos padrão de pré-processamento baseados em R antes da aplicação do modelo. O modelo de risco foi treinado na coorte TCGA-LUSC e depois avaliado de forma independente em cada coorte externa GEO, em vez de mesclar diretamente todas as coortes. A análise diferencial de expressão foi realizada usando o pacote limma R. Genes diferencialmente expressos à DPOC em GSE57148 foram triados usando |log2FC| > 0,263 e P < 0,05. Esse limiar de log2FC corresponde a uma variação de aproximadamente 1,2 vezes e foi usado como critério exploratório para reter genes potencialmente relevantes associados à PANoptose. Um total de 277 genes associados à PANoptose foram selecionados a partir de estudos previamente publicados relacionados à apoptose, piroptose, necroptose e PANoptose, e estão apresentados na Tabela Suplementar 1.
Análise de enriquecimento funcional de genes
Para esclarecer as implicações funcionais dos genes selecionados da PANoptose associados à DPOC, análises de enriquecimento da Gene Ontology (GO) e da Kyoto Encyclopedia of Genes and Genomes (KEGG) foram realizadas utilizando o pacote clusterProfiler R e a organização. Hs.eg.db pacote de anotações. Foram avaliadas as categorias de processo biológico GO, componentes celulares e função molecular. A análise de enriquecimento das vias KEGG foi realizada para identificar vias de sinalização associadas aos genes selecionados. Os valores P foram ajustados para testes múltiplos usando o método da taxa de falsa descoberta de Benjamini-Hochberg, quando aplicável. Termos de enriquecimento com P < 0,05 foram considerados estatisticamente significativos nesta análise exploratória. Os plots de enriquecimento foram gerados usando ggplot2.
Análise não supervisionada de agrupamento de padrões de expressão gênica associados à PANoptose
Para explorar a heterogeneidade molecular associada à expressão gênica associada à PANoptose no LUSC, foi realizado agrupamento por consenso usando o pacote Consensus ClusterPlus R. Amostras de LUSC foram agrupadas de acordo com os perfis de expressão dos genes de PANoptose associados à sobrevivência. O agrupamento hierárquico foi aplicado com a distância de correlação de Pearson. O número máximo de clusters foi definido para seis, e 1.000 iterações de reamostragem foram realizadas para avaliar a robustez do agrupamento. O número ótimo de agrupamento foi determinado avaliando a matriz de consenso, a curva da função de distribuição cumulativa, o gráfico da área delta e a interpretabilidade biológica dos grupos resultantes. Com base nesses critérios, k = 2 foi selecionado para análise posterior. As diferenças de sobrevivência entre os dois grupos moleculares foram avaliadas usando análise de Kaplan-Meier e o teste de log-rank.
Análise das diferenças do microambiente imunológico entre subtipos
Para comparar as características do microambiente imune entre subtipos moleculares, a infiltração de células imunes foi estimada usando o algoritmo de deconvolução CIBERSORT com a matriz de assinatura leucocitária LM22. A análise foi realizada em R usando os pacotes e1071 e preprocessCore. Os valores P da permutação CIBERSORT foram registrados para avaliar a confiabilidade das estimativas de deconvolução. Como este estudo foi exploratório e baseado em dados transcriptômicos retrospectivos, as diferenças entre células imunes foram interpretadas como padrões computacionalmente inferidos de infiltração imunológica, em vez de medições celulares diretas.
O algoritmo ESTIMATE foi usado para calcular escore estromal, escore imunológico, escore ESTIMATE e pureza tumoral para cada amostra tumoral. O GSVA foi aplicado para estimar as pontuações de enriquecimento em nível de via com base em conjuntos genéticos selecionados. Diferenças por grupo em frações de células imunes, genes de checkpoint imunológico, genes da família HLA e escores derivados do ESTIMATE foram avaliadas por meio de testes não paramétricos. Para múltiplas comparações relacionadas ao sistema imunológico, a correção de Benjamini-Hochberg foi aplicada quando apropriado; análises relatadas usando valores nominais de P foram interpretadas como exploratórias. A análise de correlação de rank de Spearman foi usada para avaliar associações entre expressão gênica e marcadores relacionados ao sistema imunológico, com coeficientes de correlação e valores P relatados quando aplicável. As diferenças entre transcritos HLA foram interpretadas como alterações transcricionais relacionadas à apresentação do antígeno, em vez de evidências funcionais diretas de maior capacidade de apresentação de antígenos.
Estabelecimento de uma assinatura prognóstica relacionada a genes associados à PANoptose
A coorte TCGA-LUSC com perfis completos de expressão e informações de sobrevivência geral foi usada para a construção prognóstica do modelo. Entre os 489 casos inicialmente recuperados de TCGA-LUSC, 381 pacientes com dados completos de sobrevivência geral foram incluídos na análise prognóstica. Esses pacientes foram divididos aleatoriamente em uma coorte de treinamento e uma coorte interna de testes, com uma proporção de 7:3. A randomização estratificada foi realizada de acordo com o status de sobrevivência para manter uma distribuição comparável de eventos de sobrevivência entre as coortes de treinamento e teste.
Na coorte de treinamento, a regressão de riscos proporcionais de Cox univariada foi usada pela primeira vez para avaliar a associação entre cada gene candidato associado à PANoptose e a sobrevivência geral. Genes com P < 0,05 foram considerados genes prognósticos candidatos e posteriormente inseridos na regressão LASSO Cox usando o pacote glmnet R. A validação cruzada dez vezes foi usada para selecionar o parâmetro de penalidade ideal e reduzir o sobreajuste. Com base nos coeficientes de regressão de Cox do LASSO e nos valores de expressão gênica normalizados correspondentes, um escore de risco individualizado foi calculado para cada paciente usando a fórmula:
Pontuação de risco = Σ(coefi × Xi)
onde coefi representa o coeficiente de regressão de cada gene selecionado e Xi representa o valor de expressão normalizada do gene correspondente. O modelo prognóstico final continha 12 genes: GSDMD, IL18, NFKBIA, PIK3CA, IL1B, BIRC3, MCL1, PSMB10, LMNA, CFLAR, IL1R1 e AKT3. A equação completa baseada em coeficientes de risco é fornecida na Tabela Suplementar 2.
A pontuação mediana de risco na coorte de treinamento foi usada como corte para classificar os pacientes em grupos de alto e baixo risco. A mesma fórmula de escórrea de risco foi aplicada à coorte interna de testes e às coortes externas de validação GSE30219 e GSE37745. Análise de sobrevivência de Kaplan-Meier, testes de classificação logarítmica e análise da curva característica operacional dependente do tempo do receptor foram usados para avaliar o desempenho do modelo. Como os conjuntos de dados de validação foram gerados usando plataformas de microarray e não continham anotação confirmada de comorbidade para DPOC, a validação externa foi interpretada como avaliação retrospectiva em coortes independentes de LUSC, em vez de validação em pacientes clinicamente confirmados com LUSC com LUCC.
Análise de previsão de sensibilidade a medicamentos
A sensibilidade ao medicamento foi estimada usando o pacote pRRophetic R, que prevê a resposta a medicamentos a partir dos perfis de expressão gênica tumoral com base em dados farmacogenômicos de referência do banco de dados Genomics of Drug Sensitivity in Cancer. Valores previstos de concentração inibitória metade-máxima (IC50) foram calculados para cada amostra de paciente. Matrizes de expressão foram processadas de acordo com os requisitos de entrada pRRofético, e a correção de efeito em lote foi realizada usando o fluxo de trabalho padrão compatível com pRRophetic. Os valores previstos de IC50 foram reportados na escala de saída pRRophetic.
Oito agentes candidatos, incluindo sorafenibe, gefitinibe, bleomicina, bosutinib, etopóside, lenalidomida, camptotecina e metotrexato, foram avaliados em um painel exploratório de sensibilidade a medicamentos. As diferenças nos valores previstos de IC50 entre grupos de alto e baixo risco foram comparadas usando o teste de soma de ranks de Wilcoxon. Esses resultados foram interpretados como estimativas computacionais de sensibilidade ao medicamento, em vez de resposta medida à quimioterapia clínica ou resistência a medicamentos confirmada experimentalmente.
Análise estatística
Todas as análises estatísticas foram realizadas usando o software R. Variáveis contínuas entre dois grupos foram comparadas usando o teste de soma de ranks de Wilcoxon, enquanto comparações entre mais de dois grupos foram realizadas usando o teste de Kruskal-Wallis quando apropriado. A sobrevivência geral foi definida como o principal ponto final de sobrevivência. Curvas de sobrevivência de Kaplan-Meier foram geradas para comparar diferenças de sobrevivência entre grupos, e a significância estatística foi avaliada usando o teste log-rank. Univariada e multivariada
Análises de regressão de riscos proporcionais de Cox foram usadas para avaliar associações prognósticas entre variáveis clínicas, grupo de risco e sobrevivência geral. Variáveis com relevância clínica ou significância estatística na análise de Cox univariada foram consideradas para regressão multivariada de Cox. A suposição de riscos proporcionais foi avaliada usando resíduos de Schoenfeld. As variáveis clínicas ausentes foram tratadas usando análise completa de casos para regressão de Cox e construção de nomogramas. A colinearidade entre variáveis clínicas foi avaliada antes da modelagem multivariada.
Curvas ROC dependentes do tempo foram usadas para avaliar o desempenho preditivo do modelo de risco para a sobrevivência geral de 1, 3 e 5 anos. Um nomograma foi construído usando variáveis retidas no modelo multivariado ou variáveis com disponibilidade clínica suficiente. Gráficos de calibração foram usados para comparar as probabilidades de sobrevivência geral previstas e observadas. A análise da curva de decisão foi realizada como uma avaliação exploratória do potencial benefício líquido entre probabilidades limiar selecionadas.
A análise de correlação de rank de Spearman foi usada para avaliar associações entre expressão gênica e características relacionadas ao sistema imunológico. Coeficientes de correlação e valores P foram relatados quando aplicável. Para comparações múltiplas, foi aplicada correção da taxa de falsas descobertas de Benjamini-Hochberg quando apropriado. Análises relatadas usando valores nominais de P foram consideradas exploratórias. Um valor P bilateral < 0,05 foi considerado estatisticamente significativo.