$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Acesso a banco de dados e ambiente de software
Obtenha acesso autorizado ao banco de dados Medical Information Mart for Intensive Care IV (MIMIC-IV, v3.1) após concluir o treinamento obrigatório sobre uso ético de dados (ID de certificação: 69002811). De acordo com as Medidas para Revisão Ética de Ciências da Vida e Pesquisa Médica Envolvendo Sujeitos Humanos (18 de fevereiro de 2023, China), o Artigo 32 estipula que pesquisas que utilizam dados públicos legalmente obtidos, dados gerados sem interferir no comportamento público ou informações anonimizadas estão isentas de revisão ética. De acordo com essas disposições, este estudo foi isento da aprovação ética institucional. O protocolo de uso de dados e as diretrizes éticas foram rigorosamente seguidos, e o estudo foi conduzido exclusivamente para fins de pesquisa científica. Configure o ambiente de banco de dados usando PostgreSQL (v17.1.11). Use o Navicat Premium (v17) como interface de gerenciamento de banco de dados e consulta para executar consultas SQL e exportar conjuntos de dados extraídos para análise.
Seleção de pacientes
Identificar pacientes com câncer de pulmão no MIMIC-IV usando os códigos17 da Nona e Décima Revisão da Classificação Internacional de Doenças. Aplique os seguintes critérios de exclusão sequencialmente: Idade <18 anos ou >90 anos; Medições de albumina sérica ausentes nas primeiras 24 horas após a internação na UTI; Múltiplas admissões em UTI ou hospital; Duração da internação na UTI <24 horas.
Extração variável
Extraia variáveis do MIMIC-IV (v3.1) usando PostgreSQL (v17.1.11) via Navicat Premium (v17), incluindo: demografia, sinais vitais, exames laboratoriais, comorbibilidades, intervenções terapêuticas, escores de gravidade e desfechos. Demografia: idade, gênero. Sinais vitais nas primeiras 24 horas após a internação na UTI: frequência cardíaca (FC), frequência respiratória (RR), saturação de oxigênio (SpO₂) e temperatura. Variáveis laboratoriais nas primeiras 24 horas: albumina sérica, glicose, creatinina, nitrogênio ureiano, bilirrubina total, hemoglobina, contagem de glóbulos vermelhos (RBC), contagem de glóbulos brancos (WBC), contagem de plaquetas, largura de distribuição de glóbulos vermelhos (RDW), alanina aminotransferase (ALT), aspartato aminotransferase (AST), tempo de protrombina (PT), cálcio, potássio, sódio, cloreto. Comorbididades dos registros diagnósticos: hipertensão, cirrose hepática, doença renal crônica, diabetes mellitus, bronquite crônica, insuficiência cardíaca congestiva e doença pulmonar obstrutiva crônica (DPOC). Escores de gravidade na internação na UTI: Avaliação Sequencial de Insuficiência Orgânica (SOFA), Score II de Fisiologia Aguda Simplificada (SAP II), Índice de Comorbidade de Charlson, Avaliação de Fisiologia Aguda e Saúde Crônica II (APACHE II). Intervenções terapêuticas: corticosteroides sistêmicos, antibióticos, vasopressores. Fator estilo de vida: histórico de tabagismo. Para todas as variáveis laboratoriais e escores de gravidade nas primeiras 24 horas, se houver múltiplas medições disponíveis, calcule o valor médio ao longo do1º dia e use esse valor para análise. Exclua variáveis com mais de 20% de dados faltando. Para variáveis com ausência ≤20%, realize imputação usando o algoritmo missForest, um método de aprendizado de máquina baseado em floresta aleatória para lidar com dados clínicos de tipo misto. A proporção de dados ausentes para variáveis-chave é fornecida na Tabela Suplementar 1.
Definição do resultado
Defina o desfecho primário como mortalidade por todas as causas dentro de 28 dias após a internação na UTI. Verifique o status de mortalidade usando registros de óbito disponíveis no banco de dados MIMIC-IV. Classifique os pacientes como sobreviventes ou não sobreviventes com base no status de mortalidade de 28 dias.
Análise estatística
Avalie a distribuição das variáveis contínuas usando o teste de Shapiro–Wilk. Compare variáveis normalmente distribuídas usando o teste t de Student e variáveis distribuídas não normalmente usando o teste de soma de ranks de Wilcoxon. Compare variáveis categóricas usando o teste qui-quadrado. Realizar regressão de menor encolhimento absoluto e operador de seleção (LASSO) com validação cruzada de 10 vezes para selecionar variáveis candidatas e reduzir a multicolinearidade. Construa modelos multivariáveis de riscos proporcionais de Cox para avaliar a associação independente entre albumina sérica e mortalidade em 28 dias. A albumina sérica foi inserida tanto como variável contínua quanto categórica, e covariáveis selecionadas pela regressão LASSO foram incluídas para ajuste. Razões de risco (HRs) e intervalos de confiança (ICs) de 95% foram estimados. Explore associações não lineares usando análise de spline cúbica restrita (RCS). Os nós foram colocados em percentis pré-definidos da distribuição da albumina, e a não linearidade foi avaliada testando os termos da spline. Gerar curvas de sobrevivência de Kaplan–Meier e comparar distribuições de sobrevivência usando o teste log-rank.
Desenvolvimento e validação de modelos de aprendizado de máquina
Divida aleatoriamente o conjunto de dados no nível do paciente em um conjunto de treinamento (70%), um conjunto de validação (15%) e um conjunto de teste independente (15%). Realize a seleção de características usando o conjunto de treinamento somente identificando a interseção das variáveis selecionadas pela regressão LASSO e pelo algoritmo Boruta, garantindo que apenas preditores estáveis e relevantes sejam mantidos. Treine oito classificadores de aprendizado de máquina no conjunto de treinamento, incluindo regressão logística, floresta aleatória, árvore de decisão, máquina de vetores de suporte, XGBoost, LightGBM, Bayes naïve complementar e classificador de vetores de suporte. O desempenho do modelo foi avaliado inicialmente no conjunto de validação e posteriormente confirmado no conjunto de teste independente usando o AUC-ROC, AUC-PR, precisão, sensibilidade, especificidade, curvas de calibração, análise da curva de decisão e curvas de aprendizado.
Interpretação do modelo e ponto final
Identifique o modelo de aprendizado de máquina com melhor desempenho com base em métricas de desempenho de validação. Aplique as Explicações Aditivas SHapley (SHAP) para quantificar a contribuição de cada característica para a previsão de mortalidade. Gerar gráficos de resumo e dependência do SHAP para visualizar a importância relativa e a direcionalidade da albumina sérica e de outros preditores. Conclua a análise integrando resultados estatísticos e de aprendizado de máquina para estabelecer um quadro interpretável de estratificação de riscos.