$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo acessou o Banco de Dados11 (Versão 1.0) do Medical Information Mart for Intensive Care IV (MIMIC-IV), PhysioNet: https://physionet.org/content/mimiciv/1.0/) e do Banco de Dados12 da Unidade de Terapia Intensiva de Telemedicina (eICU) (Versão 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/), após concluir o exame Protecting Human Research Participants (ID de Registro: 44151052). Este estudo foi conduzido de acordo com os princípios da Declaração de Helsinque (2013), e os pacientes deram consentimento para que seus dados fossem capturados nos dois bancos de dados. A aprovação ética foi dispensada para este estudo porque os dados das bases de dados da eICU e MIMIC-IV eram totalmente anonimizados (sem identificadores pessoais mantidos).
Materiais e ferramentas
Fontes de Dados: Banco de Dados MIMIC-IV: Versão 1.0, registro de acesso aberto de centro único contendo 76.540 admissões em UTI (2008-2019), acessado via PhysioNet. Banco de Dados da eUTI: Versão 2.0, banco de dados multicêntrico contendo >200.000 prontuários eletrônicos de 335 unidades em 208 hospitais dos EUA (2014-2015), acessado via PhysioNet. Software e Ambiente de Execução: RapidMiner Studio: Versão 9.10.001 (ambiente de execução: Windows 10 Pro 64-bit), usado para construção de modelos (classificação/clustering) e seleção de recursos; IBM SPSS Statistics: Versão 23.0 (ambiente de execução: Windows 10 Pro 64-bit), usado para análise estatística e imputação de valores faltantes; Java Development Kit (JDK): Versão Java SE 8u381 (ambiente de execução: Windows 10 Pro 64-bit), usado para desenvolvimento de aplicações Web; suporte ao IDE: Eclipse IDE 2023-09; Apache Tomcat: Versão 9.0.85, usado para implantar a aplicação baseada na Web.
Desenho do estudo e ambientes
O conceito deste estudo é ilustrado na Figura Suplementar 1. Este estudo analisou dados de duas grandes fontes, os bancos de dados Medical Information Mart for Intensive Care IV (MIMIC-IV) e Telehealth Intensive Care Unit (eICU), para construir um modelo preditivo da SDRA associada à pneumonia e classificar os pacientes afetados de acordo com fenótipos clínicos. Este estudo seguiu as diretrizes do Modelo de Previsão Transparente de Relato de um Modelo de Previsão Multivariável para Prognóstico ou Diagnóstico Individual (TRIPOD).
Amostras de estudo
Os dados de treinamento e testes deste estudo foram obtidos do MIMIC-IV. A fonte da verificação externa era o banco de dados multicêntrico da eICU. Este estudo utilizou a Classificação Internacional de Doenças (Nona e Décima Revisão) para extrair dados sobre pacientes com pneumonia e SDRA associada à pneumonia. Pacientes que ficaram internados por menos de 24 horas foram excluídos.
Preditores
Após avaliar a disponibilidade de dados e a taxa de variáveis clínicas ausentes nos conjuntos de dados MIMIC-IV e eICU, 52 variáveis para ARDS associado à pneumonia foram selecionadas como variáveis de treinamento candidatas a serem usadas em aprendizado de máquina, incluindo características demográficas dos pacientes, achados laboratoriais e escores de gravidade da doença. Este estudo utilizou um algoritmo de peso por correlação (baseado no peso de correlação entre variáveis e resultados) para selecionar preditores-chave (variáveis que são incluídas nos modelos) das 52 variáveis candidatas e, em seguida, selecionou fatores de agrupamento de subgrupos a partir dos principais preditores.
Para isso, abra o RapidMiner Studio, crie um novo processo e adicione o operador Peso por Correlação clicando em Operadores de > de Processo > Seleção de Características > Peso por Correlação. Defina o parâmetro: Limiar de correlação = 0,04 (mantenha variáveis com peso > 0,04). Para forçar o modelo a considerar os estágios iniciais da doença e a rapidez, os valores máximos e mínimos dos indicadores laboratoriais foram obtidos dentro de 24 horas após a admissão. Como o Escore III de Fisiologia Aguda (APSIII) não foi incluído no banco de dados da eUTI, foram usados escores na Avaliação de Fisiologia Aguda e Saúde Crônica IV (APACHE IV). Este estudo limpou os dados e interpolou os valores ausentes usando o método de imputação múltipla e padronizou as variáveis de entrada ao desenvolver modelos de previsão e sub-fenotipagem.
Análise estatística
Abra o SPSS 23.0, importe o conjunto de dados pré-processado e selecione Analisar > Estatísticas Descritivas > Explorar. Verifique Gráficos de Normalidade com Testes para realizar o teste de Kolmogorov-Smirnov para variáveis contínuas. Variáveis distribuídas enviesadas são reportadas como mediana (intervalo interquartil, IQR); Variáveis categóricas são reportadas como contagem (porcentagem, %). Para comparar variáveis contínuas entre grupos, foi utilizado o teste Mann-Whitney U ou o teste de Kruskal-Wallis, conforme apropriado. Para comparar variáveis categóricas entre grupos, foi usado o teste qui-quadrado de Pearson ou o teste exato de Fisher, conforme apropriado.
Desenvolvimento de modelos e apresentação web
Para o desenvolvimento de modelos, este estudo dividiu a coorte de derivação do MIMIC-IV em um conjunto de treinamento (90% da amostra completa escolhida aleatoriamente para desenvolvimento de modelos e ajuste de hiperparâmetros) e um conjunto de teste (10% da amostra completa escolhida aleatoriamente para testes internos); este estudo realizou verificação externa na eICU. Este estudo implementou aprendizado de máquina com cinco métodos: árvore de decisão, regressão logística, naïve bayes, empilhamento (os aprendizes base eram a regressão logística, os métodos de naïve bayes e a floresta aleatória; o aprendiz empilhante era o método da árvore de decisão) e a floresta aleatória. Árvore de decisão: clique em Process > Operators > Modelagem > Classificação > Árvore de Decisão com Algoritmo = C4.5, Tamanho mínimo da folha = 5. Para regressão logística: clique em Operadores de > de Processo > Modelagem > Classificação > Regressão Logística com força de regularização = 0,1, Iterações máximas = 100. Para Naive Bayes: clique em Process > Operators > Modeling > Classification > Naive Bayes com tipo Kernel = Gaussian. Para Floresta Aleatória: clique em Operadores de Processo > > Modelagem > Classificação > Floresta Aleatória com Número de árvores = 100, Profundidade máxima = 20. Para Empilhamento: clique em Process > Operators > Modeling > Ensemble > Empilhamento com aprendizes base = Regressão Logística + Naive Bayes + Random Forest; Empilhamento do aprendiz = Árvore de Decisão. Este estudo mediu o desempenho de predição do modelo desenvolvido calculando a área sob a curva característica operacional do receptor (AUC), precisão, precisão e recordação.
Ao construir a classificação dos subgrupos clínicos de SDRA associados à pneumonia, este estudo utilizou agrupamento k-means com preditores-chave. Para determinar o número ótimo de clusters k, foi examinado o valor das estatísticas de Gap no gráfico de estatísticas de Gap (Gap statistic), que sugeriu o número ótimo de clusters. Este estudo analisou as características clínicas e os desfechos de diferentes fenótipos, e comparamos as diferenças nas taxas de mortalidade hospitalar entre pacientes com diferentes agrupamentos que receberam e não receberam tratamento precoce de corticosteroide em doses baixas a médias.
No RapidMiner Studio, selecione File > Export Model e salve os modelos de diagnóstico de previsão e classificação de subgrupos como arquivos .model. Use JDK Java SE 8u381 e Eclipse IDE 2023-09 para escrever páginas Web em linguagem Java; Importa os arquivos .model para o projeto. Este estudo usou a linguagem Java para desenvolver uma página na qual o modelo diagnóstico e o modelo de clustering de subgrupos clínicos foram incorporados, e enviamos o modelo online.