$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Pacientes e desenho do estudo
O primeiro conjunto de dados deste estudo foi obtido do banco de dados da Pesquisa Nacional de Saúde e Nutrição (NHANES) para o período de 2017–2018. Esse período específico foi escolhido porque os dados da pesquisa incluíam medições de elastografia transitória por ultrassom do fígado usando tecnologia FibroScan®. O NHANES emprega um design estratificado de amostragem probabilística em múltiplas etapas e serve como uma pesquisa nacional baseada na população realizada bienalmente. Ele coleta sistematicamente dados nacionais representativos relacionados à saúde sobre a população não institucionalizada dos EUA para avaliar o estado nutricional e de saúde da população civil geralnos Estados Unidos 1. O NHANES é um estudo transversal representativo nacionalmente administrado pelo Centro Nacional de Estatísticas de Saúde (NCHS). O protocolo da pesquisa recebeu aprovação do Conselho de Revisão de Ética em Pesquisa do NCHS, com consentimento informado documentado obtido de todos os participantes. O estudo foi conduzido de acordo com as Declarações de Helsinque e de Istambul, e foi aprovado pelo comitê de ética do Primeiro Hospital Afiliado da Universidade Médica de Wenzhou (2016–246, 1º de dezembro de 2016), e o consentimento informado por escrito foi obtido de cada participante.
O primeiro conjunto de dados consistiu em 5494 indivíduos da pesquisa NHANES 2017–2018 que passaram pelo exame FibroScan. Após a exclusão abaixo, um total de 2677 participantes foi incluído na análise, compreendendo 718 indivíduos com NAFLD e 1959 com não-NAFLD. Esses participantes foram então divididos aleatoriamente em um conjunto de treinamento (n = 1785) e um conjunto de testes (n = 892). O segundo conjunto de dados compreendia 582 indivíduos do Departamento de Doenças Infecciosas do Primeiro Hospital Afiliado da Universidade Médica de Wenzhou (2018–2020). Após aplicar os mesmos critérios de exclusão, um total de 200 indivíduos foi incluído, consistindo em 159 indivíduos com NAFLD e 41 indivíduos com não-NAFLD. Essa coorte foi utilizada como um conjunto de validação independente. O desenho do estudo foi desenvolvido para construir e validar o modelo usando dados multicentros, aumentando assim a confiabilidade e a generalização dos achados. As características clínicas de base dos grupos com NAFLD e não NAFLD foram resumidas usando o pacote da tabela um (Tabela 1). Além disso, o processo de seleção de pacientes e o fluxo geral do estudo são ilustrados na Figura 1.
Critérios diagnósticos e critérios de exclusão para NAFLD
O diagnóstico de NAFLD baseou-se nos seguintescritérios: 16 anos: 18 anos ou mais, participação em elastografia transitória (FibroScan) com consumo de álcool limitado a ≤140 g/semana para mulheres e ≤ 210 g/semana para homens nos 12 meses anteriores, valor do parâmetro de atenuação controlada (CAP) de ≥ 302 dB/m conforme medido usando o sistema FibroScan 502 V2 Touch (Echosens, Paris, França) com uma sonda média (M) ou extra-grande (XL), ou diagnóstico confirmado por patologia de biópsia hepática no Departamento de Doenças Infecciosas do Primeiro Hospital Afiliado da Universidade Médicade Wenzhou 23.
Os critérios de exclusão para a NAFLD são descritos da seguinte forma:consumo elevado de álcool (ingestão média diária > 20 g para mulheres e > 30 g para homens, segundo a pesquisaNHANES sobre uso de álcool 5), presença de hepatite B ou C, infecção por HIV, hepatite autoimune, colangite biliar primária, doença de Wilson, uso prolongado de anti-inflamatórios não esteroides, bloqueadores dos canais de cálcio, tamoxifeno, amiodarona, corticosteroides, isoniazida ou metotrexato, gravidez ou amamentação, e diagnóstico de câncer de fígado ou qualquer outro tumor benigno ou maligno.
Coleta de dados e seleção de variáveis
As variáveis preditoras potenciais incluídas neste estudo estão listadas abaixo:
Características demográficas (ou seja, idade e gênero); Índice de massa corporal (IMC); Valores de CAP dos participantes no banco de dados NHANES; Exames bioquímicos gerais [ou seja, Albumina(ALB), Globulina (GLO), Proteína Total (TP), Lactato Desidrogenase (LDH), Nitrogênio Ureia no Sangue (BUN), Ácido Úrico (UA), Gama-Glutamil Transferase (GGT), Triglicerídeos (TG), Soro-Glicose (Glu), Creatinina Sérica (SCr), Bilirrubina Total (TBIL), Sódio (Na⁺), Cloreto (Cl⁻), Potássio (K⁺), Cálcio (Ca), Bicarbonato (HCO₃), Colesterol Total (TC), Aspartato Aminotransferase (AST) e Alanina Aminotransferase (ALT)]; Parâmetros hematológicos padrão [ou seja, contagens de glóbulos vermelhos (RBC), contagem de glóbulos brancos (WBC), contagens de neutrófilos (NEUT), contagens de eosinófilos (EOS), contagens de linfócitos (LYM), contagem de monócitos (MON), largura da distribuição de glóbulos vermelhos (RDW) e contagens de plaquetas (PLT)]; Histórico de hipertensão e diabetes mellitus (DM). Entre os participantes do estudo, os critérios diagnósticos para diabetes e hipertensão foram obtidos a partir de um estudo anterior baseado em aprendizado de máquina, focado naNAFLD 24.
Falta de manuseamento de dados e seleção de recursos
Os dados de coorte utilizados neste estudo incluíram valores ausentes. Excluir todos os registros incompletos não só diminuiria o tamanho da amostra de análise, mas também comprometeria a qualidade dos dados e potencialmente enviesaria os resultados da previsão. Portanto, quaisquer dados com valores excedentes de 20% foram excluídos. Para conjuntos de dados com valores ausentes ≤20%, diferentes métodos de imputação foram aplicados com base no tipo de dado: "norm" para variáveis contínuas, "logreg" para variáveis de classificação binária e "polyreg" para variáveis multiclasse. Essas imputações foram realizadas usando o pacote "ratos" em R para imputaçãomúltipla 25. Neste estudo, todas as variáveis contínuas foram dicotomizadas em variáveis binárias, com limiares de classificação ótimos determinados por análise da curva da característica operacional do receptor (ROC). Especificamente, o ponto de corte correspondente ao índice máximo de Youden na curva ROC foi selecionado como o critério ótimo de classificação, otimizando assim o desempenho da classificação enquanto mantinha um equilíbrio adequado entre sensibilidade e especificidade. Subsequentemente, a análise discriminante parcial de mínimos quadrados (PLS-DA) foi empregada para agrupar os dados de forma eficaz.
Para seleção adicional de características, os indivíduos foram alocados aleatoriamente em conjuntos de treinamento e teste em uma proporção de 7:3 usando o pacote "caret". Primeiro, a regressão do operador de menor encolhimento absoluto e seleção (LASSO) foi utilizada para seleção de características, identificando 14 variáveis-chave para análises subsequentes. Em seguida, o ChatGPT-4 foi aplicado para atribuir uma pontuação de importância a cada variável. Para avaliar sistematicamente a importância das características, controlando possíveis viés e variações estocásticas, foi implementado um protocolo padronizado de avaliação. O enunciado específico fornecido ao modelo foi: "Com base na literatura clínica estabelecida sobre a doença hepática gordurosa não alcoólica (NAFLD), atribua uma pontuação de importância variando de 1 (menor) a 10 (maior) para cada uma das seguintes 14 variáveis identificadas via regressão LASSO." Ao restringir a avaliação estritamente às variáveis pré-selecionadas pela regressão LASSO, o risco de incorporar características alucinadas ou irrelevantes foi minimizado. Para evitar estritamente o possível vazamento de dados e o uso inadvertido da prevalência de resultados, o modelo de linguagem foi totalmente cego para o conjunto de dados empírico. A pontuação foi limitada à síntese de conhecimento médico pré-existente sobre os nomes das variáveis. Esse procedimento aprimora metodologias tradicionais, como a seleção de estabilidade do LASSO ou a poda baseada em SHAP, garantindo que características puramente baseadas em dados exibam robusta plausibilidade fisiopatológica antes da integração final do modelo. Além disso, para mitigar a variância de resposta única, esse procedimento foi iterado 10 vezes de forma independente. A pontuação média para cada variável foi calculada ao longo dessas iterações, garantindo uma priorização de objetivos. As variáveis foram então classificadas em ordem decrescente com base em suas médias de pontuação. Por fim, a seleção foi reduzida para incluir apenas aquelas variáveis com pontuação média de importância superior a 5, resultando em 8 variáveis-chave: SCr, URI, GGT, Glu, Hipertensão, Diabetes, TG e IMC.
Desenvolvimento de modelos de previsão baseados em AutoML para NAFLD
Neste estudo, um conjunto abrangente de algoritmos clássicos e avançados de aprendizado de máquina foi integrado usando H2O AutoML para o diagnóstico eficaz da NAFLD. Ao aproveitar as capacidades de AutoML da plataforma H2O.ai, foram realizadas análises de aprendizado de máquina para tarefas de classificação binária. Os algoritmos utilizados incluíam eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) e Stacked Ensemble. Esses algoritmos foram sistematicamente avaliados para identificar o modelo ideal para o diagnóstico da doença. Para garantir uma reprodutibilidade metodológica rigorosa, os parâmetros de execução do AutoML H2O foram explicitamente definidos. A busca automatizada foi limitada a um tempo máximo de execução de 11.687 segundos e um máximo de 302 modelos, utilizando uma semente aleatória fixa de 13. As flags internas de pré-processamento incluíam a imputação automática de valores residuais ausentes usando algoritmos média/modo, bem como codificação de alvo para variáveis categóricas de alta cardinalidade. A arquitetura ótima selecionada (rotulada como GBM_grid_1_model77) era uma máquina de aumento de gradiente com os seguintes hiperparâmetros específicos: um total de 28 árvores, profundidade máxima de árvore de 5 e taxa de aprendizado de 0,1.
Para aumentar a robustez dos modelos e mitigar riscos de superajuste, foi implementado um framework AutoML incorporando protocolos sistemáticos de ajuste e validação de hiperparâmetros. O processo começou com a exploração automatizada de 200 configurações distintas de modelos por meio de otimização por hiperparâmetros, empregando validação cruzada de 5 vezes em que o conjunto de dados de treinamento foi dividido em cinco subconjuntos mutuamente exclusivos. Durante o treinamento iterativo, cada configuração utilizava quatro subconjuntos (80%) para construção de modelos, reservando um subconjunto (20%) para validação, com esse papel de validação rotando sequencialmente em todas as dobras. Para equilibrar eficiência computacional com otimização de desempenho, a parada dinâmica precoce foi implementada com base na área sob a métrica da curva ROC (AUC). Esse mecanismo suspendeu o treinamento quando as melhorias no AUC caíram abaixo do limite de 0,001 por três ciclos consecutivos, aplicando-se tanto ao refinamento individual do modelo quanto ao processo geral de busca do AutoML. A seleção final do modelo priorizou configurações que demonstravam o máximo de AUC médio tanto em conjuntos de treinamento quanto de validação, ao mesmo tempo em que exigia desempenho consistente entre esses conjuntos e variância mínima de métricas entre iterações de validação cruzada. Essa abordagem integrada garantia precisão preditiva ótima enquanto mantinha forte generalização por meio de protocolos rigorosos de validação e restrições automatizadas de otimização.
Avaliação de desempenho do modelo e interpretação dos resultados de previsão
O desempenho do modelo e a interpretação dos resultados das previsões foram avaliados de forma abrangente usando curvas ROC, escores F1 e análise SHAPLEY aditiva (SHAP). O desempenho do modelo e a interpretação dos resultados de sua previsão foram avaliados de forma abrangente usando curvas ROC, escores F1 e análise SHAPapley Aditiva (SHAP). Inicialmente, as previsões eram geradas no conjunto de dados de teste usando o modelo treinado, e as probabilidades previstas para a classe positiva (ou seja, classe 1) eram extraídas (pred_prob). A curva ROC foi construída usando o pacote pROC, e o AUC do modelo, juntamente com seu intervalo de confiança de 95%, foi calculado. O limiar ótimo na curva ROC foi determinado usando a estatística J de Youden (J = Sensibilidade + Especificidade − 1) para a determinação binária do rótulo de classificação. Com base nesse limiar derivado da curva ROC, as probabilidades previstas foram convertidas em rótulos binários de predição (0 ou 1), e uma matriz de confusão foi posteriormente gerada. A pontuação F1 no conjunto de teste foi calculada usando a função matriz de confusão, e uma visualização da matriz de confusão foi produzida e salva. Além disso, o modelo foi ainda validado em um conjunto de dados externo independente de validação composto por 200 casos (do Primeiro Hospital Afiliado da Universidade Médica de Wenzhou). Os valores do SHAP foram analisados usando o pacote "shapviz" para elucidar o impacto de cada variável nos resultados de previsão do modelo, fornecendo assim insights sobre a interpretação das previsões individuais de verosimilhança de NAFLD.
Métodos estatísticos
"A análise estatística e o desenvolvimento de software foram realizados usando a versão R 4.2.3 (R Foundation for Statistical Computing, Viena, Áustria). As variáveis contínuas foram inicialmente avaliadas quanto à normalidade usando o teste de Shapiro-Wilk ou inspeção visual dos gráficos Q-Q. Os dados normalmente distribuídos foram apresentados como média ± desvio padrão (DS), e comparações entre dois grupos independentes foram realizadas usando testes t de amostras independentes. Para comparações de múltiplos grupos, foi empregada ANOVA unidirecional com testes de HSD de Tukey pós-hoc quando apropriado. Dados contínuos não distribuídos normalmente foram resumidos como mediana [intervalo interquartil (IQR), P25–P75], e comparações de grupos foram realizadas usando o teste Mann-Whitney U para dois grupos independentes ou o teste de Kruskal-Wallis para múltiplos grupos, seguido pelo teste pós-hoc de Dunn, se necessário. Variáveis categóricas foram expressas como frequências e porcentagens (%), e comparações de proporções entre grupos foram analisadas usando o teste qui-quadrado (teste χ2 ) ou o teste exato de Fisher quando as contagens celulares esperadas eram menores que 5. O nível de significância foi definido em α = 0,05 (bidirecional), e um valor-p < 0,05 foi considerado estatisticamente significativo.