Artigo de investigação

Modelo Automatizado de Aprendizado de Máquina para Previsão de Doença Hepática Gordurosa Não Alcoólica e Validação de Coortes Externas

DOI:

10.3791/70033

3 de julho de 2026

* These authors contributed equally

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um protocolo AutoML passo a passo é apresentado para rastrear a doença hepática gordurosa não alcoólica usando dados NHANES e uma coorte externa. O método automatiza a priorização de características e a seleção de modelos (GBM), incluindo interpretação baseada em SHAP e validação externa para implantação clínica reprodutível.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A doença hepática gordurosa não alcoólica (NAFLD) é um distúrbio hepático comum associado à obesidade, resistência à insulina e síndrome metabólica, frequentemente não diagnosticado até estágios avançados. Métodos diagnósticos tradicionais, incluindo imagem e biópsia hepática, apresentam limitações na detecção precoce. Há necessidade de uma ferramenta eficiente e não invasiva para a triagem precoce da NAFLD. Utilizando tecnologia de aprendizado de máquina automatizado (AutoML), um modelo diagnóstico para NAFLD foi desenvolvido aproveitando um grande conjunto de dados do NHANES (n = 2677). Além disso, uma coorte independente de validação externa (n = 200) foi empregada para avaliar a validade externa e o desempenho do modelo. Para seleção de características clínicas promissoras, foi aplicado um método de seleção de características em duas etapas, combinando regressão LASSO com análise inteligente baseada em ChatGPT-4. Posteriormente, o processo AutoML, que integrava múltiplos algoritmos de aprendizado de máquina, foi realizado para treinamento e validação de modelos. O desempenho do modelo foi avaliado usando curvas ROC, escores F1 e análise SHapley aditiva (SHAP). O modelo GBM alcançou um AUC de 0,843 no conjunto de treinamento, 0,851 no conjunto de teste e 0,945 no conjunto externo de validação, demonstrando alta precisão diagnóstica em diferentes conjuntos de dados. Preditores-chave, incluindo IMC, triglicerídeos e GGT, foram identificados como contribuidores significativos para as previsões do modelo. A análise SHAP confirmou ainda mais a importância dessas variáveis na previsão da NAFLD. O modelo diagnóstico baseado em AutoML para NAFLD demonstrou desempenho significativamente melhorado na detecção precoce, oferecendo uma alternativa confiável, não invasiva e eficiente aos métodos diagnósticos convencionais. Esse método possui grande potencial para aplicação clínica mais ampla na NAFLD, diminuindo a dependência do conhecimento especializado enquanto melhora a precisão diagnóstica.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A doença hepática gordurosa não alcoólica (NAFLD) é uma das doenças hepáticas mais prevalentes no mundo, atualmente afetando aproximadamente 35% da população adulta no mundo, e não é atribuída ao consumo excessivode álcool 1. É caracterizado pelo acúmulo de gordura em mais de 5% dos hepatócitos, que pode potencialmente evoluir para condições mais graves, incluindo inflamação, fibrose hepática, cirrose e, por fim, insuficiência hepática 2,3. Atualmente, os métodos tradicionais para diagnosticar a NAFLD baseiam-se principalmente em marcadores bioquímicos anormais do fígado e ultrassom. No entanto, o ultrassom apresenta sensibilidade limitada quando o grau de esteatose é inferior a 20%, o que compromete sua confiabilidade na detecção de infiltração leve de gordura e frequentemente leva a diagnósticos perdidos deNAFLD 4 em estágio inicial. Embora a biópsia hepática seja considerada o padrão ouro para o diagnóstico da NAFLD, sua natureza invasiva e o risco de complicações como dor, infecção e sangramento restringem sua viabilidade para triagem em largaescala 5. Consequentemente, há uma necessidade urgente de uma ferramenta eficiente, não invasiva, econômica e altamente sensível para facilitar a triagem da NAFLD.

Com o rápido desenvolvimento das tecnologias de inteligência artificial (IA) e aprendizado de máquina (ML), abordagens orientadas por dados oferecem novas soluções para o diagnóstico precoce e avaliação de riscos da NAFLD. Ao analisar dados complexos e em grande escala, as tecnologias de ML podem identificar automaticamente padrões e relações potenciais, e têm sido amplamente aplicadas no diagnóstico e previsão de váriasdoenças 6. Por exemplo, algoritmos de ML foram usados para prever o risco de cirrose em indivíduos com infecção crônica pelo vírus da hepatite B, alcançando resultadospromissores. Estudos semelhantes na área de NAFLD desenvolveram com sucesso modelos diagnósticos usando algoritmos tradicionais de aprendizado de máquina, como máquinas de vetores de suporte (SVM) e florestas aleatórias (RF), alcançando altos níveis de precisão e demonstrando forte aplicabilidade clínica 8,9,10,11,12,13,14,15,16,17,18. Por exemplo, pesquisadores desenvolveram um modelo de aprendizado de máquina utilizando parâmetros laboratoriais para filtrar efetivamente a NAFLD na população geral por meio da análise de dados de laboratório rotineiros. Um modelo de ML utilizando parâmetros laboratoriais foidesenvolvido 13 para filtrar efetivamente a NAFLD na população geral por meio da análise de dados laboratoriais rotineiros. A prevalência da NAFLD nos EUA foi prevista combinando elastografia transitória com métodos de aprendizado de máquina usando dados NHANES 2017–201816. A equipe de pesquisa utilizou algoritmos de aprendizado de máquina para investigar a correlação entre a elastografia transitória e outras variáveis clínicas, desenvolvendo um modelo preditivo que estimou de forma confiável a prevalência da NAFLD em populações diversas.

No entanto, métodos tradicionais de aprendizado de máquina normalmente exigem esforço manual substancial, especialmente em engenharia de características, seleção de modelos e ajuste de parâmetros, que exigem conhecimento e experiência especializados. Para resolver essas limitações, foi desenvolvido o aprendizado de máquina automatizado (AutoML). O AutoML automatiza todo o pipeline de construção de modelos, abrangendo pré-processamento de dados, seleção de características, seleção de modelos e otimização de hiperparâmetros, aumentando substancialmente tanto a eficiência quanto a precisão dos processos de aprendizadode máquina 19. Um modelo preditivo para sangramento variceal esofágico foi desenvolvido e validado usando a plataforma H2OAutoML 20. O modelo utilizou vários algoritmos, incluindo deep learning (DL), eXtreme Gradient Boosting (XGBoost), modelos lineares generalizados (GLM), máquinas de gradiente boosting (GBM), random forests (RF) e conjuntos de empilhamento, com horizonte de previsão de 12 meses. O AutoML foi empregado para prever o risco de metástase hepática em pacientes com tumor estromais gastrointestinal, utilizando dados do banco de dadosSEER 21. As plataformas AutoML foram aproveitadas para desenvolver uma ferramenta diagnóstica rápida e econômica para câncer de próstata utilizando dados clínicosrotineiros 22. O surgimento do AutoML ofereceu soluções mais eficientes para diagnóstico clínico, e seu potencial na triagem de NAFLD merece uma exploração mais aprofundada. Embora a detecção precoce e o diagnóstico preciso da NAFLD sejam cruciais, a natureza assintomática da doença apresenta desafios diagnósticos significativos. Embora a tecnologia AutoML tenha demonstrado grande potencial no diagnóstico de doenças, sua aplicação no diagnóstico de NAFLD permanece restrita, ressaltando as perspectivas promissoras desse campo de pesquisa.

Este estudo desenvolveu um modelo diagnóstico de doença hepática gordurosa não alcoólica (NAFLD) utilizando a tecnologia AutoML em conjunto com elastografia transitória, utilizando dados do banco de dados NHANES dos EUA (2017–2018). O modelo foi validado externamente usando um conjunto de dados de indivíduos do Departamento de Doenças Infecciosas, Primeiro Hospital Afiliado da Universidade Médica de Wenzhou (2018–2020). O estudo avaliou o desempenho do modelo em um conjunto de dados externo e o comparou com métodos tradicionais, abordando assim lacunas de pesquisa existentes. Por meio da análise de múltiplos marcadores sanguíneos e bioquímicos, modelos preditivos foram construídos usando algoritmos como regressão logística e florestas aleatórias. Os resultados indicaram o desempenho superior do modelo na identificação precisa de indivíduos não NAFLD. Isso não só oferece uma ferramenta eficiente e precisa para triagem precoce de NAFLD, mas também avança a integração do AutoML em aplicações médicas.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pacientes e desenho do estudo

O primeiro conjunto de dados deste estudo foi obtido do banco de dados da Pesquisa Nacional de Saúde e Nutrição (NHANES) para o período de 2017–2018. Esse período específico foi escolhido porque os dados da pesquisa incluíam medições de elastografia transitória por ultrassom do fígado usando tecnologia FibroScan®. O NHANES emprega um design estratificado de amostragem probabilística em múltiplas etapas e serve como uma pesquisa nacional baseada na população realizada bienalmente. Ele coleta sistematicamente dados nacionais representativos relacionados à saúde sobre a população não institucionalizada dos EUA para avaliar o estado nutricional e de saúde da população civil geralnos Estados Unidos 1. O NHANES é um estudo transversal representativo nacionalmente administrado pelo Centro Nacional de Estatísticas de Saúde (NCHS). O protocolo da pesquisa recebeu aprovação do Conselho de Revisão de Ética em Pesquisa do NCHS, com consentimento informado documentado obtido de todos os participantes. O estudo foi conduzido de acordo com as Declarações de Helsinque e de Istambul, e foi aprovado pelo comitê de ética do Primeiro Hospital Afiliado da Universidade Médica de Wenzhou (2016–246, 1º de dezembro de 2016), e o consentimento informado por escrito foi obtido de cada participante.

O primeiro conjunto de dados consistiu em 5494 indivíduos da pesquisa NHANES 20172018 que passaram pelo exame FibroScan. Após a exclusão abaixo, um total de 2677 participantes foi incluído na análise, compreendendo 718 indivíduos com NAFLD e 1959 com não-NAFLD. Esses participantes foram então divididos aleatoriamente em um conjunto de treinamento (n = 1785) e um conjunto de testes (n = 892). O segundo conjunto de dados compreendia 582 indivíduos do Departamento de Doenças Infecciosas do Primeiro Hospital Afiliado da Universidade Médica de Wenzhou (2018–2020). Após aplicar os mesmos critérios de exclusão, um total de 200 indivíduos foi incluído, consistindo em 159 indivíduos com NAFLD e 41 indivíduos com não-NAFLD. Essa coorte foi utilizada como um conjunto de validação independente. O desenho do estudo foi desenvolvido para construir e validar o modelo usando dados multicentros, aumentando assim a confiabilidade e a generalização dos achados. As características clínicas de base dos grupos com NAFLD e não NAFLD foram resumidas usando o pacote da tabela um (Tabela 1). Além disso, o processo de seleção de pacientes e o fluxo geral do estudo são ilustrados na Figura 1.

Critérios diagnósticos e critérios de exclusão para NAFLD

O diagnóstico de NAFLD baseou-se nos seguintescritérios: 16 anos: 18 anos ou mais, participação em elastografia transitória (FibroScan) com consumo de álcool limitado a ≤140 g/semana para mulheres e ≤ 210 g/semana para homens nos 12 meses anteriores, valor do parâmetro de atenuação controlada (CAP) de ≥ 302 dB/m conforme medido usando o sistema FibroScan 502 V2 Touch (Echosens, Paris, França) com uma sonda média (M) ou extra-grande (XL), ou diagnóstico confirmado por patologia de biópsia hepática no Departamento de Doenças Infecciosas do Primeiro Hospital Afiliado da Universidade Médicade Wenzhou 23.

Os critérios de exclusão para a NAFLD são descritos da seguinte forma:consumo elevado de álcool (ingestão média diária > 20 g para mulheres e > 30 g para homens, segundo a pesquisaNHANES sobre uso de álcool 5), presença de hepatite B ou C, infecção por HIV, hepatite autoimune, colangite biliar primária, doença de Wilson, uso prolongado de anti-inflamatórios não esteroides, bloqueadores dos canais de cálcio, tamoxifeno, amiodarona, corticosteroides, isoniazida ou metotrexato, gravidez ou amamentação, e diagnóstico de câncer de fígado ou qualquer outro tumor benigno ou maligno.

Coleta de dados e seleção de variáveis

As variáveis preditoras potenciais incluídas neste estudo estão listadas abaixo:

Características demográficas (ou seja, idade e gênero); Índice de massa corporal (IMC); Valores de CAP dos participantes no banco de dados NHANES; Exames bioquímicos gerais [ou seja, Albumina(ALB), Globulina (GLO), Proteína Total (TP), Lactato Desidrogenase (LDH), Nitrogênio Ureia no Sangue (BUN), Ácido Úrico (UA), Gama-Glutamil Transferase (GGT), Triglicerídeos (TG), Soro-Glicose (Glu), Creatinina Sérica (SCr), Bilirrubina Total (TBIL), Sódio (Na⁺), Cloreto (Cl⁻), Potássio (K⁺), Cálcio (Ca), Bicarbonato (HCO₃), Colesterol Total (TC), Aspartato Aminotransferase (AST) e Alanina Aminotransferase (ALT)]; Parâmetros hematológicos padrão [ou seja, contagens de glóbulos vermelhos (RBC), contagem de glóbulos brancos (WBC), contagens de neutrófilos (NEUT), contagens de eosinófilos (EOS), contagens de linfócitos (LYM), contagem de monócitos (MON), largura da distribuição de glóbulos vermelhos (RDW) e contagens de plaquetas (PLT)]; Histórico de hipertensão e diabetes mellitus (DM). Entre os participantes do estudo, os critérios diagnósticos para diabetes e hipertensão foram obtidos a partir de um estudo anterior baseado em aprendizado de máquina, focado naNAFLD 24.

Falta de manuseamento de dados e seleção de recursos

Os dados de coorte utilizados neste estudo incluíram valores ausentes. Excluir todos os registros incompletos não só diminuiria o tamanho da amostra de análise, mas também comprometeria a qualidade dos dados e potencialmente enviesaria os resultados da previsão. Portanto, quaisquer dados com valores excedentes de 20% foram excluídos. Para conjuntos de dados com valores ausentes ≤20%, diferentes métodos de imputação foram aplicados com base no tipo de dado: "norm" para variáveis contínuas, "logreg" para variáveis de classificação binária e "polyreg" para variáveis multiclasse. Essas imputações foram realizadas usando o pacote "ratos" em R para imputaçãomúltipla 25. Neste estudo, todas as variáveis contínuas foram dicotomizadas em variáveis binárias, com limiares de classificação ótimos determinados por análise da curva da característica operacional do receptor (ROC). Especificamente, o ponto de corte correspondente ao índice máximo de Youden na curva ROC foi selecionado como o critério ótimo de classificação, otimizando assim o desempenho da classificação enquanto mantinha um equilíbrio adequado entre sensibilidade e especificidade. Subsequentemente, a análise discriminante parcial de mínimos quadrados (PLS-DA) foi empregada para agrupar os dados de forma eficaz.

Para seleção adicional de características, os indivíduos foram alocados aleatoriamente em conjuntos de treinamento e teste em uma proporção de 7:3 usando o pacote "caret". Primeiro, a regressão do operador de menor encolhimento absoluto e seleção (LASSO) foi utilizada para seleção de características, identificando 14 variáveis-chave para análises subsequentes. Em seguida, o ChatGPT-4 foi aplicado para atribuir uma pontuação de importância a cada variável. Para avaliar sistematicamente a importância das características, controlando possíveis viés e variações estocásticas, foi implementado um protocolo padronizado de avaliação. O enunciado específico fornecido ao modelo foi: "Com base na literatura clínica estabelecida sobre a doença hepática gordurosa não alcoólica (NAFLD), atribua uma pontuação de importância variando de 1 (menor) a 10 (maior) para cada uma das seguintes 14 variáveis identificadas via regressão LASSO." Ao restringir a avaliação estritamente às variáveis pré-selecionadas pela regressão LASSO, o risco de incorporar características alucinadas ou irrelevantes foi minimizado. Para evitar estritamente o possível vazamento de dados e o uso inadvertido da prevalência de resultados, o modelo de linguagem foi totalmente cego para o conjunto de dados empírico. A pontuação foi limitada à síntese de conhecimento médico pré-existente sobre os nomes das variáveis. Esse procedimento aprimora metodologias tradicionais, como a seleção de estabilidade do LASSO ou a poda baseada em SHAP, garantindo que características puramente baseadas em dados exibam robusta plausibilidade fisiopatológica antes da integração final do modelo. Além disso, para mitigar a variância de resposta única, esse procedimento foi iterado 10 vezes de forma independente. A pontuação média para cada variável foi calculada ao longo dessas iterações, garantindo uma priorização de objetivos. As variáveis foram então classificadas em ordem decrescente com base em suas médias de pontuação. Por fim, a seleção foi reduzida para incluir apenas aquelas variáveis com pontuação média de importância superior a 5, resultando em 8 variáveis-chave: SCr, URI, GGT, Glu, Hipertensão, Diabetes, TG e IMC.

Desenvolvimento de modelos de previsão baseados em AutoML para NAFLD

Neste estudo, um conjunto abrangente de algoritmos clássicos e avançados de aprendizado de máquina foi integrado usando H2O AutoML para o diagnóstico eficaz da NAFLD. Ao aproveitar as capacidades de AutoML da plataforma H2O.ai, foram realizadas análises de aprendizado de máquina para tarefas de classificação binária. Os algoritmos utilizados incluíam eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) e Stacked Ensemble. Esses algoritmos foram sistematicamente avaliados para identificar o modelo ideal para o diagnóstico da doença. Para garantir uma reprodutibilidade metodológica rigorosa, os parâmetros de execução do AutoML H2O foram explicitamente definidos. A busca automatizada foi limitada a um tempo máximo de execução de 11.687 segundos e um máximo de 302 modelos, utilizando uma semente aleatória fixa de 13. As flags internas de pré-processamento incluíam a imputação automática de valores residuais ausentes usando algoritmos média/modo, bem como codificação de alvo para variáveis categóricas de alta cardinalidade. A arquitetura ótima selecionada (rotulada como GBM_grid_1_model77) era uma máquina de aumento de gradiente com os seguintes hiperparâmetros específicos: um total de 28 árvores, profundidade máxima de árvore de 5 e taxa de aprendizado de 0,1.

Para aumentar a robustez dos modelos e mitigar riscos de superajuste, foi implementado um framework AutoML incorporando protocolos sistemáticos de ajuste e validação de hiperparâmetros. O processo começou com a exploração automatizada de 200 configurações distintas de modelos por meio de otimização por hiperparâmetros, empregando validação cruzada de 5 vezes em que o conjunto de dados de treinamento foi dividido em cinco subconjuntos mutuamente exclusivos. Durante o treinamento iterativo, cada configuração utilizava quatro subconjuntos (80%) para construção de modelos, reservando um subconjunto (20%) para validação, com esse papel de validação rotando sequencialmente em todas as dobras. Para equilibrar eficiência computacional com otimização de desempenho, a parada dinâmica precoce foi implementada com base na área sob a métrica da curva ROC (AUC). Esse mecanismo suspendeu o treinamento quando as melhorias no AUC caíram abaixo do limite de 0,001 por três ciclos consecutivos, aplicando-se tanto ao refinamento individual do modelo quanto ao processo geral de busca do AutoML. A seleção final do modelo priorizou configurações que demonstravam o máximo de AUC médio tanto em conjuntos de treinamento quanto de validação, ao mesmo tempo em que exigia desempenho consistente entre esses conjuntos e variância mínima de métricas entre iterações de validação cruzada. Essa abordagem integrada garantia precisão preditiva ótima enquanto mantinha forte generalização por meio de protocolos rigorosos de validação e restrições automatizadas de otimização.

Avaliação de desempenho do modelo e interpretação dos resultados de previsão

O desempenho do modelo e a interpretação dos resultados das previsões foram avaliados de forma abrangente usando curvas ROC, escores F1 e análise SHAPLEY aditiva (SHAP). O desempenho do modelo e a interpretação dos resultados de sua previsão foram avaliados de forma abrangente usando curvas ROC, escores F1 e análise SHAPapley Aditiva (SHAP). Inicialmente, as previsões eram geradas no conjunto de dados de teste usando o modelo treinado, e as probabilidades previstas para a classe positiva (ou seja, classe 1) eram extraídas (pred_prob). A curva ROC foi construída usando o pacote pROC, e o AUC do modelo, juntamente com seu intervalo de confiança de 95%, foi calculado. O limiar ótimo na curva ROC foi determinado usando a estatística J de Youden (J = Sensibilidade + Especificidade − 1) para a determinação binária do rótulo de classificação. Com base nesse limiar derivado da curva ROC, as probabilidades previstas foram convertidas em rótulos binários de predição (0 ou 1), e uma matriz de confusão foi posteriormente gerada. A pontuação F1 no conjunto de teste foi calculada usando a função matriz de confusão, e uma visualização da matriz de confusão foi produzida e salva. Além disso, o modelo foi ainda validado em um conjunto de dados externo independente de validação composto por 200 casos (do Primeiro Hospital Afiliado da Universidade Médica de Wenzhou). Os valores do SHAP foram analisados usando o pacote "shapviz" para elucidar o impacto de cada variável nos resultados de previsão do modelo, fornecendo assim insights sobre a interpretação das previsões individuais de verosimilhança de NAFLD.

Métodos estatísticos

"A análise estatística e o desenvolvimento de software foram realizados usando a versão R 4.2.3 (R Foundation for Statistical Computing, Viena, Áustria). As variáveis contínuas foram inicialmente avaliadas quanto à normalidade usando o teste de Shapiro-Wilk ou inspeção visual dos gráficos Q-Q. Os dados normalmente distribuídos foram apresentados como média ± desvio padrão (DS), e comparações entre dois grupos independentes foram realizadas usando testes t de amostras independentes. Para comparações de múltiplos grupos, foi empregada ANOVA unidirecional com testes de HSD de Tukey pós-hoc quando apropriado. Dados contínuos não distribuídos normalmente foram resumidos como mediana [intervalo interquartil (IQR), P25–P75], e comparações de grupos foram realizadas usando o teste Mann-Whitney U para dois grupos independentes ou o teste de Kruskal-Wallis para múltiplos grupos, seguido pelo teste pós-hoc de Dunn, se necessário. Variáveis categóricas foram expressas como frequências e porcentagens (%), e comparações de proporções entre grupos foram analisadas usando o teste qui-quadrado (teste χ2 ) ou o teste exato de Fisher quando as contagens celulares esperadas eram menores que 5. O nível de significância foi definido em α = 0,05 (bidirecional), e um valor-p < 0,05 foi considerado estatisticamente significativo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Características clínicas da NAFLD

Neste estudo, as características clínicas de indivíduos com e sem NAFLD foram analisadas sistematicamente. Uma variedade de métodos foi empregada para ilustrar claramente a distribuição e as diferenças dessas características dentro da população amostral (Tabela 1). Um total de 2.677 indivíduos foi incluído na análise, dos quais 718 tinham NAFLD. A análise abrangeu uma variedade de indicadores ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A NAFLD é a causa mais comum de doença hepática crônica no mundo, e sua prevalência aumenta cerca de 1% a cadaano. Cerca de 30% da população mundial é afetada, tornando a NAFLD não apenas a principal doença crônica do fígado, mas também a indicação de crescimento mais rápido para transplantede fígado 3. O aprendizado de máquina automatizado (AutoML) emergiu como uma ferramenta valiosa na medicina, com um de seus principais...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não têm conflito de interesses. Neste estudo, o ChatGPT-4 (OpenAI) foi utilizado como uma ferramenta analítica inteligente durante a fase de seleção de características para avaliar a relevância clínica das variáveis identificadas pela regressão LASSO. Todas as pontuações geradas pela IA foram cuidadosamente revisadas pelos autores e validadas empiricamente por meio do processo subsequente de AutoML. O ChatGPT-4 não foi usado para alterar dados brutos ou realizar cálculos matemáticos. Os autores assumem total responsabilidade pela integridade e precisão dos resultados finais.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse trabalho foi apoiado pelo Fundo de Startup para Pesquisa Científica da Universidade Médica de Fujian [2021QH1176]; o Laboratório Chave de Diagnóstico Clínico e Pesquisa Translacional da Província de Zhejiang [2022E10022]; o Projeto Provincial de Ciência e Tecnologia Médica e da Saúde de Zhejiang [2024KY1265]; e o Projeto Municipal de Pesquisa Básica de Bem-Estar Público de Wenzhou [Y2023096].

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

```html

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Datasets for NAFLD (2017–2018)Banco de dados NHANES [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/Acomo o conjunto de treinamento para a construção do modelo
Datasets for NAFLD (2018–2020)The First Affiliated Hospital of Wenzhou Medical University (2018–2020), China. [https://doi.org/10.6084/m9.figshare.32105248.]N/Acomo um conjunto de teste para a validação externa do modelo
R (versão 4.2.3)R Foundation for Statistical ComputingN/Ausado em conjunto com outras ferramentas para realizar análises de dados e gerar apresentações visuais e gráficas.
Adobe Illustrator 2025 (versão 29.2)Adobe Systems IncorporatedN/APara layout e edição de imagens
ChatGPT-4OpenAI Inc.N/APara atribuir uma pontuação de importância a cada variável selecionada
H2O AutoML (3.44.0.3)H2O.aiN/APara integrar um conjunto abrangente de algoritmos de aprendizado de máquina
```

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

MedicinaEdi o 233Edi o 233Este M s no JoVEEdi oAutoMLdiagn sticoGradient Boosting Machine

Artigos relacionados