Artículo de investigación

Modelo automatizado de aprendizaje automático para la predicción de la enfermedad hepática grasa no alcohólica y la validación externa de cohortes

DOI:

10.3791/70033

3 de julio de 2026

* These authors contributed equally

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se presenta un protocolo AutoML paso a paso para detectar la enfermedad hepática grasa no alcohólica utilizando datos NHANES y una cohorte externa. El método automatiza la priorización de características y la selección de modelos (GBM), e incluye interpretación basada en SHAP y validación externa para su despliegue clínico reproducible.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La enfermedad hepática grasa no alcohólica (NAFLD) es un trastorno hepático común asociado a la obesidad, la resistencia a la insulina y el síndrome metabólico, que a menudo no se diagnostica hasta etapas avanzadas. Los métodos diagnósticos tradicionales, como la imagen y la biopsia hepática, presentan limitaciones en la detección temprana. Existe la necesidad de una herramienta eficiente y no invasiva para el cribado temprano de NAFLD. Utilizando tecnología de aprendizaje automático automatizado (AutoML), se desarrolló un modelo diagnóstico para la NAFLD aprovechando un gran conjunto de datos de NHANES (n = 2677). Además, se empleó una cohorte independiente de validación externa (n = 200) para evaluar la validez externa y el rendimiento del modelo. Para la selección de características clínicas prometedoras, se aplicó un método de selección de características en dos etapas, combinando regresión LASSO con análisis inteligente basado en ChatGPT-4. Posteriormente, se realizó el proceso AutoML, que integraba múltiples algoritmos de aprendizaje automático, para el entrenamiento y validación del modelo. El rendimiento del modelo se evaluó utilizando curvas ROC, puntuaciones F1 y análisis SHAPLEY aditivo (SHAP). El modelo GBM logró un AUC de 0,843 en el conjunto de entrenamiento, 0,851 en el conjunto de pruebas y 0,945 en el conjunto externo de validación, demostrando una alta precisión diagnóstica en diferentes conjuntos de datos. Se identificaron predictores clave, incluyendo IMC, triglicéridos y GGT, como contribuyentes significativos a las predicciones del modelo. El análisis SHAP confirmó además la importancia de estas variables en la predicción de la NAFLD. El modelo diagnóstico impulsado por AutoML para la NAFLD demostró una mejora significativa en el rendimiento de detección temprana, ofreciendo una alternativa fiable, no invasiva y eficiente a los métodos diagnósticos convencionales. Este método tiene un gran potencial para una aplicación clínica más amplia en la NAFLD, disminuyendo la dependencia del conocimiento experto mientras mejora la precisión diagnóstica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La enfermedad hepática grasa no alcohólica (NAFLD) es una de las enfermedades hepáticas más prevalentes a nivel mundial, afectando actualmente aproximadamente al 35% de la población adulta en todo el mundo, y no se debe al consumo excesivode alcohol 1. Se caracteriza por la acumulación de grasa en más del 5% de los hepatocitos, que puede progresar potencialmente a condiciones más graves, incluyendo inflamación, fibrosis hepática, cirrosis y, finalmente, insuficiencia hepática 2,3. Actualmente, los métodos tradicionales para diagnosticar la NAFLD se basan principalmente en marcadores bioquímicos hepáticos anormales y en la ecografía. Sin embargo, la ecografía muestra una sensibilidad limitada cuando el grado de esteatosis es inferior al 20%, lo que compromete su fiabilidad para detectar una infiltración leve de grasa y a menudo conduce a diagnósticos fallidos deNAFLD 4 en fase temprana. Aunque la biopsia hepática se considera el estándar de oro para diagnosticar NAFLD, su naturaleza invasiva y el riesgo de complicaciones como dolor, infección y sangrado limitan su viabilidad para un cribado a granescala 5. Por ello, existe una necesidad urgente de una herramienta eficiente, no invasiva, rentable y altamente sensible para facilitar el cribado de NAFLD.

Con el rápido desarrollo de las tecnologías de inteligencia artificial (IA) y aprendizaje automático (ML), los enfoques basados en datos ofrecen nuevas soluciones para el diagnóstico temprano y la evaluación de riesgos de la NAFLD. Al analizar datos complejos y a gran escala, las tecnologías de aprendizaje automático pueden identificar automáticamente patrones y relaciones potenciales, y se han aplicado ampliamente en el diagnóstico y predicción de diversasenfermedades 6. Por ejemplo, se utilizaron algoritmos de aprendizaje automático para predecir el riesgo de cirrosis en individuos con infección crónica por el virus de la hepatitis B, logrando resultadosprometedores 7. Estudios similares en el campo de la NAFLD han desarrollado con éxito modelos diagnósticos utilizando algoritmos tradicionales de aprendizaje automático, como las máquinas de vectores de soporte (SVM) y los bosques aleatorios (RF), logrando altos niveles de precisión y demostrando una fuerte aplicabilidad clínica 8,9,10,11,12,13,14,15,16,17,18. Por ejemplo, los investigadores desarrollaron un modelo de aprendizaje automático utilizando parámetros de laboratorio para filtrar eficazmente la NAFLD en la población general mediante el análisis de datos rutinarios de laboratorio. Se desarrolló un modelo de aprendizaje automático utilizando parámetros de laboratorio13 para detectar eficazmente la NAFLD en la población general mediante el análisis de datos rutinarios de laboratorio. La prevalencia de la NAFLD en EE. UU. se predijo combinando elastografía transitoria con métodos de aprendizaje automático utilizando datos NHANES 2017–201816. El equipo de investigación utilizó algoritmos de aprendizaje automático para investigar la correlación entre la elastografía transitoria y otras variables clínicas, desarrollando un modelo predictivo que estimaba de forma fiable la prevalencia de la NAFLD en diversas poblaciones.

Sin embargo, los métodos tradicionales de aprendizaje automático suelen requerir un esfuerzo manual considerable, especialmente en ingeniería de características, selección de modelos y ajuste de parámetros, que requieren conocimientos y experiencia especializados. Para abordar estas limitaciones, se ha desarrollado el aprendizaje automático automatizado (AutoML). AutoML automatiza toda la cadena de construcción de modelos, abarcando preprocesamiento de datos, selección de características, selección de modelos y optimización de hiperparámetros, mejorando así sustancialmente tanto la eficiencia como la precisión de los procesos de aprendizajeautomático 19. Se desarrolló y validó un modelo predictivo para el sangrado variceal esofágico utilizando la plataforma H2OAutoML 20. El modelo empleaba varios algoritmos, incluyendo aprendizaje profundo (DL), eXtreme Gradient Boosting (XGBoost), modelos lineales generalizados (GLM), máquinas de aumento de gradiente (GBM), bosques aleatorios (RF) y conjuntos de apilamiento, con un horizonte de predicción a 12 meses. AutoML se empleó para predecir el riesgo de metástasis hepática en pacientes con tumor estromalista gastrointestinal, aprovechando datos de la base de datosSEER 21. Las plataformas AutoML se utilizaron para desarrollar una herramienta diagnóstica rápida y rentable para el cáncer de próstata utilizando datos clínicosrutinarios 22. La aparición de AutoML ha ofrecido soluciones más eficientes para el diagnóstico clínico, y su potencial en el cribado de NAFLD merece una exploración más profunda. Aunque la detección precoz y el diagnóstico preciso de la NAFLD son cruciales, la naturaleza asintomática de la enfermedad plantea desafíos diagnósticos significativos. Aunque la tecnología AutoML ha mostrado un gran potencial en el diagnóstico de enfermedades, su aplicación en el diagnóstico de NAFLD sigue siendo limitada, lo que subraya las prometedoras perspectivas de este campo de investigación.

Este estudio desarrolló un modelo diagnóstico de enfermedad hepática grasa no alcohólica (NAFLD) aprovechando la tecnología AutoML junto con la elasstografía transitoria, utilizando datos de la base de datos NHANES de EE. UU. (2017–2018). El modelo fue validado externamente utilizando un conjunto de datos de individuos del Departamento de Enfermedades Infecciosas, Primer Hospital Afiliado de la Universidad Médica de Wenzhou (2018–2020). El estudio evaluó el rendimiento del modelo en un conjunto de datos externo y lo comparó con métodos tradicionales, abordando así las lagunas de investigación existentes. Mediante el análisis de múltiples marcadores sanguíneos y bioquímicos, se construyeron modelos predictivos utilizando algoritmos como la regresión logística y los bosques aleatorios. Los resultados indicaron el mejor desempeño del modelo para identificar con precisión a individuos no NAFLD. Esto no solo ofrece una herramienta eficiente y precisa para el cribado temprano de NAFLD, sino que también impulsa la integración de AutoML en aplicaciones médicas.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pacientes y diseño del estudio

El primer conjunto de datos de este estudio se obtuvo de la base de datos de la Encuesta Nacional de Salud y Nutrición (NHANES) para el periodo 2017–2018. Este periodo específico se eligió porque los datos de la encuesta incluían mediciones de elastografía transitoria por ecografía hepática utilizando tecnología FibroScan®. NHANES emplea un diseño estratificado de muestreo probabilístico en varias etapas y funciona como una encuesta nacional basada en la población realizada cada dos años. Recopila sistemáticamente datos relacionados con la salud representativos a nivel nacional sobre la población estadounidense no institucionalizada para evaluar el estado nutricional y de salud de la población civil general enEstados Unidos. El NHANES es un estudio transversal representativo a nivel nacional administrado por el Centro Nacional de Estadísticas de Salud (NCHS). El protocolo de la encuesta recibió la aprobación de la Junta de Revisión de Ética en Investigación de la NCHS, con el consentimiento informado documentado obtenido de todos los participantes. El estudio se llevó a cabo de acuerdo con las Declaraciones de Helsinki y de Estambul, y fue aprobado por el comité de ética del Primer Hospital Afiliado de la Universidad Médica de Wenzhou (2016–246, 1 de diciembre de 2016), y se obtuvo el consentimiento informado por escrito de cada participante.

El primer conjunto de datos consistió en 5494 individuos de la encuesta NHANES 20172018 que se sometieron al examen FibroScan. Tras la exclusión a continuación, se incluyeron un total de 2677 participantes en el análisis, que comprenden 718 individuos con NAFLD y en 1959 con no NAFLD. Estos participantes se dividieron aleatoriamente en un conjunto de entrenamiento (n = 1785) y un conjunto de pruebas (n = 892). El segundo conjunto de datos comprendía 582 personas del Departamento de Enfermedades Infecciosas del Primer Hospital Afiliado de la Universidad Médica de Wenzhou (2018–2020). Tras aplicar los mismos criterios de exclusión, se incluyeron un total de 200 individuos, que consisten en 159 individuos con NAFLD y 41 con no NAFLD. Esta cohorte se utilizó como un conjunto de validación independiente. El diseño del estudio se desarrolló para construir y validar el modelo utilizando datos multicéntricos, mejorando así la fiabilidad y generalización de los hallazgos. Las características clínicas de referencia de los grupos con NAFLD y no NAFLD se resumieron utilizando el paquete de la tabla uno (Tabla 1). Además, el proceso de selección de pacientes y el flujo general del estudio se ilustran en la Figura 1.

Criterios diagnósticos y criterios de exclusión para la NAFLD

El diagnóstico de NAFLD se basó en los siguientescriterios: 16 años: 18 años o más, participación en la elastografía transitoria (FibroScan) con consumo de alcohol limitada a ≤140 g/semana en mujeres y ≤ 210 g/semana en hombres durante los 12 meses anteriores, valor del parámetro de atenuación controlada (CAP) de ≥ 302 dB/m medido mediante el sistema FibroScan 502 V2 Touch (Echosens, París, Francia) con una sonda media (M) o extra-grande (XL), o un diagnóstico confirmado por patología de biopsia hepática en el Departamento de Enfermedades Infecciosas del Primer Hospital Adscrito de la Universidad Médicade Wenzhou 23.

Los criterios de exclusión para la NAFLD se detallan de la siguiente manera:consumo elevado de alcohol (ingesta media diaria > 20 g en mujeres y > 30 g en hombres según la encuestaNHANES de consumo de alcohol 5), presencia de hepatitis B o C, infección por VIH, hepatitis autoinmune, colangitis biliar primaria, enfermedad de Wilson, uso prolongado de antiinflamatorios no esteroides, bloqueadores de los canales de calcio, tamoxifeno, amiodarona, corticosteroides, isoniazida o metotrexato, embarazo o lactancia, y un diagnóstico de cáncer de hígado u otro tumor benigno o maligno.

Recogida de datos y selección de variables

Las variables predictoras potenciales incluidas en este estudio se enumeran a continuación:

Características demográficas (es decir, edad y género); Índice de masa corporal (IMC); valores de PAC de los participantes en la base de datos NHANES; Pruebas bioquímicas generales [es decir, albúmina (ALB), globulina (GLO), proteína total (TP), lactato deshidrogenasa (LDH), nitrógeno urea en sangre (BUN), ácido úrico (UA), gamma-glutamil transferasa (GGT), triglicéridos (TG), suero-glucosa (glu), creatinina sérica (SCr), bilirrubina total (TBIL), sodio (Na⁺), cloruro (Cl⁻), potasio (K⁺), calcio (Ca), bicarbonato (HCO₃), colesterol total (TC), aspartato aminotransferasa (AST) y alanina aminotransferasa (ALT)]; Parámetros hematológicos estándar [es decir, recuento de glóbulos rojos (RBC), recuentos de glóbulos blancos (GBB), conteo de neutrófilos (NEUT), recuentos de eosinófilos (EOS), recuentos de linfocitos (LYM), recuentos de monocitos (MON), ancho de distribución de glóbulos rojos (RDW) y recuento de plaquetas (PLT)]; Antecedentes de hipertensión y diabetes mellitus (DM). Entre los sujetos incluidos en el estudio, los criterios diagnósticos para diabetes e hipertensión se obtuvieron a partir de un estudio previo basado en aprendizaje automático centrado enNAFLD 24.

Gestión de datos y selección de características ausentes

Los datos de cohorte utilizados en este estudio incluían valores faltantes. Excluir todos los registros incompletos no solo disminuiría el tamaño de la muestra de análisis, sino que también comprometería la calidad de los datos y potencialmente sesgaría los resultados de la predicción. Por lo tanto, se excluyeron cualquier dato con valores faltantes superiores al 20%. Para conjuntos de datos con valores ausentes ≤20%, se aplicaron diferentes métodos de imputación según el tipo de dato: "norm" para variables continuas, "logreg" para variables de clasificación binaria y "polyreg" para variables multiclase. Estas imputaciones se realizaron utilizando el paquete "ratones" en R para imputacionesmúltiples 25. En este estudio, todas las variables continuas se dichotomizaron en variables binarias, con umbrales óptimos de clasificación determinados mediante análisis de curvas de características de operación del receptor (ROC). Específicamente, se seleccionó el punto de corte correspondiente al índice máximo de Youden en la curva ROC como criterio óptimo de clasificación, optimizando así el rendimiento de la clasificación manteniendo un equilibrio adecuado entre sensibilidad y especificidad. Posteriormente, se empleó el análisis discriminante parcial de mínimos cuadrados (PLS-DA) para agrupar eficazmente los datos.

Para una selección adicional de características, los individuos se asignaban aleatoriamente a conjuntos de entrenamiento y pruebas en una proporción de 7:3 usando el paquete "caret". Primero, se utilizó la regresión de menor contracción absoluta y operador de selección (LASSO) para la selección de características, identificando 14 variables clave para análisis posteriores. A continuación, se aplicó ChatGPT-4 para asignar una puntuación de importancia a cada variable. Para evaluar sistemáticamente la importancia de las características controlando posibles sesgos y variaciones estocásticas, se implementó un protocolo de evaluación estandarizado. El prompt específico proporcionado al modelo fue: "Basándonos en la literatura clínica establecida sobre la enfermedad hepática grasa no alcohólica (NAFLD), asignar una puntuación de importancia que vaya de 1 (más baja) a 10 (más alta) para cada una de las siguientes 14 variables identificadas mediante regresión LASSO." Al restringir la evaluación estrictamente a las variables preseleccionadas por la regresión LASSO, se minimizó el riesgo de incorporar características alucinadas o irrelevantes. Para evitar estrictamente la posible fuga de datos y el uso inadvertido de la prevalencia de resultados, el modelo de lenguaje quedó completamente ciego ante el conjunto de datos empírico. La puntuación se limitó a sintetizar conocimientos médicos preexistentes sobre los nombres de las variables. Este procedimiento mejora metodologías tradicionales, como la selección de estabilidad LASSO o la poda basada en SHAP, asegurando que las características puramente basadas en datos exhiban una plausibilidad fisiopatológica robusta antes de la integración final del modelo. Además, para mitigar la varianza de respuesta simple, este procedimiento se iteró 10 veces de forma independiente. La puntuación media de cada variable se calculaba a lo largo de estas iteraciones, asegurando una priorización objetivo. Las variables se ordenaron en orden descendente según sus puntuaciones medias. Finalmente, la selección se redujo para incluir solo aquellas variables con una puntuación media de importancia superior a 5, resultando en 8 variables clave: SCr, URI, GGT, Glu, Hipertensión, Diabetes, TG e IMC.

Desarrollo de modelos de predicción basados en AutoML para NAFLD

En este estudio, se integró un conjunto completo de algoritmos clásicos y avanzados de aprendizaje automático utilizando H2O AutoML para el diagnóstico efectivo de la NAFLD. Aprovechando las capacidades de AutoML de la plataforma H2O.ai, se realizaron análisis de aprendizaje automático para tareas de clasificación binaria. Los algoritmos utilizados incluían eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) y Stacked Ensemble. Estos algoritmos fueron evaluados sistemáticamente para identificar el modelo óptimo para el diagnóstico de enfermedades. Para garantizar una rigurosa reproducibilidad metodológica, se definieron explícitamente los parámetros de ejecución de H2O AutoML. La búsqueda automatizada estaba limitada a un tiempo máximo de ejecución de 11.687 segundos y un máximo de 302 modelos, utilizando una semilla aleatoria fija de 13. Las banderas internas de preprocesamiento incluían la imputación automática de valores residuales faltantes mediante algoritmos media/modo, así como la codificación de destino para variables categóricas de alta cardinalidad. La arquitectura óptima seleccionada (etiquetada como GBM_grid_1_model77) era una máquina de aumento de gradiente con los siguientes hiperparámetros específicos: un total de 28 árboles, una profundidad máxima de árbol de 5 y una tasa de aprendizaje de 0,1.

Para mejorar la robustez del modelo y mitigar riesgos de sobreajuste, se implementó un marco AutoML que incorpora protocolos sistemáticos de ajuste y validación de hiperparámetros. El proceso comenzó con la exploración automatizada de 200 configuraciones de modelos distintas mediante optimización por hiperparámetros, empleando la validación cruzada de 5 veces donde el conjunto de datos de entrenamiento se particionó en cinco subconjuntos mutuamente excluyentes. Durante el entrenamiento iterativo, cada configuración utilizaba cuatro subconjuntos (80%) para la construcción del modelo, reservando un subconjunto (20%) para la validación, con este rol de validación rotando secuencialmente en todos los pliegues. Para equilibrar la eficiencia computacional con la optimización del rendimiento, se implementó una parada temprana dinámica basada en el área bajo la métrica de la curva ROC (AUC). Este mecanismo suspendió el entrenamiento cuando las mejoras en AUC bajaron del umbral de 0,001 durante tres ciclos consecutivos, aplicándose tanto al refinamiento individual del modelo como al proceso general de búsqueda de AutoML. La selección final del modelo priorizó configuraciones que demostraban el máximo promedio de AUC tanto en conjuntos de entrenamiento como de validación, requeriendo simultáneamente un rendimiento consistente entre estos conjuntos y una varianza mínima de métricas entre iteraciones de validación cruzada. Este enfoque integrado garantizaba una precisión predictiva óptima manteniendo una fuerte generalizabilidad mediante protocolos rigurosos de validación y restricciones de optimización automatizada.

Evaluación del rendimiento del modelo e interpretación de los resultados de las predicciones

El rendimiento del modelo y la interpretación de los resultados de predicción se evaluaron de forma exhaustiva utilizando curvas ROC, puntuaciones F1 y análisis SHAPapley aditivo (SHAP). El rendimiento del modelo y la interpretación de sus resultados de predicción fueron evaluados de forma exhaustiva utilizando curvas ROC, puntuaciones F1 y análisis SHAPapley Aditivive Explanation (SHAP). Inicialmente, se generaban predicciones sobre el conjunto de datos de prueba utilizando el modelo entrenado, y se extrajeron las probabilidades predichas para la clase positiva (es decir, clase 1) (pred_prob). La curva ROC se construyó usando el paquete pROC, y se calculó el AUC del modelo, junto con su intervalo de confianza del 95%. El umbral óptimo en la curva ROC se determinó utilizando la estadística J de Youden (J = Sensibilidad + Especificidad − 1) para la determinación binaria de la etiqueta de clasificación. A partir de este umbral derivado de la curva ROC, las probabilidades predichas se convirtieron en etiquetas binarias de predicción (0 o 1), y posteriormente se generó una matriz de confusión. La puntuación F1 en el conjunto de prueba se calculó usando la función matriz de confusión, y se produjo y guardó una visualización de dicha matriz de confusión. Además, el modelo fue validado en un conjunto de datos externo independiente de validación que consta de 200 casos (del Primer Hospital Afiliado de la Universidad Médica de Wenzhou). Los valores de SHAP se analizaron utilizando el paquete "shapviz" para dilucidar el impacto de cada variable en los resultados de predicción del modelo, proporcionando así información sobre la interpretación de las predicciones individuales de probabilidad de NAFLD.

Métodos estadísticos

"El análisis estadístico y el desarrollo de software se realizaron usando la versión 4.2.3 de R (Fundación R para la Computación Estadística, Viena, Austria). Las variables continuas se evaluaron inicialmente para comprobar su normalidad mediante la prueba de Shapiro-Wilk o la inspección visual de los gráficos Q-Q. Los datos normalmente distribuidos se presentaron como media ± desviación estándar (DS), y se realizaron comparaciones entre dos grupos independientes utilizando pruebas t de muestras independientes. Para comparaciones de varios grupos, se empleó ANOVA unidireccional con pruebas de HSD de Tukey post-hoc cuando era apropiado. Los datos continuos no distribuidos normalmente se resumieron como mediana [rango intercuartílico (IQR), P25–P75], y las comparaciones de grupo se realizaron utilizando la prueba U de Mann-Whitney para dos grupos independientes o la prueba de Kruskal-Wallis para varios grupos, seguida de la prueba post-hoc de Dunn si era necesario. Las variables categóricas se expresaron como frecuencias y porcentajes (%), y las comparaciones de proporciones entre grupos se analizaron utilizando la prueba chi-cuadrado (prueba χ2 ) o la prueba exacta de Fisher cuando los conteos celulares esperados eran inferiores a 5. El nivel de significación se estableció en α = 0,05 (bicolar), y se consideró estadísticamente significativo un valor p < 0,05.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Características clínicas de la NAFLD

En este estudio, se analizaron sistemáticamente las características clínicas de individuos con y sin NAFLD. Se emplearon diversos métodos para ilustrar claramente la distribución y las diferencias de estas características dentro de la población muestral (Tabla 1). En total se incluyeron 2.677 individuos en el análisis, de los cuales 718 tenían NAFLD. El análisis abarcó una variedad de indic...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La NAFLD es la causa más común de enfermedad hepática crónica en todo el mundo, y su prevalencia aumenta aproximadamente un 1% cadaaño 26. Aproximadamente el 30% de la población mundial se ve afectada, lo que convierte a la NAFLD no solo en el principal trastorno crónico hepático, sino también en la indicación de más rápido crecimiento para el trasplantehepático 3. El aprendizaje automático automatizado (AutoML) ha surgido...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen conflicto de intereses. En este estudio, ChatGPT-4 (OpenAI) se utilizó como una herramienta analítica inteligente durante la fase de selección de características para evaluar la relevancia clínica de las variables identificadas por la regresión LASSO. Todas las puntuaciones generadas por IA fueron cuidadosamente revisadas por los autores y validadas empíricamente a través del proceso posterior de AutoML. ChatGPT-4 no se utilizó para alterar datos en bruto ni para realizar cálculos matemáticos. Los autores asumen plena responsabilidad por la integridad y exactitud de los resultados finales.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por el Fondo de Inicio para la Investigación Científica de la Universidad Médica de Fujian [2021QH1176]; el Laboratorio Clave de Diagnóstico Clínico de Laboratorio e Investigación Traslacional de la provincia de Zhejiang [2022E10022]; el Proyecto Provincial de Plan de Ciencia y Tecnología Médica y Sanitaria de Zhejiang [2024KY1265]; y el Proyecto Municipal de Investigación Básica de Bienestar Público de Wenzhou [Y2023096].

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

```html

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjuntos de datos para NAFLD (2017–2018)Base de datos NHANES [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/Acomo el conjunto de entrenamiento para la construcción del modelo
Conjuntos de datos para NAFLD (2018–2020)El Primer Hospital Afiliado de la Universidad Médica de Wenzhou (2018–2020), China. [https://doi.org/10.6084/m9.figshare.32105248.]N/Acomo un conjunto de prueba para la validación externa del modelo
R (versión 4.2.3)Fundación R para Computación EstadísticaN/Autilizado junto con otras herramientas para realizar análisis de datos y generar presentaciones visuales y gráficas.
Adobe Illustrator 2025 (versión 29.2)Adobe Systems IncorporatedN/APara diseño y edición de imágenes
ChatGPT-4OpenAI Inc.N/APara asignar una puntuación de importancia a cada variable seleccionada
H2O AutoML (3.44.0.3)H2O.aiN/APara integrar un conjunto completo de algoritmos de aprendizaje automático
```

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

MedicinaN mero 233N mero 233Este mes en JoVEN meroAutoMLdiagn sticoGradient Boosting Machine

Artículos relacionados