$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Pacientes y diseño del estudio
El primer conjunto de datos de este estudio se obtuvo de la base de datos de la Encuesta Nacional de Salud y Nutrición (NHANES) para el periodo 2017–2018. Este periodo específico se eligió porque los datos de la encuesta incluían mediciones de elastografía transitoria por ecografía hepática utilizando tecnología FibroScan®. NHANES emplea un diseño estratificado de muestreo probabilístico en varias etapas y funciona como una encuesta nacional basada en la población realizada cada dos años. Recopila sistemáticamente datos relacionados con la salud representativos a nivel nacional sobre la población estadounidense no institucionalizada para evaluar el estado nutricional y de salud de la población civil general enEstados Unidos. El NHANES es un estudio transversal representativo a nivel nacional administrado por el Centro Nacional de Estadísticas de Salud (NCHS). El protocolo de la encuesta recibió la aprobación de la Junta de Revisión de Ética en Investigación de la NCHS, con el consentimiento informado documentado obtenido de todos los participantes. El estudio se llevó a cabo de acuerdo con las Declaraciones de Helsinki y de Estambul, y fue aprobado por el comité de ética del Primer Hospital Afiliado de la Universidad Médica de Wenzhou (2016–246, 1 de diciembre de 2016), y se obtuvo el consentimiento informado por escrito de cada participante.
El primer conjunto de datos consistió en 5494 individuos de la encuesta NHANES 2017–2018 que se sometieron al examen FibroScan. Tras la exclusión a continuación, se incluyeron un total de 2677 participantes en el análisis, que comprenden 718 individuos con NAFLD y en 1959 con no NAFLD. Estos participantes se dividieron aleatoriamente en un conjunto de entrenamiento (n = 1785) y un conjunto de pruebas (n = 892). El segundo conjunto de datos comprendía 582 personas del Departamento de Enfermedades Infecciosas del Primer Hospital Afiliado de la Universidad Médica de Wenzhou (2018–2020). Tras aplicar los mismos criterios de exclusión, se incluyeron un total de 200 individuos, que consisten en 159 individuos con NAFLD y 41 con no NAFLD. Esta cohorte se utilizó como un conjunto de validación independiente. El diseño del estudio se desarrolló para construir y validar el modelo utilizando datos multicéntricos, mejorando así la fiabilidad y generalización de los hallazgos. Las características clínicas de referencia de los grupos con NAFLD y no NAFLD se resumieron utilizando el paquete de la tabla uno (Tabla 1). Además, el proceso de selección de pacientes y el flujo general del estudio se ilustran en la Figura 1.
Criterios diagnósticos y criterios de exclusión para la NAFLD
El diagnóstico de NAFLD se basó en los siguientescriterios: 16 años: 18 años o más, participación en la elastografía transitoria (FibroScan) con consumo de alcohol limitada a ≤140 g/semana en mujeres y ≤ 210 g/semana en hombres durante los 12 meses anteriores, valor del parámetro de atenuación controlada (CAP) de ≥ 302 dB/m medido mediante el sistema FibroScan 502 V2 Touch (Echosens, París, Francia) con una sonda media (M) o extra-grande (XL), o un diagnóstico confirmado por patología de biopsia hepática en el Departamento de Enfermedades Infecciosas del Primer Hospital Adscrito de la Universidad Médicade Wenzhou 23.
Los criterios de exclusión para la NAFLD se detallan de la siguiente manera:consumo elevado de alcohol (ingesta media diaria > 20 g en mujeres y > 30 g en hombres según la encuestaNHANES de consumo de alcohol 5), presencia de hepatitis B o C, infección por VIH, hepatitis autoinmune, colangitis biliar primaria, enfermedad de Wilson, uso prolongado de antiinflamatorios no esteroides, bloqueadores de los canales de calcio, tamoxifeno, amiodarona, corticosteroides, isoniazida o metotrexato, embarazo o lactancia, y un diagnóstico de cáncer de hígado u otro tumor benigno o maligno.
Recogida de datos y selección de variables
Las variables predictoras potenciales incluidas en este estudio se enumeran a continuación:
Características demográficas (es decir, edad y género); Índice de masa corporal (IMC); valores de PAC de los participantes en la base de datos NHANES; Pruebas bioquímicas generales [es decir, albúmina (ALB), globulina (GLO), proteína total (TP), lactato deshidrogenasa (LDH), nitrógeno urea en sangre (BUN), ácido úrico (UA), gamma-glutamil transferasa (GGT), triglicéridos (TG), suero-glucosa (glu), creatinina sérica (SCr), bilirrubina total (TBIL), sodio (Na⁺), cloruro (Cl⁻), potasio (K⁺), calcio (Ca), bicarbonato (HCO₃), colesterol total (TC), aspartato aminotransferasa (AST) y alanina aminotransferasa (ALT)]; Parámetros hematológicos estándar [es decir, recuento de glóbulos rojos (RBC), recuentos de glóbulos blancos (GBB), conteo de neutrófilos (NEUT), recuentos de eosinófilos (EOS), recuentos de linfocitos (LYM), recuentos de monocitos (MON), ancho de distribución de glóbulos rojos (RDW) y recuento de plaquetas (PLT)]; Antecedentes de hipertensión y diabetes mellitus (DM). Entre los sujetos incluidos en el estudio, los criterios diagnósticos para diabetes e hipertensión se obtuvieron a partir de un estudio previo basado en aprendizaje automático centrado enNAFLD 24.
Gestión de datos y selección de características ausentes
Los datos de cohorte utilizados en este estudio incluían valores faltantes. Excluir todos los registros incompletos no solo disminuiría el tamaño de la muestra de análisis, sino que también comprometería la calidad de los datos y potencialmente sesgaría los resultados de la predicción. Por lo tanto, se excluyeron cualquier dato con valores faltantes superiores al 20%. Para conjuntos de datos con valores ausentes ≤20%, se aplicaron diferentes métodos de imputación según el tipo de dato: "norm" para variables continuas, "logreg" para variables de clasificación binaria y "polyreg" para variables multiclase. Estas imputaciones se realizaron utilizando el paquete "ratones" en R para imputacionesmúltiples 25. En este estudio, todas las variables continuas se dichotomizaron en variables binarias, con umbrales óptimos de clasificación determinados mediante análisis de curvas de características de operación del receptor (ROC). Específicamente, se seleccionó el punto de corte correspondiente al índice máximo de Youden en la curva ROC como criterio óptimo de clasificación, optimizando así el rendimiento de la clasificación manteniendo un equilibrio adecuado entre sensibilidad y especificidad. Posteriormente, se empleó el análisis discriminante parcial de mínimos cuadrados (PLS-DA) para agrupar eficazmente los datos.
Para una selección adicional de características, los individuos se asignaban aleatoriamente a conjuntos de entrenamiento y pruebas en una proporción de 7:3 usando el paquete "caret". Primero, se utilizó la regresión de menor contracción absoluta y operador de selección (LASSO) para la selección de características, identificando 14 variables clave para análisis posteriores. A continuación, se aplicó ChatGPT-4 para asignar una puntuación de importancia a cada variable. Para evaluar sistemáticamente la importancia de las características controlando posibles sesgos y variaciones estocásticas, se implementó un protocolo de evaluación estandarizado. El prompt específico proporcionado al modelo fue: "Basándonos en la literatura clínica establecida sobre la enfermedad hepática grasa no alcohólica (NAFLD), asignar una puntuación de importancia que vaya de 1 (más baja) a 10 (más alta) para cada una de las siguientes 14 variables identificadas mediante regresión LASSO." Al restringir la evaluación estrictamente a las variables preseleccionadas por la regresión LASSO, se minimizó el riesgo de incorporar características alucinadas o irrelevantes. Para evitar estrictamente la posible fuga de datos y el uso inadvertido de la prevalencia de resultados, el modelo de lenguaje quedó completamente ciego ante el conjunto de datos empírico. La puntuación se limitó a sintetizar conocimientos médicos preexistentes sobre los nombres de las variables. Este procedimiento mejora metodologías tradicionales, como la selección de estabilidad LASSO o la poda basada en SHAP, asegurando que las características puramente basadas en datos exhiban una plausibilidad fisiopatológica robusta antes de la integración final del modelo. Además, para mitigar la varianza de respuesta simple, este procedimiento se iteró 10 veces de forma independiente. La puntuación media de cada variable se calculaba a lo largo de estas iteraciones, asegurando una priorización objetivo. Las variables se ordenaron en orden descendente según sus puntuaciones medias. Finalmente, la selección se redujo para incluir solo aquellas variables con una puntuación media de importancia superior a 5, resultando en 8 variables clave: SCr, URI, GGT, Glu, Hipertensión, Diabetes, TG e IMC.
Desarrollo de modelos de predicción basados en AutoML para NAFLD
En este estudio, se integró un conjunto completo de algoritmos clásicos y avanzados de aprendizaje automático utilizando H2O AutoML para el diagnóstico efectivo de la NAFLD. Aprovechando las capacidades de AutoML de la plataforma H2O.ai, se realizaron análisis de aprendizaje automático para tareas de clasificación binaria. Los algoritmos utilizados incluían eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Generalized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) y Stacked Ensemble. Estos algoritmos fueron evaluados sistemáticamente para identificar el modelo óptimo para el diagnóstico de enfermedades. Para garantizar una rigurosa reproducibilidad metodológica, se definieron explícitamente los parámetros de ejecución de H2O AutoML. La búsqueda automatizada estaba limitada a un tiempo máximo de ejecución de 11.687 segundos y un máximo de 302 modelos, utilizando una semilla aleatoria fija de 13. Las banderas internas de preprocesamiento incluían la imputación automática de valores residuales faltantes mediante algoritmos media/modo, así como la codificación de destino para variables categóricas de alta cardinalidad. La arquitectura óptima seleccionada (etiquetada como GBM_grid_1_model77) era una máquina de aumento de gradiente con los siguientes hiperparámetros específicos: un total de 28 árboles, una profundidad máxima de árbol de 5 y una tasa de aprendizaje de 0,1.
Para mejorar la robustez del modelo y mitigar riesgos de sobreajuste, se implementó un marco AutoML que incorpora protocolos sistemáticos de ajuste y validación de hiperparámetros. El proceso comenzó con la exploración automatizada de 200 configuraciones de modelos distintas mediante optimización por hiperparámetros, empleando la validación cruzada de 5 veces donde el conjunto de datos de entrenamiento se particionó en cinco subconjuntos mutuamente excluyentes. Durante el entrenamiento iterativo, cada configuración utilizaba cuatro subconjuntos (80%) para la construcción del modelo, reservando un subconjunto (20%) para la validación, con este rol de validación rotando secuencialmente en todos los pliegues. Para equilibrar la eficiencia computacional con la optimización del rendimiento, se implementó una parada temprana dinámica basada en el área bajo la métrica de la curva ROC (AUC). Este mecanismo suspendió el entrenamiento cuando las mejoras en AUC bajaron del umbral de 0,001 durante tres ciclos consecutivos, aplicándose tanto al refinamiento individual del modelo como al proceso general de búsqueda de AutoML. La selección final del modelo priorizó configuraciones que demostraban el máximo promedio de AUC tanto en conjuntos de entrenamiento como de validación, requeriendo simultáneamente un rendimiento consistente entre estos conjuntos y una varianza mínima de métricas entre iteraciones de validación cruzada. Este enfoque integrado garantizaba una precisión predictiva óptima manteniendo una fuerte generalizabilidad mediante protocolos rigurosos de validación y restricciones de optimización automatizada.
Evaluación del rendimiento del modelo e interpretación de los resultados de las predicciones
El rendimiento del modelo y la interpretación de los resultados de predicción se evaluaron de forma exhaustiva utilizando curvas ROC, puntuaciones F1 y análisis SHAPapley aditivo (SHAP). El rendimiento del modelo y la interpretación de sus resultados de predicción fueron evaluados de forma exhaustiva utilizando curvas ROC, puntuaciones F1 y análisis SHAPapley Aditivive Explanation (SHAP). Inicialmente, se generaban predicciones sobre el conjunto de datos de prueba utilizando el modelo entrenado, y se extrajeron las probabilidades predichas para la clase positiva (es decir, clase 1) (pred_prob). La curva ROC se construyó usando el paquete pROC, y se calculó el AUC del modelo, junto con su intervalo de confianza del 95%. El umbral óptimo en la curva ROC se determinó utilizando la estadística J de Youden (J = Sensibilidad + Especificidad − 1) para la determinación binaria de la etiqueta de clasificación. A partir de este umbral derivado de la curva ROC, las probabilidades predichas se convirtieron en etiquetas binarias de predicción (0 o 1), y posteriormente se generó una matriz de confusión. La puntuación F1 en el conjunto de prueba se calculó usando la función matriz de confusión, y se produjo y guardó una visualización de dicha matriz de confusión. Además, el modelo fue validado en un conjunto de datos externo independiente de validación que consta de 200 casos (del Primer Hospital Afiliado de la Universidad Médica de Wenzhou). Los valores de SHAP se analizaron utilizando el paquete "shapviz" para dilucidar el impacto de cada variable en los resultados de predicción del modelo, proporcionando así información sobre la interpretación de las predicciones individuales de probabilidad de NAFLD.
Métodos estadísticos
"El análisis estadístico y el desarrollo de software se realizaron usando la versión 4.2.3 de R (Fundación R para la Computación Estadística, Viena, Austria). Las variables continuas se evaluaron inicialmente para comprobar su normalidad mediante la prueba de Shapiro-Wilk o la inspección visual de los gráficos Q-Q. Los datos normalmente distribuidos se presentaron como media ± desviación estándar (DS), y se realizaron comparaciones entre dos grupos independientes utilizando pruebas t de muestras independientes. Para comparaciones de varios grupos, se empleó ANOVA unidireccional con pruebas de HSD de Tukey post-hoc cuando era apropiado. Los datos continuos no distribuidos normalmente se resumieron como mediana [rango intercuartílico (IQR), P25–P75], y las comparaciones de grupo se realizaron utilizando la prueba U de Mann-Whitney para dos grupos independientes o la prueba de Kruskal-Wallis para varios grupos, seguida de la prueba post-hoc de Dunn si era necesario. Las variables categóricas se expresaron como frecuencias y porcentajes (%), y las comparaciones de proporciones entre grupos se analizaron utilizando la prueba chi-cuadrado (prueba χ2 ) o la prueba exacta de Fisher cuando los conteos celulares esperados eran inferiores a 5. El nivel de significación se estableció en α = 0,05 (bicolar), y se consideró estadísticamente significativo un valor p < 0,05.