Article de recherche

Modèle automatisé d’apprentissage automatique pour la prédiction de la stéatose hépatique non alcoolique et la validation externe des cohortes

DOI :

10.3791/70033

3 juillet 2026

* These authors contributed equally

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Un protocole AutoML étape par étape est présenté pour dépister la stéatose hépatique non alcoolique à partir des données NHANES et d’une cohorte externe. La méthode automatise la priorisation des fonctionnalités et la sélection des modèles (GBM), et inclut une interprétation basée sur SHAP ainsi qu’une validation externe pour un déploiement clinique reproductible.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La stéatose hépatique non alcoolique (NAFLD) est un trouble du foie courant associé à l’obésité, à la résistance à l’insuline et au syndrome métabolique, souvent non diagnostiqué jusqu’à des stades avancés. Les méthodes diagnostiques traditionnelles, notamment l’imagerie et la biopsie hépatique, présentent des limites en matière de détection précoce. Il est nécessaire d’un outil efficace et non invasif pour le dépistage précoce de la NAFLD. Grâce à la technologie d’apprentissage automatique automatisé (AutoML), un modèle de diagnostic pour la NAFLD a été développé en tirant parti d’un vaste ensemble de données issu de NHANES (n = 2677). De plus, une cohorte de validation externe indépendante (n = 200) a été employée pour évaluer la validité externe et la performance du modèle. Pour la sélection des caractéristiques cliniques prometteuses, une méthode de sélection des caractéristiques en deux étapes a été appliquée, combinant la régression LASSO avec une analyse intelligente basée sur ChatGPT-4. Par la suite, le processus AutoML, qui intégrait plusieurs algorithmes d’apprentissage automatique, a été réalisé pour l’entraînement et la validation du modèle. La performance du modèle a été évaluée à l’aide de courbes ROC, de scores F1 et de l’analyse SHAP (SHAPLEY par explication additive). Le modèle GBM a atteint un AUC de 0,843 dans l’ensemble d’entraînement, 0,851 dans l’ensemble de test et 0,945 dans l’ensemble externe de validation, démontrant une grande précision diagnostique sur différents ensembles de données. Des prédicteurs clés, dont l’IMC, les triglycérides et la GGT, ont été identifiés comme des contributeurs significatifs aux prédictions du modèle. L’analyse SHAP a également confirmé l’importance de ces variables dans la prédiction de la NAFLD. Le modèle de diagnostic piloté par AutoML pour la NAFLD a démontré une amélioration significative des performances de détection précoce, offrant une alternative fiable, non invasive et efficace aux méthodes de diagnostic conventionnelles. Cette méthode présente un grand potentiel pour une application clinique plus large dans la NAFLD, réduisant la dépendance aux connaissances expertes tout en améliorant la précision diagnostique.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La stéatose hépatique non alcoolique (NAFLD) est l’une des maladies hépatiques les plus répandues au monde, touchant actuellement environ 35 % de la population adulte dans le monde, et n’est pas attribuable à une consommation excessived’alcool 1. Elle se caractérise par l’accumulation de graisse dans plus de 5 % des hépatocytes, qui peut potentiellement évoluer vers des affections plus graves, notamment l’inflammation, la mucoviscidose hépatique, la cirrhose et, finalement, une insuffisancehépatique 2,3. Actuellement, les méthodes traditionnelles de diagnostic de la NAFLD reposent principalement sur des marqueurs biochimiques hépatiques anormaux et l’imagerie par ultrasons. Cependant, l’échographie présente une sensibilité limitée lorsque le degré de stéatose est inférieur à 20 %, ce qui compromet sa fiabilité pour détecter une légère infiltration de graisse et conduit souvent à des diagnostics manqués deNAFLD 4 à un stade précoce. Bien que la biopsie hépatique soit considérée comme la référence pour le diagnostic de la NAFLD, sa nature invasive et le risque de complications telles que douleur, infection et saignements limitent sa faisabilité pour un dépistage à grandeéchelle 5. Par conséquent, il est urgent de disposer d’un outil efficace, non invasif, rentable et hautement sensible pour faciliter le dépistage de la NAFLD.

Avec le développement rapide des technologies d’intelligence artificielle (IA) et d’apprentissage automatique (ML), les approches basées sur les données offrent de nouvelles solutions pour le diagnostic précoce et l’évaluation des risques de la NAFLD. En analysant des données complexes et à grande échelle, les technologies d’apprentissage automatique peuvent automatiquement identifier des schémas et des relations potentiels, et ont été largement utilisées dans le diagnostic et la prédiction de diversesmaladies 6. Par exemple, des algorithmes ML ont été utilisés pour prédire le risque de cirrhose chez les personnes atteintes d’une infection chronique par le virus de l’hépatite B, obtenant des résultatsprometteurs 7. Des études similaires dans le domaine de la NAFLD ont permis de développer avec succès des modèles diagnostiques utilisant des algorithmes traditionnels d’apprentissage automatique, tels que les machines à vecteurs de support (SVM) et les forêts aléatoires (RF), atteignant des niveaux élevés de précision et démontrant une forte applicabilitéclinique 8,9,10,11,12,13,14,15,16.17,18. Par exemple, des chercheurs ont développé un modèle d’apprentissage automatique utilisant des paramètres de laboratoire pour filtrer efficacement la NAFLD dans la population générale grâce à l’analyse de données de laboratoire de routine. Un modèle ML utilisant des paramètres de laboratoire a étédéveloppé 13 pour filtrer efficacement la NAFLD dans la population générale grâce à l’analyse des données de laboratoire de routine. La prévalence de la NAFLD aux États-Unis a été prédite en combinant l’élastographie transitoire avec des méthodes d’apprentissage automatique à partir des données NHANES 2017–201816. L’équipe de recherche a utilisé des algorithmes d’apprentissage automatique pour étudier la corrélation entre l’élastographie transitoire et d’autres variables cliniques, développant un modèle prédictif qui estimait de manière fiable la prévalence de la NAFLD dans diverses populations.

Cependant, les méthodes traditionnelles d’apprentissage automatique exigent généralement un effort manuel important, notamment en ingénierie des caractéristiques, sélection de modèles et réglage des paramètres, qui nécessitent des connaissances et une expérience spécialisées. Pour remédier à ces limites, l’apprentissage automatique automatisé (AutoML) a été développé. AutoML automatise l’ensemble du pipeline de construction de modèles, englobant le prétraitement des données, la sélection des fonctionnalités, la sélection des modèles et l’optimisation des hyperparamètres, améliorant ainsi de manière substantielle l’efficacité et la précision des processus d’apprentissageautomatique 19. Un modèle prédictif pour le saignement varicéral œsophagien a été développé et validé à l’aide de la plateforme H2OAutoML 20. Le modèle utilisait divers algorithmes, notamment l’apprentissage profond (DL), l’eXtreme Gradient Boosting (XGBoost), les modèles linéaires généralisés (GLM), les machines à amplification de gradient (GBM), les forêts aléatoires (RF) et les ensembles d’empilement, avec un horizon de prédiction sur 12 mois. AutoML a été utilisé pour prédire le risque de métastases hépatiques chez les patients atteints de tumeurs stromales gastro-intestinales, en s’appuyant sur les données de la base de donnéesSEER 21. Les plateformes AutoML ont été exploitées pour développer un outil diagnostique rapide et économique du cancer de la prostate en utilisant des données cliniquesde routine 22. L’émergence de l’AutoML a offert des solutions plus efficaces pour le diagnostic clinique, et son potentiel dans le dépistage de la NAFLD mérite une exploration plus approfondie. Bien que la détection précoce et le diagnostic précis de la NAFLD soient essentiels, la nature asymptomatique de la maladie pose des défis diagnostiques importants. Bien que la technologie AutoML ait montré un grand potentiel dans le diagnostic des maladies, son application dans le diagnostic de la NAFLD reste restreinte, soulignant les perspectives prometteuses de ce domaine de recherche.

Cette étude a développé un modèle diagnostique de la stéatose hépatique non alcoolique (NAFLD) en utilisant la technologie AutoML en conjonction avec l’élastographie transitoire, en s’appuyant sur les données de la base de données américaine NHANES (2017–2018). Le modèle a été validé à l’externe à partir d’un ensemble de données provenant de personnes du Département des maladies infectieuses, Premier Hôpital affilié de l’Université médicale de Wenzhou (2018–2020). L’étude a évalué la performance du modèle sur un ensemble de données externe et l’a comparé aux méthodes traditionnelles, répondant ainsi aux lacunes de recherche existantes. Grâce à l’analyse de plusieurs marqueurs sanguins et biochimiques, des modèles prédictifs ont été construits à l’aide d’algorithmes tels que la régression logistique et les forêts aléatoires. Les résultats ont indiqué la performance supérieure du modèle pour identifier avec précision les individus non-NAFLD. Cela offre non seulement un outil efficace et précis pour le dépistage précoce de la NAFLD, mais favorise également l’intégration d’AutoML dans les applications médicales.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Patients et conception de l’étude

Le premier ensemble de données de cette étude a été obtenu à partir de la base de données du National Health and Nutrition Examination Survey (NHANES) pour la période 2017–2018. Cette période précise a été choisie car les données de l’enquête incluaient des mesures d’élastographie transitoire par échographie hépatique utilisant la technologie FibroScan®. NHANES utilise un modèle d’échantillonnage probabilistique stratifié et en plusieurs étapes et sert d’enquête nationale basée sur la population menée tous les deux ans. Il collecte systématiquement des données représentatives nationales sur la santé de la population américaine non institutionnalisée afin d’évaluer l’état nutritionnel et de santé de la population civile généraleaux États-Unis 1. Le NHANES est une étude transversale représentative au niveau national, administrée par le National Center for Health Statistics (NCHS). Le protocole d’enquête a reçu l’approbation du Conseil d’éthique de la recherche du NCHS, avec un consentement documenté et informé obtenu de tous les participants. L’étude a été menée conformément aux Déclarations d’Helsinki et d’Istanbul, et a été approuvée par le comité d’éthique du Premier Hôpital affilié de l’Université Médicale de Wenzhou (2016–246, 1er décembre 2016), et un consentement éclairé écrit a été obtenu de chaque participant.

Le premier ensemble de données comprenait 5494 individus issus de l’enquête NHANES 20172018 ayant subi un examen FibroScan. Suite à l’exclusion ci-dessous, un total de 2 677 participants ont été inclus dans l’analyse, comprenant 718 individus atteints de NAFLD et 1959 sans NAFLD. Ces participants ont ensuite été divisés aléatoirement en un ensemble d’entraînement (n = 1785) et un ensemble de test (n = 892). Le second ensemble de données comprenait 582 individus du Département des maladies infectieuses du Premier Hôpital affilié de l’Université médicale de Wenzhou (2018–2020). Après avoir appliqué les mêmes critères d’exclusion, un total de 200 personnes ont été incluses, dont 159 personnes atteintes de NAFLD et 41 personnes sans NAFLD. Cette cohorte a été utilisée comme un ensemble de validation indépendant. Le plan de l’étude a été développé pour construire et valider le modèle à partir de données multicentres, améliorant ainsi la fiabilité et la généralisation des résultats. Les caractéristiques cliniques de base des groupes NAFLD et non-NAFLD ont été résumées à l’aide du paquet du tableau un (Tableau 1). De plus, le processus de sélection des patients et le déroulement global de l’étude sont illustrés à la Figure 1.

Critères diagnostiques et critères d’exclusion pour la NAFLD

Le diagnostic de la NAFLD était basé sur les critèressuivants : 16 ans ou plus, participation à un dépistage d’élastographie transitoire (FibroScan) avec consommation d’alcool limitée à ≤140 g/semaine pour les femmes et ≤ 210 g/semaine pour les hommes au cours des 12 mois précédents, une valeur du paramètre d’atténuation contrôlée (CAP) de ≥ 302 dB/m mesurée à l’aide du système FibroScan 502 V2 Touch (Echosens, Paris, France) avec une sonde moyenne (M) ou extra-large (XL), ou un diagnostic confirmé par une biopsie hépatique pathologique au Département des maladies infectieuses du premier hôpital affilié de l’Université médicalede Wenzhou 23.

Les critères d’exclusion pour la NAFLD sont décrits comme suit :consommation élevée d’alcool (consommation quotidienne moyenne > 20 g pour les femmes et > 30 g pour les hommes selon l’enquêteNHANES sur l’usage d’alcool 5), présence d’hépatite B ou C, infection par le VIH, hépatite auto-immune, cholangite biliaire primaire, maladie de Wilson, usage prolongé de médicaments anti-inflammatoires non stéroïdiens, bloqueurs calciques, tamoxifène, amiodarone, corticostéroïdes, isoniazide ou méthotrexate, grossesse ou allaitement, et un diagnostic de cancer du foie ou de toute autre tumeur bénigne ou maligne.

Collecte de données et sélection des variables

Les variables prédictrices potentielles incluses dans cette étude sont listées ci-dessous :

Caractéristiques démographiques (c’est-à-dire âge et genre) ; Indice de masse corporelle (IMC) ; les valeurs de PAC des participants dans la base de données NHANES ; Tests biochimiques généraux [c’est-à-dire albumine (ALB), globuline (GLO), protéine totale (TP), lactate déshydrogénase (LDH), urée sanguine azote (BUN), acide urique (UA), gamma-glutamyl transférase (GGT), triglycéride (TG), sérum-glucose (glu), créatinine sérique (SCr), bilirubine totale (TBIL), sodium (Na⁺), chlorure (Cl⁻), potassium (K⁺), calcium (Ca), bicarbonate (HCO₃), cholestérol total (TC), aspartate aminotransférase (AST) et alanine aminotransférase (ALT)] ; Paramètres hématologiques standards [c’est-à-dire le nombre de globules rouges (RBC), de globules blancs (GBC), de neutrophiles (NEUT), de nombres d’éosinophiles (EOS), de lymphocytes (LYM), de monocytes (MON), de largeur de distribution des globules rouges (RDW) et de plaquettes (PLT)] ; Antécédents d’hypertension et de diabète sucré (DM). Parmi les sujets inclus dans l’étude, les critères diagnostiques pour le diabète et l’hypertension ont été obtenus à partir d’une étude antérieure basée sur l’apprentissage automatique axée sur leNAFLD 24.

Manquante gestion des données et sélection des fonctionnalités

Les données de cohorte utilisées dans cette étude comprenaient des valeurs manquantes. Exclure tous les enregistrements incomplets ne diminuerait pas seulement la taille de l’échantillon d’analyse, mais compromettrait aussi la qualité des données et pourrait biaiser les résultats de prédiction. Par conséquent, toutes les données dont les valeurs manquantes dépassent 20 % étaient exclues. Pour les ensembles de données avec des valeurs manquantes ≤ 20 %, différentes méthodes d’imputation ont été appliquées selon le type de données : « norm » pour les variables continues, « logreg » pour les variables de classification binaire, et « polyreg » pour les variables multiclasses. Ces imputations ont été effectuées en utilisant le package « souris » dans R pour l’imputationmultiple 25. Dans cette étude, toutes les variables continues ont été dichotomisées en variables binaires, avec des seuils de classification optimaux déterminés via l’analyse de la courbe de caractéristique de fonctionnement du récepteur (ROC). Plus précisément, le point de coupure correspondant à l’indice de Youden maximal sur la courbe ROC a été choisi comme critère optimal de classification, optimisant ainsi la performance de classification tout en maintenant un équilibre approprié entre sensibilité et spécificité. Par la suite, l’analyse discriminante partielle des moindres carrés (PLS-DA) a été employée pour regrouper efficacement les données.

Pour une sélection supplémentaire des caractéristiques, les individus étaient répartis aléatoirement dans des ensembles d’entraînement et de test au ratio 7:3 en utilisant le package « caret ». Premièrement, la régression de l’opérateur de réduction absolue et de sélection (LASSO) a été utilisée pour la sélection des caractéristiques, identifiant 14 variables clés pour une analyse ultérieure. Ensuite, ChatGPT-4 a été appliqué pour attribuer un score d’importance à chaque variable. Pour évaluer systématiquement l’importance des caractéristiques tout en contrôlant les biais potentiels et les variations stochastiques, un protocole d’évaluation standardisé a été mis en place. Le prompt spécifique fourni au modèle était : « Basé sur la littérature clinique établie concernant la stéatose hépatique non alcoolique (NAFLD), attribuez un score d’importance allant de 1 (le plus bas) à 10 (le plus élevé) pour chacune des 14 variables suivantes identifiées via la régression du LASSO. » En limitant l’évaluation strictement aux variables présélectionnées par la régression LASSO, le risque d’incorporer des caractéristiques hallucinées ou non pertinentes a été minimisé. Pour éviter strictement une fuite potentielle de données et l’utilisation involontaire de la prévalence des résultats, le modèle de langage a été totalement aveuglé par rapport à l’ensemble de données empirique. La notation s’est limitée à la synthèse des connaissances médicales préexistantes concernant les noms des variables. Cette procédure améliore les méthodologies traditionnelles, telles que la sélection de stabilité LASSO ou l’élagage basé sur SHAP, en garantissant que les caractéristiques purement basées sur les données présentent une plausibilité pathophysiologique robuste avant l’intégration finale du modèle. De plus, pour atténuer la variance à réponse unique, cette procédure a été itérée 10 fois indépendamment. Le score moyen pour chaque variable était calculé à travers ces itérations, assurant une priorisation objective. Les variables étaient ensuite classées par ordre décroissant selon leurs scores moyens. Enfin, la sélection a été réduite à n’inclure que les variables dont le score d’importance moyen dépasse 5, ce qui donne 8 variables clés : SCr, UA, GGT, Glu, hypertension, diabète, TG et IMC.

Développement de modèles de prédiction basés sur AutoML pour la NAFLD

Dans cette étude, une suite complète d’algorithmes classiques et avancés d’apprentissage automatique a été intégrée à l’aide de H2O AutoML pour un diagnostic efficace de la NAFLD. En tirant parti des capacités AutoML de la plateforme H2O.ai, des analyses d’apprentissage automatique pour les tâches de classification binaire ont été réalisées. Les algorithmes utilisés comprenaient eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Généralized Linear Model (GLM), Extremely Randomized Trees (XRT), Deep Learning (DL) et Stacked Ensemble. Ces algorithmes ont été systématiquement évalués afin d’identifier le modèle optimal pour le diagnostic des maladies. Pour garantir une reproductibilité méthodologique rigoureuse, les paramètres d’exécution de l’AutoML H2O ont été explicitement définis. La recherche automatisée était limitée à un temps d’exécution maximal de 11 687 secondes et à un maximum de 302 modèles, utilisant une graine aléatoire fixe de 13. Les indicateurs de prétraitement internes comprenaient l’imputation automatique des valeurs résiduelles manquantes à l’aide d’algorithmes moyenne/mode, ainsi qu’un codage cible pour les variables catégoriques de haute cardinalité. L’architecture optimale sélectionnée (étiquetée GBM_grid_1_model77) était une machine d’amplification de gradient avec les hyperparamètres spécifiques suivants : un total de 28 arbres, une profondeur maximale d’arbre de 5, et un taux d’apprentissage de 0,1.

Pour renforcer la robustesse des modèles et atténuer les risques de surapprentissage, un cadre AutoML intégrant des protocoles systématiques d’ajustement et de validation des hyperparamètres a été mis en place. Le processus a débuté par une exploration automatisée de 200 configurations de modèles distinctes grâce à l’optimisation par hyperparamètres, utilisant une validation croisée à 5 fois où le jeu de données d’entraînement était divisé en cinq sous-ensembles mutuellement exclusifs. Lors de l’entraînement itératif, chaque configuration utilisait quatre sous-ensembles (80 %) pour la construction du modèle tout en réservant un sous-ensemble (20 %) pour la validation, ce rôle de validation tournant séquentiellement sur tous les plis. Pour équilibrer l’efficacité computationnelle avec l’optimisation des performances, un arrêt précoce dynamique a été mis en œuvre en fonction de la zone sous la métrique de la courbe ROC (AUC). Ce mécanisme a suspendu l’entraînement lorsque les améliorations de l’AUC sont tombées en dessous d’un seuil de 0,001 pendant trois cycles consécutifs, s’appliquant à la fois à l’affinement individuel du modèle et au processus global de recherche AutoML. La sélection finale du modèle a priorisé les configurations démontrant un AUC moyen maximal à la fois sur les ensembles d’entraînement et de validation, tout en exigeant simultanément des performances cohérentes entre ces ensembles et une variance minimale des métriques entre les itérations croisées. Cette approche intégrée garantissait une précision prédictive optimale tout en maintenant une forte généralisation grâce à des protocoles de validation rigoureux et des contraintes d’optimisation automatisée.

Évaluation de la performance du modèle et interprétation des résultats de prédiction

La performance du modèle et l’interprétation des résultats de prédiction ont été évaluées de manière exhaustive à l’aide de courbes ROC, des scores F1 et de l’analyse SHAPapley par explication additive (SHAP). La performance du modèle et l’interprétation de ses résultats de prédiction ont été évaluées de manière exhaustive à l’aide de courbes ROC, de scores F1 et de l’analyse SHAPapley Additive Explanation (SHAP). Initialement, les prédictions étaient générées sur l’ensemble de données de test à l’aide du modèle entraîné, et les probabilités prédites pour la classe positive (c’est-à-dire la classe 1) étaient extraites (pred_prob). La courbe ROC a été construite à l’aide du package pROC, et l’AUC du modèle, ainsi que son intervalle de confiance à 95 %, ont été calculés. Le seuil optimal sur la courbe ROC a été déterminé à l’aide de la statistique J de Youden (J = Sensibilité + Spécificité − 1) pour la détermination binaire de l’étiquette de classification. Sur la base de ce seuil dérivé de la courbe ROC, les probabilités prédites ont été converties en étiquettes binaires de prédiction (0 ou 1), et une matrice de confusion a ensuite été générée. Le score F1 sur l’ensemble de test a été calculé à l’aide de la fonction de matrice de confusion, et une visualisation de la matrice de confusion a été produite et enregistrée. De plus, le modèle a été validé sur un ensemble de données externe indépendant comprenant 200 cas (provenant du Premier Hôpital Affilié de l’Université Médicale de Wenzhou). Les valeurs SHAP ont été analysées à l’aide du package « shapviz » afin d’élucider l’impact de chaque variable sur les résultats de prédiction du modèle, fournissant ainsi des éclairages sur l’interprétation des prédictions de vraisemblance individuelles de la NAFLD.

Méthodes statistiques

« L’analyse statistique et le développement logiciel ont été réalisés à l’aide de la version 4.2.3 de R (Fondation R pour l’Informatique Statistique, Vienne, Autriche). Les variables continues ont d’abord été évaluées pour leur normalité à l’aide du test de Shapiro-Wilk ou de l’inspection visuelle des graphiques Q-Q. Les données normalement distribuées ont été présentées en moyenne ± écart-type (SD), et des comparaisons entre deux groupes indépendants ont été réalisées à l’aide d’échantillons indépendants t-tests. Pour les comparaisons de groupes multiples, l’ANOVA unidirectionnelle a été employée avec des tests HSD de Tukey post-hoc lorsque cela est approprié. Les données continues non distribuées anormalement ont été résumées en médiane [intervalle interquartile (IQR), P25–P75], et des comparaisons de groupes ont été réalisées à l’aide du test U de Mann-Whitney pour deux groupes indépendants ou du test de Kruskal-Wallis pour plusieurs groupes, suivis du test post-hoc de Dunn si nécessaire. Les variables catégorielles ont été exprimées en fréquences et en pourcentages ( %), et les comparaisons de proportions entre groupes ont été analysées à l’aide du test du chi-carré (test χ2 ) ou du test exact de Fisher lorsque le nombre attendu de cellules était inférieur à 5. Le niveau de signification a été fixé à α = 0,05 (à deux queues), et une valeur p < 0,05 a été considérée comme statistiquement significative.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Caractéristiques cliniques de la NAFLD

Dans cette étude, les caractéristiques cliniques des individus atteints ou non de NAFLD ont été analysées de manière systématique. Une gamme de méthodes a été employée pour illustrer clairement la répartition et les différences de ces caractéristiques au sein de la population échantillonnée (Tableau 1). Un total de 2 677 individus ont été inclus dans l’analyse, dont 718 présentaient la NA...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La NAFLD est la cause la plus fréquente de maladies chroniques du foie dans le monde, et sa prévalence augmente d’environ 1 % chaqueannée 26. Environ 30 % de la population mondiale est touchée, faisant de la NAFLD non seulement la principale maladie chronique du foie, mais aussi l’indication la plus rapide pour la transplantationhépatique 3. L’apprentissage automatique automatisé (AutoML) s’est imposé comme un outil précie...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts. Dans cette étude, ChatGPT-4 (OpenAI) a été utilisé comme outil analytique intelligent lors de la phase de sélection des caractéristiques pour évaluer la pertinence clinique des variables identifiées par la régression LASSO. Tous les scores générés par l’IA ont été soigneusement examinés par les auteurs et validés empiriquement lors du processus AutoML ultérieur. ChatGPT-4 n’a pas été utilisé pour modifier les données brutes ni effectuer des calculs mathématiques. Les auteurs assument l’entière responsabilité de l’intégrité et de l’exactitude des résultats finaux.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été soutenu par le Startup Fund for Scientific Research de l’Université médicale du Fujian [2021QH1176] ; le Laboratoire clé de diagnostic en laboratoire clinique et de recherche translationnelle de la province du Zhejiang [2022E10022] ; le projet provincial de planification médicale et scientifique des sciences et technologies de la santé du Zhejiang [2024KY1265] ; et le projet municipal de recherche sur le bien-être public fondamental de Wenzhou [Y2023096].

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Datasets pour la NAFLD (2017–2018)Base de données NHANES [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/Acomme ensemble d'entraînement pour la construction du modèle
Datasets pour la NAFLD (2018–2020)Premier hôpital affilié de l'Université médicale de Wenzhou (2018–2020), Chine. [https://doi.org/10.6084/m9.figshare.32105248.]N/Acomme un ensemble de test pour la validation externe du modèle
R (version 4.2.3)R Foundation for Statistical ComputingN/Autilisé en conjonction avec d'autres outils pour effectuer des analyses de données et générer des présentations visuelles et graphiques.
Adobe Illustrator 2025 (version 29.2)Adobe Systems IncorporatedN/APour la mise en page et l'édition d'images
ChatGPT-4OpenAI Inc.N/APour attribuer un score d'importance à chaque variable sélectionnée
H2O AutoML (3.44.0.3)H2O.aiN/APour intégrer un ensemble complet d'algorithmes d'apprentissage automatique

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

M decineNum ro 233Num ro 233Ce mois ci dans JoVENum roAutoMLdiagnosticGradient Boosting Machine

Articles connexes