Tous les patients dont les données ont été saisies dans la Inflammatory Bowel Disease Cohort Database (IBDCD) ont fourni un consentement écrit éclairé pour l’utilisation de données cliniques désidentifiées à des fins de recherche au moment de l’inscription à la base de données. Le même cadre éthique d’approbation et de consentement s’appliquait à toutes les données extraites de la base de données, y compris les cohortes de développement et de validation. Aucune information identifiable du patient n’a été utilisée dans cette étude, et toutes les données ont été désidentifiées et chiffrées pour stockage. Comme cette étude impliquait une analyse rétrospective de données désidentifiées issues d’une base de données établie, le comité d’éthique a levé l’exigence d’un consentement supplémentaire des patients pour cette analyse spécifique. Les outils de recherche utilisés dans le protocole sont listés dans le tableau des matériaux.
1. Dépistage des facteurs influents dans la méta-analyse
- Stratégie de recherche de littérature
Une stratégie de recherche systématique a été menée à travers PubMed, Web of Science, Cochrane Library, Embase et China National Knowledge Infrastructure (CNKI). La stratégie de recherche en anglais était définie comme suit :
(« Maladie de Crohn »[Mesh] OU « CD » [tiab] OU « Crohn* » [tiab]) ET (« Malnutrition »[Mesh] OU « Nutrition » [Mesh] OU « Risque nutritionnel »[tiab]) ET (« Facteurs de risque »[Mesh] OU « Prédire * »[tiab])
La période de recherche a couvert la création de la base de données jusqu’au 31 mars 2025. De plus, un tri manuel des listes de références issues des études incluses a été effectué afin d’identifier les articles potentiellement manqués. Cette stratégie a permis une revue complète de la littérature sur le risque lié à la malnutrition et les facteurs prédictifs chez les patients atteints de la maladie de Crohn (MC), avec des bases de données clairement définies, des termes de recherche, des délais et des procédures manuelles complémentaires de prélèvement afin d’assurer l’exhaustivité de la collection de la littérature.
- Critères d’inclusion et d’exclusion
Les critères d’inclusion exigeaient que les populations étudiées soient composées de patients adultes (âgés de ≥18 ans) diagnostiqués atteints de la maladie de Crohn selon le Consensus de 2018 sur le diagnostic et le traitement de la maladie inflammatoire de l’intestin. Compte tenu de l’importance clinique de la malnutrition dans la MC, l’accent a été mis sur les études définissant la malnutrition en utilisant les critères de la Société européenne pour la nutrition clinique et le métabolisme (ESPEN) de 2015, les critères de la Global Leadership Initiative on Malnutrition (GLIM) de 2019, ou le score du Malnutrition Universal Screening Tool (MUST) ≥2. Une distinction claire a été maintenue entre les critères diagnostiques définis par la littérature et l’application exclusive des critères ESPEN 2015 pour la définition des résultats au sein de la cohorte de l’étude.
Les études éligibles comprenaient des études de cohorte, cas témoins, transversales et méthodes mixtes afin d’assurer une évaluation complète des facteurs de risque de malnutrition sous plusieurs angles. Les critères d’exclusion comprenaient les études animales, les articles de revue et les résumés de conférences en raison d’un soutien de données insuffisant ou d’un manque d’évaluation par les pairs. Les études manquant d’informations statistiques essentielles, y compris les rapports de cotes (OR) et les intervalles de confiance (IC) correspondants à 95 %, ont également été exclues.
2. Présélection de la littérature et extraction des données
Le tri de la littérature et l’extraction des données ont été réalisés indépendamment par deux chercheurs afin d’en garantir l’exhaustivité et la précision. La phase initiale consistait à filtrer les titres et résumés afin d’exclure les études qui ne répondaient clairement pas aux critères d’inclusion, réduisant ainsi l’ensemble de données à des études potentiellement pertinentes et de haute qualité.
Par la suite, un dépistage en texte intégral a été réalisé pour les études jugées potentiellement éligibles. Cette étape a impliqué une évaluation détaillée de la conception de l’étude, de la méthodologie, des résultats et du respect des critères d’inclusion prédéfinis afin de garantir que seules les études répondant à toutes les exigences étaient incluses dans l’analyse finale.
L’extraction des données a été réalisée à l’aide de formulaires standardisés pour enregistrer systématiquement les informations clés, y compris les noms des auteurs, l’année de publication, le pays, la taille de l’échantillon, la répartition des sous-types de classification de Montréal, la durée moyenne de la maladie, les définitions de la malnutrition, les outils d’évaluation et les OR extraites avec des IC correspondants à 95 % pour influencer les facteurs liés au risque de malnutrition.
Toute incohérence ou incertitude survenant lors du dépistage et de l’extraction des données a été résolue par des discussions internes. Lorsque le consensus n’a pas pu être atteint, un expert tiers a été consulté pour arbitrer, minimisant ainsi les biais subjectifs et garantissant une prise de décision objective. Ce processus rigoureux a renforcé la transparence méthodologique et a fourni une base solide pour l’identification des facteurs clés associés au risque de malnutrition chez la MC.
3. Évaluation de la qualité
Des critères rigoureux d’évaluation de la qualité ont été appliqués afin d’assurer la validité scientifique et la fiabilité des études incluses. Les études de cohorte et cas-témoins ont été évaluées à l’aide de l’échelle Newcastle–Ottawa (NOS), qui évalue la qualité des études dans trois domaines : sélection, comparabilité et exposition. Seules les études avec des scores NOS ≥7 ont été classées de haute qualité et incluses dans l’analyse.
Les études transversales ont été évaluées à l’aide de l’outil d’évaluation de l’Agency for Healthcare Research and Quality (AHRQ), qui examine la sélection des participants, la suffisance de la taille de l’échantillon, la validité des méthodes de collecte de données et la pertinence des analyses statistiques. Les études avec des scores d’AHRQ ≥8 ont été considérées éligibles à l’inclusion.
L’application de ces critères rigoureux d’évaluation de la qualité minimisait les biais potentiels liés à la variabilité de la qualité des études et garantissait que le modèle prédictif était soutenu par une base de preuves fiable.
4. Construction du modèle de prédiction
- Source des données
La Base de données des cohortes des maladies inflammatoires de l’intestin (IBDCD) est une base de données prospective multicentrique contenant des données cliniques de patients atteints de la maladie de Crohn collectées entre janvier 2018 et mars 2025, incluant des informations démographiques, des caractéristiques cliniques, des indicateurs de laboratoire, des schémas de traitement et des évaluations de l’état nutritionnel. L’ensemble de données de développement du modèle comprenait 800 patients atteints de la maladie de Crohn dérivés de la base de données IBDCD, comprenant 520 patients dans la cohorte d’entraînement et 280 patients dans la cohorte de validation.
Les critères d’inclusion exigeaient un diagnostic confirmé de la maladie de Crohn pendant au moins 6 mois et la disponibilité de données cliniques complètes, incluant les facteurs influents identifiés et les données d’évaluation nutritionnelle issues de la méta-analyse. Les patients présentant des maladies comorbides pouvant affecter l’état nutritionnel, y compris les cancers ou les maladies rénales chroniques, ont été exclus afin d’assurer l’exactitude des données et la validité du modèle.
- Définition et attribution des variables
La malnutrition a été diagnostiquée strictement selon les critères ESPEN 2015, qui incluent trois composantes diagnostiques principales : perte de poids non intentionnelle (≥5 % en 3 mois ou ≥10 % en 6 mois), réduction de l’apport ou de l’absorption alimentaire (réduction de ≥ de 25 % pendant ≥14 jours), et diminution de la masse musculaire évaluée par examen physique et mesures anthropométriques, y compris le circonférence musculaire du milieu du bras. Un indice de masse corporelle faible (IMC < 18,5 kg/m2) était considéré comme un indicateur de soutien plutôt que définitif. La malnutrition n’a été confirmée que lorsqu’au moins un critère fondamental était présent, tandis qu’un IMC faible servait d’indicateur supplémentaire. Les patients présentant un IMC faible sans preuve des critères fondamentaux n’ont pas été classés comme malnutris. Cette définition évitait la circularité entre un IMC bas, variable prédictive, et la malnutrition, un résultat.
La prévalence de la malnutrition était de 42,5 % dans la cohorte de formation (n = 520) et de 40,4 % dans la cohorte de validation (n = 280). Sur la base des résultats de la méta-analyse, cinq facteurs clés influents ont été sélectionnés comme variables prédictives, notamment l’activité de la maladie définie comme la protéine C-réactive (CRP >10 mg/L ; Oui = 1, Non = 0), atteinte intestinale grêle définie par la classification de Montréal (atteinte du colon LL1/LL3 versus LL2 ; Oui = 1, Non = 0), usage biologique (Oui = 1, Non = 0), antécédents de résection intestinale (Oui = 1, Non = 0), et IMC bas (<18,5 kg/m 2 ; Oui = 1, Non = 0). L’âge et le sexe ont été collectés comme caractéristiques démographiques de base, mais n’ont pas été inclus comme variables prédictives dans le modèle final car ils n’étaient pas statistiquement significatifs lors de l’analyse préliminaire.
Un total de 17 études de haute qualité ont été incluses dans la méta-analyse. Les OR regroupés et les IC à 95 % correspondants pour les cinq facteurs prédictifs étaient les suivants : CRP élevée (OR = 4,72, IC 95 % : 3,21–6,95), atteinte de l’intestin grêle (OR = 2,89, IC 95 % : 1,93–4,33), usage biologique (OR = 0,39, IC 95 % : 0,15–1,01), antécédents de résection intestinale (OR = 6,17, IC 95 % : 2,35–16,18) et IMC bas (OR = 3,56, IC 95 % : 2.41–5.27).
- Méthode de construction du modèle
Les OR regroupés et les IC à 95 % correspondants dérivés de la méta-analyse ont été transformés en valeurs log-OR et utilisés pour obtenir les coefficients de régression (β) du modèle de régression logistique multivariable. La cohérence entre les résultats de la méta-analyse et les coefficients du modèle a été vérifiée grâce à l’analyse de corrélation de Pearson (r = 0,98, P < 0,001). Sur la base des facteurs d’influence identifiés, un modèle de régression logistique multivariable a été construit selon l’équation suivante :
« logit »(P) = α + β1 X1 + β2 X2 + β3 X3 + β4 X4 + β5 X5
où P représente la probabilité de survenue de malnutrition et les valeurs de β représentent le logarithme naturel des valeurs OR regroupées dérivées de la méta-analyse.
À l’aide du logiciel R (version 4.2.1) et du paquet « rms », le modèle a été traduit en un nomogramme cliniquement applicable. Les scores de risque initiaux (plage théorique : 0–325,1) ont été linéairement mis à l’échelle de 0 à 100 afin d’améliorer la lisibilité clinique. Sur la base des scores totaux de nomogrammes, les patients ont été stratifiés en catégories à faible risque (≤20 points), modéré (21 à 40 points) et à haut risque (>40 points) en utilisant une étalonnage basée sur les percentiles par rapport à la distribution des scores de cohorte.
Des algorithmes d’apprentissage automatique, y compris la forêt aléatoire (RF) et l’arbre de décision de gradient boosting (GBDT), ont été utilisés pour l’optimisation des fonctionnalités. Une stratégie d’empilement combinait RF et GBDT comme apprenants de base avec la régression logistique comme méta-classificateur. Les hyperparamètres étaient optimisés par validation croisée à 5 vitesses, avec RF configurée n_estimators = 200 et max_depth = 10, et GBDT configurée n_estimators = 150 et learning_rate = 0,1. La technique de suréchantillonnage des minorités synthétiques (SMOTE) a été appliquée pour corriger un déséquilibre mineur de classe dans le jeu de données d’entraînement.
5. Validation du modèle
- Jeu de données de validation
Une double stratégie de validation a été employée. La validation interne a été réalisée par rééchantillonnage bootstrap avec 1 000 répétitions. La validation de la résistance a été réalisée à l’aide d’un sous-ensemble indépendant et non chevauchant de 280 patients extraits de la base de données IBDCD, excluant les patients inclus dans la cohorte d’entraînement. Tous les patients de la cohorte de validation ont été diagnostiqués atteints de la maladie de Crohn selon le consensus sur les maladies inflammatoires intestinales de 2018, avec des données collectées prospectivement de janvier 2018 à mars 2025.
La cohorte de validation a suivi les mêmes procédures d’accertation que la cohorte de formation. La malnutrition a été évaluée selon les critères ESPEN 2015, et toutes les variables prédictives, y compris la PCR, la localisation de la lésion, l’utilisation de biomédicaments, les antécédents de résection intestinale et l’IMC, ont été mesurées dans les 72 heures suivant l’hospitalisation. Aucune différence significative n’a été observée entre les cohortes d’entraînement et de validation concernant les caractéristiques de base, notamment l’âge, le sexe et la durée de la maladie (P > 0,05), soutenant la fiabilité et l’applicabilité clinique des résultats de validation.
Des indicateurs de performance supplémentaires ont été calculés pour évaluer davantage la performance du modèle. Dans la cohorte de formation, la sensibilité était de 92,3 %, la spécificité de 94,1 %, la valeur prédictive positive (VPP) de 90,5 % et la valeur prédictive négative (VPN) de 95,2 %. Dans la cohorte de validation, la sensibilité était de 90,2 %, la spécificité de 92,8 %, la VPP de 88,7 % et la VPN de 93,9 %. Le score Brier était de 0,087 dans la cohorte de formation et de 0,102 dans la cohorte de validation, indiquant une erreur de prédiction acceptable.
- Métriques de validation
La discrimination du modèle a été évaluée en utilisant la zone sous la courbe de caractéristique de fonctionnement du récepteur (ROC) (AUC). L’étalonnage a été évalué à l’aide du test de Hosmer–Lemeshow, où P > 0,05 n’indiquait aucune différence significative entre les probabilités prédites et les résultats observés, et le score de Brier, où les valeurs de <0,20 indiquaient une erreur de prédiction acceptable. L’analyse de la courbe de décision (DCA) a également été réalisée pour évaluer le bénéfice net clinique sur une gamme de probabilités seuils.
Ce cadre de validation respectait les directives TRIPOD (Transparent Reporting of a Transparent Reporting of a Multivariable Model of Prediction for Individual Prognosis or Diagnosis).
6. Analyse statistique
Une méta-analyse a été réalisée à l’aide de RevMan version 5.4, et des OR regroupées avec des IC correspondants à 95 % ont été calculées. L’hétérogénéité a été évaluée à l’aide de la statistique I2 ; Les valeurs > 50 % indiquent une hétérogénéité substantielle. Des modèles à effets aléatoires ont été appliqués lorsque l’hétérogénéité significative était présente ; sinon, des modèles à effets fixes étaient utilisés. L’analyse de sensibilité a été réalisée en excluant séquentiellement des études individuelles afin d’évaluer la stabilité des résultats. Le biais de publication a été évalué à l’aide de graphiques en entonnoir et du test d’Egger.
Des analyses statistiques de base ont été réalisées à l’aide de la version 26.0 de SPSS. Les packages « pROC », « rms » et « glmnet » dans le logiciel R (version 4.2.1) étaient utilisés pour la construction et la validation des modèles.