Tutti i pazienti i cui dati sono stati inseriti nel Inflammatory Bowel Disease Cohort Database (IBDCD) hanno fornito un consenso informato scritto per l'uso di dati clinici de-identificati a scopo di ricerca al momento dell'iscrizione al database. Lo stesso quadro etico di approvazione e consenso si applicava a tutti i dati estratti dal database, inclusi sia i gruppi di sviluppo che di validazione. In questo studio non sono state utilizzate informazioni identificabili sui pazienti e tutti i dati sono stati de-identificati e criptati per l'archiviazione. Poiché questo studio prevedeva un'analisi retrospettiva di dati de-identificati da un database consolidato, il comitato etico ha esentato il requisito di ulteriore consenso del paziente per questa specifica analisi. Gli strumenti di ricerca utilizzati nel protocollo sono elencati nella Tabella dei Materiali.
1. Screening dei fattori influenti nella meta-analisi
- Strategia di ricerca nella letteratura
Una strategia di ricerca sistematica è stata condotta su PubMed, Web of Science, Cochrane Library, Embase e China National Knowledge Infrastructure (CNKI). La strategia di ricerca inglese è stata definita come segue:
("Morbo di Crohn"[Mesh] O "CD"[tiab] O "Crohn*"[tiab]) E ("Malnutrizione"[Mesh] O "Stato Nutrizionale" [Mesh] O "Rischio Nutrizionale"[tiab]) E ("Fattori di rischio"[Mesh] O "Predette*"[tiab])
Il periodo di ricerca ha coperto l'inizio del database fino al 31 marzo 2025. Inoltre, è stato effettuato uno screening manuale delle liste di riferimenti degli studi inclusi per identificare eventuali articoli mancanti. Questa strategia ha permesso una revisione completa della letteratura del rischio correlato alla malnutrizione e dei fattori predittivi nei pazienti con malattia di Crohn (MC), con database chiaramente definiti, termini di ricerca, tempi e procedure supplementari di prelievo manuale per garantire la completezza della raccolta della letteratura.
- Criteri di inclusione ed esclusione
I criteri di inclusione richiedevano che le popolazioni studiate fossero composte da pazienti adulti (di età ≥18 anni) diagnosticati con malattia di Crohn secondo il Consensus sul 2018 sulla Diagnosi e il Trattamento della Malattia Infiammatoria Intestinale. Data la rilevanza clinica della malnutrizione nella MC, è stata posta enfasi sugli studi che definiscono la malnutrizione utilizzando i criteri della European Society for Clinical Nutrition and Metabolism (ESPEN) 2015, i criteri della Global Leadership Initiative on Malnutrition (GLIM) 2019 o il punteggio del Malnutrition Universal Screening Tool (MUST) ≥2. È stata mantenuta una chiara distinzione tra i criteri diagnostici definiti dalla letteratura e l'applicazione esclusiva dei criteri ESPEN 2015 per la definizione degli esiti all'interno della coorte di studio.
I disegni di studio ammissibili includevano studi di coorte, casi-controllo, trasversali e metodi misti per garantire una valutazione completa dei fattori di rischio di malnutrizione da molteplici prospettive. I criteri di esclusione includevano studi su animali, articoli di revisione e abstract di conferenze a causa di un supporto dati insufficiente o della mancanza di revisione tra pari. Sono stati esclusi anche studi privi di informazioni statistiche essenziali, inclusi odds ratio (OR) e corrispondenti intervalli di confidenza (IC) al 95%.
2. Selezione della letteratura ed estrazione dei dati
Lo screening della letteratura e l'estrazione dei dati sono stati condotti indipendentemente da due ricercatori per garantire completezza e accuratezza. La fase iniziale prevedeva lo screening di titoli e abstract per escludere studi che chiaramente non soddisfavano i criteri di inclusione, restringendo così il dataset a studi potenzialmente rilevanti e di alta qualità.
Successivamente, è stato effettuato uno screening integrale per gli studi considerati potenzialmente ammissibili. Questa fase ha comportato una valutazione dettagliata del disegno dello studio, della metodologia, dei risultati e dell'aderenza a criteri di inclusione predefiniti per garantire che solo gli studi che soddisfano tutti i requisiti fossero inclusi nell'analisi finale.
L'estrazione dei dati è stata effettuata utilizzando moduli standardizzati per registrare sistematicamente le informazioni chiave, inclusi nomi degli autori, anno di pubblicazione, paese, dimensione del campione, distribuzione dei sottotipi di classificazione di Montreal, durata media della malattia, definizioni di malnutrizione, strumenti di valutazione e OR estratti con corrispondenti IC del 95% per influenzare i fattori associati al rischio di malnutrizione.
Eventuali discrepanze o incertezze sorse durante lo screening e l'estrazione dei dati sono state risolte tramite discussioni interne. Quando non si poteva raggiungere un consenso, veniva consultato un esperto terzo per arbitrare, minimizzando i pregiudizi soggettivi e garantendo decisioni obiettive. Questo rigoroso processo ha aumentato la trasparenza metodologica e ha fornito una solida base per l'identificazione dei fattori chiave associati al rischio di malnutrizione nella MC.
3. Valutazione della qualità
Sono stati applicati rigorosi criteri di valutazione della qualità per garantire la validità scientifica e l'affidabilità degli studi inclusi. Gli studi di coorte e casi-controllo sono stati valutati utilizzando la Newcastle–Ottawa Scale (NOS), che valuta la qualità degli studi in tre ambiti: selezione, comparabilità ed esposizione. Solo studi con punteggi NOS ≥7 sono stati classificati come di alta qualità e inclusi nell'analisi.
Gli studi trasversali sono stati valutati utilizzando lo strumento di valutazione dell'Agency for Healthcare Research and Quality (AHRQ), che esamina la selezione dei partecipanti, l'adeguatezza delle dimensioni del campione, la validità dei metodi di raccolta dati e l'adeguatezza delle analisi statistiche. Gli studi con punteggi AHRQ ≥8 sono stati considerati idonei all'inclusione.
L'applicazione di questi rigorosi criteri di valutazione della qualità ha minimizzato il potenziale bias legato alla variabilità della qualità dello studio e ha garantito che il modello predittivo fosse supportato da una base di evidenza affidabile.
4. Costruzione del modello di previsione
- Fonte dei dati
Il Database della Coorte della Malattia Infiammatoria Intestinale (IBDCD) è un database multicentrico prospettico delle coorti che contiene dati clinici di pazienti con malattia di Crohn raccolti tra gennaio 2018 e marzo 2025, inclusi informazioni demografiche, caratteristiche cliniche, indicatori di laboratorio, regimi di trattamento e valutazioni dello stato nutrizionale. Il dataset di sviluppo del modello includeva 800 pazienti con malattia di Crohn derivati dal database IBDCD, composti da 520 pazienti nella coorte di addestramento e 280 pazienti nella coorte di validazione.
I criteri di inclusione richiedevano una diagnosi confermata del morbo di Crohn per almeno 6 mesi e la disponibilità di dati clinici completi, inclusi fattori influenzanti identificati e dati di valutazione nutrizionale derivati dalla meta-analisi. I pazienti con condizioni comorbide potenzialmente influenzanti lo stato nutrizionale, inclusi neoplasie o malattia renale cronica, sono stati esclusi per garantire l'accuratezza dei dati e la validità del modello.
- Definizione e assegnazione delle variabili
La malnutrizione è stata diagnosticata rigorosamente secondo i criteri ESPEN 2015, che includono tre componenti diagnostici fondamentali: perdita di peso non intenzionale (≥5% entro 3 mesi o ≥10% entro 6 mesi), riduzione dell'apporto o assorbimento alimentare (riduzione del ≥25% per ≥14 giorni) e diminuzione della massa muscolare valutata tramite esame fisico e misurazioni antropometriche, inclusa la circonferenza muscolare del braccio medio. Un indice di massa corporea basso (BMI < 18,5 kg/m2) è stato considerato un indicatore diagnostico di supporto piuttosto che definitivo. La malnutrizione è stata confermata solo quando era presente almeno un criterio fondamentale, mentre un BMI basso fungeva da indicatore supplementare. I pazienti che si presentavano con un BMI basso senza evidenza dei criteri fondamentali non sono stati classificati come malnutriti. Questa definizione evitava la circolarità tra un basso BMI, una variabile predittiva, e la malnutrizione, un risultato.
La prevalenza della malnutrizione era del 42,5% nella coorte di formazione (n = 520) e del 40,4% nella coorte di validazione (n = 280). Sulla base dei risultati della meta-analisi, sono stati selezionati cinque fattori chiave che influenzano come variabili predittive, inclusa l'attività della malattia definita come proteina C-reattiva (CRP >10 mg/L; Sì = 1, No = 0), coinvolgimento dell'intestino tenue definito dalla classificazione di Montreal (LL1/LL3 vs LL2 coinvolgimento colonico; Sì = 1, No = 0), uso biologico (Sì = 1, No = 0), storia di resezione intestinale (Sì = 1, No = 0) e basso BMI (<18,5 kg/m 2; Sì = 1, No = 0). Età e sesso sono state raccolte come caratteristiche demografiche di base, ma non sono state incluse come variabili predittive nel modello finale perché non erano statisticamente significative durante l'analisi preliminare.
Un totale di 17 studi di alta qualità sono stati inclusi nella meta-analisi. Le OR aggregate e i relativi IC al 95% per i cinque fattori predittivi erano i seguenti: CRP elevata (OR = 4,72, IC 95%: 3,21–6,95), coinvolgimento dell'intestino tenue (OR = 2,89, IC 95%: 1,93–4,33), uso di biologici (OR = 0,39, IC 95%: 0,15–1,01), storia di resezione intestinale (OR = 6,17, IC 95%: 2,35–16,18) e BMI basso (OR = 3,56, IC 95%: 2.41–5.27).
- Metodo di costruzione del modello
Gli OR aggregati e i relativi IC al 95% derivati dalla meta-analisi sono stati trasformati in valori log-OR e utilizzati per derivare i coefficienti di regressione (β) del modello di regressione logistica multivariabile. La coerenza tra i risultati della meta-analisi e i coefficienti del modello è stata verificata tramite l'analisi di correlazione di Pearson (r = 0,98, P < 0,001). Sulla base dei fattori di influenza identificati, è stato costruito un modello di regressione logistica multivariabile secondo la seguente equazione:
"logit"(P) = α + β1 X1 + β2 X 2 + β3 X3 + β4 X4 + β5 X5
dove P rappresenta la probabilità di verificarsi di malnutrizione e i valori β rappresentano il logaritmo naturale dei valori OR aggregati derivati dalla meta-analisi.
Utilizzando il software R (versione 4.2.1) e il pacchetto "rms", il modello è stato tradotto in un nomogramma clinicamente applicabile. I punteggi di rischio originali (intervallo teorico: 0–325,1) sono stati scalati linearmente da 0 a 100 per migliorare la leggibilità clinica. Sulla base dei punteggi totali dei nomogrammi, i pazienti sono stati stratificati in categorie a basso rischio (≤20 punti), a rischio moderato (21–40 punti) e ad alto rischio (>40 punti) utilizzando una calibrazione basata sul percentile rispetto alla distribuzione dei punteggi di coorte.
Algoritmi di machine learning, inclusi la foresta random (RF) e l'albero decisionale di gradiente boosting (GBDT), venivano utilizzati per l'ottimizzazione delle caratteristiche. Una strategia di impilamento combinava RF e GBDT come apprendenti base con la regressione logistica come meta-classificatore. Gli iperparametri erano ottimizzati tramite validazione incrociata a 5 punti, con RF configurata come n_estimators = 200 e max_depth = 10, e GBDT configurata come n_estimators = 150 e learning_rate = 0,1. La Synthetic Minority Oversampling Technique (SMOTE) è stata applicata per affrontare un piccolo squilibrio di classe all'interno del dataset di addestramento.
5. Validazione del modello
- Dataset di validazione
Fu adottata una strategia di doppia validazione. La validazione interna veniva effettuata tramite ricampionamento bootstrap con 1.000 ripetizioni. La validazione del retenimento è stata condotta utilizzando un sottoinsieme indipendente non sovrapposto di 280 pazienti estratto dal database IBDCD, escludendo i pazienti inclusi nella coorte di addestramento. Tutti i pazienti della coorte di validazione sono stati diagnosticati con malattia di Crohn secondo il Consensus sulle Malattie Infiammatorie Intestinali del 2018, con dati raccolti prospetticamente che coprono da gennaio 2018 a marzo 2025.
La coorte di validazione ha seguito le stesse procedure di accertamento della coorte di formazione. La malnutrizione è stata valutata utilizzando i criteri ESPEN 2015 e tutte le variabili predittive, inclusi PCR, localizzazione della lesione, uso di biologici, storia di resezione intestinale e BMI, sono state misurate entro 72 ore dal ricovero. Non sono state osservate differenze significative tra le coorti di addestramento e validazione per caratteristiche basali, inclusi età, sesso e durata della malattia (P > 0,05), a supporto dell'affidabilità e dell'applicabilità clinica dei risultati di validazione.
Ulteriori metriche di performance sono state calcolate per valutare ulteriormente le prestazioni del modello. Nella coorte di formazione, la sensibilità era del 92,3%, la specificità del 94,1%, il valore predittivo positivo (PPV) del 90,5% e il valore predittivo negativo (NPV) del 95,2%. Nella coorte di validazione, la sensibilità era del 90,2%, la specificità del 92,8%, la PPV dell'88,7% e la NPV del 93,9%. Il punteggio Brier è stato 0,087 nella coorte di formazione e 0,102 nella coorte di validazione, indicando un errore predittivo accettabile.
- Metriche di validazione
La discriminazione del modello è stata valutata utilizzando l'area sotto la curva della caratteristica operativa del ricevitore (ROC) (AUC). La calibrazione è stata valutata utilizzando il test di Hosmer–Lemeshow, dove P > 0,05 non indicava differenza significativa tra probabilità previste ed esiti osservati, e il punteggio Brier, dove i valori <0,20 indicavano errori di previsione accettabili. L'analisi della curva di decisione (DCA) è stata inoltre eseguita per valutare il beneficio netto clinico su una gamma di probabilità soglia.
Questo quadro di validazione aderiva alle linee guida per la dichiarazione Transparent Reporting of a Multivariable Reporting for Individual Prognosis or Diagnosis (TRIPOD).
6. Analisi statistica
La meta-analisi è stata condotta utilizzando RevMan versione 5.4 e sono state calcolate le operazioni operative aggregate con corrispondenti IC del 95%. L'eterogeneità è stata valutata utilizzando la statistica I2 ; i valori>50% indicano un'eterogeneità sostanziale. Sono stati applicati modelli a effetti casuali quando era presente un'eterogeneità significativa; altrimenti venivano utilizzati modelli a effetti fissi. L'analisi di sensibilità è stata effettuata escludendo sequencialmente singoli studi per valutare la stabilità dei risultati. Il bias di pubblicazione è stato valutato utilizzando i funnel plot e il test di Egger.
Le analisi statistiche di base sono state condotte utilizzando SPSS versione 26.0. I pacchetti "pROC", "rms" e "glmnet" nel software R (versione 4.2.1) venivano utilizzati per la costruzione e la validazione dei modelli.