$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il protocollo NHANES è stato approvato dal National Center for Health Statistics (NCHS) Research Ethics Review Board e il consenso scritto informato è stato ottenuto da tutti i partecipanti. Questo lavoro era un'analisi secondaria di dati di uso pubblico de-identificati; pertanto, non era richiesta un'ulteriore approvazione etica istituzionale. Tutti gli autori hanno letto e approvato il manoscritto finale.
1. Progettazione dello studio e fonte dei dati
Questo studio è stato condotto come analisi secondaria di NHANES, una serie di indagini trasversali e rappresentative a livello nazionale amministrate dai Centers for Disease Control and Prevention degli Stati Uniti e supervisionate dal NCHS Research Ethics Review Board. I dataset NHANES ad uso pubblico sono stati completamente deidentificati e accessibili per analisi secondarie. Sono stati utilizzati dati dei cicli 1999–2000, 2001–2002, 2003–2004 e 2005–2006.
Per ogni ciclo venivano scaricati file pubblici di componenti NHANES, inclusi (i) file demografici contenenti l'identificatore del partecipante (SEQN) e le variabili del disegno del sondaggio, (ii) file di questionari sulla salute riproduttiva contenenti l'autovalutazione dell'endometriosi e (iii) file di laboratorio necessari per il calcolo dell'indice composito (proteina C-reattiva, trigliceridi e glucosio plasmatico a digiuno). Sono stati inoltre ottenuti file di esame/antropometria (ad esempio, indice di massa corporea) e misure di laboratorio necessarie per gli indici di comparazione (ad esempio, neutrofili, linfociti, piastrine) quando questi indici sono stati analizzati. All'interno di ogni ciclo biennale, i file component venivano uniti usando SEQN e il dataset fuso veniva verificato per garantire un record per SEQN. Sono stati poi aggiunti dataset a livello ciclico per costruire il file analitico combinato 1999–2006.
Il campione analitico era riservato a donne di età compresa tra i 20 e i 54 anni. I partecipanti sono stati esclusi se mancava lo stato di endometriosi, se mancavano componenti dell'indice composito (proteina C-reattiva, trigliceridi o glucosio plasmatico a digiuno), o se mancavano covariabili essenziali necessarie per il modello completamente aggiustato secondo una strategia a caso completo. Sono state mantenute variabili complesse di progettazione dell'indagine (strati e unità primarie di campionamento), insieme ai pesi del sottocampione di laboratorio a digiuno necessari per le analisi che incorporano misure di digiuno. Quando sono stati combinati più cicli NHANES, sono stati creati pesi multi-cicli secondo le linee guida analitiche NHANES dividendo il peso del sottocampione a 2 anni per il numero combinato di cicli, e il peso, gli strati e le variabili PSU risultanti sono state applicate in tutte le analisi. I passaggi per l'inclusione e l'esclusione dei partecipanti sono stati documentati in un diagramma di flusso (Figura 1).
2. Definizione di endometriosi
Lo stato di endometriosi è stato definito utilizzando l'item del questionario sulla salute riproduttiva: "Ti è mai stato detto da un medico o un altro professionista sanitario che hai l'endometriosi?" I partecipanti che hanno risposto "Sì" sono stati classificati come casi di endometriosi, mentre quelli che hanno risposto "No" sono stati classificati come controlli. Poiché questa definizione si basava sull'autovalutazione piuttosto che su conferma laparoscopica o istologica, la possibile classificazione errata è stata affrontata come una limitazione dello studio.
3. Definizione dell'Indice Composito (CTI)
L'indice composito C-reattivo proteina–trigliceridi–glucosio è stato operalizzato per riflettere congiuntamente l'infiammazione sistemica e il disturbo metabolico. Misurazioni di laboratorio di proteine C-reattive (mg/L), trigliceridi (mg/dL) e glucosio plasmatico a digiuno (mg/dL) sono state estratte dai file di laboratorio NHANES. L'indice trigliceridico–glucosio è stato calcolato come logaritmo naturale dei [trigliceridi × glucosio plasmatico a digiuno/2]. Il CTI è stato calcolato utilizzando la seguente formula: CTI = 0,412 × ln(CRP) + TyG. Valori CTI più alti indicano un carico combinato maggiore di infiammazione di basso grado e resistenzaall'insulina 8.
Se qualsiasi valore di proteina C-reattiva richiedeva la gestione prima della trasformazione logaritmica (ad esempio, valori pari o inferiori al limite di rilevamento), veniva applicata una singola regola predefinita in modo coerente su tutti i cicli e documentata come supportando la replicabilità (ad esempio, sostituendo i valori non positivi con il valore più piccolo positivo misurabile osservato prima della trasformazione logaritmica). I punti di taglio del quartile sono stati determinati dalla distribuzione ponderata nel campione analitico completo e applicati in modo coerente attraverso le analisi categoriche, con il Quartile 1 utilizzato come categoria di riferimento.
4. Covariate
Le covariate erano predefinite per mitigare la confusione basandosi sul ragionamento epidemiologico e sulla letteratura precedente. Le variabili demografiche includevano età, razza/etnia, livello di istruzione e stato civile. Le variabili dello stile di vita includevano la storia del fumo (≥100 sigarette nella vita vs. <100) e il consumo di alcol (≥12 bevande all'anno vs. <12). La storia di comorbidità includeva ipertensione auto-riportata, diabete, ictus, malattie coronarie e cancro. Le variabili antropometriche e di laboratorio includevano indice di massa corporea, emoglobina, conteggio di neutrofili, conteggio di linfociti e conteggio piastrinico; Queste misure supportavano anche il calcolo degli indici infiammatori dei comparatori dove applicabile (ad esempio, rapporto neutrofili/linfociti, rapporto piastrine/linfociti, indice immunitario sistemico di infiammazione, indice di risposta all'infiammazione sistemica). Le variabili riproduttive (ad esempio, gravidità e parità) sono state incluse quando disponibili nei cicli selezionati e sono state codificate secondo la documentazione NHANES. Le covariabili categoriche sono state convertite in variabili indicative prima dell'inserimento del modello.
Poiché la proteina C-reattiva era un componente dell'indice composito, non veniva inserita come covariata indipendente nei modelli di regressione multivariabile per evitare l'iperaggiustamento e la collinearità. Invece, la proteina C-reattiva e l'indice trigliceridico-glucosio sono stati valutati come marcatori di confronto nelle analisi di discriminazione.
5. Analisi statistica
Tutte le analisi hanno tenuto conto del complesso disegno di indagine NHANES per generare stime rappresentative a livello nazionale. Il disegno del sondaggio è stato specificato collegando il peso del sottocampionamento, gli strati e le variabili PSU multi-ciclo al dataset analitico. Le variabili continue sono state riassunte come medie ponderate con deviazioni standard, mentre le variabili categoriche sono state riassunte come conteggi ponderati e percentuali. Le caratteristiche di base sono state confrontate tra casi e controlli utilizzando procedure ponderate dal sondaggio appropriate per NHANES, e le caratteristiche di base sono state riassunte nella Tabella 1.
Le associazioni tra l'indice composito e l'endometriosi sono state valutate utilizzando una regressione logistica ponderata dal sondaggio. Sono stati applicati tre modelli sequenziali per dimostrare l'aggiustamento: un modello non aggiustato, un modello adattato per età e razza/etnia, e un modello completamente aggiustato che include fattori demografici, variabili dello stile di vita, storia di comorbidità, covariazioni antropometriche/di laboratorio e variabili della storia riproduttiva. L'indice composito è stato analizzato sia in modo continuo (per ogni aumento di un'unità) sia categoricamente (quartili, con il Quartile 1 come riferimento), e le stime di regressione sono state riassunte nella Tabella 2. La tendenza lineare tra i quartili è stata testata assegnando a ciascun quartile il suo valore mediano ponderato e modellando continuamente quel termine.
Le relazioni dose-risposta non lineari sono state valutate utilizzando spline cubiche ristrette ponderate da indagine con posizionamento prespecificato dei nodi, e le curve spline sono state rappresentate nella Figura 2. Gli effetti della soglia sono stati valutati utilizzando una regressione logistica segmentata (a tratti) ponderata dal sondaggio, confrontando l'adattamento del modello tra specifiche segmentate e a pendenza singola, e i parametri stimati del punto di flessione e della pendenza su ciascun lato del punto di flessione sono stati riportati nella Tabella 3.
Sono state condotte analisi di sottogruppi per esplorare la modifica degli effetti da parte di fattori predefiniti (ad esempio, fascia d'età, razza/etnia, livello di istruzione, stato civile e fattori selezionati legati allo stile di vita). L'interazione è stata testata includendo termini di prodotto incrociato tra l'indice composito continuo e gli indicatori di sottogruppo all'interno del quadro ponderato per sondaggio, e le associazioni di sottogruppi sono state riassunte nella Figura 3.
La performance discriminatoria è stata valutata utilizzando analisi delle caratteristiche operative del ricevitore basate su probabilità previste dal modello derivate da modelli logistici ponderati dal sondaggio. L'area sotto le stime della curva è stata ottenuta per l'indice composito, gli indici infiammatori comunemente usati e i marcatori componenti, e i riassunti AUC sono stati forniti nella Tabella Supplementare 1; un confronto ampliato del ROC è stato fornito nella Figura Supplementare 1.
I dati mancanti sono stati gestiti utilizzando un'analisi completa dei casi dopo aver escluso i partecipanti con stato di endometriosi mancante, componenti dell'indice composito mancanti o covariazioni essenziali mancanti necessarie per il modello completamente regolato. Quando è stata effettuata una valutazione della robustezza, sono state applicate imputazioni multiple per le covariabili con mancanza sotto un modello di imputazione predefinito, e le stime imputate sono state confrontate con le stime per casi completi.
Le analisi sono state effettuate utilizzando R (versione 4.4.1) e software statistico aggiuntivo come elencato nella Tabella dei Materiali. Sono stati registrati i pacchetti chiave utilizzati per l'inferenza di sondaggi, la modellazione delle spline, la regressione segmentata e la stima ROC, e sono state mantenute le informazioni di sessione (sistema operativo e dettagli della sessione R) per supportare la replica.
6. Punto finale della procedura e output
Il flusso di lavoro analitico è stato considerato completo una volta che il dataset armonizzato multiciclo è stato costruito con i criteri predefiniti di inclusione/esclusione (Figura 1), l'indice composito e le covariate sono stati generati secondo le regole documentate, e le analisi predefinite di regressione ponderata per sondaggio, valutazione non linearità/soglia, sottogruppi e discriminazione sono state eseguite secondo la stessa specifica di progettazione del sondaggio. I principali risultati di questo flusso di lavoro sono stati organizzati come riassunto di base (Tabella 1), stime di regressione tra modelli di aggiustamento sequenziale (Tabella 2), parametri del modello soglia (Tabella 3), visualizzazione delle spline (Figura 2), visualizzazione del riepilogo dei sottogruppi (Figura 3) e riassunti della discriminazione (Tabella Supplementare 1 e Figura Supplementare 1).
7. Validazione interna indipendente
La validazione interna indipendente è stata effettuata suddividendo il dataset combinato in una coorte di derivazione e una coorte di validazione non sovrapposta basata sui cicli NHANES. I partecipanti dei cicli 1999–2000 e 2001–2002 sono stati assegnati alla coorte di derivazione, mentre i partecipanti dei cicli 2003–2004 e 2005–2006 sono stati assegnati alla coorte di validazione. Gli stessi criteri di inclusione/esclusione, il calcolo dell'indice composito, le regole di codifica delle covariate e la strategia di ponderazione dei sondaggi sono stati applicati indipendentemente all'interno di ogni coorte.
All'interno della coorte di derivazione, sono stati adattati modelli di regressione logistica ponderati tramite sondaggio utilizzando la specifica completamente adeguata. Le procedure di valutazione della non linearità e della soglia utilizzate nell'analisi principale sono state applicate nella coorte di derivazione, e la discriminazione è stata valutata utilizzando metodi ROC/AUC basati sulle probabilità previste dal modello. La stessa strategia di modellazione è stata poi ripetuta nella coorte di validazione senza modificare definizioni di variabili, regole di codifica o specifiche di pesaggio. Le stime derivazione contro validazione sono state riassunte come un confronto coorte a coorte tra stime di associazione (Figura 4) e come curve ROC derivazione contro validazione (Figura 5), con i corrispondenti riassunti numerici forniti nella Tabella 4.