$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Le protocole NHANES a été approuvé par le Conseil d’éthique de la recherche du National Center for Health Statistics (NCHS), et un consentement éclairé écrit a été obtenu de tous les participants. Ce travail était une analyse secondaire de données d’usage public non identifiées ; par conséquent, aucune approbation éthique institutionnelle supplémentaire n’était requise. Tous les auteurs ont lu et approuvé le manuscrit final.
1. Conception de l’étude et source de données
Cette étude a été menée comme une analyse secondaire de NHANES, une série d’enquêtes transversales et représentatives au niveau national, administrées par les Centers for Disease Control and Prevention des États-Unis et supervisées par le Conseil d’éthique de la recherche du NCHS. Les ensembles de données NHANES à usage public ont été entièrement désidentifiés et consultés pour une analyse secondaire. Des données des cycles 1999–2000, 2001–2002, 2003–2004 et 2005–2006 ont été utilisées.
Des fichiers publics de composants NHANES ont été téléchargés pour chaque cycle, incluant (i) des fichiers démographiques contenant l’identifiant du participant (SEQN) et les variables de conception de l’enquête, (ii) des questionnaires de santé reproductive contenant l’auto-rapport sur l’endométriose, et (iii) des fichiers de laboratoire nécessaires au calcul de l’indice composite (protéine C-réactive, triglycérides et glucose plasmatique à jeun). Des fichiers d’examen/anthropométrie (par exemple, l’indice de masse corporelle) et les mesures de laboratoire nécessaires pour les indices comparateurs (par exemple, neutrophiles, lymphocytes, plaquettes) ont également été obtenus lors de l’analyse de ces indices. Au cours de chaque cycle de 2 ans, les fichiers composants étaient fusionnés à l’aide du SEQN, et le jeu de données fusionné était vérifié pour garantir un enregistrement par SEQN. Des ensembles de données au niveau des cycles ont ensuite été ajoutés pour construire le fichier analytique combiné de 1999 à 2006.
L’échantillon analytique était limité aux femmes âgées de 20 à 54 ans. Les participants ont été exclus si le statut d’endométriose était absent, si des composants à indice composite (protéine C-réactive, triglycérides ou glucose plasmatique à jeun) étaient absents, ou si des covariables essentielles requises pour le modèle entièrement ajusté étaient absentes dans une stratégie à cas complet. Des variables complexes de conception de l’enquête (strates et unités d’échantillonnage primaires) ont été conservées, ainsi que les sous-poids de laboratoire à jeun nécessaires pour les analyses intégrant des mesures de jeûne. Lorsque plusieurs cycles NHANES étaient combinés, des poids multi-cycles étaient créés selon les directives analytiques NHANES en divisant le poids du sous-échantillon sur 2 ans par le nombre de cycles combinés, et les variables de poids, de strates et de PSU résultantes étaient appliquées dans toutes les analyses. Les étapes d’inclusion et d’exclusion des participants ont été documentées dans un diagramme de flux (Figure 1).
2. Définition de l’endométriose
Le statut d’endométriose a été défini à l’aide de l’item du questionnaire de santé reproductive : « Un médecin ou un autre professionnel de santé vous a-t-il déjà dit que vous souffrez d’endométriose ? » Les participants ayant répondu « Oui » ont été classés comme cas d’endométriose, et ceux répondant « Non » comme témoins. Comme cette définition reposait sur l’auto-rapport plutôt que sur une confirmation laparoscopique ou histologique, une éventuelle mauvaise classification a été traitée comme une limitation de l’étude.
3. Définition de l’Indice Composite (CTI)
L’indice composite protéine C-réactive–triglycérides–glucose a été opérationnellisé pour refléter conjointement l’inflammation systémique et les perturbations métaboliques. Des mesures en laboratoire de la protéine C-réactive (mg/L), des triglycérides (mg/dL) et de la glycémie plasmatique à jeun (mg/dL) ont été extraites des fichiers de laboratoire NHANES. L’indice triglycérides–glucose a été calculé comme le logarithme naturel des [triglycérides × glucose plasmatique à jeun/2]. L’ICT a été calculée selon la formule suivante : ICT = 0,412 × Ln(CRP) + TyG. Des valeurs plus élevées de CTI indiquent une charge combinée plus élevée d’inflammation légère et de résistance àl’insuline 8.
Si des valeurs de protéines réactives C nécessitaient une manipulation avant la transformation logarithmique (par exemple, valeurs égales ou inférieures à la limite de détection), une règle prédéfinie unique était appliquée de manière cohérente sur tous les cycles et était documentée pour soutenir la reproductibilité (par exemple, en remplaçant les valeurs non positives par la plus petite valeur positive mesurable observée avant la transformation logarithmique). Les points de coupe du quartile ont été déterminés à partir de la distribution pondérée de l’échantillon analytique complet et appliqués de manière cohérente à travers les analyses catégorielles, le quartile 1 étant utilisé comme catégorie de référence.
4. Covariables
Les covariables étaient pré-spécifiées pour atténuer la confusion sur la base du raisonnement épidémiologique et de la littérature antérieure. Les variables démographiques comprenaient l’âge, la race/l’ethnie, le niveau d’éducation et l’état civil. Les variables liées au mode de vie comprenaient l’historique de tabagisme (≥100 cigarettes au cours de sa vie contre <100) et la consommation d’alcool (≥12 consommations/an contre <12). Les antécédents de comorbidité comprenaient l’hypertension auto-déclarée, le diabète, l’AVC, les maladies coronariennes et le cancer. Les variables anthropométriques et de laboratoire comprenaient l’indice de masse corporelle, l’hémoglobine, le nombre de neutrophiles, le nombre de lymphocytes et le nombre de plaquettes ; Ces mesures permettaient également le calcul des indices inflammatoires comparateurs lorsque cela était applicable (par exemple, rapport neutrophiles/lymphocytes, rapport plaquettes/lymphocytes, indice d’inflammation immunitaire systémique, indice de réponse à l’inflammation systémique). Les variables reproductives (par exemple, gravidité et parité) étaient incluses lorsqu’elles étaient disponibles dans les cycles sélectionnés et codées selon la documentation NHANES. Les covariables catégorielles ont été converties en variables indicatrices avant l’entrée du modèle.
Parce que la protéine C-réactive était une composante de l’indice composite, elle n’a pas été saisie comme covariée indépendante dans les modèles de régression multivariée afin d’éviter un surajustement et la colinéarité. Au lieu de cela, la protéine C-réactive et l’indice triglycéride–glucose ont été évalués comme marqueurs comparateurs lors des analyses de discrimination.
5. Analyse statistique
Toutes les analyses prenaient en compte la conception complexe de l’enquête NHANES pour générer des estimations représentatives au niveau national. Le plan de l’enquête a été spécifié en liant le poids multi-cycle du sous-échantillon, les strates et les variables PSU au jeu de données analytique. Les variables continues étaient résumées en moyennes pondérées avec écarts-types, et les variables catégorielles en comptages pondérés et en pourcentages. Les caractéristiques de référence ont été comparées entre cas et témoins à l’aide de procédures pondérées par enquête appropriées à NHANES, et les caractéristiques de base ont été résumées dans le tableau 1.
Les associations entre l’indice composite et l’endométriose ont été évaluées à l’aide d’une régression logistique pondérée par l’enquête. Trois modèles séquentiels ont été ajustés pour démontrer l’ajustement : un modèle non ajusté, un modèle ajusté pour l’âge et la race/ethnie, et un modèle entièrement ajusté incluant des facteurs démographiques, des variables de mode de vie, des antécédents de comorbidité, des covariables anthropométriques/de laboratoire, et des variables d’antécédents reproductifs. L’indice composite a été analysé à la fois de manière continue (par augmentation de 1 unité) et catégoriquement (quartiles, avec le quartile 1 comme référence), et les estimations de régression ont été résumées dans le tableau 2. La tendance linéaire à travers les quartiles a été testée en attribuant à chaque quartile sa valeur médiane pondérée et en modélisant ce terme de manière continue.
Les relations dose-réponse non linéaires ont été évaluées à l’aide de splines cubiques restreintes pondérées par sondage avec un placement de nœuds prédéfini, et des courbes splines ont été tracées à la Figure 2. Les effets seuils ont été évalués à l’aide d’une régression logistique segmentée pondérée par l’enquête (par morceaux) en comparant l’ajustement du modèle entre les spécifications segmentées et à pente unique, et les paramètres estimés du point d’inflexion et de la pente de chaque côté du point d’inflexion ont été rapportés dans le tableau 3.
Des analyses de sous-groupes ont été réalisées pour explorer la modification des effets par des facteurs prédéfinis (par exemple, groupe d’âge, race/ethnie, niveau d’éducation, état civil et facteurs de mode de vie sélectionnés). L’interaction a été testée en incluant des termes croisés entre l’indice composite continu et les indicateurs de sous-groupes dans le cadre pondéré par l’enquête, et les associations de sous-groupes ont été résumées à la Figure 3.
La performance discriminatoire a été évaluée à l’aide d’analyses des caractéristiques opérationnelles du récepteur basées sur des probabilités prédites par le modèle dérivées de modèles logistiques pondérés par l’enquête. La surface sous les estimations de la courbe a été obtenue pour l’indice composite, les indices inflammatoires couramment utilisés et les marqueurs composants, et les résumés des AUC ont été fournis dans le Tableau Supplémentaire 1 ; une comparaison élargie du ROC a été fournie dans la Figure Supplémentaire 1.
Les données manquantes ont été traitées par analyse complète des cas après avoir exclu les participants présentant un état d’endométriose manquant, des composantes d’indice composite manquantes ou des covariables essentielles manquantes requises pour le modèle entièrement ajusté. Lors d’une évaluation de la robustesse, des imputations multiples ont été appliquées pour les covariables manquantes sous un modèle d’imputation prédéfini, et les estimations imputées ont été comparées aux estimations du cas complet.
Les analyses ont été réalisées à l’aide de R (version 4.4.1) et d’un logiciel statistique supplémentaire listé dans le tableau des matériaux. Les packages clés utilisés pour l’inférence par sondage, la modélisation spline, la régression segmentée et l’estimation ROC ont été enregistrés, et les informations de session (système d’exploitation et détails de session R) ont été conservées pour soutenir la réplication.
6. Point final de procédure et sorties
Le flux de travail analytique a été considéré comme terminé une fois que l’ensemble de données multi-cycles harmonisé a été construit avec les critères d’inclusion/exclusion prédéfinis (Figure 1), que l’indice composite et les covariables ont été générés selon des règles documentées, et que les analyses prédéfinies de régression pondérée par enquête, d’évaluation non linéaire/seuil, de sous-groupes et de discrimination ont été exécutées selon la même spécification de conception d’enquête. Les principaux résultats de ce flux de travail ont été organisés sous forme de résumé de base (Tableau 1), d’estimations de régression à travers des modèles d’ajustement séquentiel (Tableau 2), de paramètres de modèle seuil (Tableau 3), de visualisation de splines (Figure 2), de visualisation de résumé de sous-groupes (Figure 3) et de résumés de discrimination (Tableau supplémentaire 1 et Figure supplémentaire 1).
7. Validation indépendante interne
La validation interne indépendante a été réalisée en divisant l’ensemble combiné en une cohorte de dérivation et une cohorte de validation non chevauchante basée sur les cycles NHANES. Les participants des cycles 1999–2000 et 2001–2002 ont été assignés à la cohorte de dérivation, et ceux des cycles 2003–2004 et 2005–2006 ont été assignés à la cohorte de validation. Les mêmes critères d’inclusion/exclusion, le calcul des indices composites, les règles de codage des covariables et la stratégie de pondération des enquêtes ont été appliqués indépendamment au sein de chaque cohorte.
Au sein de la cohorte de dérivation, des modèles de régression logistique pondérés par enquête ont été ajustés en utilisant la spécification entièrement ajustée. Les procédures d’évaluation non linéarité et seuil utilisées dans l’analyse principale ont été appliquées dans la cohorte de dérivation, et la discrimination a été évaluée à l’aide des méthodes ROC/AUC basées sur les probabilités prédites par le modèle. La même stratégie de modélisation a ensuite été répétée dans la cohorte de validation sans modifier les définitions des variables, les règles de codage ou les spécifications de pondération. Les estimations dérivation versus validation ont été résumées comme une comparaison cohorte à cohorte des estimations d’association (Figure 4) et comme des courbes ROC dérivation versus validation (Figure 5), avec des résumés numériques correspondants fournis dans le Tableau 4.