$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El protocolo NHANES fue aprobado por la Junta de Revisión de Ética en la Investigación del Centro Nacional de Estadísticas de Salud (NCHS), y se obtuvo el consentimiento informado por escrito de todos los participantes. Este trabajo fue un análisis secundario de datos de uso público desidentificados; por lo tanto, no se requirió una aprobación ética institucional adicional. Todos los autores leyeron y aprobaron el manuscrito final.
1. Diseño del estudio y fuente de datos
Este estudio se realizó como un análisis secundario de NHANES, una serie de encuestas transversales y representativas a nivel nacional administradas por los Centros para el Control y la Prevención de Enfermedades de EE. UU. y supervisadas por la Junta de Ética en la Investigación del NCHS. Los conjuntos de datos de NHANES de uso público fueron completamente desidentificados y se accedió para análisis secundarios. Se utilizaron datos de los ciclos 1999–2000, 2001–2002, 2003–2004 y 2005–2006.
Se descargaron archivos componentes públicos de NHANES para cada ciclo, incluyendo (i) archivos demográficos que contenían el identificador de participante (SEQN) y las variables de diseño de encuesta, (ii) archivos de cuestionarios de salud reproductiva que contenían el autoinforme de endometriosis, y (iii) archivos de laboratorio necesarios para el cálculo del índice compuesto (proteína C-reactiva, triglicéridos y glucosa plasmática en ayuno). Se obtuvieron además los archivos de examen/antropometría (por ejemplo, índice de masa corporal) y las medidas de laboratorio necesarias para los índices comparadores (por ejemplo, neutrófilos, linfocitos, plaquetas) al analizar esos índices. Dentro de cada ciclo de 2 años, los archivos de componentes se fusionaban usando SEQN, y el conjunto de datos fusionado se comprobaba para asegurar un registro por SEQN. Posteriormente se añadieron conjuntos de datos a nivel de ciclo para construir el archivo analítico combinado de 1999–2006.
La muestra analítica se restringió a mujeres de entre 20 y 54 años. Se excluyeron participantes si faltaba el estado de endometriosis, si faltaban componentes del índice compuesto (proteína C-reactiva, triglicéridos o glucosa plasmática en ayunas), o si faltaban covariables esenciales necesarias para el modelo totalmente ajustado bajo una estrategia de caso completo. Se mantuvieron variables complejas de diseño de encuestas (estratos y unidades primarias de muestreo), junto con los pesos de submuestra de laboratorio en ayuno necesarios para los análisis que incorporan medidas de ayuno. Cuando se combinaron múltiples ciclos de NHANES, se crearon pesos de varios ciclos según la guía analítica de NHANES dividiendo el peso de la submuestra de 2 años por el número combinado de ciclos, y se aplicaron los pesos, estratos y variables PSU resultantes en todos los análisis. Los pasos para la inclusión y exclusión de los participantes se documentaron en un diagrama de flujo (Figura 1).
2. Definición de endometriosis
El estado de endometriosis se definió utilizando el ítem del cuestionario de salud reproductiva: "¿Alguna vez un médico u otro profesional sanitario te ha dicho que tienes endometriosis?" Los participantes que respondieron "Sí" fueron clasificados como casos de endometriosis, y los que respondieron "No" fueron clasificados como controles. Como esta definición se basaba en autoinformes y no en confirmaciones laparoscópicas o histológicas, la posible clasificación errónea se abordó como una limitación del estudio.
3. Definición del Índice Compuesto (CTI)
El índice compuesto de proteína C-reactiva–triglicéridos–glucosa se operacionalizó para reflejar conjuntamente la inflamación sistémica y la alteración metabólica. Se extrajeron mediciones de laboratorio de la proteína C-reactiva (mg/L), triglicéridos (mg/dL) y glucosa plasmática en ayunas (mg/dL) de los archivos de laboratorio de NHANES. El índice triglicéridos–glucosa se calculó como el logaritmo natural de [triglicéridos × glucosa plasmática en ayunas/2]. CTI se calculó usando la siguiente fórmula: CTI = 0,412 × ln(CRP) + TyG. Valores más altos de CTI indican una mayor carga combinada de inflamación de bajo grado y resistencia a lainsulina 8.
Si algún valor de proteína C-reactiva requirió manipulación antes de la transformación logarítmica (por ejemplo, valores en o por debajo del límite de detección), se aplicó una única regla predefinida de forma consistente a lo largo de todos los ciclos y se documentó que soportaba replicabilidad (por ejemplo, reemplazando los valores no positivos por el valor medible positivo más pequeño observado antes de la transformación logarítmica). Los puntos de corte del cuartil se determinaron a partir de la distribución ponderada en la muestra analítica completa y se aplicaron de forma consistente en análisis categóricos, utilizando el Cuartil 1 como categoría de referencia.
4. Covariables
Se preespecificaron covariables para mitigar la confusión basándose en razonamientos epidemiológicos y literatura previa. Las variables demográficas incluían edad, raza/etnia, nivel educativo y estado civil. Las variables de estilo de vida incluyeron historial de tabaquismo (≥100 cigarrillos a lo largo de la vida frente a <100) y consumo de alcohol (≥12 bebidas al año frente a <12). El historial de comorbilidades incluyó hipertensión, diabetes, ictus, enfermedad coronaria y cáncer auto-reportados. Las variables antropométricas y de laboratorio incluyeron índice de masa corporal, hemoglobina, recuento de neutrófilos, recuento de linfocitos y recuento de plaquetas; Estas medidas también apoyaban el cálculo de índices inflamatorios comparadores cuando era aplicable (por ejemplo, proporción neutrófilos/linfocitos, proporción plaquetar-linfocitos, índice de inflamación inmunitaria sistémica, índice de respuesta inflamatoria sistémica). Las variables reproductivas (por ejemplo, gravidez y paridad) se incluyeron cuando estaban disponibles en los ciclos seleccionados y se codificaron según la documentación de NHANES. Las covariables categóricas se convirtieron en variables indicadoras antes de la introducción del modelo.
Dado que la proteína C-reactiva era un componente del índice compuesto, no se introdujo como una covariable independiente en modelos de regresión multivariable para evitar el sobreajuste y la colinealidad. En cambio, la proteína C-reactiva y el índice triglicéridos–glucosa fueron evaluados como marcadores comparadores en los análisis de discriminación.
5. Análisis estadístico
Todos los análisis tuvieron en cuenta el diseño complejo de la encuesta NHANES para generar estimaciones representativas a nivel nacional. El diseño de la encuesta se especificó vinculando el peso de la submuestra, los estratos y las variables de la PSU de múltiples ciclos con el conjunto de datos analítico. Las variables continuas se resumieron como medias ponderadas con desviaciones estándar, y las variables categóricas se resumieron como conteos ponderados y porcentajes. Las características de la línea base se compararon entre casos y controles utilizando procedimientos ponderados por encuesta apropiados para NHANES, y las características de la línea base se resumieron en la Tabla 1.
Se evaluaron las asociaciones entre el índice compuesto y la endometriosis mediante regresión logística ponderada por encuestas. Se ajustaron tres modelos secuenciales para demostrar el ajuste: un modelo no ajustado, otro ajustado por edad y raza/etnia, y un modelo completamente ajustado que incluía factores demográficos, variables de estilo de vida, historial de comorbilidades, covariables antropométricas/de laboratorio y variables de historia reproductiva. El índice compuesto se analizó tanto de forma continua (por aumento de 1 unidad) como categóricamente (cuarteles, con Cuartil 1 como referencia), y las estimaciones de regresión se resumieron en la Tabla 2. La tendencia lineal a través de cuartiles se probó asignando a cada cuartil su valor mediano ponderado y modelando ese término de forma continua.
Las relaciones dosis-respuesta no lineales se evaluaron utilizando splines cúbicos restringidos ponderados por encuesta con colocación de nudos predeterminada, y las curvas de splines se representaron en la Figura 2. Los efectos umbral se evaluaron utilizando regresión logística segmentada ponderada por encuestas (por partes) comparando el ajuste del modelo entre especificaciones segmentadas y de pendiente única, y los parámetros estimados del punto de inflexión y la pendiente a cada lado del punto de inflexión se informaron en la Tabla 3.
Se realizaron análisis de subgrupos para explorar la modificación de efectos por factores preespecificados (por ejemplo, grupo de edad, raza/etnia, nivel educativo, estado civil y factores seleccionados de estilo de vida). La interacción se evaluó incluyendo términos de producto cruzado entre el índice compuesto continuo y los indicadores de subgrupos dentro del marco ponderado por encuestas, y las asociaciones de subgrupos se resumieron en la Figura 3.
El desempeño discriminatorio se evaluó utilizando análisis de características operativas del receptor basados en probabilidades predichas por modelos derivados de modelos logísticos ponderados por encuestas. Se obtuvieron estimaciones de área bajo la curva para el índice compuesto, los índices inflamatorios comúnmente usados y los marcadores componentes, y los resúmenes de AUC se proporcionaron en la Tabla Suplementaria 1; una comparación ampliada de la ROC se proporcionó en la Figura Suplementaria 1.
Los datos faltantes se manejaron mediante análisis de casos completos tras excluir a participantes con estado de endometriosis ausente, componentes del índice compuesto o covariables esenciales necesarias para el modelo totalmente ajustado. Cuando se realizó una evaluación de robustez, se aplicó imputación múltiple para covariables con ausencia bajo un modelo de imputación preespecificado, y se compararon estimaciones imputadas con estimaciones de casos completos.
Los análisis se realizaron utilizando R (versión 4.4.1) y software estadístico adicional según la lista de la Tabla de Materiales. Se registraron paquetes clave usados para inferencia de encuestas, modelado de splines, regresión segmentada y estimación ROC, y se conservó la información de sesión (detalles del sistema operativo y de la sesión R) para soportar la replicación.
6. Punto final del procedimiento y salidas
El flujo de trabajo analítico se consideró completo una vez que se construyó el conjunto de datos armonizado de múltiples ciclos con los criterios preespecificados de inclusión/exclusión (Figura 1), se generaron el índice compuesto y las covariables según las reglas documentadas, y se ejecutaron los análisis preespecificados de regresión ponderada por encuesta, evaluación de no linealidad/umbral, subgrupos y discriminación bajo la misma especificación de diseño de encuesta. Los resultados principales de este flujo de trabajo se organizaron como un resumen de la línea base (Tabla 1), estimaciones de regresión entre modelos de ajuste secuencial (Tabla 2), parámetros del modelo umbral (Tabla 3), visualización de splines (Figura 2), visualización de resumen de subgrupos (Figura 3) y resúmenes de discriminación (Tabla Suplementaria 1 y Figura Suplementaria 1).
7. Validación interna independiente
La validación interna independiente se realizó dividiendo el conjunto de datos combinado en una cohorte de derivación y una cohorte de validación no solapada basada en los ciclos NHANES. Los participantes de los ciclos 1999–2000 y 2001–2002 fueron asignados a la cohorte de derivación, y los participantes de los ciclos 2003–2004 y 2005–2006 fueron asignados a la cohorte de validación. Los mismos criterios de inclusión/exclusión, cálculo de índices compuestos, reglas de codificación de covariables y estrategia de ponderación de encuestas se aplicaron de forma independiente dentro de cada cohorte.
Dentro de la cohorte de derivación, se ajustaron modelos de regresión logística ponderados por encuestas utilizando la especificación totalmente ajustada. Los procedimientos de evaluación de no linealidad y umbral utilizados en el análisis principal se aplicaron en la cohorte de derivación, y la discriminación se evaluó utilizando métodos ROC/AUC basados en probabilidades predichas por el modelo. La misma estrategia de modelado se repitió en la cohorte de validación sin modificar definiciones de variables, reglas de codificación ni especificaciones de ponderación. Las estimaciones derivación versus validación se resumieron como una comparación de cohorte a cohorte de estimaciones de asociación (Figura 4) y como curvas ROC derivación versus validación (Figura 5), con resúmenes numéricos correspondientes proporcionados en la Tabla 4.