$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Протокол NHANES был утверждён Советом по этике исследований Национального центра статистики здравоохранения (NCHS), и все участники получили письменное информированное согласие. Эта работа представляла собой вторичный анализ деидентифицированных данных общественного использования; поэтому дополнительное институциональное этическое одобрение не требовалось. Все авторы прочитали и утвердили окончательную рукопись.
1. Дизайн исследования и источники данных
Это исследование было проведено как вторичный анализ NHANES — серии поперечных, национально репрезентативных опросов, проводимых Центрами по контролю и профилактике заболеваний США и контролируемых Советом по этике исследований NCHS. Наборы данных NHANES для общественного использования были полностью деидентифицированы и использованы для вторичного анализа. Использовались данные циклов 1999–2000, 2001–2002, 2003–2004 и 2005–2006 годов.
Для каждого цикла скачивались публичные файлы компонентов NHANES, включая (i) демографические файлы с идентификатором участника (SEQN) и переменными дизайна опроса, (ii) анкеты по репродуктивному здоровью с самоотчетом об эндометриозе, и (iii) лабораторные файлы, необходимые для вычисления композитного индекса (C-реактивный белок, триглицериды и глюкоза натощак). При анализе этих индексов дополнительно были получены исследовательские/антропометрические файлы (например, индекс массы тела) и лабораторные показатели, необходимые для сравнительных индексов (например, нейтрофилы, лимфоциты, тромбоциты). В течение каждого двухлетнего цикла компонентные файлы объединялись с помощью SEQN, и объединённый набор данных проверялся для обеспечения одной записи на SEQN. Затем были добавлены наборы данных на уровне циклов для создания объединённого аналитического файла 1999–2006 годов.
Аналитическая выборка была ограничена женщинами в возрасте от 20 до 54 лет. Участники исключались, если отсутствовал статус эндометриоза, отсутствовали какие-либо составные компоненты индекса (белки, триглицериды или глюкоза натощак) или если отсутствовали существенные ковариаты, необходимые для полностью скорректированной модели, в рамках стратегии полного случая. Сложные переменные проектирования обследования (страты и первичные отборные единицы) были сохранены, а также лабораторные подвесы, необходимые для анализов с использованием измерений голодания. При объединении нескольких циклов NHANES в соответствии с аналитическими рекомендациями NHANES создавались многоцикловые веса путём разделения двухлетнего подвыборочного веса на количество комбинированных циклов, при этом в анализах применялись переменные веса, страты и блоки питания. Шаги включения и исключения участников были задокументированы в схеме потока (рисунок 1).
2. Определение эндометриоза
Статус эндометриоза определялся с помощью анкеты репродуктивного здоровья: «Вам когда-нибудь врач или другой медицинский работник говорили, что у вас эндометриоз?» Участники, ответившие «Да», классифицировались как случаи эндометриоза, а те, кто ответил «Нет», — как контрольные. Поскольку это определение основывалось на самооценке, а не на лапароскопическом или гистологическом подтверждении, возможное неправильное классифицирование рассматривалось как ограничение исследования.
3. Определение составного индекса (CTI)
Композитный индекс белка–триглицерид–глюкозы реактивный с С-реакцией был операционализован для совместного отражения системного воспаления и метаболических нарушений. Лабораторные измерения С-реактивного белка (мг/л), триглицеридов (мг/дл) и глюкозы натощак (мг/дл) были извлечены из лабораторных файлов NHANES. Индекс триглицерид–глюкоза рассчитывался как естественный логарифм [триглицеридов × глюкозы натощак в плазме/2]. CTI рассчитывался по следующей формуле: CTI = 0,412 × ln(CRP) + TyG. Более высокие значения CTI указывают на более высокую совокупную нагрузку низкого воспаления и инсулинорезистентности8.
Если любые значения белков, реактивных к C, требовали обработки до логарифмического преобразования (например, значения на пределе или ниже предела обнаружения), одно заранее заданное правило применялось последовательно во всех циклах и документировалось для поддержки воспроизводимости (например, замена неположительных значений на минимальное положительное измеримое значение, наблюдаемое до логарифмического преобразования). Точки среза квартилей определялись на основе взвешенного распределения в полной аналитической выборке и применялись последовательно в категориальных анализах, при этом квартиль 1 использовался в качестве эталонной категории.
4. Ковариаты
Ковариаты были заранее определены для смягчения замешательства на основе эпидемиологических рассуждений и предыдущей литературы. Демографические переменные включали возраст, расу/этническую принадлежность, уровень образования и семейное положение. Среди факторов образа жизни были история курения (≥100 сигарет за всю жизнь против <100) и употребление алкоголя (≥12 напитков в год против <12). Анамнез сопутствующих заболеваний включал самосообщаемую гипертонию, диабет, инсульт, ишемическую болезнь сердца и рак. Антропометрические и лабораторные переменные включали индекс массы тела, гемоглобин, количество нейтрофилов, лимфоцитов и тромбоцитов; Эти показатели также способствовали расчёту сравнительных воспалительных индексов, где это было необходимо (например, соотношение нейтрофилов к лимфоцитам, соотношение тромбоцитов к лимфоцитам, индекс системного иммунного воспаления, индекс системного воспаления). Репродуктивные переменные (например, гравитация и паритет) включались, когда были доступны в выбранных циклах, и кодировались в соответствии с документацией NHANES. Категориальные ковариаты были преобразованы в индикаторные переменные до ввода в модель.
Поскольку C-реактивный белок был компонентом составного индекса, он не был введён как независимый ковариат в многомерные регрессионные модели, чтобы избежать перестройки и коллинеарности. Вместо этого в анализе дискриминации были оценены С-реактивный белок и индекс триглицерид–глюкоза в качестве сравнительных маркеров.
5. Статистический анализ
Все анализы учитывали сложный дизайн опроса NHANES для получения национально репрезентативных оценок. Дизайн обследования был определен путём связки многоцикловых переменных веса, слоев и блока питания с аналитическим набором данных. Непрерывные переменные суммировались как взвешенные средние с стандартными отклонениями, а категориальные переменные — как взвешенные счёты и проценты. Исходные характеристики сравнивались между случаями и контролями с использованием процедур, взвешенных по опросу, соответствующих NHANES, а исходные характеристики были обобщены в Таблице 1.
Связь между композитным индексом и эндометриозом оценивалась с помощью логистической регрессии, взвешенной по опросу. Для демонстрации корректировки были использованы три последовательные модели: нескорректированная модель, модель с учётом возраста и расы/этнической принадлежности, и полностью скорректированная модель с демографическими факторами, переменными образа жизни, историей сопутствующих заболеваний, антропометрическими/лабораторными ковариатами и переменными репродуктивной истории. Композитный индекс анализировался как непрерывно (на прирост на 1 единицу), так и категориально (квартили, с Квартилем 1 в качестве ориентира), а оценки регрессии были обобщены в Таблице 2. Линейная тенденция между квартилями была проверена путём присвоения каждой квартилю взвешенной медианной стоимости и непрерывного моделирования этого члена.
Нелинейные соотношения доза и ответ оценивались с использованием ограниченных кубических сплайнов с заранее заданным расположением узлов, а кривые сплайна были нанесены на рисунке 2. Пороговые эффекты оценивались с помощью взвешенной по обследованию сегментированной (кусочно) логистической регрессии, сравнивая соответствие модели между сегментированными и одноуклонными спецификациями, а оценочные параметры точки изгиба и наклона с каждой стороны точки перегиба были представлены в Таблице 3.
Анализы подгрупп были проведены для изучения модификации эффекта по заранее определённым факторам (например, возрастная группа, раса/этническая принадлежность, уровень образования, семейное положение и выбранные факторы образа жизни). Взаимодействие тестировалось путём включения межпродуктовых терминов между индикаторами непрерывного композитного индекса и подгрупп в рамках взвешенной по опросу, а ассоциации подгрупп были обобщены на рисунке 3.
Дискриминационная эффективность оценивалась с помощью анализа операционных характеристик приёмника на основе предсказанных моделей вероятностей, полученных из логистических моделей с взвешенным опросом. Площадь под оценками кривой была получена для составного индекса, часто используемых воспалительных индексов и компонентных маркеров, а сводки AUC приведены в Дополнительной таблице 1; расширенное сравнение РПЦ приведено на дополнительном рисунке 1.
Отсутствующие данные обрабатывались с помощью анализа полного случая после исключения участников с отсутствующим статусом эндометриоза, отсутствующими компонентами композитного индекса или отсутствующими существенными ковариатами, необходимыми для полностью скорректированной модели. При проведении оценки надёжности применялась множественная импутация для ковариатов с отсутствующей в рамках заранее заданной модели импутации, а вчисленные оценки сравнивались с оценками полного случая.
Анализ проводился с использованием R (версия 4.4.1) и дополнительного статистического программного обеспечения, указанного в Таблице материалов. Ключевые пакеты, используемые для вывода опросов, моделирования сплайнов, сегментированной регрессии и оценки ROC, были записаны, а информация о сессиях (операционная система и детали сессии R) сохранялась для поддержки репликации.
6. Конечная точка и выходы процедуры
Аналитический рабочий процесс считался завершённым после того, как гармонизированный многоцикловый набор данных был сформирован с заранее заданными критериями включения/исключения (см. рисунок 1), составный индекс и ковариаты были сгенерированы согласно задокументированным правилам, а также были выполнены заранее заданные взвешенные регрессии, нелинейной/пороговой оценки, подгрупповые и дискриминационные анализы по той же спецификации проектирования опроса. Основные результаты этого рабочего процесса были организованы в виде базового сводки (Таблица 1), оценки регрессии по последовательным моделям корректировки (Таблица 2), параметры пороговой модели (Таблица 3), визуализация сплайна (Рисунок 2), визуализация сводки подгрупп (Рисунок 3) и сводки по дискриминации (Дополнительная таблица 1 и Дополнительный рисунок 1).
7. Внутренняя независимая валидация
Внутренняя независимая валидация проводилась путём разделения объединённого набора данных на когорту вывода и неперекрывающуюся когорту валидации на основе циклов NHANES. Участники циклов 1999–2000 и 2001–2002 годов были распределены в когорту вывода, а участники циклов 2003–2004 и 2005–2006 годов — в валидационную когорту. Одинаковые критерии включения/исключения, вычисление композитного индекса, правила кодирования ковариатов и стратегия взвешивания опроса применялись независимо внутри каждой когорты.
В когорте вывода были установлены логистические регрессионные модели, взвешенные по опросу, с использованием полностью скорректированной спецификации. Процедуры нелинейности и пороговой оценки, используемые в основном анализе, применялись в когорте дериваций, а дискриминация оценивалась с использованием методов ROC/AUC на основе предсказанных моделью вероятностей. Та же стратегия моделирования затем повторялась в когорте валидации без изменения определений переменных, правил кодирования или спецификаций взвешивания. Оценки вывода и валидации были обобщены как сравнение оценок ассоциаций между когортами (рисунок 4) и как кривая ROC по выводу и валидации (рисунок 5), с соответствующими числовыми сводками в таблице 4.