Исследовательская статья

Менделевская рандомизация и биоинформатика позволяют идентифицировать IFI27 как потенциальный биомаркер привычного выкидыша при системной красной волчанке

0 просмотров

⸱

DOI:

10.3791/72493

⸱

25 сентября 2026 г.

* These authors contributed equally

В этой статье

Краткое содержание

В данном исследовании изучается взаимосвязь между системной красной волчанкой и привычным невынашиванием беременности, а также определяется IFI27 как потенциальный биомаркер для дальнейшего изучения.

Аннотация

Системная красная волчанка (СКВ) связана с неблагоприятными исходами беременности, однако причинно-следственная связь между СКВ и привычным невынашиванием беременности (ПНБ), а также их общие молекулярные характеристики остаются недостаточно изученными. В данном исследовании были интегрированы двунаправленный двухвыборочный менделевский рандомизационный анализ (MR) и транскриптомный биоинформатический анализ для изучения этой взаимосвязи и поиска потенциальных общих биомаркеров. Базы данных FinnGen и UK Biobank были выбраны, поскольку они предоставляют обширные, неперекрывающиеся суммарные статистические данные полногеномных ассоциативных исследований (GWAS) для лиц европейского происхождения. Дифференциально экспрессируемые гены (ДЕГ) были определены на основе данных GSE61635 (кровь; |log₂ fold change| > 1) и GSE165004 (эндометрий; |log₂ fold change| > 0.5) при скорректированном P < 0.05, после чего были проведены функциональный анализ обогащения, анализ белок-белковых взаимодействий (PPI), скрининг ключевых генов (hub-genes), регрессия методом наименьших абсолютных отклонений с выбором признаков (LASSO), внешняя валидация с использованием GSE50772 и GSE198700, ROC-анализ и анализ обогащения наборов генов для одного образца (ssGSEA). Генетически предсказанная СКВ была связана со статистически значимым, но количественно умеренным увеличением числа спонтанных выкидышей (отношение шансов [OR] по методу обратной дисперсии [IVW] = 1.01, 95% доверительный интервал [CI] = 1.00–1.02; P < 0.001). Сила инструментальных переменных была достаточной, а анализ чувствительности не выявил существенной гетерогенности, направленной плейотропии или влияния отдельных вариантов. Пятьдесят девять общих ДЕГ были обогащены в процессах противовирусного иммунного ответа, адгезии клеток и апоптоза. IFI27 последовательно гиперэкспрессировался в крови при СКВ, но подвергался недоэкспрессии в эндометрии и ворсинах хориона при ПНБ, в то время как для CXCL11 не удалось получить согласованную внешнюю валидацию. Ретроспективный ROC-анализ показал значения площади под кривой (AUC) 0.822 для СКВ и 0.872 для ПНБ. Вычисленные показатели ssGSEA продемонстрировали корреляцию между экспрессией IFI27 и сигнатурами нескольких типов иммунных клеток, включая T-хелперы 2 (Th2). Эти результаты позволяют рассматривать IFI27 как потенциальный биомаркер, общий для СКВ и ПНБ; тем не менее, для подтверждения его биологической и клинической значимости требуются проспективные клинические и экспериментальные исследования.

Введение

Системная красная волчанка (СКВ) представляет собой сложное аутоиммунное заболевание, характеризующееся поражением многих систем организма и хронической иммунной дисрегуляцией1. Патологические отклонения при СКВ обусловлены прежде всего нарушением адаптивного иммунного ответа и отложением иммунных комплексов (антиген-антитело), что приводит к аутоиммунному повреждению тканей и органов2,3. Глобальная заболеваемость СКВ составляет примерно 5,14 (1,4–15,13) случая на 100 000 человеко-лет, при этом расчетная заболеваемость среди женщин составляет 8,82 (2,4–25,99) случая на 100 000 человеко-лет4. СКВ поражает людей всех возрастов, но преимущественно встречается у женщин репродуктивного возраста5,6. Беременные пациентки с СКВ подвержены повышенному риску неблагоприятных исходов беременности, включая привычный выкидыш, мертворождение, преждевременные роды и задержку внутриутробного развития плода7,8. Привычным выкидышем (ПВ) считается два или более случая самопроизвольного прерывания беременности до 20–24 недель гестации9. Сообщаемая распространенность ПВ составляет примерно 2,6%10, что делает его клинически значимым репродуктивным осложнением. Примерно у 20% беременных пациенток с СКВ происходит выкидыш11, и СКВ признана важным фактором риска развития ПВ12. В качестве предлагаемых механизмов рассматриваются гормональные изменения и иммунная дисрегуляция. Такие биомаркеры, как антикардиолипиновые антитела и волчаночный антикоагулянт, изучались как потенциальные предикторы неблагоприятных исходов беременности у пациенток с СКВ11. Эти аутоантитела могут связываться с клетками трофобласта плаценты, изменять сигнализацию, пролиферацию и инвазию трофобласта, модулировать секрецию гормонов и цитокинов, а также усиливать апоптоз, тем самым способствуя нарушению исходов беременности13. Кроме того, бета-2-гликопротеин I (β2-GPI), основной антиген при антифосфолипидном синдроме, экспрессируется в тканях плаценты. Связывание анти-β2-GPI антител с β2-GPI подавляет рост и дифференцировку трофобласта, что приводит к дефектам плаценты. Это взаимодействие также способствует созданию провоспалительной среды, характеризующейся выработкой деструктивных цитокинов и активацией комплемента, что ведет к тромбозу плаценты и привычному выкидышу14,15. Однако в предыдущих исследованиях часто отсутствовал комплексный анализ локальных репродуктивных тканей, таких как децидуальная оболочка, что ограничивало возможность корреляции системных биомаркеров с локальными патологическими изменениями. Более того, ведение беременности, осложненной СКВ, и предотвращение неблагоприятных исходов остаются сложной задачей. Генетическая предрасположенность способствует развитию СКВ, и генетические вариации также были вовлечены в патогенез ПВ16,17. Тем не менее, вопрос о существовании причинно-следственной связи между СКВ и ПВ, а также молекулярные механизмы и общие гены, лежащие в основе их сосуществования, остаются неясными.

Менделевская рандомизация (МР) представляет собой общепринятый подход к причинно-следственному выводу, при котором генетические варианты используются в качестве инструментальных переменных для оценки причинного влияния воздействующих факторов на исходы заболевания18. Используя связь между генотипом и фенотипом, МР снижает систематическую ошибку, вызванную смешивающими факторами и обратной причинно-следственной связью, по сравнению с традиционными обсервационными исследованиями. Параллельно с этим достижения в области геномных микрочиповых платформ и высокопроизводительного секвенирования позволили применять биоинформатический анализ для идентификации потенциальных диагностических биомаркеров и терапевтических мишеней с помощью транскриптомного профилирования. Интеграция этих взаимодополняющих подходов может обеспечить более глубокое понимание взаимосвязи между СКВ и РПС путем объединения причинно-следственных генетических данных с паттернами экспрессии генов, связанными с заболеванием. Таким образом, целью данного исследования было изучение потенциальной причинно-следственной связи между СКВ и РПС, идентификация общих потенциальных биомаркеров и биологических путей, а также приоритизация мишеней для последующей валидации. Для достижения этих целей был заранее определен следующий аналитический рабочий процесс: двунаправленная МР для оценки направления причинно-следственной связи; независимый анализ дифференциальной экспрессии генов с последующей транскриптомной интеграцией; анализ сетей белок-белковых взаимодействий (PPI) и регрессия методом наименьшего абсолютного сжатия и отбора (LASSO) для приоритизации биомаркеров; внешняя валидация экспрессии и анализ рабочей характеристики приемника (ROC); а также анализ обогащения наборов генов в одном образце (ssGSEA) для оценки ассоциаций с сигнатурами иммунных клеток. Данный поэтапный рабочий процесс обобщен на Рисунке 1.

figure-introduction-1
Рисунок 1. Дизайн исследования и аналитический рабочий процесс. 
На верхней панели представлена схема двунаправленного двухвыборочного менделевского рандомизирования (MR) для оценки взаимосвязи между системной красной волчанкой (СКВ) и количеством самопроизвольных выкидышей с использованием суммарных статистик полногеномного поиска ассоциаций (GWAS). Описаны этапы отбора инструментов, кластеризации по неравновесности сцепления, проведения анализа менделевского рандомизирования (MR) и анализа чувствительности. На нижней панели представлен биоинформатический рабочий процесс, включающий анализ дифференциальной экспрессии, идентификацию общих дифференциально экспрессируемых генов (DEG), анализ функционального обогащения, построение сети белок-белковых взаимодействий (PPI), поиск центральных генов (hub-genes), регрессию методом наименьшего абсолютного сжатия и отбора оператора (LASSO), внешнюю валидацию, анализ рабочих характеристик приемника (ROC), анализ обогащения наборов генов в одном образце (ssGSEA) и приоритизацию IFI27 как кандидатного биомаркера. IVW — взвешивание по обратной дисперсии; KEGG — Киотская энциклопедия генов и геномов; GO — генная онтология. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Протокол

Этическое одобрение для данного исследования не требовалось, так как оно включало только вторичный анализ общедоступных, деидентифицированных суммарных статистик полногеномных поисков ассоциаций (GWAS) и транскриптомных наборов данных. Новые участники не привлекались, биологические образцы не собирались, и доступ к идентифицируемой информации на индивидуальном уровне не осуществлялся. В оригинальных исследованиях FinnGen, UK Biobank и Gene Expression Omnibus было указано, что этическое одобрение и информированное согласие были получены в соответствии с соответствующими требованиями институтов, национальными нормами и правилами конкретных баз данных. Все наборы данных, использованные в настоящем исследовании, были доступны и анализировались в соответствии с применимыми политиками использования баз данных, условиями доступа к данным и этическими принципами. Авторы не предпринимали попыток повторной идентификации какого-либо участника. Таким образом, дополнительное письменное информированное согласие для этого вторичного анализа не потребовалось. Содержание данного исследования состоит из двух частей: MR-анализа и биоинформатического анализа (Рисунок 1). Данное исследование было полностью вычислительным и основывалось на общедоступных суммарных данных GWAS и транскриптомных наборах данных. Реагенты или расходные материалы для «мокрой» лаборатории не использовались.

Мендельевская рандомизация (MR-анализ)
Источники данных, сбор и предварительная обработка сводных статистик GWAS:
Сводные статистики GWAS для системной красной волчанки были получены из FinnGen Release 11 (finngen_R11_L12_LUPUS; RRID:SCR_022254), популяционной финской когорты. Фенотип был определен с использованием кода МКБ-10 L93 и включал 423 818 участников, из которых 777 человек составили основную группу (случаи) и 423 041 человек — контрольную группу. Файл со сводными статистиками FinnGen был загружен с публичного портала данных FinnGen в сжатом формате с разделителями-табуляциями и импортирован в R с помощью функции read_exposure_data() или read_outcome_data() пакета TwoSampleMR, в зависимости от того, использовался ли набор данных в качестве экспозиции или исхода. Были сохранены rsID, хромосома, геномная позиция, эффекторный аллель, другой аллель, частота эффекторного аллеля, бета-коэффициент, стандартная ошибка и значение P ассоциации.

Сводные статистические данные по количеству спонтанных выкидышей были получены из UK Biobank через ресурс IEU OpenGWAS (ukb-b-419; RRID:SCR_012815), включающий 78 700 участников. В прямом анализе ассоциации выбранных однонуклеотидных полиморфизмов (SNP) FinnGen с исходом были получены с помощью функции extract_outcome_data(outcomes = "ukb-b-419", proxies = FALSE). В обратном анализе SNP, ассоциированные с красной волчанкой, были получены с помощью функции extract_instruments(outcomes = "finngen_R11_L12_LUPUS", clump = FALSE), после чего соответствующие ассоциации SNP были извлечены из файла сводной статистики UK Biobank. Характеристики наборов данных GWAS, использованных в двунаправленном MR-анализе, обобщены в Таблице 1.

ПризнакРазмер выборкиПроисхождениеКонсорциумГодИдентификатор набора данных GWAS
Системная красная волчанка4,23,818ЕвропейскийFinnGen (RRID: SCR_022254)2024finngen_R11_L12_СИСТЕМНАЯ_КРАСНАЯ_ВОЛЧАНКА
Количество самопроизвольных выкидышей78,700ЕвропейскийUK Biobank (RRID: SCR_012815)2018ukb-b-419

Таблица 1: Сводные данные полногеномного поиска ассоциаций (GWAS), использованные для двунаправленного менделевского рандомизационного анализа.
В таблице обобщены общедоступные наборы данных полногеномного поиска ассоциаций, использованные в качестве источников воздействия и исхода для прямого и обратного менделевского рандомизационного анализа, включая размер выборки, происхождение, источник данных, год выпуска данных и идентификатор набора данных.

Базы данных FinnGen и UK Biobank были выбраны, так как они предоставляют большие, общедоступные наборы данных преимущественно европейского происхождения, полученные из неперекрывающихся исходных популяций, и содержат достаточное покрытие вариантов для проведения двухвыборочного МР. О перекрытии между выборками экспозиции и исхода не сообщалось. Поскольку использовались только суммарные данные, доступ к генотипическим данным на индивидуальном уровне не осуществлялся, дополнительная нормализация на уровне участников не проводилась, и исследователями не исключались никакие участники. Мы опирались на процедуры контроля качества на уровне выборок и вариантов, внедренные оригинальными консорциумами GWAS. В ходе настоящего анализа был проведен дополнительный контроль качества на уровне вариантов посредством фильтрации по значимости, клампинга по неравновесности сцепления, гармонизации аллелей, оценки силы инструмента и скрининга на плеотропию, как описано ниже.

В выпуске 11 FinnGen геномные позиции указаны в соответствии с GRCh38/hg38, в то время как гармонизированные наборы данных IEU OpenGWAS и справочный ресурс по неравновесному сцеплению используют аннотации вариантов, совместимые с GRCh37. Следовательно, сопоставление вариантов воздействия и исхода проводилось преимущественно по стабильным rsID, а не по координатам «хромосома-позиция». Прямое позиционное сопоставление между разными сборками не выполнялось. Варианты без однозначного rsID или с противоречивой информацией об аллелях в разных наборах данных были исключены перед проведением MR-анализа. Сводные статистики выпуска 11 FinnGen используют GRCh38, тогда как данные OpenGWAS гармонизированы по соглашению о референсной последовательности, используемому для сборки Build 37. Таким образом, сопоставление по rsID имеет важное значение при объединении этих двух ресурсов.

Дизайн исследования MR:
Мы строго придерживались руководств STROBE-MR (Дополнительный файл 1)19. Двунаправленный двухвыборочный дизайн MR был использован для оценки взаимосвязи между генетически предсказанной системной красной волчанкой и количеством спонтанных выкидышей. В прямом анализе системная красная волчанка рассматривалась как воздействие, а количество спонтанных выкидышей — как результат. В обратном анализе воздействие и результат были взаимозаменены, и весь рабочий процесс, включающий выбор инструментов, клампинг по неравновесности сцепления, гармонизацию данных, оценку причинно-следственной связи и анализ чувствительности, был повторен. Однонуклеотидные полиморфизмы (SNP) использовались в качестве инструментальных переменных (IV). Весь рабочий процесс выполнялся в следующем порядке: получение и форматирование суммарной статистики GWAS; выбор SNP, ассоциированных с воздействием; удаление дублирующих или не полностью аннотированных вариантов; клампинг по неравновесности сцепления; извлечение соответствующих ассоциаций с результатом; исключение SNP, напрямую связанных с результатом; гармонизация аллелей воздействия и результата; расчет силы инструмента; скрининг потенциальных вмешивающихся фенотипов; оценка причинно-следственных эффектов; оценка гетерогенности и горизонтальной плейотропии; обнаружение выбросов с помощью метода Mendelian Randomization Pleiotropy RESidual Sum and Outlier (MR-PRESSO); а также анализ чувствительности методом исключения одного варианта (leave-one-out) и анализ по отдельным SNP. Все анализы MR были реализованы с использованием R версии 4.4.2 (RRID:SCR_001905), TwoSampleMR версии 0.6.6 (RRID:SCR_019010), MRPRESSO версии 1.0 (RRID:SCR_023697) и forestploter версии 1.1.2. Анализ MR основывался на трех основных допущениях. Во-первых, согласно допущению о релевантности, выбранные SNP должны быть сильно связаны с воздействием. Во-вторых, согласно допущению о независимости, выбранные SNP должны быть независимы от факторов, которые искажают связь между воздействием и результатом. В-третьих, согласно допущению об ограничении исключения, выбранные SNP должны влиять на результат только через воздействие20 (Рисунок 1).

Методы отбора SNP:
Отбор инструментов проводился в следующем порядке: (1) выбор SNP, ассоциированных с воздействием, при P < 5 × 10−8; если количество инструментов было недостаточным, использовалось значение P < 5 × 10−6; (2) использование функции clump_data() для выполнения клампинга по неравновесности сцепления (linkage disequilibrium clumping) при R2 < 0.001 и генетическом расстоянии 10 000 kb, с ослаблением критериев до R2 < 0.01 в пределах 5 000 kb только в случае необходимости сохранения анализируемого набора инструментов; (3) фильтрация SNP, имеющих значимую связь с исходом, с использованием порога P = 5 × 10−5; (4) использование функции harmonise_data() для гармонизации аллелей воздействия и исхода, а также исключение палиндромных или иных неоднозначных вариантов; (5) расчет силы инструмента по формуле F = β2/SE2 и исключение SNP с F < 10; и (6) поиск сохраненных SNP в PhenoScanner V2 для выявления фенотипов, которые могли бы стать конфаундерами в связи между СКВ и потерей беременности21. Антифосфолипидные антитела (aPL) могут быть общим фактором риска для СКВ и количества самопроизвольных выкидышей. Поиск отдельных SNP проводился в PhenoScanner V2. Все кандидатные SNP запрашивались в PhenoScanner V2 с использованием стандартного каталога GWAS для получения всех зарегистрированных ассоциаций полногеномных поисков ассоциаций (GWAS). Порог значимости был установлен на уровне P < 1 × 10⁻5, и использовалась стандартная сборка референсного генома (GRCh37). Поскольку исследуемая популяция имела европейское происхождение, поиск прокси-вариантов был активирован с использованием европейской референсной панели (proxies = "EUR") при пороге LD R2 > 0.8 в окне 1 000 kb. Все остальные параметры поиска были оставлены по умолчанию. SNP, демонстрирующие значимые ассоциации с заранее определенным конфаундинг-фактором — антифосфолипидными антителами (aPL), рассматривались как потенциально плейотропные и исключались из окончательного набора инструментальных переменных для минимизации нарушения допущения об ограничении исключения в менделевской рандомизации. Инструментальные SNP, сохраненные для прямого и обратного MR-анализа, перечислены в Дополнительных таблицах 1 и 2 соответственно.

Статистический анализ:
После выбора инструментов и гармонизации аллелей причинно-следственные оценки рассчитывались с помощью функции mr() в пакете TwoSampleMR. Аналитический рабочий процесс выполнялся в следующем порядке. Во-первых, общий причинно-следственный эффект оценивали с помощью четырех методов МР: обратного взвешивания по дисперсии (IVW), регрессии MR-Egger, взвешенной медианы и взвешенной моды. Оценки эффекта для количества спонтанных выкидышей и СКВ представлялись в виде отношений шансов с соответствующими 95% доверительными интервалами и значениями P. Метод IVW был назначен в качестве основного анализа, поскольку он обеспечивает высокую статистическую мощность, когда все включенные SNP являются валидными инструментальными переменными и горизонтальная плейотропия отсутствует. Однако оценка IVW может быть смещенной при наличии горизонтальной плейотропии22. Регрессия MR-Egger использовалась преимущественно для оценки причинно-следственных выводов при наличии потенциальной горизонтальной плейотропии23. Метод взвешенной медианы требует, чтобы не менее 50% аналитического веса исходило от валидных IV. Этот метод оптимален при наличии гетерогенности, но отсутствии горизонтальной плейотропии24. Взвешенная мода выявляет кластеры инструментальных переменных со схожими причинно-следственными эффектами и оценивает эффект по самому большому кластеру25. Оценки эффекта, полученные с помощью четырех методов МР, представлены на Рисунке 2. Во-вторых, гетерогенность между специфичными для SNP причинно-следственными оценками оценивали с помощью теста Q Кохрена, реализованного через функцию mr_heterogeneity(). Статистика Q представляет собой взвешенную сумму квадратов отклонений индивидуальных оценок SNP от общей причинно-следственной оценки. Значение P теста Q < 0.05 считалось доказательством гетерогенности, в этом случае применялась IVW-модель со случайными эффектами. При отсутствии значимой гетерогенности использовалась IVW-модель с фиксированными эффектами26. В-третьих, направленная горизонтальная плейотропия оценивалась с помощью теста интерцепта MR-Egger, реализованного функцией mr_pleiotropy_test(). Интерцепт, значимо отличающийся от нуля при P < 0.05, считался доказательством направленной горизонтальной плейотропии. В-четвертых, процедура MR-PRESSO выполнялась с помощью функции mr_presso() в пакете MRPRESSO (RRID:SCR_023697) для обнаружения SNP с выбросами плейотропных эффектов27. При обнаружении выбросов они удалялись, и причинно-следственный анализ повторялся с использованием оставшихся инструментов. Глобальный тест MR-PRESSO использовался для оценки общей горизонтальной плейотропии, а тест на искажение (distortion test) учитывался при оценке того, существенно ли удаление выбросов изменило причинно-следственную оценку. В-пятых, анализ чувствительности методом исключения одного SNP (leave-one-out) выполнялся с помощью функции mr_leaveoneout(). В этом анализе каждый SNP последовательно исключался, и общая причинно-следственная оценка пересчитывалась с использованием оставшихся SNP. Результаты визуализировались с помощью mr_leaveoneout_plot(), чтобы определить, не была ли общая связь непропорционально обусловлена одним инструментом. В-шестых, индивидуальные оценки для конкретных SNP создавались с помощью функции mr_singlesnp(). Эти оценки использовались для построения воронкообразных графиков (funnel plots) с помощью mr_funnel_plot() для визуальной оценки асимметрии, которая может быть вызвана направленной горизонтальной плейотропией. Обобщающие форест-графики создавались с помощью forestploter (версия 1.1.2) для отображения оценок эффекта и доверительных интервалов, полученных различными методами МР. Прямой диаграмм рассеяния МР, специфичных для SNP форест-графиков, анализа leave-one-out и воронкообразного графика представлены в Дополнительных рисунках 1–4 соответственно.

figure-protocol-1
Рисунок 2. Результаты двунаправленного менделевского рандомизационного анализа. 
(A) Форест-график прямого менделевского рандомизационного (MR) анализа, где системная красная волчанка (СКВ) является воздействием, а количество самопроизвольных выкидышей — исходом. (B) Форест-график обратного MR-анализа, где количество самопроизвольных выкидышей является воздействием, а СКВ — исходом. Оценки эффекта представлены в виде отношений шансов (OR) с 95% доверительными интервалами (CI) для методов обратного взвешивания по дисперсии, MR-Egger, взвешенной медианы и взвешенной моды. SNP — однонуклеотидный полиморфизм. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Причинно-следственная связь считалась подтвержденной, если оценка IVW была статистически значимой при P < 0.05, оценки MR-Egger, взвешенного медианного значения и взвешенной моды демонстрировали направления, согласующиеся с оценкой IVW, а результаты существенно не изменялись при анализах на гетерогенность, плеотропию, MR-PRESSO или чувствительности с исключением одного инструмента (leave-one-out). Все статистические тесты были двусторонними.

Биоинформатический анализ
Данные микрочипов:
Транскриптомные наборы данных были получены из базы данных Gene Expression Omnibus (GEO; RRID:SCR_005012)28. Обработанные файлы Series Matrix, метаданные образцов и файлы аннотаций платформ были загружены для GSE61635, GSE165004, GSE50772 и GSE198700. Платформа, источник ткани, размер выборки и категория анализа для каждого набора данных приведены в Таблице 2. Поскольку наборы данных были получены из различных тканей и с использованием разных платформ микрочипов, каждый набор данных подвергался предварительной обработке и анализу независимо. Матрицы экспрессии из разных наборов данных не объединялись напрямую, и коррекция пакетного эффекта между платформами не применялась. Интеграция между наборами данных выполнялась на уровне символов генов только после того, как анализ дифференциальной экспрессии был независимо завершен для каждого исходного набора данных.

набор данных GEOЗаболеваниеПлатформаТкань (Homo sapiens)Клинические случаиКонтролиТип экспериментаАвторКатегория набора данных
GSE61635Системная красная волчанка (СКВ)GPL570Цельная кровь9930Микрочип экспрессииГрайдингер Э. Л.Набор данных для первичного анализа
GSE165004Привычное невынашивание беременности (ПНБ)GPL16699Эндометрий2424Микроматричный анализ экспрессииKeleş ID29Исследовательский набор данных
GSE50772Системная красная волчанка (СКВ)GPL570Мононуклеарные клетки периферической крови (МКПК)6120Микрочип экспрессииКеннеди WP30Валидационный набор данных
GSE198700Привычное невынашивание беременности (ПНБ)GPL13534Ворсины хориона55Микрочип экспрессииЛи Y31Валидационный набор данных

Таблица 2: Транскриптомные наборы данных, использованные для биоинформатического анализа.
В таблице представлены транскриптомные наборы данных из базы Gene Expression Omnibus (GEO), включенные в анализы поиска и валидации, с указанием заболевания, платформы микрочипов, источника ткани, размера выборки, типа эксперимента, автора оригинального исследования и категории набора данных.

Набор данных GSE61635 был получен с использованием платформы Affymetrix Human Genome U133 Plus 2.0 Array (GPL570) и включал 99 массивов цельной крови пациентов с СКВ, включая повторные визиты некоторых пациентов, и 30 массивов независимых здоровых контролей. Матрица экспрессии, представленная в базе, прошла робастную многоматричную коррекцию среднего фона, квантильную нормализацию, обобщение наборов зондов и log2-преобразование, выполненные авторами исходного исследования. Таким образом, повторная коррекция фона или квантильная нормализация не проводились. Идентификаторы пациентов были извлечены из метаданных GEO и сохранены для моделирования с повторными измерениями.

Набор данных GSE165004 был получен с использованием платформы микрочипов Agilent SurePrint G3 Human Gene Expression v2 8×60K (GPL16699). Полный набор данных включал 24 фертильных контроля, 24 пациента с RPL и 24 пациента с необъяснимым бесплодием. Были включены только 24 образца RPL и 24 образца фертильного контроля, собранные на 19–21 дни менструального цикла; 24 образца с необъяснимым бесплодием были исключены, так как они не входили в рамки предопределенного сравнения29. Использовалась матрица экспрессии, нормализованная депозитарием; дополнительная нормализация между массивами не проводилась после подтверждения сопоставимости распределения образцов с помощью диаграмм размаха («ящиков с усами») и графиков плотности.

GSE50772 использовался в качестве независимого валидационного набора данных по СКВ и включал образцы мононуклеарных клеток периферической крови 61 пациента с СКВ и 20 здоровых controls, полученные с помощью GPL57030. GSE198700 был получен с помощью GPL13534 и содержит образцы ворсин хориона пяти пациенток с RPL и пяти controls после прерывания беременности по желанию31. Депонированная матрица экспрессии была импортирована полностью и один раз преобразована с использованием log2(x + 1), так как представленные значения экспрессии были даны в нелогарифмической шкале. Данное преобразование было применено к полной матрице экспрессии перед контролем качества на уровне образцов, аннотацией зондов, обобщением на уровне генов, валидацией генов-кандидатов, анализом дифференциальной экспрессии, тестированием при сравнении групп и ROC-анализом. Гены-кандидаты не подвергались отдельному преобразованию, и в ходе последующих валидационных анализов дополнительное логарифмическое преобразование не проводилось. Для всех наборов данных идентификаторы образцов, статус заболевания, происхождение ткани и метки групп были перепроверены по соответствующим метаданным GEO перед началом анализа. Контроль качества включал оценку размеров библиотек или распределений экспрессии, построение диаграмм размаха (boxplot) по образцам, анализ главных компонент, иерархическую кластеризацию и тепловые карты расстояний между образцами. После проведения контроля качества дополнительные образцы исключены не были.

Анализ дифференциальной экспрессии:
Анализ дифференциальной экспрессии для наборов данных GSE61635 и GSE165004 проводился независимо с использованием пакета limma версии 3.60.6 (RRID:SCR_010943). Все матрицы экспрессии были организованы таким образом, что гены располагались в строках, а образцы — в столбцах. Порогом дифференциальной экспрессии было установлено значение |log₂ fold change| > 1 для GSE61635 и |log₂ fold change| > 0.5 для GSE165004 при значении P, скорректированном по методу Бенджамини–Хохберга (BH), < 0.05. Графики «вулкан» (volcano plots) были построены с помощью ggplot2 версии 3.5.1 (RRID:SCR_014601). Тепловые карты для 50 наиболее значимых дифференциально экспрессируемых генов (ДЭГ), ранжированных по скорректированному значению P, были созданы с помощью pheatmap версии 1.0.12 (RRID:SCR_016418). Общие ДЭГ были определены путем пересечения официальных символов генов из списков значимых ДЭГ для СКВ (SLE) и РПЛ (RPL) с использованием базовой функции R intersect() и визуализированы с помощью ggvenn версии 0.1.16 (RRID:SCR_025300). Тепловые карты дифференциальной экспрессии, графики «вулкан» и пересечение списков ДЭГ для СКВ и РПЛ представлены на Рисунке 3.

figure-protocol-2
Рисунок 3. Дифференциально экспрессируемые гены при системной красной волчанке и привычном невынашивании беременности. 
(A) Тепловая карта 50 наиболее значимых дифференциально экспрессируемых генов (ДЭГ) у пациентов с системной красной волчанкой (СКВ) и здоровых лиц из контрольной группы в наборе GSE61635. (B) Тепловая карта 50 наиболее значимых ДЭГ у пациентов с привычным невынашиванием беременности (ПНБ) и фертильных лиц из контрольной группы в наборе GSE165004. (C) График «вулкан» дифференциальной экспрессии генов в GSE61635. (D) График «вулкан» дифференциальной экспрессии генов в GSE165004. (E) Диаграмма Венна, показывающая пересечение списков значимых ДЭГ из поисковых наборов данных СКВ и ПНБ. ДЭГ — дифференциально экспрессируемые гены. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Функциональный анализ обогащения пересекающихся DEG:
Для анализа функций DEG на молекулярном уровне использовали онлайн-инструмент DAVID (версия 2021; RRID:SCR_001881)32 для проведения анализа обогащения функций Gene Ontology (GO) и путей Kyoto Encyclopedia of Genes and Genomes (KEGG). В качестве типа идентификатора загружали официальные символы генов человека, а в качестве вида выбирали Homo sapiens. Пользовательская фоновая популяция состояла из пересечения всех генов, прошедших аннотацию зондов и контроль качества, и которые были измеримы как в GSE61635, так и в GSE165004. Минимальный порог количества генов был установлен на уровне 2, а максимальный показатель EASE score, представляющий собой модифицированное одностороннее точное значение P по Фишеру в DAVID, был установлен на уровне 0,05. Контроль множественных сравнений осуществляли с помощью процедуры Бенджамини — Хохберга, указанной в колонке «Benjamini» в DAVID. Функциональные термины считались статистически значимыми, если EASE score был < 0,05 и скорректированное значение P по Бенджамини было < 0,05. Полные результаты из DAVID, включая названия терминов, количество генов, показатели EASE score, скорректированные значения P по Бенджамини, сопоставления входных генов и фоновых генов, были экспортированы в виде файла с разделителями-табуляторами. Для визуализации отфильтрованных результатов DAVID использовали веб-сайт CNSknowall. Результаты обогащения GO и KEGG представлены на Рисунке 4A.

figure-protocol-3
Рисунок 4. Анализ функционального обогащения и сеть белок-белковых взаимодействий общих дифференциально экспрессируемых генов. 
(A) Анализ обогащения по Gene Ontology (GO) и Kyoto Encyclopedia of Genes and Genomes (KEGG) для 59 общих дифференциально экспрессируемых генов (DEG). Диаграмма Санки иллюстрирует взаимосвязь между генами и обогащенными терминами GO, а сопровождающий пузырьковый график обобщает обогащенные термины GO и KEGG в зависимости от коэффициента обогащения (rich factor), количества генов и статистической значимости. (B) Сеть белок-белковых взаимодействий (PPI), построенная на основе 59 общих DEG с помощью STRING и визуализированная в Cytoscape. Размер и цвет узлов отражают связность сети, а ребра указывают на прогнозируемые белок-белковые ассоциации. BP — биологический процесс; CC — клеточный компонент; MF — молекулярная функция. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Сеть PPI и идентификация ключевых генов:
Общие дифференциально экспрессируемые гены (DEG) были загружены в STRING версии 11.0 (RRID:SCR_005223)33 с выбором Homo sapiens в качестве организма (таксономический идентификатор: 9606). Использовалась полная сеть STRING, учитывающая как функциональные, так и физические ассоциации белков. Были активированы все доступные каналы доказательств, включая экспериментальные данные, курируемые базы данных, коэкспрессию, текстовый майнинг, генное соседство, слияние генов и совместное occurrence генов.

Минимальный требуемый показатель взаимодействия был установлен на уровне 0,400, что соответствует средней степени достоверности. Дополнительные интеракторы первого или второго порядка не добавлялись; таким образом, сеть содержала только белки, кодируемые представленными общими дифференциально экспрессируемыми генами (DEGs). Ребра сети были отображены с использованием режима достоверности и экспортированы в файл со значениями, разделенными табуляцией, содержащий взаимодействующие белки и комбинированные показатели STRING. Показатели достоверности STRING отражают уверенность в наличии ассоциации, а не величину или силу связывания при взаимодействии.

Файл сети STRING был импортирован в Cytoscape версии 3.10.0 (RRID:SCR_003032)34. Перед анализом топологии сети были удалены узлы, не имеющие взаимодействий с другими представленными белками35. Оставшаяся сеть рассматривалась как ненаправленная. Комбинированные баллы STRING были сохранены в качестве атрибутов ребер для визуализации, в то время как ранжирование cytoHubba создавалось с использованием стандартных невзвешенных топологических определений. Результирующая сеть PPI представлена на Рисунке 4B.

Ранжирование ключевых генов (hub genes) проводили с помощью cytoHubba версии 0.1 (RRID:SCR_017677), используя шесть алгоритмов: центральность максимальной клики (MCC), максимальный компонент соседства (MNC), перколяционный компонент ребер (EPC), степень (Degree), близость (Closeness) и радиальность (Radiality)36. Для каждого алгоритма гены ранжировали в порядке убывания, и были отобраны 10 лучших генов. Кандидаты в ключевые гены сети определялись путем строгого пересечения шести списков из 10 лучших генов. Таким образом, ген считался ключевым узлом сети только в том случае, если он входил в топ-10 генов, определенных всеми шестью алгоритмами. Результаты ранжирования и процедура пересечения были экспортированы и архивированы. 10 лучших генов, выявленных каждым алгоритмом cytoHubba, представлены в Таблице 3.

РангЦентральность максимальных клик (MCC)Максимальный компонент окрестности (MNC)Граничный перколяционный компонент (EPC)СтепеньБлизостьРадиальность
1RSAD2RSAD2RSAD2RSAD2RSAD2RSAD2
2RTP4RTP4RTP4RTP4RTP4RTP4
3IFIT3IFIT3IFIT3IFIT3IFIT3IFIT3
4IFI27IFI27IFI27IFI27IFI27IFI27
5IFI44IFI44IFI44IFI44IFI44IFI44
6GBP1GBP1GBP1GBP1GBP1GBP1
7MX1MX1MX1MX1MX1MX1
8OAS1OAS1OAS1OAS1OAS1OAS1
9IFIT1IFIT1IFIT1IFIT1IFIT1IFIT1
10CXCL11CXCL11CXCL11CXCL11CXCL11CXCL11

Таблица 3: 10 основных хабовых генов, выявленных с помощью шести алгоритмов ранжирования cytoHubba.
Общие дифференциально экспрессируемые гены были ранжированы с использованием шести алгоритмов сетевой топологии, реализованных в плагине cytoHubba для программы Cytoscape. Для сравнения представлены 10 наиболее значимых генов, определенных каждым алгоритмом: Maximal Clique Centrality (MCC), Maximum Neighborhood Component (MNC), Edge Percolated Component (EPC), Degree, Closeness и Radiality.

Регрессия LASSO для идентификации основных генов:
Логистическая регрессия LASSO была выполнена независимо для наборов данных обнаружения SLE и RPL с использованием glmnet версии 4.1-8 (RRID:SCR_015505). Матрица предикторов состояла из нормализованных значений экспрессии кандидатов в узлы сети, где строки соответствовали образцам, а столбцы — генам. Статус заболевания был закодирован как 1, а контрольный статус — как 0. Биномиальная обобщенная линейная модель с чистым штрафом LASSO была подобрана с параметрами family = "binomial" и alpha = 1. Переменные-предикторы были стандартизированы внутренне с помощью standardize = TRUE, также был включен свободный член (intercept). Стратифицированное по классам 10-кратное разбиение было создано отдельно для наборов данных SLE и RPL с использованием собственного кода на языке base R. Внутри каждой страты статуса заболевания индексы образцов были случайным образом переставлены и распределены максимально равномерно по 10 фолдам с помощью sample(rep(seq_len(10), length.out = n)). Перед генерацией разбиения по фолдам для каждого набора данных был установлен случайный seed 123 для обеспечения воспроизводимости. Поскольку каждая группа статуса заболевания содержала более 10 образцов, каждый фолд перекрестной проверки включал как случаи заболевания, так и контроли. Полученные целочисленные векторы (foldid_sle и foldid_rpl) были переданы в аргумент foldid функции cv.glmnet(), и одни и те же назначения фолдов использовались для всех оцениваемых значений λ в соответствующем наборе данных.

Модели были подобраны с использованием параметров family = "binomial", alpha = 1, nfolds = 10, type.measure = "deviance", standardize = TRUE, intercept = TRUE, nlambda = 100, thresh = 1 × 10⁻7 и maxit = 100000. Параметр штрафа был выбран с помощью lambda.min, определяемого как значение lambda, при котором достигается минимальное среднее значение биномиальной девиации при перекрестной проверке. Более консервативный показатель lambda.1se, определяемый как наибольшее значение lambda в пределах одной стандартной ошибки от минимальной ошибки перекрестной проверки, был зафиксирован в качестве результата анализа чувствительности. Процедура LASSO применялась отдельно к наборам GSE61635 и GSE165004. Гены с ненулевыми коэффициентами в обеих моделях для конкретных заболеваний были определены как общие кандидатные гены, отобранные методом LASSO. Благодаря введению члена L1-регуляризации этот метод эффективно сокращает коэффициенты менее информативных генов до нуля, тем самым осуществляя отбор признаков37. Профили коэффициентов и кривые 10-кратной перекрестной проверки для поисковых наборов данных SLE и RPL представлены на Рисунке 5.

figure-protocol-4
Рисунок 5. Регрессионный анализ методом наименьшего абсолютного сокращения и отбора (LASSO) для генных хабов сети. 
(A) Профили коэффициентов, полученные с помощью логистической регрессии LASSO для набора данных поиска при системной красной волчанке (СКВ) (GSE61635). (B) Кривая десятикратной перекрестной проверки, использованная для определения оптимального параметра штрафа (λ) для модели СКВ. (C) Профили коэффициентов, полученные с помощью логистической регрессии LASSO для набора данных поиска при привычном невынашивании беременности (ПНБ) (GSE165004). (D) Кривая десятикратной перекрестной проверки, использованная для определения оптимального параметра штрафа (λ) для модели ПНБ. Числа вдоль верхней оси x указывают количество ненулевых коэффициентов регрессии при каждом значении λ. Вертикальные пунктирные линии указывают λ_min и λ_1se. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Валидация диагностической значимости основных генов:
Профили экспрессии кандидатных генов, отобранных методом LASSO, оценивали в независимом наборе данных СКВ GSE50772 и независимом наборе данных RPL GSE198700. Внешние наборы данных использовали только после завершения отбора кандидатных генов в GSE61635 и GSE165004. Дополнительный отбор признаков или подбор модели в валидационных наборах данных не проводили. Экспрессию кандидатных генов сравнивали между основной группой и контрольной группой с помощью двухстороннего критерия суммы рангов Уилкоксона. При тестировании более одного кандидатного гена в рамках одного набора данных полученные значения P корректировали с помощью процедуры Бенджамини–Хохберга. Кандидатный ген считался подтвержденным на внешних данных, если его экспрессия значимо различалась между основной и контрольной группами после коррекции на множественное тестирование, а направление изменений совпадало с данными соответствующего открывающего набора. Профили экспрессии кандидатных генов в открывающих и валидационных наборах данных представлены на рисунке 6.

figure-protocol-5
Рисунок 6Экспрессия IFI27 и CXCL11 в наборах данных для поиска и валидации. 
(A, B) Экспрессия IFI27 и CXCL11 соответственно в наборе данных для поиска (discovery dataset) по системной красной волчанке (СКВ) (GSE61635). (C, D) Экспрессия IFI27 и CXCL11 соответственно в независимом валидационном наборе данных по СКВ (GSE50772). (E, F) Экспрессия IFI27 и CXCL11 соответственно в наборе данных для поиска по привычным невынашиваниям беременности (RPL) (GSE165004). (G) Экспрессия IFI27 в независимом валидационном наборе данных по RPL (GSE198700). Сравнение экспрессии генов между группами проводили с помощью двухстороннего рангового суммового критерия Вилкоксона. P при тестировании нескольких кандидатных генов в рамках одного и того же набора данных значения корректировали с использованием метода Бенджамини — Хохберга. P < 0.05; **** P < 0,0001; ns, недостоверно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Анализ рабочей характеристики приемника (ROC-анализ) проводили с использованием pROC версии 1.18.5 (RRID:SCR_024286)38. Для каждого гена-кандидата в каждом наборе данных для поиска строились отдельные ROC-кривые. Площадь под ROC-кривой (AUC) и ее двусторонний 95% доверительный интервал рассчитывали по методу Делонга. Пороговое значение для эксплораторной диагностики определяли с помощью максимального индекса Юдена. Доверительные интервалы для порога, чувствительности и специфичности рассчитывали с использованием 2000 стратифицированных бутстреп-реплик с установленным случайным числом (seed) 123. AUC использовали в качестве независимого от порога показателя дискриминации39. Поскольку наборы данных были ретроспективными и формировались с использованием различных тканей, платформ и процедур нормализации, пороги, определенные по индексу Юдена, рассчитывались отдельно для каждого набора данных и рассматривались как эксплораторные пороги, специфичные для конкретного набора. Они не считались стандартизированными клиническими порогами и не переносились напрямую между платформами. Результаты внешнего ROC-анализа представляют собой транскриптомную валидацию, а не проспективную клиническую валидацию. pROC поддерживает расчет доверительных интервалов Делонга для AUC и оптимизацию индекса Юдена через функцию coords(), в то время как доверительные интервалы для координат ROC-кривой могут быть оценены с помощью стратифицированного бутстреп-ресемплинга. ROC-кривые и сводные данные о дискриминации генов-кандидатов в наборах данных для поиска при СКВ и RPL представлены на Рисунке 7.

figure-protocol-6
Рисунок 7. ROC-анализ (анализ рабочих характеристик приемника) генов-кандидатов. 
(A) ROC-кривая для IFI27 в открывающем наборе данных по системной красной волчанке (СКВ). (B) ROC-кривая для CXCL11 в открывающем наборе данных по СКВ. (C) Сводные данные по диагностической эффективности IFI27 и CXCL11 в открывающем наборе данных по СКВ. (D) ROC-кривая для IFI27 в открывающем наборе данных по привычному невынашиванию беременности (ПНБ). (E) ROC-кривая для CXCL11 в открывающем наборе данных по ПНБ. (F) Сводные данные по диагностической эффективности IFI27 и CXCL11 в открывающем наборе данных по ПНБ. Значения площади под кривой (AUC) представлены с 95% доверительными интервалами (CI). Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

ssGSEA-анализ иммунной инфильтрации:
Учитывая роль дисрегуляции иммунных клеток в патогенезе СКВ и РПЛ40,41, обогащение иммунными клетками было вычислено для исследовательских наборов данных GSE61635 и GSE165004. Анализ проводился отдельно для каждого набора данных, объединение данных не осуществлялось. Коллекция генных сигнатур иммунных клеток состояла из наборов маркерных генов для 28 популяций иммунных клеток, описанных Charoentong et al.42. Исходная дополнительная таблица генных сигнатур была преобразована в именованный список наборов генов с использованием официальных символов генов человека. Дублирующиеся символы внутри каждого набора генов были удалены. Гены, отсутствующие в соответствующей матрице экспрессии, были отсеяны, а наборы генов, содержащие менее пяти совпадающих генов после сопоставления идентификаторов, были исключены из данного набора данных. Анализ обогащения наборов генов в единичном образце (ssGSEA) был выполнен с использованием GSVA версии 1.52.3 (RRID:SCR_021058) и GSEABase версии 1.66.0. В GSVA версии 1.52.3 требуется объект параметров, специфичный для метода. Были использованы следующие параметры: minSize = 5, maxSize = 500, alpha = 0.25, normalize = TRUE и checkNA = "yes.

Параметр alpha был установлен на значении 0.25, и была включена финальная нормализация показателей ssGSEA. После сопоставления с матрицей экспрессии наборы генов были ограничены диапазоном от 5 до 500 генов. Для обеспечения согласованности вычислений на разных системах использовалось однопоточное выполнение. Параметр kcdf не использовался, так как он не является параметром процедуры ssgseaParam() в GSVA версии 1.52.3. Метод ssGSEA позволяет получить относительные показатели обогащения наборов генов на уровне образцов, а не экспериментально измеренное количество иммунных клеток или абсолютные клеточные фракции43. Рабочий процесс GSVA 1.52.3 требует наличия объекта параметров, специфичного для конкретного метода; параметры ssGSEA включают alpha, нормализацию показателей и ограничения по размеру наборов генов.

Для каждого иммуно-клеточного профиля значения ssGSEA сравнивали между группами заболевания и контроля с помощью двухстороннего критерия суммы рангов Уилкоксона. Значения P для 28 сравнений типов клеток корректировали отдельно в каждом наборе данных с использованием метода Бенджамини–Хохберга. Иммуно-клеточные профили с скорректированным значением P < 0.05 считались дифференциально обогащенными.

Корреляции рангов Спирмена рассчитывались между экспрессией генов-кандидатов и показателем ssGSEA для каждой сигнатуры иммунных клеток внутри каждого набора данных. Значения P для корреляций корректировались с использованием метода Бенджамини–Хохберга для всех комбинаций «ген-кандидат — иммунная клетка» в соответствующем наборе данных. Корреляции считались статистически значимыми при скорректированном значении P < 0.05. Матрицы корреляции были визуализированы с помощью ggcorrplot версии 0.1.4.1, а графики сравнения групп были построены с использованием ggplot2 версии 3.5.1.

Для всех статистических тестов использовались исходные нормализованные показатели ssGSEA. Тепловые карты и стековые визуализации применялись только для описательного представления. Полученные показатели не описывались как прямые пропорции иммунных клеток, а наблюдаемые связи интерпретировались как вычислительные корреляции, а не как экспериментально доказанные взаимодействия между клетками и генами. Профили обогащения сигнатур иммунных клеток, сравнения групп и корреляции с экспрессией генов-кандидатов представлены на Рисунке 8.

figure-protocol-7
Рисунок 8Обогащение сигнатуры иммунных клеток и корреляции с общими генами-кандидатами при системной красной волчанке и привычном невынашивании беременности. 
(A) Тепловая карта иерархической кластеризации показателей анализа обогащения наборов генов для одного образца (ssGSEA) для 28 сигнатур иммунных клеток в открывающем наборе данных по системной красной волчанке (СКВ). (B) Сравнение показателей ssGSEA для сигнатур иммунных клеток у пациентов с СКВ и в группе здорового контроля. (C) Тепловая карта корреляции Спирмена, демонстрирующая взаимосвязь между экспрессией IFI27 и CXCL11 и показателями ssGSEA для 28 сигнатур иммунных клеток в открывающем наборе данных по СКВ. (D) Тепловая карта иерархической кластеризации показателей ssGSEA для 28 сигнатур иммунных клеток в открывающем наборе данных по привычному выкидыванию (ПВ). (E) Сравнение показателей ssGSEA для сигнатур иммунных клеток у пациентов с ПВ и в группе фертильного контроля. (F) Тепловая карта корреляции Спирмена, демонстрирующая взаимосвязь между экспрессией IFI27 и CXCL11 и показателями ssGSEA для 28 сигнатур иммунных клеток в открывающем наборе данных по ПВ. Корреляции рассчитывались с использованием ранговой корреляции Спирмена, и P значения были скорректированы с использованием метода Бенджамини–Хохберга. P < 0.05; ** P < 0.01; *** P < 0,001; ns — статистически не значимо. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Результаты

Анализ МР
После выбора инструментов и согласования данных для прямого анализа МР было сохранено 16 СНП, при этом СКВ рассматривался как воздействие, а количество спонтанных выкидышей — как исход. Подробная информация об инструментальных переменных приведена в дополнительной таблице 1. У всех сохранённых СНП значения F-статистики превышали 10, что указывает на малую вероятность наличия смещения из-за слабых инструментов. Каждый из сохранённых СНП также был проанализирован с помощью PhenoScanner V2, и ни один СНП, ассоциированный с aPL, не был выявлен. Анализ MR-PRESSO не выявил выбросов. Тест Q Кохрана не показал значимой гетерогенности между оценками, специфичными для СНП (Q = 16,12, P = 0,31); поэтому был применён модельный метод IVW с фиксированными эффектами. Тест перехвата по MR-Egger не указал на направленную горизонтальную плейотропию (P = 0,69). Анализ IVW показал статистически значимую, но количественно умеренную положительную связь между генетически предсказанным СКВ и числом спонтанных выкидышей (отношение шансов [OR] = 1,01, 95% доверительный интервал [CI] = 1,00–1,02, P < 0,01; Рисунок 2A). Оценки эффекта, полученные с использованием регрессии MR-Egger (OR = 1,01, 95% CI = 1,00–1,03, P = 0,16), метода взвешенной медианы (OR = 1,01, 95% CI = 1,00–1,02, P = 0,17) и метода взвешенного модуса (OR = 1,01, 95% CI = 0,99–1,03, P = 0,42), были согласованы по направлению с оценкой IVW, хотя по отдельности они не достигли статистической значимости. Анализ с исключением по одному показал, что исключение любого отдельного СНП не изменяло существенно объединённую оценку, а приблизительно симметричный график воронки не дал визуальных доказательств того, что результат обусловлен выраженной направленной плейотропией. Соответствующие диаграмма рассеяния, лесная диаграмма по СНП, анализ с исключением по одному и график воронки представлены в дополнительных рисунках 1–4.

При обратном МР-анализе после отбора инструментов осталось 16 СНП, все они имели значения F-статистики выше 10 (Дополнительная таблица 2). Анализ MR-PRESSO не выявил выбросов. Критерий Q Кохрена не показал значимой гетерогенности (Q = 13,41, P = 0,50), а тест перехвата по методу MR-Egger не выявил признаков направленного горизонтального плейотропного эффекта (P = 0,41). Оценка по методу IVW не подтвердила ассоциации между генетически предсказанным числом спонтанных выкидышей и риском СКВ (OR = 0,93, 95% ДИ = 0,21–4,23, P = 0,93; Рисунок 2B). В совокупности результаты МР-анализа свидетельствуют о слабой ассоциации в прямом направлении — от генетически предсказанного СКВ к числу спонтанных выкидышей, тогда как обратный анализ не подтвердил наличия ассоциации от генетически предсказанного числа спонтанных выкидышей к риску СКВ.

Биоинформатический анализ
Анализ дифференциальной экспрессии:
Анализ дифференциальной экспрессии для набора данных GSE61635 выявил 976 ДЭГ между группами пациентов с СКВ и здоровых доноров, включая 678 генов с повышенной и 298 генов со сниженной экспрессией (Рисунок 3C). Анализ набора данных GSE165004 выявил 1249 ДЭГ между группами с РПЛ и контрольной группой, включая 578 генов с повышенной и 671 ген со сниженной экспрессией (Рисунок 3D). Тепловые карты, отображающие 50 наиболее значимых ДЭГ в двух исследовательских наборах данных, представлены на Рисунке 3A и Рисунке 3B. Кроме того, в обоих наборах данных было выявлено 59 общих ДЭГ (Рисунок 3E). Эти общие ДЭГ образовали набор генов, использованный в последующих анализах функционального обогащения и сетевого анализа.

Анализ функционального обогащения пересекающихся ДЭГ:
59 общих ДЭГ были подвергнуты анализу обогащения по онтологиям генов (GO) и путям KEGG с использованием DAVID. В категории биологических процессов общие ДЭГ были обогащены терминами, связанными с защитным ответом на вирус, ответом на вирус, отрицательной регуляцией репликации вирусного генома, врождённым иммунным ответом против вирусов, отрицательной регуляцией апоптоза и клеточной адгезией. Среди обогащённых терминов клеточных компонентов выделялись внеклеточная область, мембрана эндоплазматического ретикулума, актиновый цитоскелет и мембрана. Среди обогащённых молекулярных функций была выявлена связывающая активность по отношению к ионам кальция. Анализ KEGG показал обогащение путей, связанных с гепатитом C и гриппом A (Рисунок 4A). Эти результаты указывают на то, что общие ДЭГ в основном ассоциированы с антивирусными и иммунными биологическими процессами, что даёт функциональное обоснование для генов, общих для наборов данных SLE и RPL.

Сеть взаимодействий белков и выявление ключевых генов
59 общих ДЭГ были загружены в STRING для построения сети взаимодействий белков с минимальным порогом достоверности взаимодействия 0,400. Полученная сеть содержала 59 узлов и 80 рёбер. Сеть была импортирована в Cytoscape версии 3.10.0 для визуализации, а изолированные узлы были удалены до проведения топологического анализа (Рисунок 4B). Ранжирование ключевых генов выполнено с помощью плагина cytoHubba. Было применено шесть алгоритмов: максимальная центральность по максимальным кликам (MCC), максимальная компонента окрестности (MNC), компонента с перколяцией по рёбрам (EPC), степень узла (Degree), близость (Closeness) и радиальность (Radiality). Одни и те же 10 генов оказались среди наиболее значимых по результатам всех шести алгоритмов: RSAD2, RTP4, IFIT3, IFI27, IFI44, GBP1, MX1, OAS1, IFIT1 и CXCL11 (Таблица 3). Эти гены были выбраны в качестве кандидатов в ключевые узлы сети для последующей регрессии ЛАССО.

Регрессионный анализ LASSO выявил IFI27 и CXCL11 в качестве общих кандидатных генов
10 кандидатных центральных генов были подвергнуты регрессионному анализу LASSO в наборах данных по СКВ и НПО, использованных для первоначального выявления. В наборе данных по СКВ четыре гена сохранили ненулевые коэффициенты при выбранном значении параметра lambda: IFIT3, IFI27, IFI44 и CXCL11 с коэффициентами 2,575, 0,057, 2,359 и 0,307 соответственно (Рисунок 5A,B). В наборе данных по НПО ненулевые коэффициенты сохранили четыре гена: IFI27, GBP1, OAS1 и CXCL11 с коэффициентами −0,897, 0,167, −1,007 и −0,519 соответственно (Рисунок 5C,D). Сравнение генов, отобранных двумя моделями, специфичными для каждого заболевания, позволило выявить IFI27 и CXCL11 в качестве общих кандидатных генов, отобранных методом LASSO. Эти два гена были далее проанализированы в наборах данных для первоначального выявления и внешней валидации.

Внешняя валидация экспрессии IFI27 и CXCL11
Паттерны экспрессии двух кандидатных генов оценивали с использованием независимых наборов данных для валидации GSE50772 и GSE198700, полученных из базы данных GEO. В наборе данных GSE61635 экспрессия как IFI27, так и CXCL11 была значимо повышена в группе пациентов с СКВ по сравнению с группой здоровых контрольных субъектов (Рисунок 6A,B). В независимом наборе данных для валидации СКВ (GSE50772) экспрессия IFI27 оставалась значимо повышенной (Рисунок 6C), тогда как различия в экспрессии CXCL11 между группами не были значимыми (Рисунок 6D). В наборе данных по РПЛ (GSE165004) экспрессия как IFI27, так и CXCL11 была значимо снижена в группе с РПЛ по сравнению с контролем (Рисунок 6E,F). В независимом наборе данных для валидации РПЛ (GSE198700) экспрессия IFI27 оставалась значимо сниженной в группе с РПЛ (Рисунок 6G), тогда как CXCL11 не был обнаружен. В целом, IFI27 демонстрировал согласованную дифференциальную экспрессию во всех наборах данных — как при СКВ, так и при РПЛ, включая этапы открытия и валидации. Напротив, результаты по CXCL11 не были последовательно воспроизведены в независимых наборах данных для валидации. Соответственно, IFI27 был выбран в качестве общего кандидатного биомаркера для последующих анализов.

Исследовательская оценка диагностической дискриминации
Для оценки способности экспрессии IFI27 и CXCL11 различать образцы от больных и контрольные образцы в проанализированных ретроспективных транскриптомных наборах данных был проведён анализ рабочих характеристик приёмника (ROC). Для СКВ IFI27 показал площадь под ROC-кривой (AUC) 0,822 (95% ДИ = 0,752–0,892; Рисунок 7A), тогда как CXCL11 показал AUC 0,852 (95% ДИ = 0,786–0,917; Рисунок 7B). Сравнение ROC-кривых для двух кандидатных генов в наборе данных СКВ представлено на Рисунке 7C. Для РПЛ IFI27 показал AUC 0,872 (95% ДИ = 0,773–0,970; Рисунок 7D), тогда как CXCL11 показал AUC 0,668 (95% ДИ = 0,513–0,882; Рисунок 7E). Сравнение ROC-кривых для двух кандидатных генов в наборе данных РПЛ показано на Рисунке 7F. IFI27 продемонстрировал значения AUC выше 0,80 в обоих наборах данных заболеваний и показал более согласованные результаты внешней валидации по сравнению с CXCL11 в различных наборах данных по экспрессии. Эти результаты подтверждают IFI27 в качестве кандидатного биомаркера для дальнейшей оценки. Однако, поскольку анализ ROC был проведён с использованием ретроспективных публичных транскриптомных наборов данных, результаты следует рассматривать как исследовательские доказательства транскриптомной дискриминации, а не как проспективную клиническую диагностическую валидацию.

Вычислительная оценка иммунной инфильтрации
Для оценки обогащения 28 сигнатурами иммунных клеток в наборах данных GSE61635 и GSE165004, использованных в исследовании, был проведён ssGSEA. Тепловые карты обогащения иммунных клеток для наборов данных СКВ и РПЛ показаны соответственно на рисунке 8A,D, тогда как соответствующие сравнения групп по баллам ssGSEA представлены на рисунке 8B,E. В наборе данных СКВ баллы сигнатур нескольких типов иммунных клеток значительно различались между пациентами с СКВ и здоровыми контрольными субъектами, включая CD8+ Т-клетки, CD4+ Т-клетки, В-клетки, дендритные клетки, Т-хелперы 1 типа (Th1), Т-хелперы 2 типа (Th2), Т-хелперы 17 типа (Th17), естественные киллеры, макрофаги, эозинофилы, тучные клетки, моноциты и нейтрофилы (рисунок 8B). В наборе данных РПЛ баллы ssGSEA для активированных CD8+ Т-клеток, активированных CD4+ Т-клеток, эффекторных CD4+ Т-клеток памяти, Th17-клеток и моноцитов были выше в группе РПЛ по сравнению с контрольной группой. Напротив, баллы ssGSEA для регуляторных Т-клеток (Treg) и макрофагов в группе РПЛ были ниже, чем в контрольной группе (рисунок 8E). Анализ корреляции показал, что в наборе данных СКВ экспрессия IFI27 и CXCL11 положительно коррелировала с баллами ssGSEA активированных CD4+ Т-клеток, естественных киллеров, Th2-клеток и центральных CD8+ Т-клеток памяти и отрицательно коррелировала с баллом ssGSEA Th1-клеток (рисунок 8C). В наборе данных РПЛ экспрессия IFI27 положительно коррелировала с баллами ssGSEA Treg и Th2-клеток, тогда как экспрессия CXCL11 положительно коррелировала с баллом ssGSEA эозинофилов (рисунок 8F).

Доступность данных:
В ходе данного исследования не были получены новые первичные данные от участников-людей. Все анализы были основаны исключительно на общедоступных сводных статистических данных исследований ассоциаций на уровне генома (GWAS) и транскриптомных наборах данных. Сводные статистические данные GWAS по СКВ были получены из FinnGen Release 11 (номер доступа: finngen_R11_L12_LUPUS). Сводные статистические данные по количеству спонтанных выкидышей были получены из ресурса IEU OpenGWAS (номер доступа: ukb-b-419), основанного на данных UK Biobank. Транскриптомные наборы данных были получены из Национального центра биотехнологической информации, базы данных Gene Expression Omnibus (GEO), под номерами доступа GSE61635, GSE165004, GSE50772 и GSE198700. Общедоступные наборы данных можно получить в следующих репозиториях:

--  FinnGen Выпуск 11: https://r11.finngen.fi/
--  IEU OpenGWAS: https://gwas.mrcieu.ac.uk/
--  Геномная экспрессия, база данных (GEO): https://www.ncbi.nlm.nih.gov/geo/

Обработанные данные, подтверждающие результаты данного исследования, включены в статью и Дополнительные материалы. Данные на уровне отдельных участников или персонально идентифицируемая информация не использовались и не сохранялись. Аналитический рабочий процесс был выполнен с использованием общедоступного программного обеспечения и пакетов, как описано в Протоколе.

Дополнительный файл 1. Заполненный контрольный список отчетности STROBE-MR.
Заполненный контрольный список Укрепление отчетности об обсервационных исследованиях в эпидемиологии с использованием менделевского рандомизированного анализа (STROBE-MR), в котором указано, где в рукописи рассматриваются рекомендованные пункты отчетности. Нажмите здесь, чтобы загрузить этот файл.

Дополнительный рисунок 1. Диаграмма рассеяния для прямого анализа менделевского оценивания.
Диаграмма рассеяния, показывающая ассоциации между генетическими эффектами инструментальных однонуклеотидных полиморфизмов (SNP) на системную красную волчанку (SLE) и количеством спонтанных выкидышей. Каждая точка представляет один SNP, горизонтальные и вертикальные планки погрешностей указывают стандартные ошибки оценок эффекта SNP. Линии регрессии соответствуют методам менделевского оценивания с обратным взвешиванием дисперсии, MR-Egger, взвешенной медиане и взвешенному моду. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.

Дополнительный рисунок 2. Оценки причинно-следственной связи, специфичные для однонуклеотидного полиморфизма, полученные в прямом анализе менделевской рандомизации.
Лесная диаграмма, показывающая оценку причинного эффекта для каждого инструментального однонуклеотидного полиморфизма (SNP) в ассоциации между системной красной волчанкой (SLE) и числом спонтанных выкидышей. Чёрные точки обозначают оценки эффекта, специфичные для SNP, с 95% доверительными интервалами. Красные точки обозначают общие оценки причинного эффекта, полученные с использованием методов взвешивания по обратной дисперсии и MR-Egger. Вертикальная пунктирная линия указывает на отсутствие эффекта. Пожалуйста, нажмите сюда, чтобы загрузить этот файл.

Дополнительный рисунок 3. Анализ чувствительности методом исключения по одному в прямом анализе менделевской рандомизации.
Лесная диаграмма, показывающая результаты анализа чувствительности методом исключения по одному, оценивающего связь между системной красной волчанкой (СКВ) и количеством спонтанных выкидышей. Каждая чёрная точка представляет общую оценку причинного эффекта с взвешиванием по обратной дисперсии после последовательного исключения одного инструментального однонуклеотидного полиморфизма (SNP), а горизонтальные линии указывают соответствующие 95% доверительные интервалы. Красная точка представляет общую оценку с взвешиванием по обратной дисперсии, полученную с использованием всех инструментальных SNP. Вертикальная пунктирная линия указывает отсутствие эффекта. Пожалуйста, нажмите сюда, чтобы загрузить этот файл.

Дополнительный рисунок 4. Воронкообразный график прямого анализа менделевской рандомизации.
Воронкообразный график, показывающий распределение оценок причинно-следственных эффектов для отдельных СНП при ассоциации между системной красной волчанкой (СКВ) и количеством спонтанных выкидышей. Каждая точка представляет один инструментальный однонуклеотидный полиморфизм (СНП). Вертикальные линии указывают общие оценки причинно-следственных эффектов, полученные с использованием методов взвешивания по обратной дисперсии и MR-Egger. По оси ординат отложено обратное значение стандартной ошибки (1/SE). Пожалуйста, нажмите здесь, чтобы загрузить этот файл.

Дополнительная таблица 1. Инструментальные однонуклеотидные полиморфизмы, отобранные для прямого анализа менделевского рандомизированного исследования. 
В таблице перечислены инструментальные однонуклеотидные полиморфизмы (SNPs), использованные для прямого анализа менделевского рандомизированного исследования системной красной волчанки и числа спонтанных выкидышей, включая ближайший аннотированный ген, хромосому, геномную позицию, эффектный аллель, частоту эффектного аллеля, размер эффекта (Beta), стандартную ошибку (SE), P значение и F статистику. Хромосомные позиции основаны на исходной сборке генома, использованной в исследовании ассоциаций на геномном уровне. F статистика рассчитывалась как Beta2/SE2. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.

Дополнительная таблица 2. Инструментальные однонуклеотидные полиморфизмы, отобранные для обратного анализа менделевского оздоравливания. 
В таблице перечислены инструментальные однонуклеотидные полиморфизмы (SNPs), использованные для обратного анализа менделевского оздоравливания, в котором количество спонтанных выкидышей рассматривалось как воздействие, а системная красная волчанка — как исход. В таблицу включены ближайший аннотированный ген, хромосома, геномная позиция, эффектный аллель, частота эффектного аллеля, размер эффекта (Beta), стандартная ошибка (SE), P значение и F-статистика. Хромосомные позиции указаны в соответствии со сборкой исходного генома, использованной в исследовании ассоциаций на геномном уровне. F-статистика рассчитывалась как Beta2/SE2. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.

Обсуждение

С помощью двунаправленного анализа мендельевской рандомизации (MR) в сочетании с многомерным биоинформатическим анализом в данном исследовании была выявлена положительная причинно-следственная связь между системной красной волчанкой (СКВ) и привычным выкидышем (ПВ), а также проведен систематический поиск общих транскриптомных биомаркеров. Насколько нам известно, это первое исследование, в котором для изучения данной взаимосвязи были интегрированы двунаправленная MR, транскриптомный анализ и анализ иммунной инфильтрации. Несмотря на то, что наблюдаемый размер эффекта MR был умеренным (IVW OR = 1.01), эта связь последовательно подтверждалась несколькими дополнительными методами MR и анализами чувствительности без признаков существенной гетерогенности, горизонтального плейотропии или влиятельных выбросов, что указывает на статистическую надежность, но количественно малый характер наблюдаемой взаимосвязи. Следовательно, полученные результаты следует интерпретировать как свидетельство умеренного генетического вклада СКВ в предрасположенность к ПВ, а не как значимый клинический эффект. Интегрируя причинно-следственный вывод с транскриптомной валидацией и анализом иммунной инфильтрации, данная работа предлагает воспроизводимую основу для приоритизации кандидатных биомаркеров сложных иммуноопосредованных репродуктивных расстройств. В исследовании, проведенном в Египте в период с 2007 по 2021 год, в которое было включено 123 женщины с СКВ и всего 201 беременность, сообщалось, что 20.4% беременностей у женщин с СКВ закончились потерей плода44. Предыдущие исследования также указывали на то, что СКВ является важным фактором риска ПВ, поскольку иммунная дисрегуляция может повышать вероятность потери беременности12.

Биоинформатический анализ показал, что 59 общих дифференциально экспрессируемых генов (ДЭГ) были преимущественно обогащены в путях, связанных с противовирусным иммунным ответом, клеточной адгезией и регуляцией апоптоза. Вирусная инфекция может способствовать патогенезу системной красной волчанки (СКВ). Пациенты с СКВ часто демонстрируют дисфункцию как врожденного, так и адаптивного иммунного ответа45,46, что делает их более восприимчивыми к вирусным инфекциям. Эта повышенная восприимчивость может способствовать потере беременности через такие механизмы, как воспаление плаценты и повреждение клеток плаценты47. Поскольку трофобластные клетки являются важнейшим компонентом плаценты, изменения в аутофагии и биологическом поведении этих клеток также связывают с возникновением привычного рецидивирующего выкидыша (ПРВ)48,49. Совокупно эти наблюдения позволяют предположить, что иммунная дисрегуляция, связанная с СКВ, может влиять на исходы беременности, воздействуя на функцию трофобластных клеток. В ходе дальнейшего анализа IFI27 и CXCL11 были определены как потенциальные центральные (hub) гены, общие для СКВ и ПРВ. Однако для последующих анализов приоритет был отдан IFI27, поскольку он продемонстрировал большую биологическую согласованность в независимых наборах данных. Хотя оба гена были отобраны моделью LASSO, только IFI27 показал стабильную дифференциальную экспрессию как в исследуемом, так и во внешних валидационных наборах данных, в то время как CXCL11 не был последовательно воспроизведен в валидационных выборках. Кроме того, IFI27 продемонстрировал более высокую диагностическую значимость при ПРВ и оставался существенно дисрегулированным в наборах данных по крови и репродуктивным тканям. В совокупности эти результаты подтверждают, что IFI27 является более надежным кандидатом в биомаркеры, чем CXCL11, хотя требуется дополнительная экспериментальная валидация. Валидация с использованием набора данных СКВ GSE50772 и набора данных ПРВ GSE198700 показала, что экспрессия IFI27 оставалась стабильно дисрегулированной во всех валидационных выборках. Примечательно, что IFI27 был гиперэкспрессирован в образцах крови пациентов с СКВ, что согласуется с предыдущими исследованиями50, но был подавлен в образцах эндометрия и ворсин хориона пациентов с ПРВ. Эта противоположная картина может отражать различия между системной иммунной дисрегуляцией и локальной иммунной средой на материнско-плацентарном интерфейсе при СКВ, осложненной ПРВ.

IFI27 представляет собой интерферон-стимулируемый ген, участвующий в противовирусном иммунитете, интерфероновом сигналинге и иммунных ответах хозяина после вирусной инфекции51,52. При нормальном течении беременности экспрессия IFI27 заметно повышена в клетках трофобласта53, что указывает на важную физиологическую роль в поддержании функции трофобласта. Напротив, наши анализы продемонстрировали снижение экспрессии IFI27 в эндометрии и ворсинках хориона у пациенток с привычной потерью беременности (RPL). Хотя этот результат отличается от некоторых предыдущих отчетов54, его следует интерпретировать с осторожностью, поскольку в данном исследовании интегрировались транскриптомные наборы данных, полученные из разных тканей, а не из сопоставленных материнско-плодных образцов. Одним из возможных объяснений является то, что хроническая системная активация интерферона I типа при СКВ вызывает стойкий интерфероновый сиглинг в циркулирующих иммунных клетках, одновременно способствуя десенсибилизации рецепторов, иммунному истощению или включению компенсаторных механизмов отрицательной обратной связи на материнско-плодном интерфейсе. В качестве альтернативы, тканеспецифическая эпигенетическая регуляция или различия в клеточном составе между периферической кровью и репродуктивными тканями могут подавлять локальную экспрессию IFI27, несмотря на системную активацию интерферона. Эти гипотезы остаются спекулятивными и требуют механистического подтверждения с использованием сопоставленных образцов материнской крови, ткани эндометрия и трофобласта, в идеале на уровне отдельных клеток, чтобы разграничить тканеспецифические и клеточно-специфические регуляторные механизмы55.

Анализ иммунной инфильтрации выявил значительные различия в сигнатурах иммунных клеток как при СКВ, так и при РПЛ, что характеризовалось прежде всего изменениями в популяциях, связанных с CD4+ T-клетками. Экспрессия IFI27 положительно коррелировала с обогащением Th2-клетками при обоих заболеваниях; однако эти результаты представляют собой вычислительные корреляции, полученные с помощью ssGSEA, а не экспериментально подтвержденные биологические взаимодействия. Предыдущие исследования показали, что периферическая кровь пациентов с СКВ содержит пониженную долю Th1- и Treg-клеток, но повышенную долю Th2-клеток56,57, что согласуется с нашими данными. При нормальной беременности иммунный баланс Th1/Th2 на материно-плодном интерфейсе смещается в сторону доминирования Th258. Таким образом, снижение экспрессии IFI27 в репродуктивных тканях может отражать изменения локального иммунного гомеостаза, связанные с нарушением материно-плодной толерантности, хотя вопрос о том, регулирует ли IFI27 этот процесс напрямую, остается открытым и требует экспериментального подтверждения.

Следует признать ряд ограничений. Во-первых, хотя результаты МР-анализа подтвердили наличие причинно-следственной связи, расчетный генетический эффект был относительно небольшим, что позволяет предположить, что СКВ представляет собой лишь один из компонентов многофакторного патогенеза РПЛ. Во-вторых, транскриптомная интеграция включала наборы данных, полученные из различных тканей (периферическая кровь, эндометрий и ворсины хориона), с использованием разных микрочиповых платформ и независимых когорт, что могло привести к биологической и технической неоднородности, несмотря на последовательную валидацию IFI27. В-третьих, когорта внешней валидации для ворсин хориона включала ограниченное количество образцов, что могло снизить статистическую мощность и обобщаемость результатов. В-четвертых, поскольку общедоступные наборы данных содержали ограниченную клиническую информацию, не удалось в полной мере оценить важные факторы, включая активность заболевания, статус антифосфолипидных антител, прием лекарственных препаратов, стадию беременности и другие клинические ковариаты. Наконец, несмотря на то, что скрининг с помощью PhenoScanner минимизировал потенциальное плеотропное искажение в МР-анализе, вероятность остаточного искажения нельзя полностью исключить.

С точки зрения трансляционной медицины, IFI27 в настоящее время следует рассматривать как потенциальный биомаркер, а не как клинически валидированный диагностический маркер. Перед внедрением в клиническую практику необходимы проспективные многоцентровые исследования для подтверждения его диагностической эффективности в различных популяциях, создания стандартизированных платформ анализа и определения диагностических порогов, а также для выяснения того, как стадия беременности, активность заболевания и иммуносупрессивная терапия влияют на экспрессию IFI27. Функциональные эксперименты в сочетании с пространственной транскриптомикой и одноклеточным транскриптомным анализом также будут иметь решающее значение для выяснения того, вносит ли IFI27 активный вклад в иммунорегуляцию между матерью и плодом или просто отражает иммунную активацию, вызванную интерфероном.

Раскрытие информации

Конфликт интересов:
Авторы заявляют об отсутствии конкурирующих финансовых или нефинансовых интересов.

Благодарности

Данная работа была поддержана ключевым проектом по интеграции традиционной китайской и западной медицины при лечении основных сложных заболеваний Муниципального управления традиционной китайской медицины Пекина (2023BJSZDYNJBXTGG-003), государственным общественным научно-исследовательским фондом для фундаментальных исследований институтов (ZZ16-XRZ-038) и проектом по продвижению высокоуровневых китайских медицинских госпиталей (HLCMHPP2023087). Источники финансирования не принимали участия в планировании исследования, сборе, анализе и интерпретации данных, подготовке рукописи или принятии решения о представлении рукописи к публикации. Авторы благодарят исследователей и участников исследования FinnGen, UK Biobank и Национальный центр биотехнологической информации Gene Expression Omnibus (GEO) за предоставление открытого доступа к их наборам данных. Авторы также выражают признательность консорциуму FinnGen, который объединяет образцы финских биобанков с общенациональными данными реестров здравоохранения посредством сотрудничества финских исследовательских организаций, биобанков и международных партнеров.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
набор из 28 генных сигнатур иммунных клетокОпубликованный дополнительный ресурс генных сигнатурДополнительный список генов-маркеров иммунных клеток, описанный Charoentong et al. (ссылка 42)Неприменимо
RRID: Недоступно
Цель / примечания: Сигнатуры иммунных клеток, используемые для ssGSEA.
CNSknowallвеб-платформа CNSknowallвыходные файлы DAVIDНеприменимо
RRID: Недоступно
Цель / примечания: Визуализация отфильтрованных результатов функционального обогащения.
Компьютерная рабочая станцияИнституциональная вычислительная средаНеприменимоНеприменимо
RRID: Неприменимо
Цель / примечания: Вычислительный анализ.
Расходные материалыНеприменимоНеприменимоНеприменимо
RRID: Неприменимо
Цель / примечания: Расходные материалы для работы в «мокрой» лаборатории не использовались.
CytoscapeКонсорциум CytoscapeНе применимо3.10.0
RRID: SCR_003032
Цель / примечания: Белок–визуализация сетей белковых взаимодействий и топологический анализ
cytoHubbaМагазин приложений CytoscapeНеприменимо0.1
RRID: SCR_017677
Цель / примечания: Ранжирование хаб-генов с использованием MCC, MNC, EPC, степени центральности, близости и радиальности.
Инструмент функциональной аннотации DAVIDНациональные институты здравоохранения / Национальный институт ракаЗагруженные общие списки дифференциально экспрессируемых генов (DEG) и фоновых генов2021
RRID: SCR_001881
Цель / примечания: Анализ обогащения генных онтологий (Gene Ontology) и путей KEGG.
Европейская эталонная панель неравновесного сцепления (LD)Проект «1000 геномов» / IEU OpenGWASЕвропейская панель фазы 3 (варианты, совместимые с GRCh37)Фаза 3
RRID: Не сообщается
Цель / примечания: Клампинг неравновесного сцепления с использованием рабочего процесса OpenGWAS/TwoSampleMR.
FinnGenКонсорциум FinnGenfinngen_R11_L12_СИСТЕМНАЯ_КРАСНАЯ_ВОЛЧАНКАВыпуск 11
RRID: SCR_022254
Цель / примечания: Сводные статистические данные GWAS для системной красной волчанки.
forestploterCRANНеприменимо1.1.2
RRID: Недоступно
Цель / примечания: Визуализация оценок менделевской рандомизации с помощью форест-графика.
Gene Expression Omnibus (GEO)Национальный центр биотехнологической информацииGSE61635; GSE165004; GSE50772; GSE198700Неприменимо
RRID: SCR_005012
Цель / примечания: Источник транскриптомных наборов данных для первичного поиска и валидации.
Генная онтологияКонсорциум Gene Ontologyтермины GO, полученные с помощью DAVIDаннотации DAVID 2021
RRID: SCR_002811
Цель / примечания: Аннотирование биологических процессов, клеточных компонентов и молекулярных функций.
ggcorrplotCRANНеприменимо0.1.4.1
RRID: Недоступно
Цель / примечания: Визуализация гена-кандидата–корреляционные матрицы иммунных клеток.
ggplot2CRANНеприменимо3.5.1
RRID: SCR_014601
Цель / примечания: Графики вулкан (Volcano plots), диаграммы размаха (box plots) и другие виды статистической графики.
ggvennCRANНе применимо0.1.16
RRID: SCR_025300
Цель / примечания: Визуализация общих дифференциально экспрессируемых генов.
glmnetCRANНеприменимо4.1-8
RRID: SCR_015505
Цель / примечания: Логистическая регрессия LASSO и кросс-валидация.
GSE165004NCBI GEOGSE165004 / GPL16699Обработанная матрица серий
RRID: SCR_005012
Цель / примечания: Набор данных по поиску биомаркеров эндометрия при РПЛ.
GSE198700NCBI GEOGSE198700 / GPL13534Обработанная матрица серий
RRID: SCR_005012
Цель / примечания: Независимый валидационный набор данных по ворсинам хориона при повторных привычных выкидышах.
GSE50772NCBI GEOGSE50772 / GPL570Обработанная матрица серий
RRID: SCR_005012
Цель / примечания: Независимый валидационный набор данных мононуклеарных клеток периферической крови пациентов с СКВ.
GSE61635NCBI GEOGSE61635 / GPL570Обработанная матрица серий
RRID: SCR_005012
Цель / примечания: Набор данных для поиска биомаркеров в цельной крови при СКВ.
GSEABaseBioconductorНеприменимо1.66.0
RRID: Недоступно
Цель / примечания: Управление наборами генов иммунных клеток для ssGSEA.
GSVA (анализ вариации набора генов)BioconductorНеприменимо1.52.3
RRID: SCR_021058
Цель / примечания: Анализ обогащения наборов генов для одного образца (ssGSEA).
IEU OpenGWASПодразделение интегративной эпидемиологии MRCukb-b-419; finngen_R11_L12_LUPUSНеприменимо
RRID: Не сообщается
Цель / примечания: Получение суммарных статистических данных GWAS и гармонизированных данных о генетических ассоциациях.
Киотская энциклопедия генов и геномов (KEGG)Kanehisa LaboratoriesПути KEGG, доступные через DAVIDаннотации DAVID 2021
RRID: SCR_012773
Цель / примечания: Аннотация обогащения путей.
limmaBioconductorНеприменимо3.60.6
RRID: SCR_010943
Цель / примечания: Анализ дифференциальной экспрессии.
MRPRESSOВербанк и др.Неприменимо1
RRID: SCR_023697
Цель / примечания: Выявление горизонтальной плейотропии и атипичных инструментальных переменных.
pheatmapCRANНеприменимо1.0.12
RRID: SCR_016418
Цель / примечания: Тепловые карты экспрессии.
PhenoScanner V2Консорциум PhenoScannerЗапросы фенотипов на уровне однонуклеотидных полиморфизмов (SNP)Версия 2
RRID: Недоступно
Цель / примечания: Скрининг отобранных однонуклеотидных полиморфизмов (SNP) на наличие потенциальных смешивающих ассоциаций с фенотипом.
pROCCRANНе применимо1.18.5
RRID: SCR_024286
Цель / примечания: ROC-кривые, значения AUC, доверительные интервалы Делонга, пороги отсечения по индексу Юдена и бутстреп-доверительные интервалы.
RR Foundation for Statistical ComputingНеприменимо4.4.2
RRID: SCR_001905
Цель / примечания: Среда статистических вычислений.
РеагентыНе применимоНеприменимоНеприменимо
RRID: Неприменимо
Цель / примечания: Реагенты для лабораторных исследований in vitro не использовались.
Пожалуйста, предоставьте исходный текст для перевода.Консорциум STRINGHomo sapiens (таксон 9606); минимальный показатель взаимодействия 0,40011
RRID: SCR_005223
Цель / примечания: Белок–построение сети белок-белковых взаимодействий
TwoSampleMRПодразделение интегративной эпидемиологии MRCНеприменимо0.6.6
RRID: SCR_019010
Цель / примечания: Двунаправленная двухвыборочная менделевская рандомизация: извлечение данных, гармонизация, оценка причинно-следственной связи и анализ чувствительности.
UK BiobankБиобанк Великобритании (UK Biobank)ukb-b-419сводный набор данных за 2018 год
RRID: SCR_012815
Цель / примечания: Сводные статистические данные GWAS для количества самопроизвольных выкидышей.

Ссылки

  1. Petri M. Pregnancy and systemic lupus erythematosus. Best Pract Res Clin Obstet Gynaecol. 2020;64:24-30.
  2. Zhao X, et al. Advances in drug therapy for systemic lupus erythematosus. Curr Med Chem. 2021;28(7):1251-1268.
  3. Stanescu II, et al. Salivary biomarkers of inflammation in systemic lupus erythematosus. Ann Anat. 2018;219:89-93.
  4. Tian J, Zhang D, Yao X, Huang Y, Lu Q. Global epidemiology of systemic lupus erythematosus: A comprehensive systematic analysis and modelling study. Ann Rheum Dis. 2023;82(3):351-356.
  5. Palma Dos Reis CR, et al. Prediction of adverse pregnancy outcomes in women with systemic lupus erythematosus. Clin Rev Allergy Immunol. 2020;59(2):287-294.
  6. Venne K, Scott S, Bernatsky S, Vinet E. Induced abortions in women with systemic lupus erythematosus. Lupus. 2021;30(4):484-488.
  7. Kim JW, et al. Lupus low disease activity state achievement is important for reducing adverse outcomes in pregnant patients with systemic lupus erythematosus. J Rheumatol. 2021;48(5):707-716.
  8. Braga A, et al. Systemic lupus erythematosus and pregnancy: A Portuguese case-control study. Clin Rev Allergy Immunol. 2022;62(2):324-332.
  9. Dimitriadis E, Menkhorst E, Saito S, Kutteh WH, Brosens JJ. Recurrent pregnancy loss. Nat Rev Dis Primers. 2020;6(1):98.
  10. Quenby S, et al. Miscarriage matters: The epidemiological, physical, psychological, and economic costs of early pregnancy loss. Lancet. 2021;397(10285):1658-1667.
  11. Valeff NJ, Ventimiglia MS, Diao L, Jensen F. Lupus and recurrent pregnancy loss: The role of female sex hormones and B cells. Front Endocrinol (Lausanne). 2023;14:1233883.
  12. Gao R, Zeng X, Qin L. Systemic autoimmune diseases and recurrent pregnancy loss: Research progress in diagnosis and treatment. Chin Med J (Engl). 2021;134(17):2140-2142.
  13. Pantham P, Abrahams VM, Chamley LW. The role of anti-phospholipid antibodies in autoimmune reproductive failure. Reproduction. 2016;151(5):R79-R90.
  14. Meroni PL, et al. Updating on the pathogenic mechanisms of antiphospholipid antibody-associated pregnancy loss. Clin Rev Allergy Immunol. 2008;34(3):332-337.
  15. Blank M, Shoenfeld Y. Antiphospholipid antibody-mediated reproductive failure in antiphospholipid syndrome. Clin Rev Allergy Immunol. 2010;38(2–3):141-147.
  16. Babker A, et al. Frequency of ACE I/D and PAI-1 4G/5G polymorphisms in women with recurrent pregnancy loss in Sudan. Biomed Pharmacol J. 2025;18(3):1953-1961.
  17. Babker AM, et al. Detection of human platelet antigen polymorphisms (HPA-1 and HPA-3) and factor XIII mutation in Sudanese women with recurrent pregnancy loss. BMC Res Notes. 2024;17(1):66.
  18. Grover S, Del Greco MF, Stein CM, Ziegler A. Mendelian randomization. Methods Mol Biol. 2017;1666:581-628.
  19. Skrivankova VM, et al. Strengthening the reporting of observational studies in epidemiology using Mendelian randomization: The STROBE-MR statement. JAMA. 2021;326(16):1614-1621.
  20. Emdin CA, Khera AV, Kathiresan S. Mendelian randomization. JAMA. 2017;318(19):1925-1926.
  21. Burgess S, Thompson SG, CRP CHD Genetics Collaboration. Avoiding bias from weak instruments in Mendelian randomization studies. Int J Epidemiol. 2011;40(3):755-764.
  22. Hemani G, et al. The MR-Base platform supports systematic causal inference across the human phenome. eLife. 2018;7:e34408.
  23. Bowden J, Davey Smith G, Burgess S. Mendelian randomization with invalid instruments: Effect estimation and bias detection through Egger regression. Int J Epidemiol. 2015;44(2):512-525.
  24. Bowden J, Davey Smith G, Haycock PC, Burgess S. Consistent estimation in Mendelian randomization with some invalid instruments using a weighted median estimator. Genet Epidemiol. 2016;40(4):304-314.
  25. Hartwig FP, Davey Smith G, Bowden J. Robust inference in summary data Mendelian randomization via the zero modal pleiotropy assumption. Int J Epidemiol. 2017;46(6):1985-1998.
  26. Burgess S, Butterworth A, Thompson SG. Mendelian randomization analysis with multiple genetic variants using summarized data. Genet Epidemiol. 2013;37(7):658-665.
  27. Verbanck M, Chen CY, Neale B, Do R. Detection of widespread horizontal pleiotropy in causal relationships inferred from Mendelian randomization between complex traits and diseases. Nat Genet. 2018;50(5):693-698.
  28. Barrett T, et al. NCBI GEO: Archive for functional genomics data sets—update. Nucleic Acids Res. 2013;41(Database issue):D991-D995.
  29. Keleş İD, et al. Gene pathway analysis of the endometrium at the start of the window of implantation in women with unexplained infertility and unexplained recurrent pregnancy loss: Is unexplained recurrent pregnancy loss a subset of unexplained infertility? Hum Fertil (Camb). 2023;26(5):1129-1141.
  30. Kennedy WP, et al. Association of the interferon signature metric with serological disease manifestations but not global activity scores in multiple cohorts of patients with SLE. Lupus Sci Med. 2015;2(1):e000080.
  31. Matsumoto Y, et al. Characteristic DNA methylation profiles of chorionic villi in recurrent miscarriage. Sci Rep. 2022;12(1):11673.
  32. Sherman BT, Lempicki RA. Systematic and integrative analysis of large gene lists using DAVID bioinformatics resources. Nat Protoc. 2009;4(1):44-57.
  33. Szklarczyk D, et al. STRING v11: Protein–protein association networks with increased coverage, supporting functional discovery in genome-wide experimental datasets. Nucleic Acids Res. 2019;47(D1):D607-D613.
  34. Shannon P, et al. Cytoscape: A software environment for integrated models of biomolecular interaction networks. Genome Res. 2003;13(11):2498-2504.
  35. Jia P, Zheng S, Long J, Zheng W, Zhao Z. dmGWAS: Dense module searching for genome-wide association studies in protein–protein interaction networks. Bioinformatics. 2011;27(1):95-102.
  36. Chin CH, et al. cytoHubba: Identifying hub objects and subnetworks from complex interactome. BMC Syst Biol. 2014;8(Suppl 4):S11.
  37. Mohammadi M. A projection neural network for the generalized Lasso. IEEE Trans Neural Netw Learn Syst. 2020;31(6):2217-2221.
  38. Kumar R, Indrayan A. Receiver operating characteristic (ROC) curve for medical researchers. Indian Pediatr. 2011;48(4):277-287.
  39. de Hond AAH, Steyerberg EW, van Calster B. Interpreting area under the receiver operating characteristic curve. Lancet Digit Health. 2022;4(12):e853-e855.
  40. Xu H, et al. Single-cell transcriptomics reveals CCL3+ classical monocyte subset linked to autoimmune pathogenesis. J Inflamm Res. 2025;18:16273-16291.
  41. Zych M, et al. Surface immune checkpoints as potential biomarkers in physiological pregnancy and recurrent pregnancy loss. Int J Mol Sci. 2024;25(17):9378.
  42. Charoentong P, et al. Pan-cancer immunogenomic analyses reveal genotype-immunophenotype relationships and predictors of response to checkpoint blockade. Cell Rep. 2017;18(1):248-262.
  43. Liu J, Lu J, Wang G, Gu L, Li W. Prognostic characteristics of a six-gene signature based on ssGSEA in sarcoma. Aging (Albany NY). 2024;16(2):1536-1554.
  44. Mokbel A, et al. Pregnancy outcomes among Egyptian women with systemic lupus erythematosus: A prospective cohort study. Lupus. 2023;32(4):521-530.
  45. Illescas-Montes R, Corona-Castro CC, Melguizo-Rodríguez L, Ruiz C, Costela-Ruiz VJ. Infectious processes and systemic lupus erythematosus. Immunology. 2019;158(3):153-160.
  46. Banko A, et al. Epstein-Barr virus infection as a potential indicator of the occurrence and clinical presentation of systemic lupus erythematosus. Front Immunol. 2023;14:1307589.
  47. Nigro G, et al. Role of infections in recurrent spontaneous abortion. J Matern Fetal Neonatal Med. 2011;24(8):983-989.
  48. Yang D, et al. YY1-PVT1 affects trophoblast invasion and adhesion by regulating mTOR pathway-mediated autophagy. J Cell Physiol. 2020;235(10):6637-6646.
  49. Guan D, et al. Immunologic insights in recurrent spontaneous abortion: Molecular mechanisms and therapeutic interventions. Biomed Pharmacother. 2024;177:117082.
  50. Zhao X, et al. Identification of key biomarkers and immune infiltration in systemic lupus erythematosus by integrated bioinformatics analysis. J Transl Med. 2021;19(1):35.
  51. Villamayor L, et al. The IFN-stimulated gene IFI27 counteracts innate immune responses after viral infections by interfering with RIG-I signaling. Front Microbiol. 2023;14:1176177.
  52. Lim FY, et al. High-frequency home self-collection of capillary blood correlates IFI27 expression kinetics with SARS-CoV-2 viral clearance. J Clin Invest. 2023;133(23):e173715.
  53. Apps R, et al. Genome-wide expression profile of first-trimester villous and extravillous human trophoblast cells. Placenta. 2011;32(1):33-43.
  54. Li Y, et al. RNA sequencing of decidua reveals differentially expressed genes in recurrent pregnancy loss. Reprod Sci. 2021;28(8):2261-2269.
  55. Dankers W, et al. Failing maternal-fetal tolerance in SLE (FaMaLE): A prospective cohort study for finding the molecular mechanisms behind pregnancy complications. Lupus Sci Med. 2025;12(1):e001668.
  56. Xiang S, et al. Imbalance of helper T cell type 1, helper T cell type 2, and associated cytokines in patients with systemic lupus erythematosus: A meta-analysis. Front Pharmacol. 2022;13:988512.
  57. Tu J, et al. UC-BSC exosomes regulate Th17/Treg balance in patients with systemic lupus erythematosus via miR-19b/KLF13. Cells. 2022;11(24):4123.
  58. Wang W, et al. T helper (Th) cell profiles in pregnancy and recurrent pregnancy loss: Th1/Th2/Th9/Th17/Th22/Tfh cells. Front Immunol. 2020;11:2025.

Перепечатки и разрешения

Теги

биомаркер IFI27транскриптомный биоинформатический анализдифференциально экспрессируемые геныфункциональный обогатительный анализанализ белок-белковых взаимодействийLASSO-регрессиясигнатуры иммунных клеток