$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании анализировались статистические данные по общегеномному исследованию ассоциаций (GWAS) на уровне деидентифицированной идентичности, которые являются общедоступными. В соответствии с политикой репозитория и одобрениями, полученными первоначальными исследователями, для этого вторичного анализа не требовалось новое одобрение институционального контрольного совета или дополнительное индивидуальное информированное согласие. Все участники GWAS сообщили о процедурах одобрения этики и согласия в своих публикациях источников. Все анализы проводились в соответствии с институциональными руководящими принципами и Хельсинкской декларацией.
Обзор и обоснование
В исследовании была реализована двухнаправленная модель менделевской рандомизации (МР), ограниченная сводной статистикой европейского происхождения, для оценки возможных причинно-следственных связей между рассеянным склерозом (РС) и гематологическими злокачественными опухолиями (ГМ). Дизайн соответствует трём основным предположениям MR: релевантности инструмента, независимости от смешивателей и ограничениям на исключение. Таким образом, рабочий процесс включает (i) доступ к набору данных и кураторство, (ii) выбор инструментов с геномной значимостью с сгруппированием дисбаланса связи (LD), (iii) скрининг смешения с помощью PhenoScanner, (iv) гармонизацию аллелей с явной обработкой палиндромных вариантов, (v) оценку направленности с помощью теста Steiger¹², (vi) первичную МР-оценку с помощью дополнительных методов, (vii) полный набор диагностики чувствительности и (viii) стандартизированную генерацию рисунков и таблиц под Многократное тестирование контроля. Каждый из этих шагов подробно описан в последующих подразделах протокола, а обзор конвейера представлен на рисунке 1.
Материалы, программное обеспечение и RRIDs
Анализы проводились в версии R 4.3.1 (RRID:SCR_001905) с использованием RStudio/Posit 2023.12+ (RRID:SCR_000432). Локальное объединение LD использовало PLINK версии 1.9 (сборка 2.3; RRID:SCR_001757)13. Оценка и извлечение данных MR использовали пакет R TwoSampleMR v0.5.7 10; Поиск инструментов для потенциальных объединяющих инструментов использовал Phenoscanner версии 1.0; обнаружение и коррекция выбросов использовали MRPRESSO v1.0. Точные версии приводятся для пакетов без RRID.
Источники данных и доступ
Сводные статистические данные по РС были получены из метаанализа Международного консорциума по генетике рассеянного склероза, включающего 47 429 случаев РС и 68 374 контрольных группы с гармонизированным контролем качества в 15 когортах. Сводные статистические данные HM были получены из FinnGen (общий n = 218 792; >16 миллионов вариантов) и включали лимфома Ходжкина (HL), диффузную крупно-B-клеточную лимфому (DLBCL), фолликулярную лимфому (FL), зрелые T/NK-клеточные лимфомы (MTNKL), другие или неуточнённые неходжкинские лимфомы (NHL), лимфоидный лейкоз, миелоидный лейкоз, лейкоз неопределённого типа клеток и множественные миеломы/плазматическиеопухоли 14. Доступ к наборам данных осуществлялся через портал IEU OpenGWAS с использованием задокументированных идентификаторовдоступа 15. Все анализы в данном исследовании были основаны исключительно на этих общедоступных сводных наборах данных GWAS; Не использовались и не генерировались внутренние данные о когорте учреждения или пациентов на индивидуальном уровне. Поскольку мы не выявили дополнительные GWAS с гармонизированными определениями MS и гематологических злокачественных опухолей, которые позволяли бы полное воспроизведение конвейера, независимая внешняя валидация с использованием отдельного набора данных не проводилась и признана как ограничение. Протокол написан так, чтобы его можно было напрямую повторно применять к будущим наборам данных GWAS для независимой проверки.
Выбор инструментов и скопление LD
Для каждого воздействия были отобраны однонуклеотидные полиморфизмы (SNP) с геномной значимостью (P < 5 × 10-8) с использованием функции extract_instruments в TwoSampleMR, применённой к наборам данных OpenGWAS. Для обеспечения независимости инструментов LD затем выполнялось на европейской эталонной панели с использованием либо внутренних утилит для скопления TwoSampleMR, либо локально с PLINK, с порогом r² 0,001 и физическим окном 10 000 килобаз. При использовании PLINK параметры командной строки устанавливались на порог первичной значимости 5 × 10-8, r² = 0,001, и окно 10 Мб, чтобы скопленные инструменты точно соответствовали этим критериям. Прочность прибора оценивалась с использованием F-статистики, полученной из оценки эффекта воздействия и её стандартной ошибки (F ≈ β²/SE²); варианты с F < 10 были исключены из окончательных наборов приборов, а оставшиеся SNP были перенесены на скрининг PhenoScanner.
Скрининг с помощью PhenoScanner
Для минимизации горизонтальной плейотропии с учётом известных факторов риска каждый кандидат-инструмент был запрошён в PhenoScanner V2 по каталогу GWAS с использованием корпуса феносканера R (v1.0)16,17. Для каждого SNP мы запросили все зарегистрированные ассоциации в P < 1 × 10⁻5 и вручную проверяли полученные признаки. Ассоциации, указывающие на связи с установленными факторами риска гематологического злокачественного развития — такими как воздействие курения, ожирение/антропометрические признаки (например, индекс массы тела, окружность талии и показатели жира в организме) — или прямые связи с фенотипами гематологической злокачественности побудили исключить соответствующий SNP из набораинструментов 18. Категории признаков, считающиеся исключающими, основывались на предыдущих данных, связывающих ожирение и курение с риском лейкемии, лимфомы илимиеломы 18,19,20. Запросы использовали общие ключевые формулировки (например, дым, сигарета, ИМТ, ожирение, талия, ожирение, гематологическая злокачественность, лимфома, лейкемия, миелома). Все удаления фиксировались в таблице отслеживания вместе с чертой PhenoScanner, вызывающей исключение, а очищенные списки инструментов затем передавались на этап гармонизации.
Гармонизация и палиндромная обработка
Аллели эффекта для каждого SNP были гармонизированы между наборами данных экспозиции и результатов с помощью функции harmonise_data в пакете TwoSampleMR (v0.5.7, R). Мы выровняли все аллели исхода с аллелем эффекта экспозиции так, чтобы положительные бета-коэффициенты всегда соответствовали одному и тому же аллелю в обоих наборах данных. Палиндромные варианты (A/T или C/G) с промежуточными частотами эффектных аллелей (0,42-0,58) в панели отсчёта OpenGWAS рассматривались как неоднозначные по цепи и автоматически удалялись путём настройки гармонизации на отброс неоднозначных SNP. Палиндромные SNP с частотами эффектных аллелей вне этого диапазона сохранялись и выравнивались с использованием указанных аллелевых частот. Поскольку доступность аллелей и палиндромный статус немного различались между результатами FinnGen, гармонизация проводилась отдельно для каждого фенотипа HM, а окончательное количество инструментов, входящих в анализ, специфичный для результата, извлекалось из гармонизированных R-объектов и отражалось в таблицах.
Оценка направленности (фильтрация по Штайгеру)
Направленность оценивалась с помощью подхода Штайгера, реализованного в функции steiger_filtering TwoSampleMR. Для каждого SNP функция сначала рассчитывала дисперсию, объяснённую (R²) в воздействии и результате по бета-коэффициенту GWAS, стандартной ошибке и размеру выборки. В исследовании были удалены инструменты, для которых R² был выше по результату, чем в воздействии, что указывало на возможное обратное направление эффекта. Фильтрация Штайгера применялась отдельно для каждого набора результатов, а оставшиеся инструменты (ряды с steiger_dir == TRUE) сохранялись и использовались в последующих MR-анализах. Подсчёты приборов после Steiger были зафиксированы для каждого результата и представлены вместе с оценками MR.
Первичная оценка МР и многократное тестирование
Первичные причинные оценки были получены с помощью МР с обратной дисперсией (IVW) в модели фиксированных эффектов с использованием функции mr в TwoSampleMR, с методами, обозначенными как «mr_ivw», «mr_egger_regression» и «mr_weighted_median». Для каждого результата HM в mr передавались гармонизированные и фильтрованные по Штайгеру инструменты, а логарифмические коэффициенты шансов и стандартные ошибки извлекались и экспоненциированы для получения коэффициентов шансов (OR) с 95% доверительными интервалами (CI) для бинарныхпризнаков 21. Для изучения устойчивости к незначительным нарушениям предположения о отсутствии плейотропии мы также применили взвешенные медианные оценки и регрессионные оценкиMR-Egger 22,23, реализованные в том же пакете. Когда тест Q Кокрана (начиная с mr_heterogeneity года) показал значительную гетерогенность (P < 0,05), исследование также соответствовало мультипликативным моделям случайных эффектов IVW и предоставило результаты как фиксированных, так и случайных эффектов. Семейная ошибка по девяти исходам ХМ контролировалась с помощью коррекции Бонферрони при α = 0,05/9 = 5,56 × 10-3; ассоциации с P-значениями ниже этого порога считались статистически значимыми, тогда как ассоциации с 0,0056 ≤ P < 0,05 интерпретировались как наводящие и описывались осторожно.
Диагностика чувствительности: гетерогенность, плейотропия и исключения
Статистика Q Кокрана использовалась для оценки гетерогенности между инструментами для моделей IVW и MR-Egger, реализованная через функцию mr_heterogeneity в TwoSampleMR. Направленная горизонтальная плейотропия оценивалась с помощью теста перехвата MR-Egger (mr_pleiotropy_test) и глобального теста в пакетеMR-PRESSO 24. MR-PRESSO 24 был запущен с рекомендованными настройками в R (NbDistribution ≥ 5 000, SignifThreshold = 0,05) для выявления влиятельных выбросов и количественной оценки потенциальных искажений путём сравнения оценок IVW до и после удалениявыбросов 25. Для каждой пары экспозиции-результат были проведены анализы с оставленным выездом (mr_leaveoneout), чтобы определить, влияет ли какой-либо отдельный SNP непропорционально на общую оценку. Для прозрачности и воспроизводимости все диагностические выходы экспортировались из R и отчитывались вместе с соответствующим количеством приборов после гармонизации, фильтрации по Штайгеру и удаления выбросов MR-PRESSO.
Прочность прибора и оценка NOME
Сила прибора для MR-Egger была количественно измерена с помощью статистикиI2GX, вычисленной как 1 минус среднее квадрата стандартных ошибок ассоциаций воздействия SNP, делённого на их дисперсию междуинструментами 26. Значения, близкие к 1, указывают на лучшее соответствие предположении «Ошибка без измерения» (NOME); более низкие значения указывают на возможное регрессионное разбавление и быстрое осторожное толкование результатов MR-Egger. Для каждого анализа, специфичного для результата, был рассчитан и представлен I2GX.
Обратная менделевская рандомизация
Полный конвейер повторялся в обратном направлении, рассматривая каждый подтип HM как экспозицию, а MS — как результат. Когда значимые инструменты, охватывающие весь геном, были недостаточны для данного воздействия HM, допускался ослабленный порог отбора P < 5 × 10-6 при сохранении тех же параметров скупления LD, скрининга с помощью PhenoScanner, процедур гармонизации, фильтрации по Steiger и диагностики чувствительности. Анализы с использованием ослабленных порогов чётко отмечались в соответствующих таблицах и легендах рисунков.
Визуализация и экспорт фигур
Графики рассеяния, леса, воронки и «оставляя один раз» были созданы с легендами, расположенными под панелями, а размеры шрифтов были отрегулированы, чтобы метки не скрывали отображённые данные. Границы осей были стандартизированы для сопоставимых результатов для облегчения визуального сравнения. Фигурки экспортировались с минимальной скоростью 300 dpi в форматах без потерь, таких как TIFF или PNG. Все отмеченные числовые значения были перекрёстно сверены с представленными оценками для обеспечения согласованности текста, таблиц и рисунков.
Воспроизводимость и обмен данными
Случайные семена фиксировались там, где это было применимо, записывались версии программного обеспечения, а скрипты анализа вместе с промежуточными объектами архивировались для повторного запуска всех шагов. Идентификаторы доступа к набору данных и определения фенотипов были задокументированы, а списки инструментов на каждом этапе фильтрации — после группировки, после гармонизации, после фильтрации Штайгера и после MR-PRESSO — были подготовлены для загрузки в виде файлов таблиц в соответствии с руководящими принципами журнала.