$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio analizó estadísticas de estudios de asociación genómica a nivel resumido (GWAS) desidentificadas y de acceso público a nivel sumario. De acuerdo con las políticas del repositorio y las aprobaciones obtenidas por los investigadores originales, no se requirió la aprobación de la junta de revisión institucional ni el consentimiento informado individual adicional para este análisis secundario. Todos los GWAS colaboradores informaron de procedimientos de aprobación ética y consentimiento en sus publicaciones fuente. Todos los análisis se realizaron en cumplimiento de las directrices institucionales y de la Declaración de Helsinki.
Visión general y razonamiento
El estudio implementó un marco bidireccional de aleatorización mendeliana (RM) de dos muestras, restringido a estadísticas resumidas de ascendencia europea para evaluar posibles relaciones causales entre la esclerosis múltiple (EM) y las malignidades hematológicas (HM). El diseño se adhiere a las tres suposiciones principales de la RM: relevancia del instrumento, independencia frente a factores de confusión y restricción por exclusión. Por tanto, el flujo de trabajo incluye (i) acceso y curación de conjuntos de datos, (ii) selección de instrumentos con significación genómica global con agrupamiento por desequilibrio de enlace (LD), (iii) cribado de confusión usando PhenoScanner, (iv) armonización de alelos con manejo explícito de variantes palindrómicas, (v) evaluación de direccionalidad usando la prueba de Stieger¹², (vi) estimación primaria de RM con métodos complementarios, (vii) un conjunto completo de diagnósticos de sensibilidad, y (viii) generación estandarizada de figuras y tablas bajo Control de pruebas múltiples. Cada uno de estos pasos se describe en detalle en las subsecciones posteriores del protocolo, y en la Figura 1 se presenta una visión general de la canalización.
Materiales, software y RRIDs
Los análisis se realizaron en la versión 4.3.1 de R (RRID:SCR_001905) utilizando RStudio/Posit 2023.12+ (RRID:SCR_000432). El agrupamiento LD, cuando se realiza localmente, utilizaba PLINK v1.9 (compilación 2.3; RRID:SCR_001757)13. La estimación y extracción de datos por RM utilizaron el paquete R TwoSampleMR v0.5.7 10; las búsquedas de instrumentos para posibles confundidores usaban fenoescáner v1.0; la detección y corrección de valores atípicos utilizó MRPRESSO v1.0. Se informan versiones exactas para los paquetes sin RRIDs.
Fuentes de datos y acceso
Las estadísticas resumen de la EM se obtuvieron del metaanálisis del Consorcio Internacional de Genética de la Esclerosis Múltiple, que comprende 47.429 casos de EM y 68.374 controles con control de calidad armonizado en 15 cohortes. Se obtuvieron estadísticas resumen de HM de FinnGen (n total = 218.792; >16 millones de variantes) e incluyeron linfoma de Hodgkin (HL), linfoma difuso de células B grandes (DLBCL), linfoma folicular (FL), linfomas maduros de células T/NK (MTNKL), otro linfoma no Hodgkin (NHL) o no especificado, leucemia linfoide, leucemia mieloide, leucemia de tipo celular no especificado y neoplasias de mieloma/célulasplasmáticas múltiples 14. Los conjuntos de datos se accedieron a través del portal OpenGWAS del IEU utilizando identificadores de accesodocumentados 15. Por tanto, todos los análisis de este estudio se basaron exclusivamente en estos conjuntos de datos GWAS de nivel sumario disponibles públicamente; No se utilizaron ni generaron datos internos de cohortes institucionales ni datos individuales de pacientes. Como no identificamos GWAS adicional con definiciones armonizadas de subtipos de EM y malignidad hematológica que permitieran una replicación completa de la canalización, no se realizó una validación externa independiente usando un conjunto de datos separado y se reconoce como una limitación. El protocolo está escrito para poder ser reaplicado directamente a futuros conjuntos de datos GWAS para una validación independiente.
Selección de instrumentos y agrupación de LD
Para cada exposición, se seleccionaron polimorfismos de nucleótido único (SNPs) con significación genómica general (P < 5 × 10-8) utilizando la función extract_instruments en TwoSampleMR aplicada a los conjuntos de datos de OpenGWAS. Para asegurar la independencia del instrumento, se realizó el agrupamiento LD contra un panel de referencia de ascendencia europea utilizando ya sea las utilidades internas de agrupación de TwoSampleMR o localmente con PLINK, con un umbral r² de 0,001 y una ventana física de 10.000 kilobases. Cuando se usaba PLINK, los parámetros de la línea de comandos se establecían en un umbral de significación primaria de 5 × 10-8, r² = 0,001 y una ventana de 10 Mb para que los instrumentos agrupados coincidieran exactamente con estos criterios. La intensidad del instrumento se evaluó utilizando la estadística F derivada de la estimación del efecto de la exposición y su error estándar (F ≈ β²/SE²); las variantes con F < 10 fueron excluidas de los conjuntos finales de instrumentos, y los SNPs restantes se trasladaron a la revisión del FenoEscáner.
Cribado de confusión con PhenoScanner
Para minimizar la pleiotropía horizontal a través de factores de riesgo conocidos, cada instrumento candidato fue consultado en PhenoScanner V2 a lo largo del catálogo GWAS utilizando el encapsulado R del fenoescáner (v1.0)16,17. Para cada SNP, solicitamos todas las asociaciones reportadas en P < 1 × 10⁻5 e inspeccionamos manualmente los rasgos devueltos. Las asociaciones que indicaban vínculos con factores de riesgo hematológicos de malignidad establecidos —como la exposición relacionada con el tabaquismo o rasgos de adiposidad/antropometría (por ejemplo, índice de masa corporal, circunferencia de cintura y medidas de grasa corporal)— o asociaciones directas con fenotipos de malignidad hematológicas provocaron la exclusión del SNP correspondiente del conjuntode instrumentos 18. Las categorías de rasgos consideradas excluyentes se basaron en evidencia previa que relacionaba la obesidad y el tabaquismo con el riesgo de leucemia, linfoma omieloma 18,19,20. Las consultas usaban raíces de palabras clave amplias (por ejemplo, humo, cigarrillo, IMC, obesidad, cintura, adiposidad, malignidad hematológica, linfoma, leucemia, mieloma). Todas las eliminaciones se documentaban en una hoja de cálculo de seguimiento junto con el rasgo PhenoScanner que activaba la exclusión, y las listas de instrumentos limpias se pasaban al paso de armonización.
Armonización y manejo palindrómico
Los alelos de efecto de cada SNP se armonizaron entre los conjuntos de datos de exposición y resultados utilizando la función harmonise_data en el paquete TwoSampleMR (v0.5.7, R). Alineamos todos los alelos de resultado con el alelo de efecto de exposición para que los coeficientes beta positivos siempre correspondieran al mismo alelo en ambos conjuntos de datos. Las variantes palindrómicas (A/T o C/G) con frecuencias intermedias de efecto-alelo (0,42-0,58) en el panel de referencia OpenGWAS se trataron como ambiguas en el hilo y se eliminaron automáticamente al configurar la acción de armonización para eliminar SNPs ambiguos. Los SNPs palindrómicos con frecuencias efecto-alelo fuera de este rango se conservaron y alinearon usando las frecuencias aleladas reportadas. Debido a que la disponibilidad de alelos y el estado palindrómico diferían ligeramente entre los resultados de FinnGen, la armonización se realizó por separado para cada fenotipo HM, y el número final de instrumentos que introdujeron cada análisis específico del resultado se extrajo de los objetos R armonizados y se informó en las tablas.
Evaluación de direccionalidad (filtrado de Steiger)
La direccionalidad se evaluó utilizando el enfoque Steiger implementado en la función steiger_filtering de TwoSampleMR. Para cada SNP, la función calculó primero la varianza explicada (R²) en la exposición y el resultado del coeficiente beta GWAS, el error estándar y el tamaño de la muestra. El estudio eliminó entonces los instrumentos para los que R² era mayor en el resultado que en la exposición, indicando una posible dirección inversa del efecto. El filtrado Steiger se aplicó por separado para cada conjunto de datos de resultados, y los instrumentos restantes (filas con steiger_dir == TRUE) se guardaron y utilizaron en los análisis RM posteriores. Se registraron los recuentos de instrumentos posteriores a Steiger para cada resultado, que se reportan junto con las estimaciones de RM.
Estimación primaria de RM y control de pruebas múltiples
Las estimaciones causales primarias se obtuvieron con RM ponderada por varianza inversa (IVW) bajo un modelo de efectos fijos utilizando la función mr en TwoSampleMR, con métodos especificados como "mr_ivw", "mr_egger_regression" y "mr_weighted_median". Para cada resultado de HM, se pasaron instrumentos armonizados y filtrados por Steiger a la RM, y se extrajeron y exponenciaron los razones de probabilidad logarítmica y los errores estándar para obtener razones de probabilidad (OR) con intervalos de confianza (IC) del 95% para rasgosbinarios 21. Para examinar la robustez ante violaciones modestas de la suposición de no pleiotropía, aplicamos además los estimadores de regresión Ponderada Mediana yMR-Egger 22,23, implementados en el mismo paquete. Cuando la prueba Q de Cochran (de mr_heterogeneity) indicó una heterogeneidad sustancial (P < 0,05), el estudio también ajustó modelos de IVW de efectos aleatorios multiplicativos e informó resultados tanto de efectos fijos como aleatorios. El error familiar en los nueve resultados de HM se controló mediante corrección de Bonferroni con α = 0,05/9 = 5,56 × 10-3; Las asociaciones con valores de P por debajo de este umbral se consideraron estadísticamente significativas, mientras que las asociaciones con valores de P <≤ 0,05 se interpretaron como sugestivas y se describieron con cautela.
Diagnósticos de sensibilidad: heterogeneidad, pleiotropía y valores atípicos
La estadística Q de Cochran se utilizó para evaluar la heterogeneidad entre instrumentos tanto para modelos de IVW como de MR-Egger, implementada mediante la función mr_heterogeneity en TwoSampleMR. La pleiotropía horizontal direccional se evaluó utilizando la prueba de interceptación MR-Egger (mr_pleiotropy_test) y la prueba global en el paqueteMR-PRESSO 24. MR-PRESSO24 se ejecutó con los ajustes recomendados en R (NbDistribution ≥ 5.000, SignifThreshold = 0,05) para detectar valores atípicos influyentes y cuantificar la posible distorsión comparando estimaciones de IVW antes y después de la eliminaciónde valores atípicos 25. Se realizaron análisis de omisión (mr_leaveoneout) para cada par exposición-resultado para determinar si algún SNP individual influyó de manera desproporcionada en la estimación global. Para mayor transparencia y reproducibilidad, todas las salidas diagnósticas se exportaron desde R y se reportaron junto con los recuentos correspondientes de instrumentos tras la armonización, el filtrado Steiger y la eliminación de valores atípicos MR-PRESSO.
Potencia del instrumento y evaluación NOME
La intensidad del instrumento para MR-Egger se cuantificó usando la estadística I2GX, calculada como 1 menos la media de los errores cuadráticos estándar de las asociaciones SNP-exposición dividido por su varianza entre instrumentos26. Los valores más cercanos a 1 indican un mejor cumplimiento con la suposición de No Error de Medición (NOME); valores más bajos sugieren posible dilución de regresión y una interpretación cautelosa de los resultados de MR-Egger. Se calculóyreportó 2 GX para cada análisis específico de resultado.
Aleatorización mendeliana inversa
La cadena completa se repitió en sentido inverso, tratando cada subtipo de HM como la exposición y MS como el resultado. Cuando los instrumentos significativos a nivel genómico eran insuficientes para una exposición dada a HM, se permitió un umbral de selección relajado de P < 5 × 10-6 , manteniendo los mismos parámetros de agrupamiento de LD, cribado con FenoEscáner, procedimientos de armonización, filtrado Steiger y diagnósticos de sensibilidad. Los análisis que usaban umbrales relajados estaban claramente etiquetados en las tablas y leyendas de las figuras correspondientes.
Visualización y exportación de figuras
Se generaron gráficos dispersos, bosque, embudo y de dejar uno fuera con leyendas situadas debajo de los paneles y tamaños de fuente ajustados para asegurar que las etiquetas no ocultaran los datos trazados. Los límites de los ejes se estandarizaron en resultados comparables para facilitar la comparación visual. Las figuras se exportaban a un mínimo de 300 dpi en formatos sin pérdidas como TIFF o PNG. Todos los valores numéricos representados se cruzaron con las estimaciones reportadas para asegurar la consistencia entre texto, tablas y figuras.
Reproducibilidad y compartición de datos
Se fijaron semillas aleatorias cuando era aplicable, se grabaron versiones de software y se archivaron los scripts de análisis junto con objetos intermedios para permitir la repetición de todos los pasos. Se documentaron los identificadores de acceso al conjunto de datos y las definiciones de fenotipos, y las listas de instrumentos en cada etapa de filtrado — post-agrupación, post-armonización, post-filtrado Steiger y post-MR-PRESSO se prepararon para su carga como archivos de hoja de cálculo conforme a las directrices de la revista.