$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Todas las investigaciones originales del Estudio de Asociación Generalizada del Genoma (GWAS) incluidas en este análisis obtuvieron el consentimiento informado por escrito de los participantes y la aprobación de sus respectivos comités de ética institucional. Dado que el presente estudio utilizó estadísticas resumidas GWAS desidentificadas y disponibles públicamente, no se requirió aprobación adicional del comité de revisión institucional. Las herramientas de investigación utilizadas en este protocolo se enumeran en la Tabla de Materiales.
1. Datos
Se obtuvieron estadísticas resumen de polimorfismo de nucleótido único (SNP) a partir de bases de datos GWAS accesibles públicamente tanto para conjuntos de datos de exposición como de resultados. Las estadísticas resumen GWAS sobre la edad en el primer coito sexual (AFS) se obtuvieron de un metaanálisis GWAS de 2021 que comprendía 214.547 personas de ascendencia europea del Biobanco del Reino Unido (UKB)12. AFS se trataba como una variable de exposición continua. Se utilizaron datos de comportamiento sexual reportados por los participantes recogidos mediante entrevistas anónimas, excluyendo a individuos menores de 12 años. Las respuestas sobre el historial sexual y la edad en el primer acto sexual se extrajeron tal y como se describió en el estudioGWAS original 12.
Las estadísticas resumen GWAS para la infección por el Virus de la Inmunodeficiencia Humana (VIH) se obtuvieron del comunicado R5 del consorcio FinnGen, que incluyó 357 casos de VIH y 218.435 controles13. El AFS fue designado como la variable de exposición y la infección por VIH como variable de resultado. Solo se incluyeron conjuntos de datos que involucraban a individuos de ascendencia europea para minimizar el sesgo de estratificación poblacional. El flujo de trabajo analítico general para la extracción de datos GWAS, filtrado de SNP, armonización, análisis de aleatorización mendeliana, pruebas de sensibilidad e interpretación de resultados se resume en la Figura 1.
2. Diseño del estudio
Se aplicó un marco de aleatorización mendeliana (RM) de dos muestras basado en la asignación cromosómica aleatoria durante lameiosis 14. Se utilizaron variantes genéticas asociadas con el AFS como variables instrumentales para estimar la relación entre el AFS y el riesgo de infección por VIH. El análisis de RM se realizó bajo tres supuestos fundamentales: los SNPs seleccionados estaban fuertemente asociados con AFS, consistente con la suposición de relevancia; los SNPs eran independientes de las posibles variables de confusión asociadas al riesgo de infección por VIH, coherentes con la suposición de independencia; y los SNPs influyeron exclusivamente en la infección por VIH a través de AFS sin vías causales alternativas, consistente con la suposición de restricción de exclusión (Figura 2)14.
La intensidad del instrumento se evaluó utilizando umbrales de significación a nivel genómico y estadísticas F. Se seleccionaron SNPs significativos a nivel genómico asociados con AFS utilizando umbrales estrictos de agrupamiento de desequilibrio de ligación, y se excluyeron SNPs con estadística F < 10 para minimizar el sesgo débil del instrumento y reforzar la suposición de relevancia. Se evaluaron los posibles efectos de pleiotropía y confusión mediante análisis de sensibilidad. Las suposiciones de restricción de independencia y exclusión se evaluaron posteriormente mediante procedimientos de armonización, cribado de confusión por confusión, pruebas de interceptación MR-Egger, análisis de heterogeneidad Q de Cochran, evaluación de valores atípicos MR-PRESSO y análisis de sensibilidad leave-one-out para reducir la probabilidad de pleiotropía horizontal y confusión residual. Se realizaron análisis de sensibilidad adicionales para identificar efectos pleiotrópicos y validar las suposiciones de la RM15. Se realizaron análisis de RM para evaluar si la AFS genéticamente predecía antes estaba asociada con el riesgo de infección por VIH.
3. Selección de variables instrumentales
Se implementaron rigurosos procedimientos de control de calidad antes de la selección de SNP. Los SNPs significativamente asociados con AFS en el umbral de significación genómica (P < 5 × 10⁻8) se extrajeron utilizando la función extract_instruments() en el paquete TwoSampleMR con umbrales de desequilibrio de ligamiento de r2 < 0,001 y una distancia de agrupamiento > 10.000kb 16. Se calcularon estadísticas F para todos los SNPs seleccionados, y se excluyeron variables instrumentales débiles con F < 1017.
La estadística F se calculó de la siguiente manera:

donde:
En estas ecuaciones, N denota el tamaño de la muestra del conjunto de datos seleccionado, k denota el número de SNPs utilizados para el análisis de RM, β denota la estimación del efecto SNP en AFS, SD denota la desviación estándar de β y MAF denota la frecuencia de alelos menores. Los SNPs que cumplían todos los criterios predefinidos se conservaban como variables instrumentales finales para el análisis de RM.
4. Eliminación de SNPs confundentes y palindrómicos
Todos los SNP seleccionados fueron revisados para posibles asociaciones con rasgos de confusión antes de la armonización. Se excluyeron los SNPs asociados con fenotipos relacionados con el VIH o posibles rasgos de confusión con r2 > 0,8023,24. Los conjuntos de datos de exposición y resultados se armonizaron usando la función harmonise_data(), y se eliminaron SNPs palindrómicos con frecuencias alelares intermedias para evitar ambigüedad de la cadena23.
Los SNPs palindrómicos se definieron como variantes que contenían alelos A/T o G/C con frecuencias alelares intermedias que iban de 0,01 a 0,3024.
5. Estimación del efecto causal
Los análisis de RM se realizaron utilizando la función mr() con ponderación inversa de varianza (IVW), regresión MR-Egger, mediana ponderada, modo ponderado y modo simple para estimar la relación entre AFS e infección por VIH25. Se evaluó la consistencia entre los métodos de RM para valorar la robustez de las estimaciones causales y el posible sesgo pleiotrópico. La IVW se utilizó como método analítico principal porque combinaba las proporciones de Wald específicas de SNP mediante metaanálisis24.
Las estimaciones del efecto causal se informaron en forma de odds ratios (OR), coeficientes beta (β) e intervalos de confianza (IC) del 95%. Posteriormente se realizaron análisis de heterogeneidad y sensibilidad. Las estadísticas Q de Cochran se calcularon usando la función mr_heterogeneity(), y se realizaron análisis de dejar uno fuera utilizando la función mr_leaveoneout() para determinar la influencia de SNPs individuales en estimacionescausales 26,27.
Se realizaron pruebas de intercepción MR-Egger utilizando la función mr_pleiotropy_test(), y se realizaron pruebas globales MR-PRESSO para evaluar la pleiotropía horizontal e identificar SNPs atípicos. Se generaron estimaciones corregidas tras la eliminación de valores atípicos utilizando los procedimientosMR-PRESSO 28.
6. Análisis estadístico
Todos los análisis estadísticos se realizaron utilizando el software R (versión 4.1.0; R Foundation for Statistical Computing, Viena, Austria) con los paquetes TwoSampleMR, LDlinkR, devtools y MR-PRESSO para extracción de SNP, agrupamiento de desequilibrio de ligación, armonización, análisis de aleatorización mendeliana y pruebas de sensibilidad. FinnGen (RRID no disponible), MR-PRESSO (RRID no disponible) y LDlinkR (RRID no disponible) se utilizaron para apoyar el flujo de trabajo analítico. Todas las pruebas estadísticas fueron bidireccionales, y la significación estadística se definió como P < 0,05.
El poder estadístico se estimó utilizando la calculadora web de mRnd en función del tamaño de la muestra y estimaciones de efecto de variablesinstrumentales 29. Los resultados analíticos finales incluyeron estimaciones de OR, intervalos de confianza del 95%, estadísticas de heterogeneidad, evaluaciones de pleiotropía y análisis de sensibilidad, que se interpretaron colectivamente para evaluar la robustez y consistencia de la asociación entre AFS genéticamente predicha y riesgo de infección por VIH. Todos los análisis se realizaron utilizando funciones establecidas de los paquetes TwoSampleMR, LDlinkR, devtools y MR-PRESSO en el software R. No se desarrollaron guiones analíticos personalizados para el presente estudio.