$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Todas as investigações originais do Estudo de Associação Genoma Ampla (GWAS) incluídas nesta análise obtiveram consentimento informado por escrito dos participantes e aprovação de seus respectivos comitês de ética institucionais. Como o presente estudo utilizou estatísticas resumidas GWAS desidentificadas e disponíveis publicamente, não foi necessária aprovação adicional do conselho de revisão institucional. As ferramentas de pesquisa usadas neste protocolo estão listadas na Tabela de Materiais.
1. Dados
Estatísticas resumidas de polimorfismo de nucleotídeo único (SNP) foram obtidas a partir de bancos de dados GWAS públicos acessíveis tanto para conjuntos de dados de exposição quanto de desfecho. Estatísticas resumidas do GWAS para idade na primeira relação sexual (AFS) foram obtidas a partir de uma meta-análise GWAS de 2021 que compreende 214.547 indivíduos de ascendência europeia do Biobanco do Reino Unido (UKB)12. A AFS era tratada como uma variável de exposição contínua. Foram usados dados de comportamento sexual relatados pelos participantes, coletados por meio de entrevistas anônimas, excluindo indivíduos menores de 12 anos. As respostas sobre histórico de relações sexuais e idade na primeira relação sexual foram extraídas conforme descrito no estudoGWAS original 12.
Estatísticas resumidas de GWAS para a infecção pelo Vírus da Imunodeficiência Humana (HIV) foram obtidas a partir do comunicado R5 do consórcio FinnGen, que incluiu 357 casos de HIV e 218.435 controles13. A AFS foi designada como a variável de exposição, e a infecção pelo HIV foi definida como a variável de desfecho. Apenas conjuntos de dados envolvendo indivíduos de ascendência europeia foram incluídos para minimizar o viés de estratificação populacional. O fluxo de trabalho analítico geral para extração de dados GWAS, filtragem de SNPs, harmonização, análises de randomização mendeliana, testes de sensibilidade e interpretação de resultados está resumido na Figura 1.
2. Desenho do estudo
Foiaplicado um sistema de randomização mendeliana (RM) com duas amostras baseado na alocação cromossômica aleatória durante a meiose. Variantes genéticas associadas à AFS foram usadas como variáveis instrumentais para estimar a relação entre AFS e risco de infecção pelo HIV. A análise de RM foi conduzida sob três pressupostos centrais: os SNPs selecionados estavam fortemente associados à AFS, consistente com a suposição de relevância; os SNPs eram independentes das variáveis de confusão potenciais associadas ao risco de infecção por HIV, consistentes com a suposição de independência; e os SNPs influenciaram a infecção pelo HIV exclusivamente por meio de AFS sem vias causais alternativas, consistente com a suposição de restrição de exclusão (Figura 2)14.
A força do instrumento foi avaliada usando limiares de significância genômica e estatísticas F. SNPs significativos em todo o genoma associados à AFS foram selecionados usando limiares rigorosos de agrupamento de desequilíbrio de ligação, e SNPs com estatística F < 10 foram excluídos para minimizar o viés fraco do instrumento e fortalecer a suposição de relevância. Os potenciais efeitos de pleiotropia e confusão foram avaliados por meio de análises de sensibilidade. As suposições de independência e exclusão foram ainda avaliadas por meio de procedimentos de harmonização, triagem de confundidores, testes de interceptação MR-Egger, análises de heterogeneidade Q de Cochran, avaliação de valores atípicos MR-PRESSO e análises de sensibilidade leave-one-out para reduzir a probabilidade de pleiotropia horizontal e confundimento residual. Análises adicionais de sensibilidade foram realizadas para identificar efeitos pleiotrópicos e validar as suposições da RM15. Análises de RM foram realizadas para avaliar se a AFS geneticamente prevista mais cedo estava associada ao risco de infecção pelo HIV.
3. Seleção de variáveis instrumentais
Procedimentos rigorosos de controle de qualidade foram implementados antes da seleção dos SNPs. SNPs significativamente associados à AFS no limiar de significância genômica (P < 5 × 10⁻8) foram extraídos usando a função extract_instruments() no pacote TwoSampleMR, com limiares de desequilíbrio de ligação de r2 < 0,001 e distância de agrupamento > 10.000kb 16. Estatísticas F foram calculadas para todos os SNPs selecionados, e variáveis instrumentais fracas com F < 10 foram excluídas17.
A estatística F foi calculada da seguinte forma:

onde:
Nessas equações, N denota o tamanho da amostra do conjunto de dados selecionado, k indica o número de SNPs usados para análise de RM, β denota a estimativa do efeito SNP na AFS, SD denota o desvio padrão de β e MAF denota a frequência de alelos menores. SNPs que atenderam a todos os critérios pré-definidos foram mantidos como variáveis instrumentais finais para análise de RM.
4. Remoção de SNPs confundentes e palindrômicos
Todos os SNPs selecionados foram revisados quanto a possíveis associações com traços de confusão antes da harmonização. SNPs associados a fenótipos relacionados ao HIV ou possíveis traços de confusão com r2 > 0,80 foramexcluídos 23,24. Conjuntos de dados de exposição e desfechos foram harmonizados usando a função harmonise_data(), e SNPs palindrômicos com frequências aleladas intermediárias foram removidos para evitar ambiguidade dasfibras 23.
SNPs palindrômicos foram definidos como variantes contendo alelos A/T ou G/C com frequências alelares intermediárias variando de 0,01 a 0,3024.
5. Estimativa do efeito causal
Análises de RM foram realizadas usando a função mr() com ponderação inversa de variância (IVW), regressão MR-Egger, mediana ponderada, modo ponderado e modo simples para estimar a relação entre AFS e infecção porHIV 25. A consistência entre os métodos de RM foi avaliada para analisar a robustez das estimativas causais e o potencial viés pleiotrópico. A IVW foi usada como principal método analítico porque combinava razões de Wald específicas para SNPs por meio dameta-análise 24.
As estimativas de efeito causal foram reportadas como razões de probabilidade (ORs), coeficientes beta (β) e intervalos de confiança (ICs) de 95%. Análises de heterogeneidade e sensibilidade foram realizadas posteriormente. As estatísticas Q de Cochran foram calculadas usando a função mr_heterogeneity(), e análises leave-one-out foram realizadas usando a função mr_leaveoneout() para determinar a influência de SNPs individuais nas estimativascausais 26,27.
Testes de interceptação MR-Egger foram realizados usando a função mr_pleiotropy_test(), e testes globais MR-PRESSO foram realizados para avaliar a pleiotropia horizontal e identificar SNPs atípicos. Estimativas corrigidas foram geradas após a remoção de valores atípicos usando os procedimentosMR-PRESSO 28.
6. Análise estatística
Todas as análises estatísticas foram realizadas usando o software R (versão 4.1.0; R Foundation for Statistical Computing, Viena, Áustria) com os pacotes TwoSampleMR, LDlinkR, devtools e MR-PRESSO para extração de SNPs, agrupamento de desequilíbrio de ligação, harmonização, análise de randomização mendeliana e testes de sensibilidade. FinnGen (RRID não disponível), MR-PRESSO (RRID não disponível) e LDlinkR (RRID não disponível) foram usados para suportar o fluxo de trabalho analítico. Todos os testes estatísticos foram bilaterais, e a significância estatística foi definida como P < 0,05.
O poder estatístico foi estimado usando a calculadora mRnd baseada na web, com base nas estimativas de tamanho da amostra e do efeito das variáveisinstrumentais 29. Os resultados analíticos finais incluíram estimativas de OR, intervalos de confiança de 95%, estatísticas de heterogeneidade, avaliações de pleiotropia e análises de sensibilidade, que foram coletivamente interpretadas para avaliar a robustez e consistência da associação entre AFS geneticamente previsto e risco de infecção por HIV. Todas as análises foram realizadas usando funções estabelecidas dos pacotes TwoSampleMR, LDlinkR, devtools e MR-PRESSO no software R. Nenhum script analítico personalizado foi desenvolvido para o presente estudo.