$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Alle oorspronkelijke Genome-Wide Association Study (GWAS) onderzoeken die in deze analyse zijn opgenomen, verkregen schriftelijke geïnformeerde toestemming van deelnemers en kregen goedkeuring van hun respectievelijke institutionele ethische commissies. Omdat de huidige studie gebruikmaakte van openbaar toegankelijke, gedeïdentificeerde GWAS-samenvattende statistieken, was aanvullende goedkeuring van de institutionele beoordelingscommissie niet vereist. De onderzoeksinstrumenten die in dit protocol worden gebruikt, zijn vermeld in de Materiaaloverzicht.
1. Data
Samenvattende statistieken voor enkel-nucleotide polymorfisme (SNP) werden verkregen uit openbaar toegankelijke GWAS-databases voor zowel blootstellings- als uitkomstdatasets. GWAS-samenvattende statistieken voor leeftijd bij de eerste geslachtsgemeenschap (AFS) zijn verkregen uit een GWAS-meta-analyse uit 2021 met 214.547 personen van Europese afkomst van de UK Biobank (UKB)12. AFS werd behandeld als een continue blootstellingsvariabele. Door deelnemers gerapporteerde seksuele gedragsgegevens verzameld via anonieme interviews werden gebruikt, waarbij personen jonger dan 12 jaar werden uitgesloten. Antwoorden over seksuele gemeenschapsgeschiedenis en leeftijd bij de eerste geslachtsgemeenschap werden geëxtraheerd zoals beschreven in de oorspronkelijke GIS-studie12.
GWAS-samenvattende statistieken voor infectie met het humaan immunodeficiëntievirus (HIV) werden verkregen uit de R5-release van het FinnGen-consortium, die 357 HIV-gevallen en 218.435 controlegroepenomvatte. AFS werd aangewezen als de blootstellingsvariabele en hiv-infectie als de uitkomstvariabele. Alleen datasets met individuen van Europese afkomst werden opgenomen om populatiestratificatie-bias te minimaliseren. De algemene analytische workflow voor GWAS-gegevensextractie, SNP-filtering, harmonisatie, Mendeliaanse randomisatie-analyses, gevoeligheidstesten en outputinterpretatie wordt samengevat in Figuur 1.
2. Studieontwerp
Een twee-steekproef Mendelian randomization (MR) raamwerk gebaseerd op willekeurige chromosomale toewijzing tijdens meiose werd toegepast14. Genetische varianten die met AFS geassocieerd zijn, werden gebruikt als instrumentele variabelen om de relatie tussen AFS en HIV-infectierisico te schatten. De MR-analyse werd uitgevoerd onder drie kernaannames: de geselecteerde SNP's waren sterk geassocieerd met AFS, in overeenstemming met de relevantieaanname; de SNP's waren onafhankelijk van mogelijke verstorende variabelen die samenhangen met het risico op hiv-infectie, in overeenstemming met de aanname van onafhankelijkheid; en de SNP's beïnvloedden hiv-infectie uitsluitend via AFS zonder alternatieve causale routes, in overeenstemming met de aanname van uitsluitingsbeperking (Figuur 2)14.
De instrumentsterkte werd geëvalueerd met behulp van genoombrede significantiedrempels en F-statistieken. Genoombrede significante SNP's geassocieerd met AFS werden geselecteerd met strenge linkage disequilibrium clumping drempels, en SNP's met F-statistieken < 10 werden uitgesloten om zwakke instrumentbias te minimaliseren en de relevantieveronderstelling te versterken. Potentiële pleiotropie- en verwarringseffecten werden geëvalueerd met behulp van gevoeligheidsanalyses. De aannames over onafhankelijkheids- en uitsluitingsbeperkingen werden verder beoordeeld via harmonisatieprocedures, confounder screening, MR-Egger intercepttesten, Cochran's Q-heterogeniteitsanalyses, MR-PRESSO out-uitschietersbeoordeling en leave-one-out gevoeligheidsanalyses om de kans op horizontale pleiotropie en residuele verwarring te verminderen. Aanvullende gevoeligheidsanalyses werden uitgevoerd om pleiotrope effecten te identificeren en MR-aannames te valideren15. MR-analyses werden uitgevoerd om te beoordelen of genetisch voorspelde eerdere AFS geassocieerd was met het risico op hiv-infectie.
3. Selectie van instrumentele variabelen
Strenge kwaliteitscontroleprocedures werden ingevoerd vóór de SNP-selectie. SNP's die significant geassocieerd zijn met AFS bij de genome-brede significantiedrempel (P < 5 × 10⁻8) werden geëxtraheerd met behulp van de extract_instruments()-functie in het TwoSampleMR-pakket met linkage-disequilibriumdrempels van r2 < 0,001 en een klonterafstand > 10.000 kb16. F-statistieken werden berekend voor alle geselecteerde SNP's, en zwakke instrumentele variabelen met F < 10 werdenuitgesloten 17.
De F-statistiek werd als volgt berekend:

waarbij:
In deze vergelijkingen duidt N de steekproefgrootte van de geselecteerde dataset aan, k het aantal SNP's dat voor MR-analyse wordt gebruikt, β de SNP-effectschatting op AFS, SD de standaardafwijking van β, en MAF de frequentie van het kleine allel. SNP's die aan alle vooraf gedefinieerde criteria voldeden, werden behouden als laatste instrumentele variabelen voor MR-analyse.
4. Verwijdering van verwarrende en palindromische SNP's
Alle geselecteerde SNP's werden beoordeeld op mogelijke associaties met confounding characteristics vóór harmonisatie. SNP's geassocieerd met hiv-gerelateerde fenotypes of potentiële confounderende eigenschappen met r2 > 0,80 werdenuitgesloten in 23,24. Blootstellings- en uitkomstdatasets werden geharmoniseerd met behulp van de harmonise_data()-functie, en palindromische SNP's met intermediaire allelfrequenties werden verwijderd om strengambiguïteit23 te voorkomen.
Palindromische SNP's werden gedefinieerd als varianten die A/T- of G/C-allelen bevatten met intermediaire allelfrequenties variërend van 0,01 tot 0,3024.
5. Causaal effect schatting
MR-analyses werden uitgevoerd met behulp van de mr()-functie met inverse variantieweging (IVW), MR-Egger-regressie, gewogen mediaan, gewogen modus en eenvoudige modus om de relatie tussen AFS en HIV-infectiete schatten 25. De consistentie tussen MR-methoden werd geëvalueerd om de robuustheid van causale schattingen en mogelijke pleiotrope bias te beoordelen. IVW werd gebruikt als primaire analytische methode omdat het SNP-specifieke Wald-verhoudingen combineerde via meta-analyse24.
Causale effectschattingen werden gerapporteerd als odds ratio's (OR's), bètacëfficiënten (β) en 95% betrouwbaarheidsintervallen (BI's). Daarna werden heterogeniteits- en gevoeligheidsanalyses uitgevoerd. De Q-statistieken van Cochran werden berekend met de mr_heterogeneity()-functie, en leave-one-out-analyses werden uitgevoerd met de mr_leaveoneout()-functie om de invloed van individuele SNP's op causale schattingen26,27 te bepalen.
MR-Egger intercepttesten werden uitgevoerd met de mr_pleiotropy_test()-functie, en MR-PRESSO globale tests werden uitgevoerd om horizontale pleiotropie te beoordelen en uitschieters SNP's te identificeren. Gecorrigeerde schattingen werden gegenereerd na verwijdering van uitschieters met MR-PRESSO procedures28.
6. Statistische analyse
Alle statistische analyses werden uitgevoerd met R-software (versie 4.1.0; R Foundation for Statistical Computing, Wenen, Oostenrijk) met de TwoSampleMR-, LDlinkR-, devtools en MR-PRESSO-pakketten voor SNP-extractie, koppelingsdisequilibrium-klontering, harmonisatie, Mendeliaanse randomisatieanalyse en gevoeligheidstesten. FinnGen (RRID niet beschikbaar), MR-PRESSO (RRID niet beschikbaar) en LDlinkR (RRID niet beschikbaar) werden gebruikt ter ondersteuning van de analytische workflow. Alle statistische tests waren tweezijdig, en statistische significantie werd gedefinieerd als P < 0,05.
De statistische kracht werd geschat met behulp van de webgebaseerde mRnd-calculator op basis van steekproefgrootte en instrumentele variabele-effectschattingen29. De uiteindelijke analytische resultaten omvatten OR-schattingen, 95% betrouwbaarheidsintervallen, heterogeniteitsstatistieken, pleiotropiebeoordelingen en gevoeligheidsanalyses, die gezamenlijk werden geïnterpreteerd om de robuustheid en consistentie van de associatie tussen genetisch voorspelde AFS en HIV-infectierisico te evalueren. Alle analyses werden uitgevoerd met bestaande functies uit de TwoSampleMR, LDlinkR, devtools en MR-PRESSO pakketten in R-software. Voor deze studie zijn geen aangepaste analytische scripts ontwikkeld.