$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Wszystkie oryginalne badania Genome-Wide Association Study (GWAS) zawarte w tej analizie uzyskały pisemną zgodę świadomie wyrażoną przez uczestników i otrzymały aprobatę odpowiednich komitetów etycznych instytucji. Ponieważ niniejsze badanie wykorzystało publicznie dostępne, anonimizowane statystyki z podsumowania GWAS, dodatkowa aprobata komitetu nadzorczego instytucjonalnego nie była wymagana. Narzędzia badawcze użyte w tym protokole są wymienione w Tabeli Materiałów.
1. Dane
Podsumowanie statystyk polimorfizmu pojedynczego nukleotydu (SNP) zostało uzyskane z publicznie dostępnych baz danych GWAS dla zarówno zestawów danych ekspozycji jak i wyniku. Statystyki podsumowujące GWAS dla wieku w chwili pierwszego stosunku płciowego (AFS) zostały uzyskane z metaanalizy GWAS z 2021 roku obejmującej 214 547 osób pochodzenia europejskiego z UK Biobank (UKB)12. AFS zostało traktowane jako ciągła zmienna ekspozycyjna. Dane dotyczące zachowań seksualnych zgłaszanych przez uczestników zebrane poprzez anonimowe wywiady były wykorzystywane, wyłączając osoby w wieku poniżej 12 lat. Odpowiedzi dotyczące historii stosunków płciowych i wieku w chwili pierwszego stosunku płciowego zostały wyodrębnione zgodnie z opisem w oryginalnym badaniu GWAS12.
Statystyki podsumowujące GWAS dla zakażenia wirusem immunodeficjencji ludzkiej (HIV) zostały uzyskane z konsorcjum FinnGen wersja R5, która obejmowała 357 przypadków HIV i 218 435 kontroli13. AFS zostało wyznaczone jako zmienna ekspozycyjna, a zakażenie HIV zdefiniowano jako zmienną wynikową. Włączono tylko zestawy danych dotyczące osób pochodzenia europejskiego, aby zminimalizować stronniczość wynikającą z podziału populacji. Ogólny przepływ analityczny dla ekstrakcji danych GWAS, filtrowania SNP, harmonizacji, analiz randomizacji mendelowskiej, testów czułości i interpretacji wyników jest podsumowany w Rysunku 1.
2. Projekt badania
Zastosowano dwuwarstwową ramę randomizacji mendelowskiej (MR) opartą na losowym przydziale chromosomów podczas mejozy14. Warianty genetyczne związane z AFS zostały użyte jako zmienne instrumentalne do oszacowania związku między AFS a ryzykiem zakażenia HIV. Analiza MR przeprowadzona została w oparciu o trzy założenia rdzeniowe: wybrane SNP były silnie związane z AFS, zgodnie z założeniem istotności; SNP były niezależne od potencjalnych zmiennych zakłócających związanych z ryzykiem zakażenia HIV, zgodnie z założeniem niezależności; a SNP wpływały na zakażenie HIV wyłącznie poprzez AFS bez alternatywnych ścieżek przyczynowych, zgodnie z założeniem wykluczenia restrykcji (Rysunek 2)14.
Moc instrumentu oceniono za pomocą progów znaczącości genomowej i statystyk F. Genomowo znaczące SNP związane z AFS wybrano używając surowych progów skupienia dysrówny równowagi wiązania i SNP o statystykach F < 10 wykluczono, aby zminimalizować stronniczość słabego instrumentu i wzmocnić założenie istotności. Potencjalne efekty plejotropii i zakłóceń oceniono za pomocą analiz czułości. Założenia niezależności i wykluczenia restrykcji oceniono dodatkowo poprzez procedury harmonizacji, przesiewanie zmienne zakłócające, testowanie przechwytu MR-Egger, analizy heterogeniczności Cochrana Q, ocenę wybiegających wartości MR-PRESSO i analizy czułości typu leave-one-out w celu zmniejszenia prawdopodobieństwa plejotropii poziomej i resztkowego zakłócenia. Dodatkowe analizy czułości przeprowadzono, aby zidentyfikować efekty plejotropii i zweryfikować założenia MR15. Analizy MR przeprowadzono, aby ocenić, czy genetycznie przewidziane wcześniejsze AFS było związane z ryzykiem zakażenia HIV.
3. Wybór zmiennych instrumentalnych
Przed wyborem SNP zastosowano rygorystyczne procedury kontroli jakości. SNP istotnie związane z AFS na poziomie znaczącości genomowej (P < 5 × 10⁻8) wyodrębniono używając funkcji extract_instruments() w pakiecie TwoSampleMR z progami dysrówny równowagi wiązania r2 < 0,001 i odległością skupienia > 10 000 kb16. Statystyki F obliczono dla wszystkich wybranych SNP, a słabe zmienne instrumentalne z F < 10 wykluczono17.
Statystykę F obliczono następująco:
