$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
이 분석에 포함된 모든 원래 유전체 전역 연관성 연구(GWAS) 조사는 참가자로부터 서면 동의를 받았고, 해당 기관 윤리 위원회의 승인을 받았습니다. 본 연구는 공개된 비식별화된 GWAS 요약 통계를 사용했기 때문에 추가 기관 검토 위원회 승인이 필요하지 않았습니다. 이 프로토콜에서 사용되는 연구 도구들은 재료표에 나열되어 있습니다.
1. 데이터
노출 및 결과 데이터셋에 대해 공개적으로 접근 가능한 GWAS 데이터베이스에서 단일 염기화 다형성(SNP) 요약 통계가 수집되었습니다. GWAS 첫 성관계 연령(AFS)에 대한 요약 통계는 2021년 영국 바이오뱅크(UKB)에서 유럽계 혈통 214,547명을 대상으로 한 GWAS 메타분석에서 얻어졌습니다12. AFS는 연속 노출 변수로 취급되었습니다. 12세 미만 개인은 제외하였으며, 익명 인터뷰를 통해 수집된 참여자 보고된 성행동 데이터가 사용되었습니다. 성관계 이력과 첫 성관계 나이에 관한 응답은 원래 GWAS 연구에서 설명한 대로 추출되었습니다12.
인간면역결핍바이러스(HIV) 감염에 대한 GWAS 요약 통계는 357건의 HIV 사례와 218,435명의 대조군13명을 포함한 FinnGen 컨소시엄 R5 릴리스에서 얻어졌습니다. AFS는 노출 변수로 지정되었고, HIV 감염은 결과 변수로 정의되었습니다. 인구 계층화 편향을 최소화하기 위해 유럽계 혈통 개인을 포함하는 데이터셋만 포함하였습니다. GWAS 데이터 추출, SNP 필터링, 조화, 멘델 무작위화 분석, 민감도 테스트, 출력 해석의 전체 분석 워크플로우는 그림 1에 요약되어 있습니다.
2. 연구 설계
감수분열 중 무작위 염색체 배분을 기반으로 한 2표본 멘델 무작위화(MR) 프레임워크가 적용되었다14. AFS와 관련된 유전 변이가 도구적 변수로 사용되어 AFS와 HIV 감염 위험 간의 관계를 추정하였습니다. MR 분석은 세 가지 핵심 가정 하에 수행되었습니다: 선택된 SNP는 AFS와 강하게 연관되어 있어 관련성 가정과 일치함; SNP는 HIV 감염 위험과 관련된 잠재적 교란 변수와 독립적이었으며, 이는 독립성 가정과 일치합니다; 그리고 SNP는 배제 제한 가정과 일치하여 대체 인과 경로 없이 AFS를 통해서만 HIV 감염에 영향을 미쳤다(그림 2)14.
기기 강도는 유전체 유의성 임계값과 F-통계량을 사용하여 평가하였습니다. AFS와 관련된 유전체 유의한 SNP는 엄격한 연관 불균형 집집 임계값을 사용하여 선택되었고, F-<통계량이 10인 SNP는 약한 기기 편향을 최소화하고 관련성 가정을 강화하기 위해 제외하였다. 잠재적 다면형성 및 교란 효과는 민감도 분석을 통해 평가하였다. 독립성 및 배제 제한 가정은 조화 절차, 교란 선별, MR-Egger 인터셉트 검정, Cochran의 Q 이질도 분석, MR-PRESSO 이상치 평가, 그리고 1-out 제외 민감도 분석을 통해 수평 다변성 및 잔여 교란 가능성을 줄이기 위해 추가로 평가되었습니다. 추가적인 민감도 분석이 수행되어 다면성 효과를 확인하고 MR 가정을 검증하였습니다15. MR 분석을 통해 유전적으로 예측된 초기 AFS가 HIV 감염 위험과 연관이 있는지 평가하였습니다.
3. 기기적 변수의 선택
SNP 선출 전에 엄격한 품질 관리 절차가 시행되었습니다. 전체 유의점 임계값(P < 5 × 10⁻8)에서 AFS와 유의하게 연관된 SNP는 TwoSampleMR 패키지의 extract_instruments() 함수를 사용해 r2 < 0.001, 응집 거리 10,000 kb16> 추출하였다. 선택된 모든 SNP에 대해 F-통계량을 계산했으며, F< 10인 약한 기구 변수는17개를 제외하였다.
F-통계량은 다음과 같이 계산되었다:

여기서 다음과 같습니다:
이 방정식들에서 N은 선택한 데이터셋의 표본 크기를, k는 MR 분석에 사용되는 SNP 수, β은 AFS에 대한 SNP 효과 추정치, SD는 β의 표준편차, MAF는 소규모 대립유전자 빈도를 나타냅니다. 모든 사전 정의 기준을 충족하는 SNP는 MR 분석의 최종 기기 변수로 유지되었습니다.
4. 교란 및 회문 SNP 제거
모든 선정된 SNP는 조화 전에 교란 특성과의 잠재적 연관성을 검토하였습니다. HIV 관련 표현형 또는 잠재적 교란 형질과 관련된 SNP는 r2 > 0.80과 함께 제외되었고, 23,24명은 제외되었습니다. 노출 및 결과 데이터셋은 harmonise_data() 함수를 사용하여 조화시켰으며, 중간 대립유전자 빈도를 가진 회문 SNP는 가닥 모호성을 방지하기 위해 제거되었다.
회문 SNP는 중간 대립유전자 빈도가 0.01에서 0.30 사이인 A/T 또는 G/C 대립유전자를 포함하는 변이로 정의되었다.
5. 인과 효과 추정
MR 분석은 mr() 함수와 역분산 가중치(IVW), MR-에거 회귀, 가중 중앙값, 가중 모드, 단순 모드를 사용하여 AFS와 HIV 감염 간의 관계를 추정하였습니다25. MR 방법 전반의 일관성을 평가하여 인과 추정의 견고성과 잠재적 다기능 편향을 평가하였다. IVW는 SNP 특이적 Wald 비율을 메타분석을 결합하여 주요 분석 방법으로 사용되었습니다.
인과 효과 추정치는 오즈비(OR), 베타 계수(β), 95% 신뢰구간(CI)으로 보고되었습니다. 이질성 및 민감도 분석이 이후 수행되었습니다. 코크란의 Q 통계량은 mr_heterogeneity() 함수를 사용하여 계산되었고, mr_leaveoneout() 함수를 이용한 리브-원 아웃 분석은 개별 SNP가 인과 추정치에 미치는 영향을 결정했습니다26,27.
MR-Egger 인터셉트 검사는 mr_pleiotropy_test() 함수를 사용하여 수행되었고, MR-PRESSO 전역 검사는 수평 다면형성을 평가하고 이상치 SNP를 식별하기 위해 수행되었다. MR-PRESSO 절차28을 사용하여 이상치 제거 후 보정된 추정치가 생성되었다.
6. 통계 분석
모든 통계 분석은 R 소프트웨어(버전 4.1.0; R Foundation for Statistical Computing, 비엔나, 오스트리아)에서 TwoSampleMR, LDlinkR, devtools, MR-PRESSO 패키지를 사용하여 SNP 추출, 연관 비평형 응집, 조화, 멘델 무작위화 분석, 민감도 테스트에 사용되었습니다. FinnGen(RRID 불가), MR-PRESSO(RRID 불가), LDlinkR(RRID 불가)가 분석 워크플로우를 지원하기 위해 사용되었습니다. 모든 통계 검정은 양측 검사였으며, 통계적 유의성은 P < 0.05로 정의되었습니다.
통계적 검정력은 표본 크기와 기기 변수 효과 추정치를 기반으로 웹 기반 mRnd 계산기를 사용하여 추정되었다29. 최종 분석 결과물에는 OR 추정치, 95% 신뢰구간, 이질성 통계, 다면성 평가, 민감도 분석이 포함되었으며, 이를 종합하여 유전적으로 예측된 AFS와 HIV 감염 위험 간의 연관성의 견고성과 일관성을 평가하였습니다. 모든 분석은 R 소프트웨어의 TwoSampleMR, LDlinkR, devtools, MR-PRESSO 패키지의 확립된 함수들을 사용하여 수행되었습니다. 본 연구를 위해 맞춤형 분석 스크립트는 개발되지 않았다.