研究文章

利用两样本孟德尔随机化框架评估首次性行为年龄与HIV感染风险之间的关联

43 次观看

DOI:

10.3791/69992

2026年7月10日

本文内容

摘要

本研究应用孟德尔随机化方法,利用遗传工具变量评估初次性行为年龄与HIV感染风险之间的潜在关联,以减少混杂因素影响并加强因果推断。

摘要

本研究采用两样本孟德尔随机化框架,探讨初次性行为年龄(AFS)与人类免疫缺陷病毒(HIV)感染风险之间的潜在关联。分析了来自欧洲人群的全基因组关联研究(GWAS)汇总数据,包括214,547名个体的AFS数据,以及FinnGen R5数据集中357例HIV病例和218,435名对照。在进行连锁不平衡剔除和工具变量强度评估后,筛选出与AFS显著相关的独立单核苷酸多态性作为工具变量。采用逆方差加权法(IVW)、MR-Egger回归、加权中位数法、加权众数法和简单众数法评估因果效应。通过Cochran’s Q检验、MR-Egger截距分析、MR-PRESSO评估和留一法敏感性分析,评估异质性、多效性和结果稳健性。IVW分析表明,遗传预测的较晚初次性行为与较低的HIV感染风险相关(OR = 0.192,95% CI = 0.062–0.592,P = 0.004),而较早的性行为起始则对应更高的HIV易感性。多种孟德尔随机化方法得出的方向一致的结果支持了该关联的稳定性。然而,由于HIV结局分析依赖于单一数据集且HIV病例数量有限,结果应谨慎解读。这些发现支持较早性行为起始与HIV易感性之间存在潜在关联,并展示了孟德尔随机化在研究与传染病结局相关的行为危险因素中的应用价值。

引言

人类的生殖行为,包括首次性行为年龄(AFS)、性伴侣数量以及首次生育年龄,与社会、行为和健康结局密切相关1,2。先前的研究表明,青少年首次性行为年龄有提前的趋势3。例如,在英国,首次异性性行为的中位年龄约为17岁,且报告在16岁之前发生初次性行为的青少年比例正在上升2。观察性研究还发现,较早发生初次性行为与更高概率的高风险性行为、物质使用、不良心理健康结局以及性传播感染相关4

人类免疫缺陷病毒(HIV)是获得性免疫缺陷综合征(AIDS)的致病因子,至今仍是全球公共卫生面临的一项重大挑战5。最新的全球数据显示,目前全球约有3900万人感染HIV6。在中国,近年来新诊断HIV感染的发病率持续上升7。多项观察性研究提示,初次性行为年龄较早与HIV感染及其他性传播感染的风险增加相关,尤其是在男男性行为者(MSM)中更为显著8,9。据报道,HIV阳性男男性行为者的首次同性性行为年龄也较双性恋男性更年轻10。然而,初次性行为年龄(AFS)应主要被视为反映性暴露模式和风险行为的行為与社会指标,而非HIV感染的直接生物学决定因素。

尽管观察性研究提供了重要的流行病学证据,但这些关联可能受到残余混杂因素、社会经济因素、行为异质性以及反向因果关系的影响。孟德尔随机化(Mendelian randomization, MR)分析利用遗传变异作为工具变量,通过减少混杂和反向因果偏差来加强因果推断11。对于评估与传染病结局相关的暴露行为而言,MR 方法尤其有价值,因为涉及性行为的随机对照试验通常不可行或不符合伦理要求。以往关于初次性行为年龄(AFS)与 HIV 风险之间关系的研究主要为观察性研究,相对较少有研究应用遗传流行病学方法来确定所观察到的关联是否反映了独立于更广泛的行为或社会经济影响之外的因果关系。

访问受限。请登录或开始试用以查看此内容。

方案

本分析所纳入的所有原始全基因组关联研究(GWAS)均获得了参与者的书面知情同意,并得到了各自机构伦理委员会的批准。由于本研究使用的是公开的、去标识化的GWAS汇总统计资料,因此无需额外的机构审查委员会批准。本方案中使用的研究工具列于材料表中。

1. 数据

暴露和结局数据集的单核苷酸多态性(SNP)汇总统计信息均来自公开可获取的全基因组关联研究(GWAS)数据库。关于首次性行为年龄(AFS)的GWAS汇总统计数据来自2021年一项GWAS荟萃分析,该分析纳入了来自英国生物银行(UKB)的214,547名欧洲血统个体12。AFS被视为一个连续型暴露变量。所用数据为通过匿名访谈收集的参与者自报性行为信息,并排除了年龄小于12岁的个体。有关性行为史及首次性行为年龄的回答提取方法详见原始GWAS研究中的描述12

人类免疫缺陷病毒(HIV)感染的全基因组关联研究(GWAS)汇总统计数据来自FinnGen联盟R5版本,该数据包含357例HIV病例和218,435名对照个体13。AFS被指定为暴露变量,HIV感染被定义为结局变量。为尽量减少人群分层偏倚,仅纳入了欧洲血统个体的相关数据集。GWAS数据提取、SNP筛选、数据协调、孟德尔随机化分析、敏感性检验及结果解释的整体分析流程见图1

2. 研究设计

基于减数分裂过程中染色体随机分配的双样本孟德尔随机化(Mendelian randomization, MR)框架被应用于本研究14。与初潮年龄(AFS)相关的遗传变异被用作工具变量,以估计AFS与HIV感染风险之间的关联。MR分析基于三个核心假设进行:所选单核苷酸多态性(SNPs)与AFS显著相关,符合相关性假设;这些SNPs与HIV感染风险的潜在混杂因素无关,符合独立性假设;并且这些SNPs仅通过AFS影响HIV感染,不存在其他因果通路,符合排他性限制假设(图214

采用全基因组显著性阈值和F统计量评估工具变量的强度。通过严格的连锁不平衡剪枝阈值筛选与AFS相关的全基因组显著性SNP,并排除F统计量<10的SNP,以减少弱工具变量偏倚并增强相关性假设。通过敏感性分析评估潜在的多效性及混杂效应。进一步通过数据协调程序、混杂因素筛选、MR-Egger截距检验、Cochran’s Q异质性分析、MR-PRESSO异常值评估以及留一法敏感性分析,对独立性假设和排除限制假设进行评估,以降低水平多效性和残余混杂的可能性。此外还进行了额外的敏感性分析,以识别多效性效应并验证孟德尔随机化(MR)假设15。通过MR分析评估遗传预测的较早AFS是否与HIV感染风险相关。

3. 工具变量的选择

在选择SNP之前实施了严格的质控程序。使用TwoSampleMR软件包中的extract_instruments()函数,提取在全基因组显著性阈值(P < 5 × 10⁻8)下与AFS显著相关的SNP,连锁不平衡阈值设为r2 < 0.001,聚类距离设为> 10,000 kb16。对所有选定的SNP计算F统计量,并排除F值< 10的弱工具变量17

F 统计量的计算方法如下:

                                                       用于统计模型比较的F检验方程;涉及样本量、预测变量和决定系数R²。

                   其中:                    遗传变异影响方程,R²=2(1-MAF)×MAF×(β/SD)² 公式。

在这些方程中,N 表示所选数据集的样本量,k 表示用于孟德尔随机化(MR)分析的单核苷酸多态性(SNP)数量,β 表示 SNP 对 AFS 的效应估计值,SD 表示 β 的标准差,MAF 表示次要等位基因频率。满足所有预设标准的 SNP 被保留作为 MR 分析的最终工具变量。

4. 去除混杂性及回文性SNP

在进行数据整合之前,对所有选定的单核苷酸多态性(SNPs)均进行了审阅,以评估其是否可能与混杂性状相关。与HIV相关表型或潜在混杂性状相关且r2 > 0.80的SNPs被排除23,24。使用harmonise_data()函数对暴露和结局数据集进行整合,并剔除具有中间等位基因频率的回文SNPs,以避免链取向歧义23

回文SNP被定义为包含A/T或G/C等位基因且等位基因频率介于0.01至0.30之间的变异24

5. 因果效应估计

采用 mr() 函数进行孟德尔随机化(MR)分析,通过逆方差加权法(IVW)、MR-Egger 回归、加权中位数法、加权众数法和简单众数法来估计 AFS 与 HIV 感染之间的关系25。通过评估多种 MR 方法结果的一致性,以判断因果效应估计的稳健性及潜在的多效性偏倚。本研究将 IVW 作为主要分析方法,因其通过荟萃分析整合了各个 SNP 特异性的 Wald 比值24

因果效应估计值以比值比(OR)、贝塔系数(β)和95%置信区间(CI)表示。随后进行了异质性和敏感性分析。使用 mr_heterogeneity() 函数计算 Cochran’s Q 统计量,并使用 mr_leaveoneout() 函数进行留一法分析,以确定单个 SNP 对因果估计值的影响26,27

使用 mr_pleiotropy_test() 函数进行 MR-Egger 截距检验,并采用 MR-PRESSO 全局检验评估水平多效性并识别异常值 SNP。在通过 MR-PRESSO 程序去除异常值后,生成校正后的估计结果28

6. 统计学分析

所有统计分析均使用 R 软件(版本 4.1.0;R Foundation for Statistical Computing,奥地利维也纳)进行,采用 TwoSampleMR、LDlinkR、devtools 和 MR-PRESSO 软件包完成 SNP 提取、连锁不平衡剪枝、数据一致性处理、孟德尔随机化分析及敏感性检验。FinnGen(RRID 不可用)、MR-PRESSO(RRID 不可用)和 LDlinkR(RRID 不可用)被用于支持分析流程。所有统计检验均为双侧检验,统计学显著性定义为 P < 0.05。

采用基于网络的 mRnd 计算器,根据样本量和工具变量效应估计值来估算统计功效29。最终的分析结果包括比值比(OR)估计值、95% 置信区间、异质性统计量、多效性评估以及敏感性分析,这些结果被综合解读以评估基因预测的 AFS 与 HIV 感染风险之间关联的稳健性和一致性。所有分析均使用 R 软件中的 TwoSampleMR、LDlinkR、devtools 和 MR-PRESSO 软件包中的已有函数完成。本研究未开发任何自定义分析脚本。

访问受限。请登录或开始试用以查看此内容。

结果

孟德尔随机化(Mendelian randomization, MR)分析提示,基于遗传预测的首次性行为年龄(AFS)与 HIV 感染风险之间可能存在关联。通过 MR-PRESSO 方法进行敏感性分析和异常值评估后,观察到的关联方向保持一致。逆方差加权(inverse variance weighting, IVW)分析显示,遗传预测的较晚 AFS 与较低的 HIV 感染风险相关(OR = 0.192,95% CI = 0.062–0.592,P = 0.004)。该估计表明,遗传预测的 AFS 增加与 HIV 感染可能性显著降低相关,而较早的首次性行为则对应更高的 HIV 易感性。

所有工具变量的 F 统计量均>10,估计统计功效>80%,符合孟德尔随机化分析中工具变量强相关性的假设,降低了弱工具变量偏倚的可能性。在逆方差加权法(IVW)、MR-Egger 回归、加权中位数、加权众数及简单众数分析中均观察到方向一致的关联性,表明多种孟德尔随机化方法之间具有分析结果的一致性。

散点图可视化显示,五...

访问受限。请登录或开始试用以查看此内容。

讨论

本研究利用公开可用的全基因组关联研究(GWAS) 汇总统计数据分析,采用两样本孟德尔随机化(MR)框架,评估遗传预测的首次性行为年龄(AFS)与HIV感染风险之间的潜在关联。研究结果表明,遗传预测的较早AFS与更高的HIV易感性相关,提示AFS与HIV感染风险之间可能存在反向关系。在逆方差加权法(IVW)、加权中位数法(WM)和MR-Egger回归分析中均得到一致结果,支持所观察到的关联具有稳健性,并且总体上与既往流行病学观察结果一致。既往研究报道,较早开始性行为的男男性行为者(MSM)可能更倾向于从事增加HIV暴露风险的行为,包括多个性伴侣、无保护性行为以及物质使用2,3,4。较早的性行为起始年龄还与其他更广泛的与性风险行为相关的模式相关30。这些观察提示,较早的AFS可能主要作为与HIV暴露风险增加相关的行为或社会代理指标,而非HIV感染易感性的直接生物学决定因素。行为特征,包括冒险倾向、物...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

致谢

作者声明本研究未获得其他资金来源或机构支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
devtools 软件包R 统计计算基金会,奥地利维也纳R 软件包用于软件包安装、数据处理及孟德尔随机化工作流程的准备。
FinnGen 全基因组关联研究数据集FinnGen 联盟不适用作为结局的全基因组关联研究资源,用于获取 HIV 感染的汇总统计信息。
全基因组关联研究汇总数据英国生物样本库联盟、FinnGen 联盟公开的全基因组关联研究数据集可公开获取的全基因组关联研究汇总统计数据,用于 SNP 提取和孟德尔随机化分析。
LDlinkR 软件包美国国家癌症研究所(NCI)、美国国立卫生研究院(NIH)R 软件包用于连锁不平衡评估和 SNP 验证。
mRnd 计算器基于网页的工具https://shiny.cnsgenomics.com/mRnd/用于孟德尔随机化分析中的统计功效计算。
MR-PRESSO 软件包GitHub 代码仓库不适用用于孟德尔随机化分析中的多效性评估和异常值校正。
R 软件R 统计计算基金会,奥地利维也纳版本 4.1.0;RRID:SCR_001905用于统计分析及执行孟德尔随机化工作流程。
SNP 数据英国生物样本库联盟、FinnGen 联盟公开的 SNP 数据集作为孟德尔随机化分析工具变量使用的 SNP。
TwoSampleMR 软件包MR-Base 平台RRID:SCR_018317用于双样本孟德尔随机化分析、数据协调及敏感性检验。
英国生物样本库全基因组关联研究数据集英国生物样本库联盟不适用作为暴露因素的全基因组关联研究资源,用于获取首次性行为年龄(AFS)的汇总统计信息。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 233

相关文章