本研究描述了利用微阵列技术获得的DNA甲基化数据的处理流程。该方案展示了从样本制备到数据分析的各个步骤。所有操作均进行了详细说明,视频中还演示了关键的操作步骤。
方法文章
* These authors contributed equally
本研究描述了利用微阵列技术获得的DNA甲基化数据的处理流程。该方案展示了从样本制备到数据分析的各个步骤。所有操作均进行了详细说明,视频中还演示了关键的操作步骤。
肥胖与生活方式直接相关,并与DNA甲基化改变有关,这些改变可能导致脂肪生成和脂质储存过程的异常,从而促进疾病的发展。本文展示了一项从受试者筛选到肥胖与非肥胖患者表观遗传数据分析的完整实验方案。该方案的所有步骤均在一项预试验研究中经过测试和验证。共有32名女性参与研究,其中15名根据体重指数(BMI)被归类为肥胖组(45.1 ± 5.4 kg/m2);17名根据BMI被归类为非肥胖组(22.6 ± 1.8 kg/m2)。在线性回归分析中,肥胖组共鉴定出564个与脂肪质量相关的CpG位点,这些位点位于启动子区域。差异分析发现,在肥胖个体中存在470个低甲基化CpG位点和94个高甲基化位点。低甲基化最显著富集的通路包括RUNX、WNT信号通路以及缺氧反应通路。高甲基化通路则与胰岛素分泌、胰高血糖素信号通路和Ca2+相关。我们得出结论:该实验方案能够有效识别DNA甲基化模式及性状相关的DNA甲基化改变。这些甲基化模式可能与基因表达的改变相关,进而影响脂肪生成和脂质储存过程。我们的研究结果证实,致肥胖的生活方式可能促进人类DNA的表观遗传改变。
大规模组学技术已越来越多地应用于慢性疾病的研究中。这些方法的一个显著特点是可向科学界提供大量生成的数据。因此,为了实现研究间的直接技术比较,对实验方案进行标准化的需求日益凸显。本研究提出了一种用于获取和分析DNA甲基化数据的标准化方案,并以一项试点研究作为应用示例。
现代人类生活方式以负能量平衡为主,导致脂肪组织过度积累,进而引发肥胖¹。多种因素加剧了肥胖率的上升,如久坐不动、高热量饮食和高压力的生活节奏。世界卫生组织(WHO)估计,2016年全球有19亿成年人肥胖,这意味着全球超过20%的人口体质指数(BMI)超过30 kg/m22。2018年最新数据显示,美国(USA)的肥胖患病率已超过42%3。
表观遗传学是指染色体区域通过结构上的适应来记录、传递或维持基因活性状态改变的机制4。DNA甲基化是一种可逆的化学修饰,发生在胞嘧啶-鸟嘌呤二核苷酸位点(CpG位点),形成5-甲基胞嘧啶-pG(5mCpG)。它可通过调控转录机器对DNA的可及性来调节基因表达5,6,7,8。在此背景下,明确哪些CpG位点与肥胖相关性状相关至关重要9。多种因素可促进或抑制特定位点的DNA甲基化。该过程所必需的酶,如DNA甲基转移酶10(DNMTs)和十一个易位蛋白(TETs),可在环境暴露条件下促进DNA的甲基化或去甲基化11。
近年来,随着人们对DNA甲基化研究的兴趣日益增长,选择最合适的分析策略以精确回答每个科学问题已成为研究人员关注的重点12,13,14。450K DNA甲基化芯片是目前最常用的方法,已在超过360篇出版物中用于确定DNA甲基化谱14,可检测位于已知基因中99%区域的多达485,000个CpG位点的甲基化状态15。然而,该芯片现已停产,被覆盖850,000个CpG位点的EPIC芯片所取代。本实验方案适用于450K和EPIC两种芯片平台16,17,18。
该方案在图1中以逐步形式展示,包括以下步骤:人群选择、取样、实验准备、DNA甲基化流程和生物信息学分析。本文展示了我们实验室开展的一项预实验研究,用以说明本方案各步骤的实施过程。

图1:本方案的示意图。 请点击此处查看此图的放大版本。
圣保罗大学里贝朗普雷图医学院大学医院(HCRP-USP)伦理委员会批准了本研究(CAAE:14275319.7.0000.5440)。所有参与者均签署了知情同意书,全部操作均遵循《赫尔辛基宣言》进行。
1. 人群与抽样
2. 人体测量与身体成分
表1:人群特征。所有变量均符合参数检验条件(p > 0.05,Shapiro-Wilk检验),组间差异采用独立样本t检验进行评估,显著性水平定义为p < 0.05。*p < 0.0001。请点击此处下载该表格。
3. 生物材料的采集
4. DNA 提取
5. 甲基化分析前的准备
6. DNA甲基化分析流程
注意:DNA甲基化实验分为4天(图1)。请遵循制造商的建议和规格操作,以获得准确的结果。
7. 生物信息学分析
注意:必须更改微阵列类型的某些属性(例如,arraytype = "450k" 应替换为 arraytype = "EPIC")。ChAMP 分析流程的作者在该软件包的 Bioconductor 页面中详细描述了所有需要修改的字段30。
使用ChAMP分析流程后,经过所有筛选步骤(不合格的CpG位点、非CpG探针、靠近SNP的CpG位点、多重比对位点以及与X和Y染色体相关的CpG位点)共保留了409,887个探针用于后续分析;该流程示意图见图2。

图 2:生物信息学分析流程图。 请点击此处查看本图的放大版本。
此外,密度图显示所有样本在与质量控制步骤相关的 beta 分布上具有相似的密度。该分析评估了 beta 值的分布情况,并指出是否存在需要排除的样本。在本批次中,未根据此分析排除任何样本。

图 3:通过 ChAMP 软件包获得的 β 值密度图。 请点击此处查看该图的放大版本。
采用奇异值分解(SVD)分析来验证显著影响DNA甲基化数据变异性的主成分。结果显示,BMI、WC(p < 1e10-5)和FM(p < 0.05)对数据变异性具有显著影响(图4)。

图 4:奇异值分解分析。 请点击此处查看此图的放大版本。
细胞类型估算结果显示,肥胖女性体内的自然杀伤细胞(NK)和B细胞比例均较高(图5)。

图5:采用Houseman方法估算的细胞组分。Gran:粒细胞。 CD4T:辅助性T细胞,淋巴细胞。CD8T:细胞毒性T细胞,淋巴细胞。Mono:单核细胞。B Cell:B淋巴细胞。NK:自然杀伤细胞,淋巴细胞。*p < 0.05。 请点击此处查看该图的高清版本。
肥胖与非肥胖女性在细胞类型校正前后DNA甲基化水平存在差异。在对DNA甲基化数据进行细胞类型校正前,共检测到43,463个差异甲基化位点(DMPs),校正后仍有3,329个CpG位点具有显著差异。其中445个CpG位点位于基因间区(IGR),2,884个位于基因区内,且多数位于启动子区域(n = 1,438)。各区域分布分别为TSS1500(n = 612)、TSS200(n = 826)、5'UTR(n = 390)、第一外显子(n = 273)、基因体(body,n = 724)和3'UTR(n = 59)。结合Δβ值进行分析 <-0.05 和 >0.05,在肥胖个体与非肥胖个体相比中,有162个CpG位点呈低甲基化,576个CpG位点呈高甲基化(图6)。数据可在 GEO 数据库中获取,注册编号为 GSE166611。

图6:差异甲基化位点。 请点击此处查看此图的放大版本。
在甲基化研究中,可以评估不同组之间的甲基化差异,并找出与特定性状相关的CpG位点。在体脂量研究中,共发现13,222个CpG位点。其中,位于启动子区域的6,159个CpG位点与体脂量相关,包括470个高甲基化位点和94个低甲基化位点(图7),相应基因在这些位点上富集(表2)。

图7:与脂肪量独立相关的低甲基化和高甲基化基因的启动子区域。 请点击此处查看该图的放大版本。
表2:差异甲基化CpG位点基因的功能富集分析。 请点击此处下载该表格。
补充材料 1: 请点击此处下载该文件。
由于成本效益比较高,DNA甲基化芯片是检测DNA甲基化最常用的方法14。本研究描述了一项使用商业化微阵列平台的详细实验方案,用于评估在巴西队列中开展的一项预试验中的DNA甲基化水平。预试验获得的结果证实了该实验方案的有效性。图3展示了样本之间的可比性以及完全的亚硫酸氢盐转化效果32。
作为质量控制步骤,ChAMP 算法建议在过滤过程中排除某些 CpG 位点。排除探针的目的是提高数据分析的准确性并消除偏差。低质量的 CpG 位点(p 值低于 0.05)被去除,以消除数据集中的实验噪声。剩余的目标位点在密度图分析中均通过检测。Zhou33 指出,过滤靠近 SNP 的 CpG 位点非常重要,可避免错配、多态性胞嘧啶甲基化的误读,以及 I 型探针设计中的颜色切换问题34。此外,由于印记效应对 X 和 Y 染色体的影响不同,Heiss 和 Just35 强调了过滤这些探针的重要性,因为在女性样本中,杂交问题可能成为混杂因素35。
DMAPs 的有效期、甲酰胺的开启日期、绝对乙醇的分析质量以及总白细胞计数被认为是本实验方案中的关键步骤。
此外,根据我们的观察,细胞类型估计在进行生物信息学分析时至关重要。Houseman 方法执行细胞类型估计,如 Tian 的研究中所述30。该方法基于 473 个特异性 CpG 位点,可预测最重要细胞类型的百分比,例如粒细胞、单核细胞、B 细胞和 T 细胞36。我们使用了 ChAMP 软件包中推荐的函数 "myRefbase"。在完成估计后,ChAMP 算法将调整 beta 值,并从数据集中消除这一偏差。这一步骤在聚焦于肥胖的研究中尤为关键,因为该人群由于处于慢性炎症状态,白细胞组成存在显著差异。
我们仅针对常见PCR封膜的方法改进和故障排除修改了原始封膜方案。每次离心后,均更换新的封膜。我们无法使用标准的热封方法,因此改用铝箔包裹板子进行密封。
尽管商业检测试剂盒被认为是表观遗传学研究的金标准,但该实验方案的一个局限性在于试剂和设备依赖于单一品牌,可能导致特异性问题37,38,39,40。另一个局限性是缺乏能够指示实验是否按正确进程进行的监测指标41。
本实验方案的标准化为表观遗传学研究提供了重要指导,可减少实验过程中的人为误差,并实现不同研究之间的成功数据分析与结果可比性。
根据我们的结果,DNA甲基化实验适用于比较肥胖与非肥胖个体的研究43。此外,所提出的生物信息学分析可提供高质量的数据,可用于大规模研究。
通过SVD分析,我们发现与肥胖相关的性状(BMI、WC和FM)影响了DNA甲基化数据的变异性。一个重要的结果是,细胞类型估计表明,与非肥胖女性相比,肥胖女性的自然杀伤细胞(NK细胞)和B细胞比例更高(图5)。这些细胞数量的增加可能与这些个体存在的低度炎症状态有关44。我们观察到,肥胖患者在与脂肪质量相关的基因启动子区域存在低甲基化和高甲基化的CpG位点。其中大多数位点表现为低甲基化,这可能与这些个体体内活性氧(ROS)水平的自然升高有关。这种氧化应激状态可能促进二核苷酸位点上鸟嘌呤的扰动,形成8-羟基-2'-脱氧鸟苷(8-OHdG),从而产生5mCp-8-OHdG二核苷酸位点,并导致TET酶的募集。上述所有事件可能通过不同的作用机制共同促进DNA的低甲基化和高甲基化45。
此外,肥胖个体的脂肪生成速率似乎会增加,新细胞与旧细胞的比例约为10%46,47。表观遗传因素强调致肥胖环境的影响,可改变细胞的增殖和分化速率,促进脂肪组织的形成48。表观遗传改变还可能影响脂肪生成程序,促进或限制其发育过程。主要的转录因子(PPARγ 或 C/EBPα)或由表观遗传修饰酶的招募或排除所调控的、位于下游启动子区域的多蛋白复合物的组装,可通过高甲基化或低甲基化调节基因表达45。已有研究报道,PPARγ 通路可改变 WNT 通路,而本研究中发现该通路相关基因富集。尽管目前尚不清楚 WNT 信号在脂肪生成过程中如何发挥作用,但近期研究表明,其在脂肪细胞代谢中可能具有重要作用,尤其是在致肥胖条件下49。
本文作者无任何利益冲突,且无任何财务信息披露。
我们感谢田源博士(tian.yuan@ucl.ac.uk)在解答有关 ChAMP 软件包所有疑问方面的支持。同时感谢吉列尔梅·特莱斯硕士(Msc.)对本文技术和科学问题所做出的贡献;他在表观遗传学以及视频采集与格式化技术方面提出了重要建议(guilherme.telles@usp.br)。耗材经费来源:圣保罗研究基金会(FAPESP)(#2018/24069-3)和国家科学技术发展委员会(CNPq:#408292/2018-0)。个人资助:圣保罗研究基金会(FAPESP:#2014/16740-6)以及高等教育人员发展协调办公室(CAPES:88882.180020/2018-01)。本研究数据将无限制地公开并免费提供。通讯作者请联系 NYN(电子邮件:nataliayumi@usp.br)或 CBN(电子邮件:carla@fmrp.usp.br)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 无水乙醇 | J.T. Baker | B5924-03 | |
| 琼脂糖凝胶 | Kasvi | K9-9100 | |
| 生物电阻抗检测 | Quantum BIA 450 Q - RJL System | ||
| 乙二胺四乙酸(EDTA) | Corning | 46-000-CI | |
| EZ DNA Methylation-Gold 试剂盒 | ZymoResearch, Irvine, CA, USA | D5001 | |
| 甲酰胺 | Sigma | F9037 | |
| FMS—片段化溶液 | Illumina | 11203428 | 提供试剂 |
| HumanMethylation450 BeadChip | Illumina | ||
| Maxwell 仪器 | Promega, Brazil | AS4500 | |
| MA1—多样本扩增 1 混合液 | Illumina | 11202880 | 提供试剂 |
| MicroAmp 光学粘性封膜 | Thermo Fisher Scientific | 201703982 | |
| MSM—多样本扩增主混合液 | Illumina | 11203410 | 提供试剂 |
| NaOH | F. MAIA | 114700 | |
| PB1—用于BeadChips杂交前处理的试剂 | Illumina | 11291245 | 提供试剂 |
| PB2—杂交过程中使用的加湿缓冲液 | Illumina | 11191130 | 提供试剂 |
| 2-丙醇 | Emsure | 10,96,34,01,000 | |
| RA1—重悬、杂交和洗涤溶液 | Illumina | 11292441 | 提供试剂 |
| RPM—随机引物混合液 | Illumina | 15010230 | 提供试剂 |
| STM—高效双色主混合液 | Illumina | 11288046 | 提供试剂 |
| TEM—双色延伸主混合液 | Illumina | 11208309 | 提供试剂 |
| 超纯EDTA | Invitrogen | 155576-028 | |
| 带条形码的96孔反应板(0.1 mL) | ByoSystems | 4346906 | |
| 带条形码的96孔反应板(0.8 mL) | Thermo Fisher Scientific | AB-0859 | |
| XC1—XStain BeadChip 溶液1 | Illumina | 11208288 | 提供试剂 |
| XC2—XStain BeadChip 溶液2 | Illumina | 11208296 | 提供试剂 |
| XC3—XStain BeadChip 溶液3 | Illumina | 11208392 | 提供试剂 |
| XC4—XStain BeadChip 溶液4 | Illumina | 11208430 | 提供试剂 |