本方案介绍了一种标准化的生物信息学工作流程,用于分析急性髓系白血病(AML)中的转录组改变。目标是比较初诊和复发性骨髓样本,筛选出与化疗耐药及疾病进展相关的分子特征,以供后续研究优先开展。
方法文章
* These authors contributed equally
本方案介绍了一种标准化的生物信息学工作流程,用于分析急性髓系白血病(AML)中的转录组改变。目标是比较初诊和复发性骨髓样本,筛选出与化疗耐药及疾病进展相关的分子特征,以供后续研究优先开展。
急性髓系白血病(AML)是一种高度异质性的血液系统恶性肿瘤,其中复发和获得性化疗耐药仍是治疗失败的主要原因。本文介绍了一种针对骨髓穿刺液的转录组学生物信息学分析流程。该流程的主要目标是提供一个标准化的工作流程,用于识别与复发 AML 疾病进展和治疗耐药相关的分子特征。该分析流程详细描述了对非配对骨髓样本进行比较的计算步骤,示例数据来自 5 例初诊患者和 4 例复发患者的测序数据。该方法概述了处理 RNA 测序数据、进行差异基因表达分析以及开展下游功能评估的关键步骤。应用此工作流程在代表性数据集中鉴定出 2,025 个差异表达基因(DEGs),包括 FOXC1、HOXA11、HOXA11-AS 和 AXL,这些基因被列为与复发相关的候选转录本。功能分析和网络分析进一步筛选出与小 GTP 酶信号通路、炎症信号通路、细胞外基质相互作用以及 RNA 生物合成过程相关的关键基因集合和相互作用枢纽。总体而言,该方法提供了一个可重复的计算分析流程,可用于绘制与复发 AML 相关的转录组特征图谱,并生成需后续实验验证的科学假说。
急性髓系白血病(AML)是一组起源于造血干细胞/祖细胞的克隆性恶性肿瘤,其特征是骨髓中未成熟髓系细胞异常增殖,并抑制造血分化1,2,3。尽管当前的标准诱导化疗方案(如阿糖胞苷联合蒽环类药物)可使大多数患者达到完全缓解,但复发率仍高达50%–70%,且复发患者的预后显著恶化4,5,6。获得性化疗耐药与AML治疗失败密切相关,因此有必要深入分析与此过程相关的分子特征,以改进治疗策略并提高患者生存率7,8。
在更广泛的研究文献中,已有研究表明,急性髓系白血病(AML)的化疗耐药性不仅限于药物外排泵的上调或药物代谢异常,还与白血病干细胞(LSCs)的存活维持、血液学微环境内类上皮-间质转化(EMT)表型的形成以及与骨髓微环境的相互作用相关9,10,11。例如,LSC群体表现出高度的自我更新能力和静息状态,这使其对细胞周期特异性化疗药物具有内在耐药性12。此外,受体酪氨酸激酶(如AXL)的上调已被证实与FLT3-ITD+ AML中的耐药性相关,常伴随PI3K/AKT和MAPK通路的激活以及抗凋亡能力的增强13,14。代谢重编程和表观遗传重塑也被认为是耐药形成的重要调控轴。有证据表明,复发期间的AML细胞可能通过增强的氧化磷酸化(OXPHOS)活性、调节NAD⁺/NADH比例以及组蛋白修饰状态的改变,来适应化疗诱导的氧化应激和DNA损伤15,16,17。骨髓微环境中的炎症因子,如IL-6和CXCL8,也与LSC的存活和化疗耐药相关,通常与STAT3/NF-κB信号通路的激活协同发生11,18。
尽管这些机制已被认识,但与急性髓系白血病(AML)复发和化疗耐药相关的转录组变化仍未能被充分阐明,尤其是在临床样本中同时评估代谢、表观遗传以及骨髓微环境相关信号时。本工作流程通过优先筛选与从初诊到临床复发转变过程相关的差异表达基因(DEG)、通路及调控网络,弥补了这一不足。该方法整合了差异表达分析、基因集富集分析(GSEA)以及蛋白质-蛋白质相互作用(PPI)网络构建,以系统描绘全转录组重编程,并筛选出可用于后续机制验证的候选分子。
本方法的总体目标是提供一个标准化、可重复的生物信息学流程,用于比较新诊断与复发性急性髓系白血病(AML)骨髓样本的整体转录组。采用这种计算机模拟技术的依据在于其能够无偏倚地捕获全基因组范围的转录事件,突破单一通路分析的局限,从而优先识别复杂的多维调控网络。与微阵列或靶向多重qPCR面板等替代方法相比,该技术具有显著优势,包括更高的动态范围、检测新转录本的能力,以及在无需预设计探针限制的情况下对基因表达进行精确定量19,20。为判断该方法是否适用于其研究,读者应注意,此流程专为处理来自配对或非配对临床队列(如组织穿刺样本)的批量RNA测序数据的研究人员设计。该方法适用于识别广泛的耐药相关特征及候选调控网络,而若研究人员需要细胞类型特异性或空间分辨率,则需采用互补的单细胞或空间测序工作流程。最终,这一计算流程可帮助优先筛选出候选基因、通路和调控网络,供后续实验研究进一步验证。
所有涉及人体组织取样的方法均遵循机构指南和《赫尔辛基宣言》(2013年修订版)。临床骨髓样本的获取已获得机构伦理委员会的批准(批准号:TY-ZKY2024-116-01 和 TY-ZKY2024-116-02)。
1. 临床样本采集与患者分类
2. RNA 质量控制与文库制备
3. 聚类与转录组测序
4. 数据质量控制与序列比对
5. 新转录本预测与基因表达定量
6. 差异基因表达分析
7. 基因本体(GO)富集分析
8. 基因与基因组京都百科全书(KEGG)通路富集分析
9. 基因集富集分析 (GSEA)
10. 蛋白质-蛋白质相互作用(PPI)网络分析
临床队列与测序验证
上游RNA提取与文库构建方案的成功实施(图1通过测序产量和质量指标确认。在此代表性数据集中,来自五名新诊断急性髓系白血病(AML)患者和四名复发性AML患者的骨髓样本,每样本平均产生约6.0 GB的原始数据。质量控制评估(表 2) 确认碱基质量和测序深度达到下游生物信息学分析所需的阈值9。RNA完整性较低(例如,RIN < 6.0)、比对率低或转录本降解偏差高均表明输入材料质量不理想,会影响下游差异表达分析的可靠性。
全转录组变异性与主成分分析
为评估全局转录组变异并检验临床分组情况,对标准化表达数据进行了主成分分析(PCA)。在此代表性数据集中,新诊断组与复发组在二维空间中呈现出分离趋势(图2A)20,其中PC1和PC2分别占总方差的23.82%和18.75%。文氏图中的 图2B,C 为新诊断组和复发组中各样本检测到的基因提供额外的描述性总结,以支持在进行下游差异表达分析前的样本水平重复性检验。由于队列规模较小且样本未配对,主成分分析(PCA)的分离结果被解读为流程示例性输出,而非疾病状态特异性生物学的确定性证据。
差异表达基因(DEG)分析
将已建立的协议阈值(|log2FC| ≥ 1 且校正后 P 值 ≤ 0.05)应用于 DESeq2 的输出结果,共鉴定出 2,025 个差异表达基因(DEGs),其中包括在复发组中上调的 772 个基因和下调的 1,253 个基因(图 3A)。变异程度较高的候选转录本包括 FOXC1(log2FC = 7.55,P = 4.92 × 10-5)、HOXA11(log2FC = 7.76)、HOXA11-AS(log2FC = 7.23)和 AXL(log2FC = 3.50),以及下调的 RHOB、PTX3 和 CXCL8。已有文献表明其中多个基因与急性髓系白血病(AML)的干性、信号通路或治疗反应相关13,29;然而,本研究的工作流程仅将其识别为与复发相关的候选转录本。这些基因在临床耐药中是否具有明确的机制性作用,仍需后续独立的功能验证。
功能与通路富集分析(GO、KEGG 和 GSEA)
功能注释流程将差异表达基因(DEGs)映射到更广泛的生物系统中。基因本体(GO)分析发现,小GTP酶介导的信号转导、金属离子转运以及染色质组装相关的术语显著富集(图4A–C)。KEGG通路分析揭示了细胞外基质-受体相互作用和细胞因子-细胞因子受体相互作用的关联(图4D)。基因集富集分析(GSEA)显示,复发组中RNA生物合成过程富集,而新诊断组中能量代谢通路富集(图5A)。这些富集结果为基因集的改变提供了描述性的路线图,应被解读为生成假设的关联,而非已证实的复发驱动因素。
蛋白质-蛋白质相互作用(PPI)网络构建
初始的 STRING 网络包含 56 个节点和 193 条相互作用。在移除未连接或孤立的节点后,所展示的 Cytoscape 子网络包含 42 个节点和 136 条相互作用(图 5B)。网络模块化分析将 TP53、CCL2、CXCL8 和 IL6 优先识别为具有最多相互作用的核心数学枢纽。由于蛋白质-蛋白质相互作用(PPI)网络依赖于数据库预测的相互作用评分(例如,ATF3 评分为 0.982),因此枢纽节点的识别应被理解为对未来实证研究的目标优先排序,而非 p53 介导的凋亡逃逸或其他耐药机制的直接证据。
本实验方案生成的原始 RNA 测序数据已存入 Figshare 数据库,并可通过以下 DOI 公开访问:https://doi.org/10.6084/m9.figshare.30655814。处理后的数据及相关分析文件已包含在文章及其补充材料中。用于重现计算流程的代表性命令行参数和分析设置详见补充文件 1。支持本研究发现的所有数据均可无限制获取。
| 患者编号 | 年龄(岁) | 性别 | 分子突变 | 生存期/随访时间(月) | 临床状态 |
| R_AML_1 | 70 | 男性 | FLT3-ITD (+) | 22 | 已故 |
| R_AML_2 | 29 | 女性 | NPM1 (+) | 11 | 存活 |
| R_AML_3 | 40 | 男性 | CEBPA (+) | 17 | 存活 |
| R_AML_4 | 55 | 女性 | 三重阴性* | 24 | 已故 |
表1: 复发性急性髓系白血病(R_AML)组患者的基线人口学与临床特征。 表1总结了代表性分析中所用复发性急性髓系白血病队列的基线人口学和临床特征,包括与转录组学工作流程解读相关的患者层面临床特征。
| 样本 | 文库 | 原始读段数 | 原始碱基数 | 干净读段数 | 干净碱基数 | 错误率 | Q20 | Q30 | GC含量百分比 |
| AML_1 | FRAS25 0244891-1r | 48705066 | 7.31G | 47807532 | 7.17G | 0.01 | 99.35 | 97.48 | 47.48 |
| AML_2 | FRAS25 0244896-1r | 42969940 | 6.45G | 42237962 | 6.34G | 0.01 | 99.35 | 97.44 | 46.74 |
| AML_3 | FRAS2502 44906-1r | 48738386 | 7.31G | 47744462 | 7.16G | 0.01 | 99.36 | 97.48 | 47.28 |
| AML_4 | FRAS250 244915-1r | 48723650 | 7.31G | 47688240 | 7.15G | 0.01 | 99.29 | 97.26 | 47.45 |
| AML_5 | FRAS2502 44920-1r | 49508198 | 7.43G | 47740308 | 7.16G | 0.01 | 99.37 | 97.53 | 47.73 |
| R_AML_1 | FRAS2502 44892-1r | 47879408 | 7.18G | 46671584 | 7.0G | 0.01 | 99.39 | 97.49 | 47.63 |
| R_AML_2 | FRAS2502 70005-1r | 47657378 | 7.15G | 46957882 | 7.04G | 0.01 | 99.39 | 97.49 | 50.5 |
| R_AML_3 | FRAS250 405722-1r | 58754766 | 8.81G | 56867112 | 8.53G | 0.01 | 99.38 | 97.42 | 46.52 |
| R_AML_4 | FRAS2502 44902-1r | 48491122 | 7.27G | 47469334 | 7.12G | 0.01 | 99.23 | 97.21 | 46.43 |
表2:数据质量汇总。 表2报告了每个样本的测序质量指标,包括读段产量、碱基质量、GC含量以及用于判断样本是否适用于下游分析的比对相关质控信息。

图1:实验方案工作流程。该工作流程总结了主要的实验与计算步骤,包括临床样本采集、RNA质量控制、文库构建与测序、测序读段处理与比对、转录本定量、差异表达分析、GO/KEGG富集分析、GSEA(基因集富集分析)以及PPI网络构建。请点击此处查看此图的放大版本。

图 2:样本的定量分析。(A)进行主成分分析(PCA)以评估组间差异和组内样本的重复性。PCA基于所有样本的标准化基因表达值,采用线性代数方法进行。(B, C)维恩图显示在AML和R_AML组样本中检测到的基因。样本特有区域表示仅在单个样本中检测到的基因,而重叠区域表示在两个或多个样本中共同检测到的基因。请点击此处查看该图的放大版本。

图3:差异基因表达分析。(A)柱状图显示通过DESeq2鉴定出的各比较组间差异表达基因(DEGs)的数量,筛选阈值为校正后P值 ≤ 0.05 且 |log2倍数变化| ≥ 1。(B)DEGs的火山图。x轴表示log2倍数变化值,y轴表示-log10(P值)。蓝色虚线表示用于筛选DEGs的阈值线。(C)DEGs的层次聚类热图。x轴表示样本名称,y轴表示DEGs的标准化表达值。请点击此处查看该图的放大版本。

图4:差异表达基因的功能富集分析。(A)GO富集条形图。横轴表示GO术语,纵轴表示富集显著性,以-log10(padj)表示。颜色代表BP(生物过程)、CC(细胞组分)和MF(分子功能)。(B)GO富集气泡图。横轴表示注释到每个GO术语的差异表达基因(DEGs)占DEGs总数的比例,纵轴表示GO术语。气泡大小对应于注释基因的数量,颜色梯度表示富集显著性。(C)KEGG富集条形图。横轴表示KEGG通路,纵轴表示富集显著性。(D)KEGG富集气泡图。气泡大小表示注释基因的数量,颜色梯度反映富集显著性。 请点击此处查看该图的放大版本。

图5:GSEA富集分析与蛋白质-蛋白质相互作用(PPI)网络分析。(A)条形图显示选定显著基因集的标准化富集评分(NES)。正的NES值表示在R_AML组中富集,而负的NES值表示在新诊断AML组中富集。(B)蛋白质-蛋白质相互作用(PPI)网络。每个节点代表一种蛋白质,每条边表示相连蛋白质之间的相互作用。请点击此处查看该图的放大版本。
实验方案中的关键步骤
成功执行该生物信息学工作流程依赖于多个关键步骤。首先,骨髓穿刺液的立即速冻和适当裂解(步骤 1.6)至关重要,因为骨髓微环境富含核糖核酸酶,可迅速降解转录组完整性30。在计算分析阶段,正确设置 DESeq2 软件包中的实验设计公式(步骤 6.3)对于实现准确的差异表达分析尤为关键,尤其是在比较临床状态(初诊 versus 复发)的同时考虑潜在混杂变量的情况下。最后,在基因集富集分析(GSEA)过程中应用严格的错误发现率(FDR)阈值(步骤 9.6)是一个关键的统计学质控点,用以避免对假阳性功能网络的过度解读。
修改与故障排除
该方法中一个常见的挑战是批次效应的存在,当临床样本在较长时间内分批收集和测序时,常会出现此类问题。应在分析前定义批次变量,包括样本采集日期、RNA提取日期、文库制备批次、测序通道和测序运行批次。如果主成分分析(PCA)或样本相关性分析显示样本根据测序日期或其他技术变量聚类,而非基于临床表型,则用户应在统计可行的情况下,在差异表达分析的设计公式中纳入批次变量,或在可视化前应用批次校正算法(如 ComBat 或 SVA)进行调整31。若将本方案应用于全血样本而非骨髓穿刺样本,一个关键的修改是在文库制备过程中增加珠蛋白 mRNA 耗竭步骤,以防止高丰度的珠蛋白转录本占据过多的测序读长深度。代表性工作流程所使用的软件版本及主要参数补充如下:fastp v0.23.2、HISAT2 v2.0.5、StringTie v1.3.3b、featureCounts v1.5.0-p3、R v3.5.0、DESeq2 v1.20.0、clusterProfiler v3.8.1、org.Hs.eg.db v3.6.0、双端 150 bp 测序、GSEA v4.2.3(采用 1,000 次基因集置换检验)、MSigDB v7.5.1、STRING v11.5(使用高置信度相互作用)、Cytoscape v3.9.1。代表性命令行参数和分析设置详见补充文件1。
方法的局限性
尽管该方案具有全面性,但仍存在固有的方法学局限性。首先,该方案采用批量RNA测序技术,仅能获取整个骨髓穿刺样本的平均转录组谱,缺乏单细胞水平的空间分辨率。因此,该工作流程无法确定上调的复发相关特征是来源于白血病干细胞、基质细胞、免疫细胞,还是细胞类型组成的变化32。其次,代表性数据集样本量较小(n = 9)且为非配对设计,限制了统计学的稳健性,并妨碍得出明确的因果推论。第三,该工作流程完全基于生物信息学分析,虽可识别出候选的调控枢纽和信号通路,但在缺乏正交的体外或体内实验验证的情况下,无法独立证实这些通路在化疗耐药中的功能必要性。
近期的单细胞及单细胞基因组学研究通过更高分辨率解析了急性髓系白血病(AML)的细胞状态异质性、克隆结构以及与治疗相关的演化过程,从而拓展了AML的参考研究框架33,34,35,36。这些方法与本文所述的批量RNA测序(bulk RNA-seq)工作流程相辅相成:批量测序为队列水平的转录组特征提供了实用且具有成本效益的筛查策略,而单细胞及多组学方法则可用于后续研究,将候选信号归因于特定的恶性细胞或微环境细胞群体。
相对于现有方法的意义
尽管存在这些局限性,该转录组学分析流程相较于其他诊断和分析技术仍具有优势。急性髓系白血病(AML)复发的传统临床评估通常依赖于靶向多重qPCR检测面板或常规流式细胞术。虽然这些靶向方法在快速诊断方面具有实用价值,但受限于预定义的探针,只能评估已知的耐药标志物19。通过采用无偏倚的全基因组转录组测序并结合网络分析,本方案能够识别出新颖的转录本以及系统范围内的关联,而这些可能是现有靶向方法所忽略的。
重要性与潜在应用
本方案中所述的方法学与转化血液学及个体化医学相关,因其可优先筛选出与复发相关的转录组特征,供进一步研究。一个潜在的后续应用是鉴定在复发过程中出现的表面抗原或免疫逃逸通路。此类候选分子可为未来验证性研究的设计提供依据,若经实验确认,可能有助于开发新一代免疫疗法,包括CAR-T或CAR-NK细胞治疗策略37。这些转化性应用应被视为基于当前数据集生成的假设,而非已确立的结论。
作者声明无利益冲突。
本研究由赣州市科学技术局(2022—ZD1368)资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Agilent 2100 生物分析仪 | Agilent Technologies, Santa Clara, CA, USA | RRID:SCR_019389 | G2939BA |
| AMPure XP 系统 | Beckman Coulter, Brea, CA, USA | RRID:SCR_008452 | A63881 |
| cBot 簇生成系统 | Illumina, San Diego, CA, USA | - | SY-301-2002 或机构特定系统编号 |
| clusterProfiler(软件) | Bioconductor | RRID:SCR_016884 | v3.8.1 |
| Cytoscape(软件) | Cytoscape 联盟 | RRID:SCR_003032 | v3.9.1 |
| DESeq2(软件) | Bioconductor | RRID:SCR_015687 | v1.20.0 |
| DNA 聚合酶 I | New England Biolabs (NEB, Ipswich, MA, USA | - | M0209L |
| dNTP 溶液混合物 | New England Biolabs (NEB, Ipswich, MA, USA | - | N0447L |
| edgeR(软件) | Bioconductor | RRID:SCR_012802 | v3.22.5 |
| fastp(软件) | OpenGene | RRID:SCR_016962 | v0.23.2 |
| featureCounts / Subread(软件) | 沃尔特和伊丽莎·霍尔研究所 | RRID:SCR_012919 | featureCounts v1.5.0-p3 |
| GRCh38 参考基因组 | 基因组参考联盟 / Ensembl | - | GRCh38; Ensembl release 109 |
| GSEA 软件 | Broad 研究所 | RRID:SCR_003199 | v4.2.3 |
| HISAT2(软件) | 约翰斯·霍普金斯大学 | RRID:SCR_015530 | v2.0.5 |
| M-MuLV 逆转录酶(RNase H-) | New England Biolabs (NEB, Ipswich, MA, USA | - | M0253L |
| MSigDB 基因集 | Broad 研究所 | RRID:SCR_016863 | v7.5.1 |
| NEBNext Ultra II 定向 RNA 文库构建试剂盒(适用于 Illumina) | New England Biolabs (NEB, Ipswich, MA, USA | - | E7760L/E7765L 或实验室特定试剂盒 |
| NEBNext Ultra II RNA 文库构建试剂盒(适用于 Illumina) | New England Biolabs (NEB, Ipswich, MA, USA | - | E7770L |
| NovaSeq 测序平台 | Illumina, San Diego, CA, USA | RRID:SCR_016387 | NovaSeq 系统;服务提供商仪器编号 |
| org.Hs.eg.db(注释包) | Bioconductor | - | v3.6.0 |
| Phusion 高保真 DNA 聚合酶 | Thermo Fisher Scientific, Waltham, MA, USA | RRID:AB_2756816 | F530L |
| Qubit 2.0 荧光仪 | Thermo Fisher Scientific, Waltham, MA, USA | RRID:SCR_018095 | Q32866 |
| Qubit dsDNA HS 检测试剂盒 | Thermo Fisher Scientific, Waltham, MA, USA | - | Q32851 |
| R 软件 | 统计计算基金会 R | RRID:SCR_001905 | v3.5.0 |
| 随机六聚体引物 | Thermo Fisher Scientific, Waltham, MA, USA | - | SO142 |
| RNA 6000 Nano 试剂盒 | Agilent Technologies, Santa Clara, CA, USA | - | 5067-1511 |
| RNase H | New England Biolabs (NEB, Ipswich, MA, USA | - | M0297L |
| RNA-seq 文库构建试剂盒 / 测序服务 | 诺禾致源,中国北京 | - | 项目编号 X101SC25054246-Z01-J003 |
| STRING 数据库 | STRING 联盟 | RRID:SCR_005223 | v11.5 |
| StringTie(软件) | 约翰斯·霍普金斯大学 / 计算生物学中心 | RRID:SCR_016323 | v1.3.3b |
| TruSeq PE 簇生成试剂盒 v3-cBot-HS | Illumina, San Diego, CA, USA | - | PE-401-3001 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可