需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

以TRPM4为例的TCGA数据与单细胞数据联合分析

630 次观看

⸱

DOI:

10.3791/69304

⸱

2025年12月5日

* These authors contributed equally

本文内容

摘要

本文介绍了一种基于转录组分析和单细胞分析,并结合101种机器学习算法,系统研究单个基因在膀胱癌(BLCA)中作用的实验方案,旨在为该单个基因构建预后预测模型。

摘要

本文介绍了一种基于公共转录组数据集和单细胞数据集的分析方法,可用于全面描述单个基因在肿瘤中的作用,包括塑造肿瘤免疫微环境、决定肿瘤分子亚型以及预测肿瘤患者的预后。同时,引入单基因数据不仅能够避免单一转录组分析所带来的随机性和异质性问题,还能深入探究该基因在哪些特定细胞簇中表达,并进一步研究该基因在信号通路中所发挥的功能。考虑到许多研究人员可能不熟悉单细胞分析,本文介绍了一个名为 TISCH2 的在线网站(http://tisch.compbio.cn/),以帮助用户完成单细胞数据分析。此外,101 种机器学习方法的应用在构建最精确的预后模型中发挥了不可或缺的作用。综上所述,这种整合了生物信息学分析、机器学习和单细胞分析的单基因综合分析方法,将在研究单个基因在肿瘤进展中的功能以及基因在通路中作用的研究中发挥不可替代且至关重要的作用。

引言

众所周知,膀胱癌(BLCA)是全球最具侵袭性和转移性的恶性肿瘤之一,而目前膀胱癌的生物标志物仍存在诸如准确性不足等问题1。为了明确BLCA患者的预后并预测其临床结局,寻找膀胱癌的生物标志物并建立预后模型具有重要意义。尽管人们已开发出一些用于生物标志物研究的方法,但目前大多数方法仍局限于转录组学层面,这不可避免地导致样本异质性2。此外,仅研究转录组数据往往难以探究不同细胞亚群的作用,以及基因在不同通路中的单细胞水平功能,从而使以往的研究精确性和有效性受限3。考虑到单细胞分析对初学者可能存在挑战,已有在线平台被推出以支持单细胞分析,帮助用户快速掌握相关技能4。最后但同样重要的是,即使通过转录组分析和单细胞分析发现某个单基因可作为合适的生物标志物,也不能保证该标志物在所有队列中均适用,因此有必要构建与该生物标志物相关的预后模型,以增强结论的普适性5。101种机器学习算法是指结合10种不同的机器学习算法构建101个预后模型,旨在筛选出最优的预后模型。由于纳入了随机森林、XGBoost和SVM等在处理复杂数据方面能力更强且稳定性更高的算法,该组合算法表现出显著的稳定性。为了使该预后模型更准确且与生物标志物更相关,首先对所有基因与该生物标志物进行相关性分析,然后根据需求筛选约20至30个基因,再利用101种机器学习算法构建预后模型,随后通过一系列分析最终确定结果。

与过去基于简单转录组学分析预测的生物标志物相比6,单细胞转录组学分析能够无偏倚地将组织或样本分解为其基本的细胞组成。它可清晰区分不同类型的细胞(如T细胞、B细胞和巨噬细胞),发现新的细胞亚群(如耗竭性T细胞和调节性T细胞),并捕捉连续的动态过程(如细胞分化轨迹)4。这类似于将水果和牛奶分别归类,从而清晰地展示每种成分及其数量。与单队列Cox模型相比7,采用101种机器学习方法构建的预后模型也更加准确且科学合理,因为它能够从数据中自动学习变量之间复杂的非线性相互作用。例如,某种特定基因突变的影响可能仅在特定年龄和肿瘤大小的患者中才具有显著性。随机森林和神经网络等机器学习模型能够自动捕捉这些高阶交互作用,而无需人工预先设定8。该方法的关键适用条件包括:用于分析的数据集必须包含绝大多数基因,基因总数不宜过低,而用于构建预后模型的基因数量也不宜过高,通常维持在20至30个左右为最佳。单细胞数据集的质量控制标准应满足:细胞数量大于1000,每个细胞的UMI数大于1000,每个细胞检测到的基因数大于5009。

本文以TRPM4在膀胱尿路上皮癌(BLCA)中的作用为例,系统性地提供了一种从公共转录组数据集和单细胞数据集中鉴定新型生物标志物的逐步研究方法。通过整合多种研究手段及多样化数据集——包括癌症基因组图谱-膀胱癌(TCGA-BLCA)数据集、单细胞数据集GSE145281,以及BLCA数据集GSE32894和GSE31684——从多个角度提升肿瘤学领域生物标志物的精确性与适用性,并推动TRPM4在BLCA中的深入研究。TCGA-BLCA数据集来源于加州大学圣克鲁兹分校Xena(UCSC Xena)网站;GSE32894和GSE31684数据集从基因表达综合数据库(GEO)下载;单细胞数据GSE145281来源于肿瘤免疫单细胞中心2(TISCH2)。此外,BLCA分子亚型及治疗反应相关数据提取自相关研究论文的补充电子表格文件。随后开展生物信息学分析、单细胞分析及机器学习,构建了一套整合性的单基因研究方法体系。

访问受限。请登录或开始试用以查看此内容。

方案

注意:本文使用的所有代码均可在以下网站找到 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code。

1. 转录组数据的准备

  1. TCGA-BLCA 数据集的准备
    1. 从 UCSC Xena 网站(https://xenabrowser.net/datapages/)10 下载所有 TCGA 数据集。所下载的数据集已预先处理,无需进行基因注释等额外工作11。
    2. 选择 TCGA 数据集,然后点击 TCGA-BLCA 数据集。随后进入 TCGA-BLCA 数据集页面,点击 Gene Expression RNA-seq,从 TCGA-BLCA 数据集中下载临床数据和基因表达谱。在该数据集中,确保包含 400 名 BLCA 患者的 mRNA 表达数据。
    3. 为区分肿瘤样本与邻近正常组织样本,将样本编号以 01 和 11 结尾的样本分别归类:01 结尾表示肿瘤样本,11 结尾表示癌旁组织(正常样本)。
  2. GSE32894 和 GSE31684 数据集的准备
    1. 点击 GEO 网站(https://www.ncbi.nlm.nih.gov),以下载 BLCA 数据集 GSE32894 和 GSE3168412,13。
    2. 点击右上角的 相应条目,确保跳转至 GSE32894 和 GSE31684 数据集的页面。
    3. 接着,下载 GSE32894 的 mRNA 数据、临床数据和生存数据。点击 GSE32894 数据集的 http 按钮。同时,使用平台按钮下载 GPL6947 平台数据。在下载 GSE32894 的 mRNA 数据、临床数据和生存数据时,点击 Series Matrix File(s) 按钮,再点击 GSE32894_series_matrix.txt.gz 按钮进行下载。
    4. 下载 GSE31684 的 mRNA 数据、临床数据和生存数据。点击 GSE31684 数据集的 http 按钮。同时,使用平台按钮下载 GPL570 平台数据。在下载 GSE31684 的 mRNA 数据、临床数据和生存数据时,点击 Series Matrix File(s) 按钮,再点击 GSE31684_series_matrix.txt.gz 按钮进行下载。
    5. 在过滤步骤中,去除无意义的基因,例如表达水平为零或接近零的基因。使用基于 sva 软件包的 ComBat 方法14进行批次校正。

2. 单细胞分析的准备

  1. 制备 GSE145281
    1. 为了在单细胞水平上开展研究,需查找膀胱尿路上皮癌(BLCA)的单细胞数据集,因为仅依靠转录组数据不足以确定哪个细胞簇中TRPM4的表达最为显著。
    2. 此处访问用于肿瘤单细胞分析的在线网站 TISCH2(http://tisch.compbio.cn/)。 
    3. 根据实验需求,选择所需癌症类型,本例中以 BLCA 为例。
    4. 点击BLCA按钮,选择名为 GSE145281 的数据集。

3. 膀胱癌分子亚型的制备及对治疗选择反应数据的准备

  1. 从此处引用的文章15中下载膀胱尿路上皮癌(BLCA)的分子亚型及其对治疗选择反应的数据。
  2. 打开 PubMed 网站(https://pubmed.ncbi.nlm.nih.gov/),搜索该文章并点击 补充表格。此压缩文件包中共包含 18 个文件。

4. TRPM4 的膀胱癌免疫微环境分析

  1. 不同 TRPM4 分组中 133 个免疫调节因子表达的热图
    1. 根据 TRPM4 的表达水平,将所有 BLCA 样本分为高 TRPM4 组和低 TRPM4 组。
    2. 分别复制所有样本名称和 TRPM4 表达数据,然后按照 TRPM4 表达水平从高到低排序,并根据 TRPM4 表达量将前一半样本归入 High-TRPM4 组,后一半样本归入 Low-TRPM4 组,记录在 Group 列中。所有 TCGA-BLCA 患者的 ID 列于 补充表 1 中。
    3. 安装转录组数据分析所需的 R 软件包。对提供的代码进行轻微修改,例如更改文件路径,然后运行代码。仔细检查基因 ID 与免疫调节因子 ID 是否正确匹配,确保基因 ID 后面没有空格或其他不易察觉的干扰因素,这些是导致热图生成失败的主要原因。
  2. 使用 ESTIMATE R 软件包对肿瘤样本进行基质成分和免疫成分分析
    1. 确保已安装转录组数据分析所需的所有 R 软件包。根据代码要求,将所需数据命名为相应名称,然后点击 运行 按钮。
      ​注意:请记住,该网站也提供在线分析功能。虽然可以通过访问网站(https://bioinformatics.mdanderson.org/estimate/rpackage.html)获得所需结果,但此方法不适用于分析自行收集的数据。
    2. 点击 疾病 按钮,选择 膀胱尿路上皮癌 选项。然后选择 RNA-seq-V2 平台按钮。下载所有样本的基质评分、免疫评分和 ESTIMATE 评分。
  3. 不同 TRPM4 分组间表达水平的小提琴图
    1. 安装转录组数据分析所需的所有 R 软件包。所需的所有 R 软件包均列于 补充表 2 中。根据代码要求,将所需数据命名为相应名称,然后点击运行按钮。
    2. 务必仔细核对基因 ID 是否正确输入,确保基因 ID 末尾无空格或其他不易察觉的干扰因素,这些是导致小提琴图生成失败的主要原因。
  4. 不同 TRPM4 分组间的三角热图
    1. 安装转录组数据分析所需的所有 R 软件包。准备好若干免疫检查点基因的表达数据,例如 TIGIT 和 CD80。打开 TCGA-BLCA 转录组数据,逐项查找,因为免疫检查点基因数量不多。
    2. 根据代码要求,将所需数据命名为相应名称,然后点击 运行 按钮。
  5. 不同基因与 TRPM4 之间的相关性图
    1. 安装转录组数据分析所需的所有 R 软件包。将 TRPM4 填写为第一个基因,将待研究的基因为第二个基因,本例中为 CD3E。
    2. 点击 运行 按钮后,需将 CD3E 更改为其他需要分析的基因,例如 CTLA4。

5. GSE145281 数据集中 TRPM4 的单细胞分析

  1. 使用单细胞分析方法分析 BLCA GSE145281 数据集
    1. 进入网站并点击 BLCA。与转录组分析相比,单细胞分析可更深入地探索哪个细胞簇对 TRPM4 表现出高表达。需确认单细胞分析数据来源于 GSE130001,并核对质量控制标准:每个数据集的细胞数量应大于 1000,每个细胞的 UMI 数应大于 1000,每个细胞检测到的基因数应大于 500。各簇与其他所有细胞相比的差异表达基因通过 log 转换后的倍数变化(|logFC| >= 0.25)确定,聚类分辨率应设为 0.5。
  2. 不同细胞簇的细胞注释
    1. 确保所有细胞簇均已进行注释。例如,B 细胞可通过 CD19、MS4A1、CD27、IGHD、IGHM、TCL1A 和 FCRL5 进行注释。所有用于细胞注释的基因均可在 补充表 3 中找到。
    2. 然后选择 GSE145281 并下载 TRPM4 的全部分析结果。点击 Overall 按钮,下载 GSE145281 不同簇和细胞类型的 UMAP 图。
    3. 点击 Gene 按钮,选择待分析的单个基因。点击 GSEA 按钮,观察该单基因在不同通路(如 KEGG 通路和 Hallmark 通路)中的功能16,17。
    4. 点击 CCI 按钮,获取高表达该单基因的细胞簇的细胞互作图(cell chat plot)和细胞互作气泡图(cell chat bubble plot)。
    5. 点击 TF enrichment 按钮,查看各细胞簇中富集的转录因子。

6. 101 种机器学习方法构建与 TRPM4 相关的预后模型

  1. 安装进行转录组数据分析所需的所有 R 软件包。考虑到单一的机器学习方法可能并不总是预测预后的最佳选择,因此可以采用 101 种机器学习技术构建预后模型。对 TCGA-BLCA 队列以及 GSE32894 和 GSE31684 队列中的所有基因进行相关性分析,并 TRPM4.
  2. 根据与之显著相关的基因数量 TRPM4,选择所有与之相关性大于或等于 0.6 或小于或等于 -0.6 的基因 TRPM4. 选择所有与 TRPM4 在所有队列中。
  3. 将 GSE32894 和 GSE31684 队列的所有数据合并,形成验证集,并使用 TCGA-BLCA 作为训练集。
  4. 根据代码要求,将所需数据命名为相应的名称,然后点击 运行 按钮。

访问受限。请登录或开始试用以查看此内容。

结果

众所周知,利用转录组学分析免疫微环境在单个基因水平上的核心优势在于,它能够建立单个基因与免疫细胞及分子在基因表达水平上动态相互作用的直接关联,从而直接观察免疫特征,并识别在单个基因高/低表达组之间浸润的免疫细胞比例差异,或免疫检查点分子表达变化的情况18。生物信息学分析的代表性结果包括与免疫微环境和免疫分子分析相关的结果,例如小提琴图等。单细胞分析的代表性结果包括每个细胞簇中目标基因的表达水平,以及每个细胞簇的通路热图分析。101 种机器学习模型的代表性结果则是用于构建预后模型的算法热图。

首先,热图显示有133种免疫调节分子在低表达组中表达水平更高TRPM4 组(图1A)。根据 ESTIMATE R 软件包的计算结果,很明显,高风险组中的基质评分(stromalscore)、免疫评分(immunescore)和 ESTIMATE 评分(estimatescore)均较低TRPM4 组,从而表明在高表达样本中 TRPM4 ...

访问受限。请登录或开始试用以查看此内容。

讨论

在以往的研究中,单个基因的生物信息学分析常遇到浅显、不准确及适用性有限等问题19。此外,以往关于单个基因的研究通常局限于转录组数据。而当仅关注转录组数据时,可能会出现样本异质性和随机性等问题,导致难以识别普遍规律20。因此,为解决上述问题,已引入单细胞数据以更深入地理解单个基因在通路水平上的关键作用。本文的关键步骤是引入了一个名为 TISCH2(http://tisch.compbio.cn/)的在线网站用于单细胞分析4。质量控制所采用的标准为:每个数据集的细胞数量超过 1000,每个细胞的 UMI 数量超过 1000,每个细胞检测到的基因数量超过 500。此外,101 种机器学习方法也是关键步骤之一,用于寻找最优预后模型,以预测所有患者的预后情况和临床结局21。最后但同样重要的是,务必应用多种生物信息学分析图来描述单个基因的研究结果。

在绘制图表和进行分析的过程中,难免会遇到一些问题。如果发...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在利益冲突。

致谢

我们感谢BioBean生物信息学联盟开发了智能分析框架(可在 http://www.sxdyc.com/ 获取)。他们创新的计算基础设施通过精准分析和自动化数据解读模块,显著加快了研究工作流程。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
R 4.3.3无无无

参考文献

  1. Zhang, C., et al. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).
  2. Han, M. H., et al. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).
  3. Xie, S., et al. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).
  4. Han, Y., et al. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).
  5. Yao, Y., et al. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).
  6. Ding, X., et al. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).
  7. Zhu, T., et al. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).
  8. Xie, J. H., et al. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).
  9. Sun, D., et al. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).
  10. Cao, X., et al. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).
  11. Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  12. Yu, Q., et al. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).
  13. Wu, Q., et al. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).
  14. Johnson, W. E., Li, C., Rabinovic, A. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).
  15. Hu, J., et al. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).
  16. Kanehisa, M., Sato, Y., Morishima, K. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).
  17. Munkley, J., et al. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).
  18. Da, Y., et al. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).
  19. Chen, C., et al. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).
  20. Jonauskaite, D., et al. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).
  21. Zhu, W., et al. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).
  22. Zhao, J., et al. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

TRPM4基因肿瘤免疫微环境肿瘤分子亚型预后模型机器学习生物信息学分析单基因分析TISCH2网站