方法文章

基于TCGA数据和单单元数据的分析,以 TRPM4 为例

DOI:

10.3791/69304

2025年12月5日

* These authors contributed equally

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一个基于转录组分析和单细胞分析,结合101个机器学习算法,全面分析单基因在膀胱癌(BLCA)中作用的方案,以构建该单基因的预后模型。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文引入了一种基于公开转录组数据集和单细胞数据集的分析方法,可用于全面描述单基因在肿瘤中的作用,包括塑造肿瘤免疫微环境、塑造肿瘤分子亚型以及预测肿瘤患者的预后。同时,引入单基因数据不仅可以避免单一转录组分析带来的随机性和异质性,还能更深入地探索该基因表达在哪些特定细胞簇中,以及进一步研究该基因在通路中的作用。鉴于许多研究者可能不擅长单细胞分析,本文介绍了一个名为TISCH2(http://tisch.compbio.cn/)的在线网站,帮助大家完成单细胞分析。此外,101种机器学习方法的应用在构建最准确的预后模型中发挥了不可或缺的作用。总之,人们认为,这种结合生物信息学分析、机器学习和单细胞分析的综合单基因分析方法,在研究单基因在肿瘤进展中的功能以及研究单个基因在通路中的功能中,能够发挥不可或缺且关键的作用。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

众所周知,膀胱癌(BLCA)是世界上最具侵袭性和转移性的恶性肿瘤之一,目前膀胱癌的生物标志物仍存在一些问题,比如不准确等。为了确定BLCA患者的预后并预测其结局,寻找膀胱癌的生物标志物并建立预后模型至关重要。尽管人们已经开发了一些生物标志物的研究方法,但大多数方法目前仅限于转录组学,这不可避免地导致样本中的异质性2。此外,仅靠转录组学数据研究往往无法探究不同细胞亚群的作用,以及基因在单细胞层面不同通路中的作用,这使得以往的研究精度和效果不够理想。考虑到单胞体分析对初学者来说可能具有挑战性,已推出一个在线平台,帮助他们快速掌握技能。最后但同样重要的是,即使通过转录组分析和单细胞分析发现单一基因是合适的生物标志物,也无法保证该标志物适用于所有队列,因此有必要构建与该生物标志物相关的预后模型,使结论更具普遍适用性。.101机器学习算法是指通过结合10种不同的机器学习算法构建101个预后模型,目标是识别最优预后模型。引入了如随机森林、XGBoost和SVM等更能处理复杂数据且稳定性更高的算法,使该组合算法展现出显著的稳定性。为了使该预后模型更准确且更贴近生物标志物,首先对所有基因与生物标志物进行相关分析,然后根据需求选择约20-30个基因,随后使用101机器学习算法构建预后模型,随后进行一系列分析以最终确定结果。

与过去6年简单转录组分析预测的生物标志物相比,单细胞和转录组分析的生物标志物能够公正地将组织或样本分解为其基本细胞成分。它能够清晰分化不同细胞类型(如T细胞、B细胞和巨噬细胞),发现新的亚群(如耗尽的T细胞和调控T细胞),同时捕捉连续的动态过程(如细胞分化轨迹)4。这就像把水果和牛奶分开摆放,可以清晰地看到每个成分及其数量。与单队列Cox模型7相比,使用101机器学习构建的预后模型也更准确且科学可靠,因为它能够自动从数据中学习变量间复杂且非线性的相互作用。例如,特定基因突变的影响可能仅在特定年龄和肿瘤大小的患者中显著。机器学习模型如随机森林和神经网络能够自动捕捉这些高阶交互,无需手动说明8。用于分析的数据集必须包含绝大多数基因的信号关键适用性约束,基因数量不应过少,且用于构建预后模型的基因数量不应过高,通常保持在20-30左右,这才是最优。单细胞组的质量控制标准应大于1000,每细胞UMI计数应大于1000,且每细胞基因数应大于5009

这里提供了从公开转录组数据集和单细胞数据集中识别新生物标志物的逐步方法,以 BLCA 中 TRPM4 的作用为例。采用多种研究方法和多样化数据集——包括癌症基因组图谱-膀胱癌数据集(TCGA-BLCA)、单细胞数据集GSE145281以及BLCA数据集GSE32894和GSE31684——以从多角度提升肿瘤学中生物标志物的精确性和适用性,并推动 BLCA中TRPM4 的研究。TCGA-BLCA数据集来自加州大学圣克鲁斯分校Xena(UCSC Xena)网站。GSE32894和GSE31684均从基因表达综合目录(GEO)下载,单细胞数据GSE145281来源于肿瘤免疫单细胞中心2(TISCH2)。此外,还从相关文章的补充电子表格文件中提取了BLCA分子亚型和处理反应的数据。随后进行生物信息学分析、单细胞分析和机器学习,建立单基因研究的综合方法。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

注意:本文中使用的所有代码均可在 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code 网站上找到。

1. 转录组学数据的制备

  1. TCGA-BLCA数据集的准备
    1. 请从UCSC Xena (https://xenabrowser.net/datapages/)10网站下载所有TCGA数据集。下载的数据集经过预处理,无需额外工作如基因注释11
    2. 选择 TCGA数据集 ,然后点击 TCGA-BLCA数据t。然后,访问TCGA-BLCA数据集页面,点击 基因表达RNA-seq,下载TCGA-BLCA数据集中的临床数据和基因表达谱。该数据集中,确保有400名BLCA患者的mRNA表达数据。
    3. 为了区分肿瘤样本与相邻的正常组织样本,将端端01和端端的样本11分开,端端01的样本表示肿瘤样本,端端11的样本表示癌症邻近组织(正常样本)。
  2. GSE32894和GSE31684的准备
    1. 点击GEO网站(https://www.ncbi.nlm.nih.gov)下载BLCA数据集GSE32894 GSE3168412,13
    2. 点击右上角的 “相应条目 ”后,确保进入数据集GSE32894和 GSE31684页面。
    3. 接下来,下载相应的mRNA数据、临床数据和存活数据以供GSE32894。点击GSE32894数据集的 http 按钮。另外,使用平台按钮下载GPL6947平台数据。点击 系列矩阵文件 按钮,下载mRNA数据、临床数据和存活数据后,点击 GSE32894_series_matrix.txt.gz序列 矩阵文件按钮下载GSE32894,GSE32894。
    4. 下载相应的mRNA数据、临床数据和存活数据以GSE31684。点击GSE31684数据集的 http 按钮。另外,请使用平台按钮下载GPL570平台数据。点击 系列矩阵文件 按钮,下载mRNA数据、临床数据和存活数据后,点击 GSE31684_series_matrix.txt.gz 按钮下载该文件GSE31684 GSE31684。
    5. 在过滤步骤中,去除无意义的基因,如表达水平为零或接近零的基因。采用基于sva package14的ComBat方法进行批量校正。

2. 制备单胞分析

  1. GSE145281的准备
    1. 为了在单细胞层面进行研究,请查找BLCA单细胞数据集,考虑到仅凭转录组数据不足以确定哪个细胞簇表达 TRPM4 最显著。
    2. 点击这里,访问TISCH2(http://tisch.compbio.cn/),这是一个用于肿瘤单细胞分析的在线网站。
    3. 根据实验需求,选择所需的 癌症类型 ,以BLCA为例。
    4. 点击 BLCA 按钮,选择名为GSE145281的数据集。

3. BLCA分子亚型及对治疗选择反应数据的制备

  1. 从本文引用的文章下载BLCA分子亚型及对治疗选择反应的数据,15
  2. 打开PubMed网站(https://pubmed.ncbi.nlm.nih.gov/)。搜索该文章并点击补充表格。这个压缩文件包共有18个文件。

4. BLCA对TRPM4的免疫微环境分析

  1. 不同 TRPM4 组中133种免疫调节剂表达的热图图
    1. 根据 TRPM4的表达式,将所有BLCA样本分为高TRPM4 组和低TRPM4 组。
    2. 分别复制所有样本名称和TRPM4表达数据,然后按TRPM4表达的递减顺序排序,并将样本的前半部分归入高-TRPM4组,后半部分根据TRPM4表达式分类为“组”列的低-TRPM4组。所有TCGA-BLCA患者的身份证均列于补充表1
    3. 安装用于转录组数据分析所需的R软件包。对提供的代码做些微修改,比如更改文件位置,然后运行代码。仔细检查基因ID与免疫调节因子的ID是否正确匹配,确保基因ID后没有空隙或其他不显眼的因素,因为这些是热图生成失败的主要原因。
  2. 使用ESTIMATE R软件包进行肿瘤样本的基质和免疫学分析
    1. 确保所有用于转录组数据分析所需的R软件包都已安装。根据代码要求,将所需数据命名为相应名称,然后点击 运行 按钮。
      注意:需要注意的是,本网站还提供在线分析功能。虽然访问网站(https://bioinformatics.mdanderson.org/estimate/rpackage.html)可以获得期望结果,但这种方法不适合分析自我收集的数据。
    2. 点击 疾病 按钮,选择 膀胱尿路皮癌 选项。然后,选择 RNA-seq-V2 平台按钮。下载所有样本的基质评分、免疫评分和估计分数。
  3. 不同 TRPM4 基团表达式的小提琴图
    1. 安装所有用于转录组数据分析所需的R软件包。所有所需的R软件包列于 补充表2。根据代码要求,将所需数据命名为相应名称,然后点击运行按钮。
    2. 务必仔细核实基因ID的正确输入,确保基因ID末尾没有空隙或其他不显眼的因素,因为这些是小提琴图制作失败的主要原因。
  4. 不同 TRPM4 组之间的三角形热图图
    1. 安装所有用于转录组数据分析所需的R软件包。务必准备多个免疫检查点基因的表达数据,如 TIGIT CD80。打开TCGA-BLCA转录组数据,然后逐条搜索,因为免疫检查点基因数量不多。
    2. 根据代码要求,将所需数据命名为相应名称,然后点击 运行 按钮。
  5. 不同基因与TRPM4之间的相关图
    1. 安装所有用于转录组数据分析所需的R软件包。将 TRPM4 填入第一个基因,第二个基因是正在研究的基因,也就是 CD3E
    2. 点击 运行 按钮后,确保将 CD3E 切换到需要分析的其他基因,如 CTLA4

5. GSE145281数据集中 TRPM4 的单细胞分析

  1. BLCA GSE145281单细胞分析数据分析
    1. 进入网站并点击 BLCA。单细胞分析使得更深入地探索哪些细胞簇表现出高表达TRPM4,相较于转录组分析。确保单细胞分析数据来自GSE130001,并与质量控制标准核对,确保每个数据集的细胞数大于1000,每个细胞的UMI计数大于1000,每个细胞的基因数大于500。每个簇与所有细胞的差异表达基因通过对数转化折叠变化(|logFC| >= 0.25)识别,聚类分辨率应为0.5。
  2. 不同单元簇的单元注释
    1. 确保所有单元簇都有注释。例如,B细胞可以通过CD19、MS4A1、CD27、IGHD、IGHM、TCL1A和FCRL5进行注释。所有用于细胞注释的基因都可以在 补充表3中找到。
    2. 然后选择GSE145281并下载 TRPM4的所有结果。点击“整体”按钮,下载不同簇和细胞类型GSE145281的UMAP图。
    3. 点击基因按钮,选择将要分析的单一基因。点击GSEA按钮,观察该单一基因在多条通路中的功能,如KEGG通路和Hallmark通路16,17
    4. 点击 CCI 按钮,查找高度表达单一基因的簇细胞聊天图和细胞聊天气泡图。
    5. 点击 TF富集 按钮,查看每个簇的富集转录因子。

6. 101 机器学习构建与TRPM4相关的预后模型

  1. 安装所有用于转录组数据分析所需的R软件包。考虑到单一机器学习方法未必总是预测预后的最佳方法,可以通过101种机器学习技术构建预后模型。对TCGA-BLCA队列及GSE32894、GSE31684队列与 TRPM4的所有基因进行相关分析。
  2. 根据与 TRPM4强相关基因的数量,选择所有与 TRPM4相关性大于或等于0.6或小于或等于-0.6的基因。在所有队列中选择所有与 TRPM4 强相关的基因。
  3. 将GSE32894和GSE31684队列的所有数据合并,形成验证集,并以TCGA-BLCA作为训练集。
  4. 根据代码要求,将所需数据命名为相应名称,然后点击 运行 按钮。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

众所周知,利用转录组学分析单个基因的免疫微环境的核心好处在于,它能够直接关联单个基因与免疫细胞和分子在基因表达层面的动态相互作用,从而直接观察免疫特征,并识别单个基因表达或变化高低的群体间免疫细胞浸润比例的差异免疫检查点分子的表达18.生物信息学分析的代表性结果是与免疫微环境和免疫分子的分析相关的,如小提琴图等。单细胞分析的代表性结果是每个细胞簇的目标基因表达水平和每个细胞簇的通路热图分析。101个机器学习模型的代表性结果是用于构建预后模型的算法热图。

首先,热图图显示133种免疫调节因子在低TRPM4组表达更为明显(见图1A)。根据ESTIMATE R包的计算,高TRPM4组的stromalscore、immunescore和estimatescore均较低,表明在高TRPM4表达样本中,免疫浸润和间质浸润往往不足(

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在以往的研究中,单基因的生物信息学分析常常遇到表面性、不准确性和适用性有限等问题。此外,以往关于单基因的研究通常局限于转录组数据。此外,当仅关注转录组数据时,可能出现样本异质性和随机性等问题,使得识别普遍模式变得困难20。因此,为了解决上述问题,引入了单细胞数据,以更好地理解单个基因在通路层面的关键作用。本文的关键步骤是引入了一个名为TISCH2(http://tisch.compbio.cn/)的在线网站,用于单细胞分析4。质量控制标准是每个数据集的细胞数超过1000,每个细胞的UMI计数超过1000,每个细胞的基因数超过500。此外,101机器学习也是寻找最佳预后模型以预测所有患者预后和临床结局的关键步骤21。最后但同样重要的是,记得应用多个生物信息学分析图来描述单个基因的结果。

当然,在绘制图表和分析过程中遇到问题是不可...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明他们没有利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们感谢BioBean信息学联盟开发了一个智能分析框架(可在 http://www.sxdyc.com/ 年获取)。他们创新的计算基础设施通过精密分析和自动化数据解读模块,极大加快了研究工作流程。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
R 4.3.3没有没有没有

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, C., et al. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).
  2. Han, M. H., et al. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).
  3. Xie, S., et al. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).
  4. Han, Y., et al. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).
  5. Yao, Y., et al. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).
  6. Ding, X., et al. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).
  7. Zhu, T., et al. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).
  8. Xie, J. H., et al. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).
  9. Sun, D., et al. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).
  10. Cao, X., et al. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).
  11. Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  12. Yu, Q., et al. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).
  13. Wu, Q., et al. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).
  14. Johnson, W. E., Li, C., Rabinovic, A. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).
  15. Hu, J., et al. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).
  16. Kanehisa, M., Sato, Y., Morishima, K. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).
  17. Munkley, J., et al. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).
  18. Da, Y., et al. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).
  19. Chen, C., et al. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).
  20. Jonauskaite, D., et al. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).
  21. Zhu, W., et al. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).
  22. Zhao, J., et al. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

TCGA DataSingle Cell DataTRPM4 GeneTumor Immune MicroenvironmentTumor Molecular SubtypesPrognostic ModelMachine LearningBioinformatics AnalysisSingle Gene AnalysisTISCH2 Website

相关文章