本文介绍了一个基于转录组分析和单细胞分析,结合101个机器学习算法,全面分析单基因在膀胱癌(BLCA)中作用的方案,以构建该单基因的预后模型。
方法文章
* These authors contributed equally
本文介绍了一个基于转录组分析和单细胞分析,结合101个机器学习算法,全面分析单基因在膀胱癌(BLCA)中作用的方案,以构建该单基因的预后模型。
本文引入了一种基于公开转录组数据集和单细胞数据集的分析方法,可用于全面描述单基因在肿瘤中的作用,包括塑造肿瘤免疫微环境、塑造肿瘤分子亚型以及预测肿瘤患者的预后。同时,引入单基因数据不仅可以避免单一转录组分析带来的随机性和异质性,还能更深入地探索该基因表达在哪些特定细胞簇中,以及进一步研究该基因在通路中的作用。鉴于许多研究者可能不擅长单细胞分析,本文介绍了一个名为TISCH2(http://tisch.compbio.cn/)的在线网站,帮助大家完成单细胞分析。此外,101种机器学习方法的应用在构建最准确的预后模型中发挥了不可或缺的作用。总之,人们认为,这种结合生物信息学分析、机器学习和单细胞分析的综合单基因分析方法,在研究单基因在肿瘤进展中的功能以及研究单个基因在通路中的功能中,能够发挥不可或缺且关键的作用。
众所周知,膀胱癌(BLCA)是世界上最具侵袭性和转移性的恶性肿瘤之一,目前膀胱癌的生物标志物仍存在一些问题,比如不准确等。为了确定BLCA患者的预后并预测其结局,寻找膀胱癌的生物标志物并建立预后模型至关重要。尽管人们已经开发了一些生物标志物的研究方法,但大多数方法目前仅限于转录组学,这不可避免地导致样本中的异质性2。此外,仅靠转录组学数据研究往往无法探究不同细胞亚群的作用,以及基因在单细胞层面不同通路中的作用,这使得以往的研究精度和效果不够理想。考虑到单胞体分析对初学者来说可能具有挑战性,已推出一个在线平台,帮助他们快速掌握技能。最后但同样重要的是,即使通过转录组分析和单细胞分析发现单一基因是合适的生物标志物,也无法保证该标志物适用于所有队列,因此有必要构建与该生物标志物相关的预后模型,使结论更具普遍适用性。.101机器学习算法是指通过结合10种不同的机器学习算法构建101个预后模型,目标是识别最优预后模型。引入了如随机森林、XGBoost和SVM等更能处理复杂数据且稳定性更高的算法,使该组合算法展现出显著的稳定性。为了使该预后模型更准确且更贴近生物标志物,首先对所有基因与生物标志物进行相关分析,然后根据需求选择约20-30个基因,随后使用101机器学习算法构建预后模型,随后进行一系列分析以最终确定结果。
与过去6年简单转录组分析预测的生物标志物相比,单细胞和转录组分析的生物标志物能够公正地将组织或样本分解为其基本细胞成分。它能够清晰分化不同细胞类型(如T细胞、B细胞和巨噬细胞),发现新的亚群(如耗尽的T细胞和调控T细胞),同时捕捉连续的动态过程(如细胞分化轨迹)4。这就像把水果和牛奶分开摆放,可以清晰地看到每个成分及其数量。与单队列Cox模型7相比,使用101机器学习构建的预后模型也更准确且科学可靠,因为它能够自动从数据中学习变量间复杂且非线性的相互作用。例如,特定基因突变的影响可能仅在特定年龄和肿瘤大小的患者中显著。机器学习模型如随机森林和神经网络能够自动捕捉这些高阶交互,无需手动说明8。用于分析的数据集必须包含绝大多数基因的信号关键适用性约束,基因数量不应过少,且用于构建预后模型的基因数量不应过高,通常保持在20-30左右,这才是最优。单细胞组的质量控制标准应大于1000,每细胞UMI计数应大于1000,且每细胞基因数应大于5009。
这里提供了从公开转录组数据集和单细胞数据集中识别新生物标志物的逐步方法,以 BLCA 中 TRPM4 的作用为例。采用多种研究方法和多样化数据集——包括癌症基因组图谱-膀胱癌数据集(TCGA-BLCA)、单细胞数据集GSE145281以及BLCA数据集GSE32894和GSE31684——以从多角度提升肿瘤学中生物标志物的精确性和适用性,并推动 BLCA中TRPM4 的研究。TCGA-BLCA数据集来自加州大学圣克鲁斯分校Xena(UCSC Xena)网站。GSE32894和GSE31684均从基因表达综合目录(GEO)下载,单细胞数据GSE145281来源于肿瘤免疫单细胞中心2(TISCH2)。此外,还从相关文章的补充电子表格文件中提取了BLCA分子亚型和处理反应的数据。随后进行生物信息学分析、单细胞分析和机器学习,建立单基因研究的综合方法。
访问受限。请登录或开始试用以查看此内容。
注意:本文中使用的所有代码均可在 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code 网站上找到。
1. 转录组学数据的制备
2. 制备单胞分析
3. BLCA分子亚型及对治疗选择反应数据的制备
4. BLCA对TRPM4的免疫微环境分析
5. GSE145281数据集中 TRPM4 的单细胞分析
6. 101 机器学习构建与TRPM4相关的预后模型
访问受限。请登录或开始试用以查看此内容。
众所周知,利用转录组学分析单个基因的免疫微环境的核心好处在于,它能够直接关联单个基因与免疫细胞和分子在基因表达层面的动态相互作用,从而直接观察免疫特征,并识别单个基因表达或变化高低的群体间免疫细胞浸润比例的差异免疫检查点分子的表达18.生物信息学分析的代表性结果是与免疫微环境和免疫分子的分析相关的,如小提琴图等。单细胞分析的代表性结果是每个细胞簇的目标基因表达水平和每个细胞簇的通路热图分析。101个机器学习模型的代表性结果是用于构建预后模型的算法热图。
首先,热图图显示133种免疫调节因子在低TRPM4组表达更为明显(见图1A)。根据ESTIMATE R包的计算,高TRPM4组的stromalscore、immunescore和estimatescore均较低,表明在高TRPM4表达样本中,免疫浸润和间质浸润往往不足(
访问受限。请登录或开始试用以查看此内容。
在以往的研究中,单基因的生物信息学分析常常遇到表面性、不准确性和适用性有限等问题。此外,以往关于单基因的研究通常局限于转录组数据。此外,当仅关注转录组数据时,可能出现样本异质性和随机性等问题,使得识别普遍模式变得困难20。因此,为了解决上述问题,引入了单细胞数据,以更好地理解单个基因在通路层面的关键作用。本文的关键步骤是引入了一个名为TISCH2(http://tisch.compbio.cn/)的在线网站,用于单细胞分析4。质量控制标准是每个数据集的细胞数超过1000,每个细胞的UMI计数超过1000,每个细胞的基因数超过500。此外,101机器学习也是寻找最佳预后模型以预测所有患者预后和临床结局的关键步骤21。最后但同样重要的是,记得应用多个生物信息学分析图来描述单个基因的结果。
当然,在绘制图表和分析过程中遇到问题是不可...
访问受限。请登录或开始试用以查看此内容。
作者声明他们没有利益冲突。
我们感谢BioBean信息学联盟开发了一个智能分析框架(可在 http://www.sxdyc.com/ 年获取)。他们创新的计算基础设施通过精密分析和自动化数据解读模块,极大加快了研究工作流程。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| R 4.3.3 | 没有 | 没有 | 没有 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可