本文介绍了一种基于转录组分析和单细胞分析,并结合101种机器学习算法,系统研究单个基因在膀胱癌(BLCA)中作用的实验方案,旨在为该单个基因构建预后预测模型。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
方法文章
* These authors contributed equally
本文介绍了一种基于转录组分析和单细胞分析,并结合101种机器学习算法,系统研究单个基因在膀胱癌(BLCA)中作用的实验方案,旨在为该单个基因构建预后预测模型。
本文介绍了一种基于公共转录组数据集和单细胞数据集的分析方法,可用于全面描述单个基因在肿瘤中的作用,包括塑造肿瘤免疫微环境、决定肿瘤分子亚型以及预测肿瘤患者的预后。同时,引入单基因数据不仅能够避免单一转录组分析所带来的随机性和异质性问题,还能深入探究该基因在哪些特定细胞簇中表达,并进一步研究该基因在信号通路中所发挥的功能。考虑到许多研究人员可能不熟悉单细胞分析,本文介绍了一个名为 TISCH2 的在线网站(http://tisch.compbio.cn/),以帮助用户完成单细胞数据分析。此外,101 种机器学习方法的应用在构建最精确的预后模型中发挥了不可或缺的作用。综上所述,这种整合了生物信息学分析、机器学习和单细胞分析的单基因综合分析方法,将在研究单个基因在肿瘤进展中的功能以及基因在通路中作用的研究中发挥不可替代且至关重要的作用。
众所周知,膀胱癌(BLCA)是全球最具侵袭性和转移性的恶性肿瘤之一,而目前膀胱癌的生物标志物仍存在诸如准确性不足等问题1。为了明确BLCA患者的预后并预测其临床结局,寻找膀胱癌的生物标志物并建立预后模型具有重要意义。尽管人们已开发出一些用于生物标志物研究的方法,但目前大多数方法仍局限于转录组学层面,这不可避免地导致样本异质性2。此外,仅研究转录组数据往往难以探究不同细胞亚群的作用,以及基因在不同通路中的单细胞水平功能,从而使以往的研究精确性和有效性受限3。考虑到单细胞分析对初学者可能存在挑战,已有在线平台被推出以支持单细胞分析,帮助用户快速掌握相关技能4。最后但同样重要的是,即使通过转录组分析和单细胞分析发现某个单基因可作为合适的生物标志物,也不能保证该标志物在所有队列中均适用,因此有必要构建与该生物标志物相关的预后模型,以增强结论的普适性5。101种机器学习算法是指结合10种不同的机器学习算法构建101个预后模型,旨在筛选出最优的预后模型。由于纳入了随机森林、XGBoost和SVM等在处理复杂数据方面能力更强且稳定性更高的算法,该组合算法表现出显著的稳定性。为了使该预后模型更准确且与生物标志物更相关,首先对所有基因与该生物标志物进行相关性分析,然后根据需求筛选约20至30个基因,再利用101种....
访问受限。请登录或开始试用以查看此内容。
注意:本文使用的所有代码均可在以下网站找到 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code。
1. 转录组数据的准备
访问受限。请登录或开始试用以查看此内容。
众所周知,利用转录组学分析免疫微环境在单个基因水平上的核心优势在于,它能够建立单个基因与免疫细胞及分子在基因表达水平上动态相互作用的直接关联,从而直接观察免疫特征,并识别在单个基因高/低表达组之间浸润的免疫细胞比例差异,或免疫检查点分子表达变化的情况18。生物信息学分析的代表性结果包括与免疫微环境和免疫分子分析相关的结果,例如小提琴图等。单细胞分析的代表性结果包括每个细胞簇中目标基因的表达水平,以及每个细胞簇的通路热图分析。101 种机器学习模型的代表性结果则是用于构建预后模型的算法热图。
首先,热图显示有133种免疫调节分子在低表达组中表达水平更高TRPM4 组(图1A)。根据 ESTIMATE R 软件包的计算结果,很明显,高风险组中的基质评分(stromalscore)、免疫评分(immunescore)和 ESTIMATE 评分(estimatescore)均较低TRPM4 组,从而表明在高表达样本中 TRPM4 .......
访问受限。请登录或开始试用以查看此内容。
在以往的研究中,单个基因的生物信息学分析常遇到浅显、不准确及适用性有限等问题19。此外,以往关于单个基因的研究通常局限于转录组数据。而当仅关注转录组数据时,可能会出现样本异质性和随机性等问题,导致难以识别普遍规律20。因此,为解决上述问题,已引入单细胞数据以更深入地理解单个基因在通路水平上的关键作用。本文的关键步骤是引入了一个名为 TISCH2(http://tisch.compbio.cn/)的在线网站用于单细胞分析4。质量控制所采用的标准为:每个数据集的细胞数量超过 1000,每个细胞的 UMI 数量超过 1000,每个细胞检测到的基因数量超过 500。此外,101 种机器学习方法也是关键步骤之一,用于寻找最优预后模型,以预测所有患者的预后情况和临床结局21。最后但同样重要的是,务必应用多种生物信息学分析图来描述单个基因的研究结果。
在绘制图表和进行分析的过程中,难免会遇到一些问题。如果发.......
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
我们感谢BioBean生物信息学联盟开发了智能分析框架(可在 http://www.sxdyc.com/ 获取)。他们创新的计算基础设施通过精准分析和自动化数据解读模块,显著加快了研究工作流程。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| R 4.3.3 | 无 | 无 | 无 |
访问受限。请登录或开始试用以查看此内容。