本文介绍了一种可重复的生物信息学与单细胞分析工作流程,用于探索髓过氧化物酶(MPO)表达与乳腺癌中免疫/髓系特征之间的关联。由于分析基于公开数据集和计算机模拟方法,研究结果应视为探索性发现,并用于提出假设。
研究文章
* These authors contributed equally
本文介绍了一种可重复的生物信息学与单细胞分析工作流程,用于探索髓过氧化物酶(MPO)表达与乳腺癌中免疫/髓系特征之间的关联。由于分析基于公开数据集和计算机模拟方法,研究结果应视为探索性发现,并用于提出假设。
乳腺癌仍是癌症相关死亡的主要原因,探索性计算工作流程有助于优先筛选与免疫相关的标志物以供进一步研究。本研究利用癌症基因组图谱乳腺浸润性导管癌(TCGA-BRCA)的批量转录组数据以及公共单细胞数据集GSE161529,分析髓过氧化物酶(MPO)表达与临床结局、免疫浸润、甲基化、上游调控因子注释、单细胞表达模式、虚拟敲低敏感性结果、药物-基因相互作用检索以及吸收、分布、代谢、排泄和毒性(ADMET)注释之间的关联。在乳腺癌组织中,MPO表达水平低于邻近非肿瘤组织。较高的MPO表达与更长的无进展间隔期相关,但其与总生存期和疾病特异性生存期的关联无统计学显著性。受试者工作特征(ROC)分析提示在所分析的公共数据集中存在肿瘤与正常组织的区分能力,但不应将其解读为临床诊断验证。免疫去卷积与富集分析表明,MPO表达主要与免疫相关及髓系相关转录特征共变,而非表明其对肿瘤微环境中的免疫反应具有内在调控作用。在单细胞分辨率下,MPO信号稀疏,在基于k近邻(KNN)的邻域扩展前仅检测到85个MPO阳性细胞。由于稀疏表达、细胞类型注释不确定性、dropout效应、双细胞污染或环境RNA等因素可能影响结果,对可检测的MPO信号及MPO相关评分的解释需持谨慎态度。 在计算机中 虚拟敲低提示了候选的免疫和炎症相关转录变化,但这些结果被视为探索性发现,需进一步验证。基于药物-基因相互作用数据库(DGIdb)的药物-基因检索及ADMET注释仅用作初步的化学注释,不被解释为治疗证据。总体而言,本研究提供了一种可重复的计算机模拟工作流程,用于提出关于乳腺癌中MPO相关免疫/髓系特征的假设,但这些假设仍需在外部队列中验证并进行实验确认。
乳腺癌是一种高度异质性的免疫相关恶性肿瘤1。其疾病进展、复发和转移风险以及治疗反应与肿瘤免疫微环境(TIME)的组成和功能状态密切相关2。尽管综合治疗策略正在不断优化,但部分患者仍会出现疾病进展或复发,凸显了迫切需要识别能够表征TIME状态并支持风险分层的分子生物标志物,同时阐明其潜在机制。
髓过氧化物酶(MPO)是一种含血红素的过氧化物酶,主要在中性粒细胞中表达,在较小程度上也在单核细胞和巨噬细胞中表达。通过生成次氯酸及其他活性氧化物,MPO 参与抗菌防御,但也可能促进氧化性组织损伤和慢性炎症。在癌症中,MPO 的生物学意义似乎具有情境依赖性3。一方面,MPO 介导的氧化应激已被认为通过 DNA 损伤、脂质和蛋白质氧化、炎症信号传导以及肿瘤微环境的重塑,参与了致癌过程和肿瘤进展4,5,6。另一方面,在某些肿瘤背景下,MPO 阳性的先天免疫细胞或髓系细胞浸润与较好的预后或抗肿瘤免疫活性相关7,8,9。这些看似矛盾的研究结果提示,MPO 的临床和生物学意义可能取决于肿瘤类型、疾病阶段、MPO 的细胞来源以及肿瘤微环境的免疫组成。然而,MPO 在乳腺癌中的表达模式及其预后意义,特别是在单细胞水平上的特征,仍尚未完全阐明。
肿瘤免疫微环境(TIME)包含异质性的髓系、淋巴系、基质和上皮细胞组分10。髓过氧化物酶(MPO)经典地与中性粒细胞及其他髓系来源细胞相关,因此在整体肿瘤表达谱中检测到的MPO相关信号可能反映的是免疫细胞组成,而非肿瘤细胞内在的活性10。在乳腺癌中,MPO信号在整体及单细胞数据集中的分布情况、其与免疫浸润估计值的关联性,以及下游计算分析的可重复性仍缺乏充分表征。因此,本研究将MPO视为一个与免疫相关的标志物,用于探索性工作流程的开发,而非作为已证实的TIME因果调控因子或经验证的治疗靶点。与单一队列的差异表达分析或单一平台的免疫浸润估计相比,整合整体转录组学、免疫去卷积、甲基化注释、单细胞图谱映射和计算扰动分析的工作流程,可提供更全面的基因相关免疫背景的探索视角。该方法有助于优先筛选候选标志物并生成可验证的假设,尤其在尚无实验数据可用时具有重要意义。然而,此类计算整合本身无法确定基因的细胞来源、因果关系、药理活性或临床实用性。随着大规模公共癌症队列和单细胞转录组技术的发展,生物信息学方法可用于在群体和单细胞水平上探索基因表达、临床结局、免疫细胞组成及转录状态之间的关联11。基于单细胞基因调控网络的计算扰动方法,可能进一步提供有关基因相关转录敏感性的假设生成信息12,13。因此,本研究旨在表征MPO在乳腺癌中的表达模式、生存关联、免疫/髓系背景、甲基化谱、单细胞分布以及探索性计算扰动谱。整体工作流程如图1所示。
从 TCGA 数据库获取数据
TCGA 乳腺浸润性癌(TCGA-BRCA)队列的RNA测序数据和临床信息来自基因组数据共享门户14。从该门户提取了以每百万转录本(TPM)格式表示的STAR流程RNA-seq数据,并匹配相应的临床注释信息。排除了缺乏对应临床信息的RNA-seq样本。在基于表达水平的分析中,TPM值被转换为log2(TPM + 1)。使用基因符号MPO和Ensembl基因ID ENSG00000005381.8提取MPO的表达数据。对于需要将样本分为MPO高表达和低表达组的分析,仅纳入TCGA-BRCA肿瘤样本,排除邻近的正常组织样本。肿瘤样本根据TCGA-BRCA肿瘤样本中log2(TPM + 1)转换后的MPO表达值的中位数进行分组:MPO表达值大于或等于中位数的样本归入MPO-high组,低于中位数的样本归入MPO-low组。除非另有说明,该基于中位数的分组策略用于生存分析、差异表达分析、富集分析、甲基化分组以及免疫细胞富集比较。临床病理特征,包括性别、年龄、种族、病理T分期、组织学分级、PAM50亚型、病理分期、肿瘤状态,以及总生存期(OS)、无进展间隔期(PFI)和疾病特异性生存期(DSS)等生存终点,均使用R 4.2.1版本进行分析。
公共免疫组织化学图像检索
采用邻近的正常乳腺组织和乳腺癌组织的髓过氧化物酶(MPO)免疫组织化学(IHC)代表性图像作为蛋白质水平的定性参考。这些图像未纳入定量形态测量或统计学分析。方框区域表示高倍放大显示的部位。比例尺在20×图像中表示100 µm,在40×图像中表示50 µm。
表达相关性分析
采用 TCGA-BRCA 数据集分析在乳腺癌中与 MPO 表达共变的基因。计算 MPO 与所有蛋白编码基因之间的全基因组 Pearson 相关系数,并选取正相关性最强的前 30 个基因和负相关性最强的前 30 个基因用于可视化展示。对于涉及多个检测基因的相关性分析,采用 Benjamini-Hochberg 错误发现率方法对名义 p 值进行校正。MPO 相关的蛋白质-蛋白质相互作用(PPI)网络通过相互作用基因/蛋白质检索工具(STRING)数据库构建,仅保留相互作用评分大于 0.40 的蛋白质对用于可视化15。
功能富集 分析
通过比较MPO高表达与MPO低表达的TCGA-BRCA肿瘤组,筛选出差异表达基因(DEGs),筛选阈值设定为|log2FC| > 1,且经Benjamini-Hochberg方法校正的p值 < 0.05。采用R软件包clusterProfiler 4.4.4对差异表达基因进行功能富集分析,包括基因本体(GO)的生物过程、细胞组分、分子功能以及京都基因与基因组百科全书(KEGG)通路分析16,17,18,19,20。当校正后的p值 < 0.05时,认为GO和KEGG富集项具有显著性。
基于MPO高表达组与MPO低表达组之间差异表达统计量的预排序基因列表,进行基因集富集分析(GSEA)。分析使用了MSigDB C2经典通路集合c2.cp.all.v2022.1.Hs.symbols.gmt,该集合对应于MSigDB v2022.1.Hs,包含3,050个基因集21,22。富集结果的显著性判定标准为Benjamini–Hochberg校正后的p值< 0.05、FDR q值< 0.25,以及|标准化富集评分|> 1。在适用情况下,使用GOplot软件包计算显著富集项的Z分数,用于可视化展示。
肿瘤中免疫细胞富集的分析
使用R软件包estimate 1.0.13版本中实现的ESTIMATE算法,评估TCGA-BRCA队列中的免疫和基质成分。以log2(TPM + 1)转换后的表达数据作为输入,计算每个肿瘤样本的免疫评分、基质评分和ESTIMATE评分。利用TIMER/TIMER2.0分析MPO表达水平与TCGA-BRCA队列中主要免疫细胞群体估计浸润水平之间的关联,包括B细胞、CD8+ T细胞、CD4+ T细胞、巨噬细胞、中性粒细胞和树突状细胞23,24,25。基于TIMER的结果被解释为来自相应在线资源的免疫浸润估计值。针对24种免疫细胞类型的免疫细胞富集分析,采用R软件包GSVA 1.46.0版本进行单样本基因集富集分析(ssGSEA)26。基于CIBERSORT解析22种免疫细胞类型所使用的LM22免疫细胞特征矩阵见补充表1。采用Spearman秩相关分析MPO表达水平与免疫细胞富集评分之间的相关性。利用Wilcoxon秩和检验比较按中位数划分的MPO高表达组与MPO低表达组肿瘤之间免疫细胞富集评分的差异。对于涉及多种免疫细胞类型的分析,采用Benjamini–Hochberg错误发现率方法对p值进行校正。
MPO 基因的 DNA 甲基化
使用MethSurv评估MPO基因座内的DNA甲基化模式。TCGA-BRCA的CpG甲基化β值及其与生存的相关性数据均来自MethSurv平台。对选定的MPO相关CpG位点进行可视化,并利用MethSurv提供的生存分析结果评估其与生存结局的关联27。对于涉及多个CpG位点的分析,采用Benjamini-Hochberg错误发现率方法在所检测的MPO相关CpG位点间对p值进行校正。这些甲基化分析被解读为探索性表观遗传注释。
中性粒细胞相关基因的PPI网络构建及相关性分析
为了研究髓过氧化物酶(MPO)与中性粒细胞相关生物学之间的关联,进行了系统的网络分析。从现有文献中整理出一组包含已确立的中性粒细胞活化及相关的炎症过程介质的基因集。完整的中性粒细胞相关基因列表见补充表2。将基因符号统一为官方基因符号,去除重复条目,并将可用基因与TCGA-BRCA表达矩阵取交集后,进行STRING/蛋白质-蛋白质相互作用(PPI)分析、枢纽基因优先排序以及MPO与枢纽基因的相关性分析。使用STRING数据库(版本11.5)构建这些基因之间的PPI网络,设定中等置信度相互作用评分阈值(>0.40)。基于度中心性(即每个节点直接相互作用的数量)对网络中的枢纽基因进行算法优先排序。选取度评分最高的前20个基因用于后续相关性分析。
随后,从 TCGA-BRCA 转录组数据集中提取了这些枢纽基因和 MPO 的表达谱。采用 Spearman 秩相关对 MPO 与每个枢纽基因之间的关联性进行统计学评估。为了刻画枢纽基因彼此之间的相关性模式,计算了所有肿瘤样本中两两之间的 Spearman 相关矩阵。这些相关性分析为后续的可视化提供了定量基础,包括 MPO 与枢纽基因相关性的棒棒图,以及展示枢纽基因间相关性模式的和弦图/热图。
靶向 MPO 的上游转录因子和 miRNA 的预测
利用 KnockTF 数据库(https://bio.liclab.net/KnockTF/index.php)28,29、ChIP 数据库(http://chip-atlas.org/)30,31 和 GTRD 数据库32,33(https://gtrd.biouml.org/#!)预测 MPO 的靶向转录因子。此外,使用 TargetScan 数据库(https://www.targetscan.org/vert_80/)预测靶向 MPO 的潜在 miRNA 结合位点。Venn 图通过 MicroBioinformatics 网站(https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34 生成。
髓过氧化物酶的单细胞分析
特定数据集 GSE161529 来源于基因表达综合数据库(Gene Expression Omnibus, GEO)。数据预处理首先在细胞水平进行过滤,以排除低质量细胞——即满足以下任一条件的细胞:线粒体基因表达超过 25%、总唯一分子标识符(UMI)计数低于 5000,或检测到的基因数少于 2500 个。随后,对环境 RNA 污染和技术批次效应进行了校正35。采用主成分分析(PCA)进行降维以评估细胞间的相似性,继而使用 UMAP 进行细胞聚类与可视化。然后,根据细胞的典型标记基因,将不同聚类注释为相应的细胞类型11。用于单细胞特征评分的 MPO 相关基因集见于补充文件 1。在评分前,基因符号被统一为官方基因符号,去除重复条目,并将可用基因与 GSE161529 表达矩阵取交集。采用 AUCell、Seurat AddModuleScore 和 ssGSEA 方法计算每个细胞的 MPO 相关评分。三种方法所得评分经 Z 分数标准化,缩放至可比范围后整合,生成用于下游描述性分析的综合 MPO 相关评分。通过分析细胞间相互作用网络,比较了基于 MPO 相关信号分层的上皮肿瘤细胞与多种伙伴细胞类型之间推断的配体–受体通讯模式。这些结果被解读为描述性通讯模式,而非表明表达 MPO 的细胞直接介导细胞间通讯的证据。
使用 scTenifoldKnk 进行 MPO 的单细胞虚拟敲低及通路富集分析
通过整合 Seurat 和 scTenifoldKnk 对 MPO 进行了单细胞虚拟敲低分析。在完成标准质控(每个细胞检测到 200–6,000 个基因;线粒体基因比例 < 10%)后,对数据进行对数归一化处理,并选取 2,000 个高变基因用于降维和聚类分析。为富集与 MPO 相关的细胞环境,保留了髓系/中性粒细胞基因模块评分位于前 50% 的细胞。在这些细胞中,通过在 PCA 空间中以 MPO 阳性细胞为种子点,使用 k = 40 的最近邻扩展方法,定义了一个 MPO 邻近细胞亚群。该扩展亚群并不被视为纯粹的 MPO 阳性细胞群体,且未从该 KNN 扩展步骤中得出任何关于细胞类型比例的结论。随后,使用高变基因与 MPO(在 ≥25 个细胞中表达)的并集作为基因集合,对该亚群进行 scTenifoldKnk 虚拟敲低分析。筛选出显著扰动的基因(FDR < 0.05,经 BH 校正)。对所得基因进一步进行 GO 生物过程和 KEGG 通路的功能富集分析(q < 0.05)。
探索性药物-基因检索与 ADMET 注释
通过查询DGIdb获取初步的MPO相关药物-基因或化学物质-基因相互作用记录。由于数据库导出的相互作用列表可能包含由不同证据类型支持的条目,且未必直接对应具有临床可操作性的治疗药物,因此所获得的化合物被视为探索性注释,而非优先考虑的治疗候选物。随后使用SwissADME和ADMETlab汇总预测的理化性质、药代动力学及毒理学特性。这些计算机预测的注释信息用于为化合物层面的解读提供初步背景,并强调在考虑任何治疗相关性之前,仍需进一步开展药理学、毒理学和临床层面的系统整理36。
乳腺癌中 MPO 的表达模式及探索性生存关联
为了描述MPO在多种癌症数据集中的表达模式,我们分析了TCGA泛癌数据集中的MPO RNA-seq数据,发现膀胱尿路上皮癌(BLCA)、乳腺浸润性癌(BRCA)、多形性胶质母细胞瘤(GBM)、头颈部鳞状细胞癌(HNSC)、肾嫌色细胞癌(KICH)、肝细胞癌(LIHC)、肺腺癌(LUAD)、肺鳞状细胞癌(LUSC)、胰腺腺癌(PAAD)、前列腺腺癌(PRAD)和甲状腺癌(THCA)的肿瘤组织中MPO表达水平较低,而结肠腺癌(COAD)、肾乳头状细胞癌(KIRP)及其他组织中MPO表达水平较高(图2A)。随后,我们评估了每种癌症类型中MPO表达与临床结局之间的关联。在TCGA-BRCA队列中,无论配对还是非配对比较,均显示肿瘤组织中的MPO表达低于正常/邻近组织(图2B、C)。根据肿瘤MPO表达的中位值将TCGA-BRCA肿瘤样本分层后,Kaplan-Meier分析显示,MPO表达较高的患者具有更长的无进展间隔时间(风险比(HR)= 0.67,p = 0.028)(图2D)。总生存期(OS)(p = 0.296;补充图1A)和疾病特异性生存期(DSS)(p = 0.18;补充图1B)差异无统计学意义。肿瘤与正常组织的ROC曲线提示该数据集中两组组织之间存在一定区分度(图2E),但此分析不应被解读为临床诊断验证。这种探索性区分可能受到正常样本来源、批次效应、肿瘤纯度及组织组成差异的影响。MPO表达还与病理T分期(图2F)和PAM50亚型分布相关(图2G)。我们提供了邻近正常乳腺组织和乳腺癌组织的代表性MPO免疫组化(IHC)图像,作为蛋白水平的定性参考(图2H)。方框区域表示高倍镜下放大的区域。20×概览图像包含100 µm比例尺,而40×高倍镜图像包含50 µm比例尺。
TCGA-BRCA 队列中 MPO 的相关性与富集分析 队列
Pearson 相关性分析鉴定了与 MPO 正相关的前 30 个基因,这些基因在 MPO 表达梯度上表现出协同上调(图 3A),而与 MPO 负相关的前 30 个基因则呈现相反的表达模式(图 3B)。在通路水平上,MPO 表达与多个肿瘤相关特征评分呈显著正相关,包括炎症反应特征(r = 0.41;图 3C)、EMT 标志物(r = 0.264;图 3D)以及活性氧(ROS)相关基因集评分(r = 0.415;图 3E),提示在 TCGA-BRCA 队列中,MPO 表达与炎症/氧化及间充质样转录状态相关联。
对MPO相关基因进行无监督聚类,进一步根据临床注释(包括病理T分期和PAM50内在亚型)将肿瘤划分为不同的表达模式(图3F)。为了探索MPO相关基因之间可能存在的关联性,我们利用STRING构建了蛋白质-蛋白质相互作用(PPI)网络,结果显示多个与MPO相关的基因之间存在相互连接的模块(图3G)。在该PPI网络中,ESR1、FOXA1、XBP1、GATA3和KRT18在此相关性推导出的模块中表现出较高的网络连接性。这些结果鉴定了与MPO表达共变的基因,但并未确立MPO相关的发病机制或因果方向。MPO高表达组与MPO低表达组之间的差异表达分析揭示了转录组差异,结果总结于火山图中(图3H)。共鉴定出1,159个上调基因和854个下调基因,为后续富集分析提供了输入数据。
接下来,我们使用 R 语言中的 clusterProfiler 软件包,探究 MPO 高表达组与 MPO 低表达组之间差异表达基因(DEGs)的功能相关性。基因本体(GO)富集分析表明,这些差异表达基因主要参与免疫相关的生物学过程,包括免疫反应相关细胞表面受体信号通路的调控以及淋巴细胞介导的免疫,同时在细胞组分方面也显著富集于 T 细胞受体复合物,在分子功能方面则富集于受体激活活性(图 4A)。与此一致,KEGG 通路分析揭示了与免疫和炎症相关的通路,包括细胞因子-细胞因子受体相互作用、趋化因子信号通路、T 细胞受体信号通路、自然杀伤细胞介导的细胞毒性、Th1/Th2 和 Th17 细胞分化、NF-κB 信号通路、原发性免疫缺陷以及 IgA 产生的肠道免疫网络(图 4B)。
为了进一步将表达方向性与功能术语相结合,采用 GO 图谱根据差异表达基因的 |log2FC| 值计算术语层面的 Z 分数,结果再次凸显了免疫富集的转录程序,例如体液免疫反应、白细胞/淋巴细胞介导的免疫、免疫反应激活以及信号转导(图 4C)。基于排序基因列表的基因集富集分析(GSEA)也显示免疫系统通路富集,包括适应性免疫系统、细胞因子–细胞因子受体相互作用以及中性粒细胞脱颗粒(图 4D–G)。由于 MPO 是一种髓系/中性粒细胞相关基因,这些富集结果被解读为 MPO 高表达样本具有更强的免疫/髓系转录信号,而非 MPO 本身重塑免疫微环境的证据。
髓过氧化物酶(MPO)表达与乳腺癌中免疫细胞浸润的相关性
我们在 TCGA-BRCA 队列中评估了 MPO 表达与肿瘤微环境特征之间的关系。应用 ESTIMATE 算法发现,MPO 表达与 ESTIMATE 评分(R = 0.347,p < 0.001)、免疫评分(R = 0.361,p < 0.001)以及基质评分(R = 0.232,p < 0.001)之间存在显著的正相关关系(图 5A)。这些评分在样本中的分布情况如 图 5B 所示。利用 TIMER/TIMER2.0 资源进行的分析表明,在 TCGA-BRCA 队列中,MPO 表达与主要免疫细胞群体的估计浸润水平相关,包括 B 细胞、CD8+ T 细胞、中性粒细胞、CD4+ T 细胞、巨噬细胞和树突状细胞(图 5C)。为进一步评估这种关联模式,我们使用基于 ssGSEA 的 24 种免疫细胞类型的富集评分进行分析。经 Benjamini–Hochberg 错误发现率校正后,MPO 表达与多种免疫细胞富集评分呈正相关,包括 T 细胞、B 细胞、细胞毒性细胞、树突状细胞亚群、巨噬细胞、T 辅助细胞亚群、调节性 T 细胞、CD8+ T 细胞、NK 细胞、肥大细胞和中性粒细胞(图 5D)。这些结果应解释为免疫组分的关联性,而非 MPO 直接调控免疫细胞浸润的证据。我们生成了热图以可视化 TCGA-BRCA 队列中样本层面的免疫细胞富集模式(图 5E)。随后,我们比较了根据中位数定义的 MPO 高表达组与 MPO 低表达组之间 ssGSEA 估计的免疫细胞富集评分。两组之间多个免疫细胞富集评分存在差异,包括活化树突状细胞(aDC)、B 细胞、CD8+ T 细胞、细胞毒性细胞、中性粒细胞、T 细胞、调节性 T 细胞(Tregs)、Th1 细胞、Th2 细胞、Th17 细胞、γδ T 细胞、滤泡辅助 T 细胞(TFH)、高度可变基因(HVG)细胞、效应记忆 T 细胞、中央记忆 T 细胞以及 T 辅助细胞(图 5F、G)。此外,采用 LM22 特征矩阵基于 CIBERSORT 的去卷积方法估算了 22 种免疫细胞类型的相对比例,所得的免疫细胞组成模式如 图 5H 所示。
TCGA-BRCA 队列中 MPO 的 DNA 甲基化分析 队列
采用相同的中位肿瘤MPO表达量截断值,将TCGA-BRCA样本分为MPO高表达组和MPO低表达组,并分别可视化各组的DNA甲基化模式(图6A)。MethSurv分析显示,MPO基因座内部分CpG位点与生存相关,包括cg22331200、cg14619064和cg11151395(图6B–G)。这些与甲基化相关的结果被解读为探索性表观遗传注释,在得出预后或机制性结论之前,需经独立验证。
乳腺癌中MPO表达与中性粒细胞相关基因网络的关联
采用TCGA-BRCA队列研究MPO表达与中性粒细胞相关基因之间的关联。基于STRING数据库构建了中性粒细胞相关基因的蛋白质-蛋白质相互作用(PPI)网络,并根据网络拓扑结构对枢纽基因进行排序(图7A)。随后评估了排名前20的枢纽基因与MPO表达的相关性。如棒棒糖图所示,MPO与多种中性粒细胞相关介质呈 predominantly 正相关,其中与趋化因子/先天免疫信号通路组分(如CCL5、CCL2和TLR2)以及TLR4、CXCR4、TNF和MMP9的相关性更强(图7B)。
为进一步表征这些枢纽基因之间的共调控模式,我们利用弦图和相关性热图可视化了它们的两两关系,结果显示枢纽模块内的基因普遍存在正向相关性,符合协调一致的炎症/中性粒细胞相关转录程序(图7C,D综上所述,这些结果表明,在乳腺癌中,MPO 表达水平的升高伴随着中性粒细胞相关基因网络的协同表达。
MPO 的候选转录因子注释
为了探索可能与MPO相关的候选转录因子,我们查询并整合了公共转录因子资源,包括KnockTF、ChIP-Atlas和GTRD。进一步通过基于网络的优先级排序和相关性分析对候选转录因子进行了汇总。结果的图示总结见补充图2,完整的表格结果见补充文件2。由于这些数据库整合了来自不同实验背景的证据,数据库的重叠情况和网络度仅用于候选因子的注释与优先级排序。这些结果并未被解读为MPO在乳腺癌中存在直接转录调控功能的证据。因此,所提出的候选因子(包括MYC)仅作为补充性的探索性注释,而非经过验证的上游调控因子。
基于 MPO 信号分层的单细胞聚类与描述性细胞间通讯分析
为了注释细胞类型,我们首先基于各谱系的经典标志物进行了簇特异性表达分析。图中展示了各簇中这些关键基因的平均表达水平及表达这些基因的细胞百分比,为后续注释提供了支持(图8A)。相应地,注释后的细胞簇以均匀流形近似与投影(UMAP)图形式可视化,其中每个细胞群根据其鉴定出的类型以不同颜色编码,包括浆细胞样树突状细胞、内皮细胞、肌上皮细胞、增殖中的上皮细胞、浆细胞、细胞毒性T细胞、上皮肿瘤细胞、B细胞、活化的CD4+ T细胞、单核细胞–巨噬细胞、成纤维细胞以及传统T细胞(图8B)。热图展示了选定基因在各细胞簇(C1–C8)中的表达水平。每一行代表一个基因,每一列代表一个细胞簇。颜色梯度表示表达水平,红色代表高表达,蓝色代表低表达。左侧的系统发育树对具有相似表达模式的基因进行了聚类(图8C)。MPO相关评分使用补充文件1中提供的MPO相关基因集对每个细胞进行计算。采用AUCell、Seurat AddModuleScore以及单样本基因集富集分析(ssGSEA)三种方法分别计算每个细胞的评分。三种方法所得评分经Z分数标准化、缩放到可比较的范围后整合,生成一个综合的MPO相关评分,用于后续描述性分析(图8D)。
该细胞间相互作用分析比较了基于MPO相关信号分层的细胞群之间推断的配体-受体通讯模式,包括相互作用网络、信号模式热图、输出信号气泡图和输入信号气泡图(图8E–H)。由于MPO信号在单细胞水平上较为稀疏,且其在注释细胞类型中的表观分布可能受到dropout、环境RNA、双细胞(doublets)以及注释不确定性的影响,因此这些通讯图应被视为描述性分析流程的输出结果。它们并不能证明表达MPO的细胞介导或调控了细胞间通讯。可检测到的MPO信号仅出现在有限数量的细胞中,包括注释的上皮肿瘤细胞和单核细胞-巨噬细胞(图8I)。鉴于MPO通常与中性粒细胞/髓系谱系相关,这一模式需要在独立的单细胞数据集或通过正交实验方法进一步验证。
基于稀疏 MPO 阳性细胞的探索性 scTenifoldKnk 敏感性分析
整合了多个10x Genomics样本,随后进行标准化和高变基因(HVG)筛选、基于PCA的降维分析、构建k近邻图以及Louvain聚类。通过DotPlot总结各聚类中经典的标记基因表达模式,以支持后续的细胞类型注释(图9A)。UMAP可视化展示了整合数据集中已注释的单细胞群体(图9B)。经典的谱系标记基因(例如,上皮细胞的EPCAM和KRT8/KRT18;免疫细胞的PTPRC;B细胞的MS4A1;髓系细胞的LST1/S100A8/S100A9;内皮细胞的PECAM1;成纤维细胞/平滑肌谱系的COL1A1)呈现聚类特异性的表达模式,进一步支持细胞类型注释(图9C)。按样本分层的堆叠柱状图显示,每个样本均包含多个聚类,且整体批次间变异有限(图9D)。
在单细胞数据集中,MPO 的表达相对稀疏,最初仅检测到 85 个 MPO 阳性细胞(图 9E)。鉴于数量有限,仅使用基于 KNN 的邻域扩展方法定义了一个局部的 MPO 邻域亚群,用于探索性敏感性分析。该扩展亚群不应被解释为纯粹的 MPO 阳性细胞群体,因为它可能包含 MPO 表达水平较低或无法检测到的邻近细胞。在该 MPO 邻域亚群中,使用 scTenifoldKnk 进行 MPO 的虚拟敲低,作为计算敏感性分析。所得的火山图、流形位移分析、流形比对可视化、GO/KEGG 富集结果以及位移最显著的基因(图 9F-N)突显了与抗原呈递、髓系/淋巴细胞活化、细胞因子产生以及吞噬体相关通路相关的候选转录程序。这些结果应被理解为探索性的转录敏感性输出,而非 MPO 在乳腺癌中机制性调控这些通路的直接证据。需要独立的单细胞数据集以及正交实验验证(如免疫组织化学、流式细胞术、qPCR 或功能实验)来证实这些观察结果。
探索性药物-基因相互作用检索与 ADMET 注释
作为以 MPO 为中心的分析的探索性延伸,从 DGIdb 中检索了药物-基因相互作用信息。补充图 3 展示了图形化摘要,补充表 3 提供了化合物水平的结果。DGIdb 查询返回了一组异质性的与 MPO 相关的化学条目,其中包括一些临床合理性有限或毒理学特征不利的化合物。因此,基于本研究的分析,这些数据库来源的化合物未被视为乳腺癌的治疗候选物。对 ADMET 相关信息进行了汇总,以对预测的理化性质、药代动力学和毒理学特性进行初步注释。基于数据库的化合物检索和 ADMET 注释并不等同于经临床整理的药物优先排序。因此,这些结果仅作为筛选水平的化学注释,说明在将任何化合物纳入治疗研究之前,必须谨慎进行药理学、毒理学和临床层面的筛选。本研究的主要发现集中于 MPO 表达与免疫/髓系相关转录特征之间的关联。
数据可用性:
TCGA-BRCA 转录组和临床数据来自基因组数据共享门户(https://portal.gdc.cancer.gov;下载日期为2025年8月26日;数据发布版本为202208)。单细胞数据集 GSE161529 来自基因表达综合数据库(https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE161529)。本研究未生成新的测序数据。分析脚本在 https://github.com/tengfeitcm/MPO 公开获取。

图1:数据收集与分析流程图。 请点击此处查看此图的放大版本。

图 2:乳腺癌中 MPO 的表达模式及探索性生存关联。(A) 利用 TCGA 数据库分析了 33 种不同癌症类型及其相邻正常组织中的 MPO 表达水平。(B) 从 TCGA-BRCA 数据集中选取非配对样本,用于分析乳腺癌和正常组织中的 MPO mRNA 表达。(C) 从 TCGA-BRCA 数据集中选取配对样本,用于分析乳腺癌和正常组织中的 MPO mRNA 表达。(D) 基于 TCGA-BRCA 队列中肿瘤 MPO 表达中位值截断点进行分层的患者无进展间隔(PFI)的 Kaplan-Meier 生存分析。(E) 在所分析的公共转录组数据集中,基于 MPO 表达水平评估肿瘤与正常组织区分能力的探索性 ROC 曲线。(F) 不同病理 T 分期中 MPO 的表达情况。(G) 不同 PAM50 分子亚型中 MPO 的表达,图中显示亚型标签。(H) 相邻正常乳腺组织和乳腺癌组织的代表性 MPO 免疫组织化学(IHC)图像。方框区域表示高倍放大显示的区域。20× 的概览图像包含 100 µm 比例尺,而 40× 高倍图像包含 50 µm 比例尺。这些图像作为蛋白水平的定性参考展示,未用于定量形态测量或统计学分析。请点击此处查看该图的放大版本。

图3: 乳腺癌中与MPO相关的相关性及差异表达分析。(A)基于TCGA数据库中mRNA水平的Pearson相关系数,与MPO表达呈正相关的前30个编码基因。(B)基于Pearson相关系数,与MPO表达呈负相关的前30个编码基因。(C)散点图展示MPO与炎症反应上调基因之间的Spearman相关性。(D)散点图展示MPO与EMT标志物上调基因之间的Spearman相关性。(E)散点图展示MPO与活性氧(ROS)上调基因之间的Spearman相关性。(F)基于临床意义(T分期和PAM50)的MPO相关基因簇热图。(G)利用STRING数据库预测的MPO相关蛋白的蛋白质-蛋白质相互作用(PPI)网络。(H)TCGA-BRCA队列中根据中位数划分的MPO高表达与低表达肿瘤组之间差异表达基因的火山图。 请点击此处查看该图的放大版本。

图 4:乳腺癌中 MPO 的富集分析。(A)MPO 高表达组与 MPO 低表达组之间 2,013 个差异表达基因的基因本体(Gene Ontology)富集分析。(B)2,013 个差异表达基因的京都基因与基因组百科全书(Kyoto Encyclopedia of Genes and Genomes)通路富集分析。(C)整合了富集术语、差异表达方向及 |log2FC| 值的联合基因本体富集可视化图。(D)MPO 相关免疫相关基因集的代表性 GSEA 富集图;图中显示了基因集名称、标准化富集评分和 FDR q 值。(E)另一个 MPO 相关免疫相关基因集的代表性 GSEA 富集图;图中显示了基因集名称、标准化富集评分和 FDR q 值。(F)另一个 MPO 相关免疫相关基因集的代表性 GSEA 富集图;图中显示了基因集名称、标准化富集评分和 FDR q 值。(G)另一个 MPO 相关免疫相关基因集的代表性 GSEA 富集图;图中显示了基因集名称、标准化富集评分和 FDR q 值。请点击此处查看该图的放大版本。

图 5: 乳腺癌中免疫细胞富集与MPO表达之间的相关性。(A) 散点图显示MPO表达与ESTIMATE评分、免疫评分及基质评分之间的相关性。(B) 箱形图显示基于中位数划分的MPO高表达与MPO低表达肿瘤组之间ESTIMATE评分、免疫评分和基质评分的差异。(C) 基于TIMER/TIMER2.0的分析,展示MPO表达与主要免疫细胞群体估计浸润水平之间的关联。(D) 棒棒糖图显示MPO表达与ssGSEA估计的24种免疫细胞类型富集评分之间的Spearman相关性。多个免疫细胞相关性的P值采用Benjamini–Hochberg错误发现率方法进行校正。(E) 热图展示TCGA-BRCA队列中样本层面的免疫细胞富集模式。(F) 箱形图显示基于中位数划分的MPO高表达与MPO低表达肿瘤组之间第一组ssGSEA估计的免疫细胞富集评分差异;组间比较采用Wilcoxon秩和检验并进行Benjamini–Hochberg校正。(G) 箱形图显示基于中位数划分的MPO高表达与MPO低表达肿瘤组之间第二组ssGSEA估计的免疫细胞富集评分差异;组间比较采用Wilcoxon秩和检验并进行Benjamini–Hochberg校正。(H) 堆叠柱状图显示基于LM22特征矩阵,通过CIBERSORT估计的22种免疫细胞类型在MPO低表达与MPO高表达肿瘤组中的细胞比例。 请点击此处查看该图的放大版本。

图6: 乳腺癌中MPO基因的DNA甲基化分析。(A)基于中位数定义的MPO高表达组与MPO低表达组中MPO甲基化模式的热图。(B)Kaplan-Meier生存曲线,显示cg27456487位点甲基化的预后意义。(C)Kaplan-Meier生存曲线,显示cg02668773位点甲基化的预后意义。(D)Kaplan-Meier生存曲线,显示cg07110356位点甲基化的预后意义。(E)Kaplan-Meier生存曲线,显示cg11151395位点甲基化的预后意义。(F)Kaplan-Meier生存曲线,显示cg14619064位点甲基化的预后意义。(G)Kaplan-Meier生存曲线,显示cg22331200位点甲基化的预后意义。请点击此处查看该图的放大版本。

图 7: 利用 TCGA 数据库在 mRNA 水平上分析 MPO 与中性粒细胞相关基因的相关性。(A) 蛋白质相互作用网络的可视化图谱,展示核心蛋白与其他蛋白之间的相互作用。(B) MPO 与前 20 个中性粒细胞相关基因的相关性分析,显示不同基因的相关系数及 P 值分布。(C) 前 20 个中性粒细胞相关基因之间的弦图(chord diagram),直观呈现基因关联的强度与方向。(D) 前 20 个中性粒细胞相关基因的相关性热图,通过颜色梯度和统计标记展示相关系数及显著性水平。请点击此处查看该图的高清版本。

图8:乳腺癌单细胞数据集中单细胞聚类及MPO相关细胞间通讯分析。(A)各细胞簇中经典标记基因的点图,用于细胞类型注释。(B)注释后细胞群体的UMAP可视化图。(C)选定标记基因在不同细胞簇中的热图。(D)基于补充文件1提供的基因集,使用AUCell、ssGSEA和Seurat AddModuleScore方法计算MPO相关评分在注释细胞类型中的汇总点图。(E)细胞间相互作用网络图,展示按MPO相关信号分层的上皮肿瘤细胞与其他细胞类型之间的通讯关系;边的宽度表示相互作用强度,节点大小反映整体相互作用活性。(F)显示不同细胞类型间输出和输入信号模式的热图。(G)上皮肿瘤细胞按MPO相关信号分层后向其他细胞类型发出的信号通路的气泡图。(H)其他细胞类型向按MPO相关信号分层的上皮肿瘤细胞传递的输入信号通路的气泡图。(I)MPO在注释细胞类型中的表达分布。请点击此处查看该图的放大版本。

图 9:单细胞图谱分析及 MPO 敏感性虚拟敲低结果的探索性分析。(A)DotPlot 显示单细胞聚类中经典标志基因的表达情况;圆点大小表示表达每个标志基因的细胞百分比,颜色强度表示平均表达水平。(B)注释后的单细胞群体的 UMAP 可视化图,每种颜色代表一种不同的细胞类型或聚类。(C)关键标志基因表达的 UMAP 可视化图,显示包括髓系细胞在内的各类细胞标志基因的表达分布。(D)各样本中细胞聚类比例的堆叠柱状图。(E)MPO 基因表达的 UMAP 可视化图。(F)单细胞测序质控指标的 violin 图。(G)关键标志基因的聚类图。(H)在聚类水平上的经典标志基因 DotPlot。(I)虚拟敲低敏感性分析中发生变化基因的火山图。(J)位移与显著性之间的散点图。(K)流形对齐箭头图。(L)虚拟敲低结果中基因的 GO BP 富集分析。(M)虚拟敲低结果中基因的 KEGG 通路富集分析。(N)排除 MPO 后流形位移最大的前 20 个基因。请点击此处查看该图的放大版本。
补充图1:TCGA-BRCA队列中MPO的额外生存分析。(A,B)本文件包含基于中位肿瘤MPO表达水平截断值分层的(A)总生存率和(B)疾病特异性生存率的补充Kaplan-Meier生存分析。这些分析作为图2D的补充结果分析提供,在当前队列中无统计学显著性。请点击此处下载该文件。
补充图2:MPO的探索性候选转录因子注释。(A)维恩图,显示来自三个公开转录因子资源的候选转录因子的交集。(B)MYC表达比较结果。(C)转录因子相关性热图,含行和列标签。(D)MPO与MYC相关性输出结果。(E)MYC生存分析结果。(F)MYC ROC结果。与MYC相关的输出结果仅作为补充性候选转录因子注释展示,不用于支持机制性的上游调节因子结论。请点击此处下载该文件。
补充图3:MPO基因的探索性DGIdb药物-基因检索结果。灰色节点代表MPO基因,橙色节点代表检索到的小分子条目,连接线表示数据库预测的药物-基因关系。请点击此处下载该文件。
补充表 1: 用于基于 CIBERSORT 的 22 种免疫细胞类型去卷积分析的 LM22 免疫细胞特征矩阵。基因符号已进行标准化处理,删除了重复条目,并在下游分析前将可用基因与相应的 TCGA-BRCA 或 GSE161529 表达矩阵进行了交集处理。请点击此处下载该文件。
补充表 2: 用于 STRING/蛋白质互作网络分析、核心基因优先排序以及 MPO–核心基因相关性分析的中性粒细胞相关基因列表。 请点击此处下载该文件。
补充表 3:MPO 的探索性 DGIdb 药物-基因检索及 ADMET 注释结果。该文件包含通过 DGIdb 检索到的与 MPO 相关的化学物-基因相互作用记录,以及化合物水平预测的理化性质、药代动力学和毒性相关注释。这些结果仅作为初步的化学注释提供,不应被解读为治疗候选化合物列表。它们并未证实 MPO 抑制作用、靶点结合、配体特异性、选择性、安全性、治疗有效性或临床适用性。本表中的数值代表所列化合物预测的理化性质和类药性参数。分子量单位为克每摩尔(g/mol)。氢键受体和氢键供体数值分别表示预测的氢键受体和供体数量。Moriguchi 辛醇-水分配系数表示预测的脂溶性。Lipinski 违反项表示各化合物不满足 Lipinski 五规则标准的数目。生物利用度评分表示预测的口服生物利用度相关评分,拓扑极性表面积指预测的拓扑极性表面积。请点击此处下载该文件。
补充文件 1:用于通过 AUCell、Seurat AddModuleScore 和 ssGSEA 进行单细胞特征评分的 MPO 相关基因列表。 请点击此处下载该文件。
补充文件2:MPO的探索性候选转录因子和miRNA注释结果。该文件包含基于公共资源(包括KnockTF、ChIP-Atlas、GTRD和TargetScan)的数据库推导出的候选转录因子和miRNA注释结果。这些注释仅用于探索性候选基因的优先排序,不作为MPO在乳腺癌中受上游调控的功能性证据。请点击此处下载该文件。
本研究提出了一种探索性的公共数据集和计算机模拟工作流程,用于分析髓过氧化物酶(MPO)表达与乳腺癌中免疫/髓系特征之间的关联。TCGA-BRCA 分析显示,MPO 在肿瘤组织中的表达低于相邻的非肿瘤组织,且较高的 MPO 表达与更长的无进展间隔期相关。然而,总生存期和疾病特异性生存期的差异无统计学意义。因此,根据现有证据,不应将 MPO 视为可靠或已确立的预后生物标志物。未来的研究应采用多变量 Cox 回归模型评估 MPO,调整已确立的临床病理学变量,并结合独立验证队列和亚型分层分析。
与传统的单队列差异表达分析或单平台免疫浸润估计相比,这种以MPO为中心的工作流程整合了大规模转录组学、免疫富集、甲基化注释、单细胞映射以及虚拟扰动分析,从而更全面地探索与MPO相关的免疫/髓系特征。然而,该工作流程仍是对外部队列验证、空间或蛋白水平验证以及实验性扰动检测的补充,而非替代。
免疫浸润和富集结果应被解读为与MPO相关的免疫微环境,而非由MPO驱动的免疫重塑。MPO主要在中性粒细胞及其他髓系细胞中表达37。因此,MPO表达与ESTIMATE评分、免疫评分、免疫细胞富集评分、中性粒细胞相关基因、细胞因子通路、抗原呈递特征或中性粒细胞脱颗粒通路之间的正相关性在生物学上是合理的,可能主要反映了在整体肿瘤样本中免疫细胞/髓系细胞丰度的差异。该解释与先前研究一致,已有研究表明MPO阳性中性粒细胞浸润与乳腺癌的良好预后相关,且MPO已被发现参与树突状细胞功能及T细胞驱动的组织炎症38,39。批量RNA测序数据无法确定MPO是否在肿瘤细胞内具有固有活性,或所观察到的信号是否主要来源于浸润的免疫细胞。要明确其细胞来源和功能,需要独立的单细胞数据集、空间图谱分析、免疫组织化学、流式细胞术或基于扰动的实验模型。
单细胞分析提供了额外的描述性信息,但仍受限于髓过氧化物酶(MPO)检测的稀疏性。在基于KNN的邻域扩展之前,最初仅检测到85个MPO阳性细胞。尽管KNN扩展能够对MPO阳性细胞局部转录邻域中的细胞进行敏感性分析,但该过程可能包含并不直接表达MPO的细胞。因此,scTenifoldKnk的虚拟敲低结果应被解读为一种探索性的计算敏感性分析,而非MPO介导通路调控的证据40。在得出机制性结论之前,还需在独立的单细胞乳腺癌数据集以及正交实验检测中进行验证。
转录因子分析也应谨慎解读。KnockTF、GTRD 和 ChIP-Atlas 预测结果的重叠部分经基于度的优先级排序后,可提名候选转录因子,但无法确立这些因子对乳腺癌中 MPO 的功能性转录调控作用。因此,MYC 及其他候选因子仅作为探索性注释予以保留。由于转录因子活性具有高度的上下文依赖性,可能因肿瘤亚型、细胞组成、检测平台及预处理策略的不同而变化,在为任何候选因子指派上游调控作用之前,均需进行特定上下文的验证。此类验证应包括 ChIP-qPCR 或 ChIP-seq、启动子报告基因检测,以及转录因子扰动后对 MPO 表达水平的测定。
药物-基因检索及ADMET注释也应谨慎解读。DGIdb可能返回异质性的化学物-基因关联,包括那些并非选择性MPO配体的化合物,这些化合物可能临床合理性有限或具有不利的毒理学特性36。ADMET预测可提供初步的化学注释,但不能确立靶点结合、效价、选择性、安全性或治疗有效性41。因此,当前的化合物水平结果不应被用于推断其治疗潜力。有意义的转化评估需要一组经过审慎筛选的药理学相关MPO抑制剂或探针,与已知的靶向MPO的化合物进行比较,并通过生化、细胞和药理学实验进行验证。在解读与药物相关的研究结果时,还应考虑MPO在癌症中依赖于情境且可能具有双重作用的特点。MPO可能通过氧化应激、活性氧化物生成、DNA损伤、慢性炎症以及肿瘤微环境的重塑等机制促进肿瘤发展。与此同时,在整体肿瘤数据集中检测到的MPO表达可能反映了中性粒细胞或其他髓系免疫细胞的浸润,在某些情况下,这可能与免疫活跃的微环境及更佳的临床预后相关39,42。因此,对MPO的生物学解释取决于肿瘤类型、细胞来源、疾病阶段以及免疫细胞组成。
MPO 基因座内的 DNA 甲基化研究结果也被视为探索性发现。在 MethSurv 分析中,部分选定的 CpG 位点显示出与生存率的关联,但这些结果在得出预后或机制性结论之前,仍需独立验证。MPO 的表观遗传调控可能与转录因子结合及染色质水平的调控相互作用,但在缺乏功能性染色质数据或扰动实验数据的情况下,此类相互作用仍属推测43。
MPO 表达的临床意义应谨慎解读。目前的研究结果并未确立 MPO 作为一种具有临床可操作性的生物标志物,或可指导乳腺癌免疫治疗决策的标志物。相反,MPO 可能反映了肿瘤微环境中与髓系细胞/中性粒细胞相关的免疫背景。在今后的研究中,可将 MPO 表达与已确立的免疫治疗相关标志物联合评估,包括肿瘤浸润性淋巴细胞、PD-L1 表达、免疫检查点基因表达、分子分型以及经过验证的免疫特征谱。在考虑将 MPO 用于患者分层或免疫治疗决策之前,此类分析应包含独立队列、多变量模型以及治疗反应数据集。
多个工作流程步骤对于可重复性至关重要,包括一致的 TCGA-BRCA 数据预处理、仅肿瘤样本的基于中位数的 MPO 高/低分组、预定义的统计学阈值和多重检验校正、免疫细胞富集算法及特征基因集、单细胞质量控制与注释、基于 KNN 的 MPO 邻域扩展,以及虚拟敲低和 DGIdb/ADMET 输出结果的探索性处理。这些参数的改变可能影响下游结果及其解释,因此应谨慎报告并严格重复。在故障排查时,若出现不一致的结果,应通过检查样本来源、表达量标准化方法、分组截断值、多重检验校正方法、免疫细胞特征基因集、单细胞质控与注释、KNN 邻域定义、虚拟敲低阈值、富集分析截断值以及 DGIdb/ADMET 中异质性化合物记录来进行排查。
本研究存在若干局限性,需予以说明。首先,本研究基于对公共数据库(TCGA-BRCA和公开的单细胞数据)的回顾性分析,因此可能受到队列异质性、样本来源差异、批次效应、临床注释不完整以及肿瘤组成差异的影响。其次,当前发现主要来源于转录组关联分析和计算机模拟分析,缺乏直接的实验验证。因此,观察到的MPO表达与免疫/髓系特征、甲基化注释、转录因子候选物及虚拟敲低结果之间的关联,不应被解释为因果机制。第三,在单细胞数据集中MPO的检测信号稀疏,KNN邻域扩展前仅检测到85个MPO阳性细胞;经扩展后的MPO邻域细胞亚群可能包含MPO表达水平较低或无法检测的细胞,不应视为纯粹的MPO阳性细胞群体。第四,由于MPO主要与中性粒细胞及其他髓系谱系细胞相关,因此在整体RNA测序数据中检测到的MPO相关信号可能受到免疫细胞丰度、肿瘤纯度和细胞组成的混杂影响,而非反映肿瘤细胞内在的活性。最后,基于DGIdb的药物-基因检索及ADMET注释仅为探索性化学注释,这些结果并未证实MPO抑制作用、靶点结合能力、选择性、安全性、治疗有效性或临床适用性。未来需要利用独立队列、空间分辨或蛋白水平验证以及功能实验进一步研究,以确认这些发现的生物学和临床相关性。
综上所述,当前公共数据集的分析结果支持髓过氧化物酶(MPO)表达与乳腺癌中免疫/髓系转录特征之间的关联,且在所分析的队列中,较高的MPO表达与较长的无进展间隔期相关。这些发现仍属于探索性研究,仅具有提出假设的意义。本研究并未证实MPO对肿瘤免疫微环境具有因果调控作用,也未证实MYC对MPO具有功能性调控,或所筛选出的化合物具有治疗相关性。本研究的主要贡献在于提供了一套可重复的计算工作流程,以及一组有待在外部队列中验证并进行实验确认的可检验假设。
作者声明本工作中不存在利益冲突。仅在稿件修改期间使用了基于人工智能的语言编辑工具,以辅助润色英文语言并提高可读性。该工具未用于研究设计、数据分析、图表生成、结果解释、参考文献选择或科学结论的推导。所有分析、结果、解释、参考文献及最终文本均经过作者仔细核对、审阅和批准,作者对稿件内容负全部责任。
作者感谢航天中心医院科研基金(YN202530)提供的经费支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CellChat | R 软件包/开源 | https://github.com/sqjin/CellChat | 细胞间通讯分析 |
| ChIP-Atlas | 公共数据库 | https://chip-atlas.org/ | 转录因子靶点筛选;2021 年更新 |
| clusterProfiler | Bioconductor | https://bioconductor.org/packages/clusterProfiler/ | GO/KEGG 富集分析;v4.4.4 |
| Cytoscape | Cytoscape 联盟 | https://cytoscape.org/ | 网络可视化与拓扑结构分析 |
| DGIdb | 华盛顿大学/公共数据库 | https://www.dgidb.org/ | 药物-基因相互作用检索 |
| GDC/TCGA-BRCA | 美国国家癌症研究所 | https://portal.gdc.cancer.gov/ | 批量转录组学与临床数据来源 |
| 基因表达综合数据库:GSE161529 | NCBI | https://www.ncbi.nlm.nih.gov/geo/ | 单细胞数据集来源 |
| GSEA/MSigDB | Broad 研究所 | https://www.gsea-msigdb.org/gsea/msigdb | 基因集富集分析与基因集参考;版本 3.0 |
| GSVA | Bioconductor | https://bioconductor.org/packages/GSVA/ | 基因集变异/ssGSEA 相关评分;版本 1.46.0 |
| GTRD | 公共数据库 | http://gtrd.biouml.org/ | 转录因子靶点筛选;2021 年 |
| KnockTF | 公共数据库 | http://www.licpathway.net/KnockTF/index.html | 转录因子扰动资源;版本 2.0 |
| R | 统计计算 R 基金会 | https://www.r-project.org/ | 统计计算环境 |
| scTenifoldKnk | R 软件包/开源 | https://github.com/cailab-tamu/scTenifoldKnk | 虚拟敲低分析 |
| Seurat | R 软件包/开源 | https://satijalab.org/seurat/ | 单细胞预处理与聚类分析 |
| STRING | ELIXIR/公共数据库 | https://string-db.org/ | 蛋白质-蛋白质相互作用分析;v11 |
| SwissADME | SIB 瑞士生物信息学研究所 | http://www.swissadme.ch/ | 类药性评估;2017 年发布/网络工具 |
| TIMER | 公共网络资源 | https://timer.cistrome.org/ | 免疫浸润分析;TIMER2.0 |
| UCSC Xena 或关联的 TCGA 门户 | UCSC | https://xenabrowser.net/ | 探索性数据访问/验证 |