研究文章

利用量子聚类算法分析基因表达行为相似性的癌症预测生物信息学方法

429 次观看

DOI:

10.3791/68890

2026年1月9日

本文内容

摘要

本方案旨在利用混合量子K均值算法对癌症分类中的基因表达数据进行聚类,该算法可自动识别最优聚类数量并高效分离聚类,从而推动在含噪声中等规模量子设备上的生物信息学应用 (含噪声的中等规模量子)设备。

摘要

本研究提出了一种具有自动聚类检测功能的混合量子K均值聚类算法,用于对癌症与非癌症基因表达数据进行分类。该方法采用量子多特征映射进行状态编码,基于交换测试的量子距离估计,以及基于量子梯度的优化方法,通过最小化类内方差动态识别最优聚类数量。初始聚类中心通过基于距离的概率成比例策略选取,从而提高了算法的稳定性和准确性。在乳腺癌数据集上的应用结果表明,该方法优于现有的量子K均值算法,其轮廓系数达到0.641(对比值为0.601),Calinski-Harabasz指数为766.57(对比值为617.65),Davies-Bouldin指数为0.659(对比值为0.704),表明其在聚类紧凑性与分离性方面表现更优。尽管所提出的算法由于迭代优化过程导致时间复杂度略高,为O (N×Kmax×Mobs),但在聚类准确性、误差降低和实际可行性方面显著优于预设聚类数的量子K均值算法。该算法在处理高维数据方面的高效性以及对量子噪声的鲁棒性,凸显了其在真实世界生物信息学应用中的潜力,特别是在基于基因表达谱的癌症分类任务中。

引言

在生物医学工程、生物信息学、统计学、社会科学和经济学中,聚类是一种将数据组织成有意义的同质性组别的基本技术。例如,拓扑数据分析(TDA)已被应用于癌症基因表达数据集,以揭示高维空间中的结构模式1。聚类通过将高度相似的对象划分到同一簇中,而将不相似的对象分配到不同簇中,从而实现数据的组织。该方法属于无监督学习,无需依赖标注的训练数据。

在过去的几十年中,人们开发了众多聚类算法。经典方法包括基于划分的聚类2˒3、基于密度的聚类4,5、层次聚类6,7、基于网格的聚类8˒9,以及基于模型的聚类10。对这些方法的综述指出了它们的优势,同时也揭示了其局限性11。尽管这些算法在特定情境下有效,但大多数经典算法在处理高维、含噪声或分布不规则的数据时存在困难。因此,目前尚不存在一种能在所有数据类型上均表现最优的通用聚类方法。

....

访问受限。请登录或开始试用以查看此内容。

方案

1. 量子特征映射

将经典数据点编码为量子态,是通过将它们映射到量子希尔伯特空间中实现的,该空间可被量子计算机高效地访问和操控16˒17,19。该过程采用非线性量子特征映射,将经典数据嵌入希尔伯特空间(图1)。固定的量子电路特征映射将输入数据点转换为量子态17,而变分电路则通过调整测量基来实现机器学习任务22。变分电路由一组参数化量子门构成,通过混合量子-经典技术进行优化23

访问受限。请登录或开始试用以查看此内容。

结果

一个好的聚类结果取决于多种因素,例如聚类之间的分离距离、聚类内部距离、方差比准则等。因此,聚类性能通过三个标准指标进行评估:轮廓系数(Silhouette Score)、Calinski-Harabasz指数(CH Index)和Davies-Bouldin指数(DB Index)。轮廓系数通过公式 静态平衡公式:S=(nc-ic)/max(nc,ic),示意图,科研计算工具。 来衡量聚类间的分离程度,其中 ic 表示类内平均距离,nc 表示到最近聚类的平均距离。该值范围为 -1 到 +1,接近 +1 的值表示聚类紧凑且分离良好。CH指数通过公式

访问受限。请登录或开始试用以查看此内容。

讨论

本研究提出一种新型的混合量子K均值聚类算法,结合最优 聚类检测,专门用于利用高维基因表达数据对癌变与非癌变样本进行分类。该方法融合了量子多特征映射、基于交换测试的量子距离估计以及 基于量子梯度的优化技术,以动态确定最优聚类数量。与传统K均值算法不同,传统方法需预先设定聚类数目且对初始聚类中心的选择敏感,而所提出的方法采用基于概率比例的聚类中心初始化策略,以确保算法的稳定性与收敛性。

结合最优聚类数确定的量子K均值算法利用量子特征映射和概率性质心初始化,以增强在复杂数据集(如基因表达谱)中的聚类性能。通过将量子原理引入聚类流程,该方法提高了组间分离度,并在高维数据分析中提供了更强的鲁棒性20

基因表达数据的量子特征映射

基因表达数据集通常包含大量基因,每个基因都对应一个表达水平。这些数据点位于高维特征空间中,在此空间中,传统的聚类方法在.......

访问受限。请登录或开始试用以查看此内容。

致谢

作者感谢使用了公开的基因表达数据集和量子模拟器,这些资源使得本研究的实际验证成为可能。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Apple MacBook Pro(M1 芯片)Apple Inc.-8核 CPU / 8核 GPU,16 GB 统一内存 — 用于本地模拟
乳腺癌基因表达数据集Kaggle-包含 569 个样本、32 个特征的数据集(在研究中通过主成分分析 PCA 降维)
macOS Monterey(操作系统)Apple Inc.12.6.9本地机器上使用的运行环境
math(Python 标准库)Python Software Foundation内置基本数学函数
MatplotlibMatplotlib 社区3.8.4绘图与可视化
NoiseModel、QuantumError、ReadoutError(Qiskit Aer)IBM / Qiskit 项目属于 Aer 0.13.3 版本用于模拟真实的量子噪声
NumPyNumPy 开发者团队1.26.4数值计算与数组操作
pandaspandas 开发团队2.2.2数据处理、输入/输出、表格操作
PythonPython Software Foundation3.10.12编程语言,用于 Jupyter / IPython 环境
Qiskit AerIBM / Qiskit 项目0.13.3模拟器后端,支持噪声建模与执行
Qiskit IBM Runtime – Session、SamplerV2IBM / Qiskit 项目0.41.1用于在模拟器中执行电路的执行框架
Qiskit TerraIBM / Qiskit 项目0.45.0用于量子电路构建与转译的框架
scikit-learnscikit-learn 开发者1.4.2主成分分析 PCA、聚类评估指标、数据预处理

参考文献

  1. Mehta, V., Agarwal, M., Kaliyar, R. K. A comprehensive and analytical review of text clustering techniques. Int. J. Data Sci. Anal. 18 (3), 239-258 (2024).
  2. Bezdek, J. C. Pattern recognition with fuzzy objective function algorithms. , Springer Science & Business Media. (2013).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

K

相关文章