本研究中使用视觉 Transformer 模型,能够从 CT 图像中对肺癌进行分类,在 1,190 次扫描中达到了 98.18% 的准确率。与传统的卷积神经网络(CNN)模型相比,该模型在存在噪声和模糊图像的情况下仍保持了令人满意的鲁棒性,准确率维持在 80–88% 之间,适用于消费级健康诊断应用。
本研究中使用视觉 Transformer 模型,能够从 CT 图像中对肺癌进行分类,在 1,190 次扫描中达到了 98.18% 的准确率。与传统的卷积神经网络(CNN)模型相比,该模型在存在噪声和模糊图像的情况下仍保持了令人满意的鲁棒性,准确率维持在 80–88% 之间,适用于消费级健康诊断应用。
由于良性疾病与恶性疾病在影像学检查中的差异较为细微,肺癌的诊断仍然具有挑战性。尽管传统的卷积神经网络(CNNs)一直是医学影像分析的主要方法,但其在成像方法变化时的应用性和鲁棒性仍然有限。机器学习的进步正在改变面向消费者的医疗健康技术中的传统诊断方式,从而改善医疗服务的可及性与个性化患者护理流程。本文描述了使用视觉变换器(Vision Transformers, ViTs)结合CT扫描进行肺癌分类的方法,并探讨其在消费者健康应用中的相关性。该视觉变换器模型在包含1,190张CT图像的完整数据集上进行训练,在分类任务中达到了98.18%的准确率,马修斯相关系数(Matthews Correlation Coefficient)为0.9676。此外,该模型还在模拟的实时场景中,利用实时噪声和模糊数据集进行了性能验证。尽管在整体数据集上保持了高诊断准确性的验证方法,ViT模型在区分噪声图像与模糊图像方面的表现仍优于传统验证方法,准确率达到80%至88%,即使在上述不利条件下亦表现出良好性能。尽管初步结果表明ViT在处理图像变异时具有良好的鲁棒性,但由于评估研究是在相对较小的数据集和模拟环境下完成的,因此在结果解读时仍需保持谨慎。未来的研究若能采用更大规模、更能代表真实临床条件且经过临床验证的数据集,将有助于进一步明确ViT在肿瘤学诊断临床识别中的优势,并提升肺癌的早期检出能力。
肺癌在全球范围内具有重大负担,每年影响数百万人的生命。由于肺癌具有侵袭性强且常在晚期才出现症状的特点,其相关死亡率较高。早期检测至关重要,因为及早干预可显著提高治疗效果和生存率1。目前,初步筛查和诊断的常规方法仍依赖于计算机断层扫描(CT),以实现对肺部结构更详细的可视化。然而,CT图像的评估过程复杂,完全依赖放射科医生的主观判断。肿瘤在大小、形状和密度等方面的变异性也降低了人为观察的可靠性。环境因素可能进一步影响基于人工分析的决策准确性和可重复性。
鉴于上述局限性,近年来的研究文献大力推动将人工智能(AI)应用于医学影像领域,尤其聚焦于深度学习(DL)模型。深度学习,特别是卷积神经网络(CNNs),通过改变图像分析方式,颠覆了医学影像中的观察模式2。CNNs显著提升了肿瘤学中的诊断流程,展现出识别影像数据中细微而复杂特征的能力,这些特征通常难以被人眼察觉。尽管取得了这些进展,CNNs在小样本数据集上仍存在过拟合问题,在成像条件变化时鲁棒性降低,并且依赖局部感受野,可能忽略全局依赖关系。虽然混合型CNN-Transformer方法试图结合卷积先验与注意力机制,但仍继承了卷积架构的固有偏差。图1展示了数据集中属于不同类别的若干样本实例。
访问受限。请登录或开始试用以查看此内容。
该数据集共包含来自110个病例的1,190张CT扫描切片,分为三类:正常(55例)、良性(15例)和恶性(40例)。每个病例包含多张CT切片(每例约80至200张切片),提供胸部区域的多种轴向视图。CT图像采用SOMATOM扫描仪以标准成像参数在DICOM格式下获取:管电压 = 120 kV,层厚 = 1 mm,窗宽 = 350–1,200 Hounsfield单位(HU),窗中心值 = 50–600 HU,扫描时患者处于深吸气后屏气状态。
所有图像在分析前均已完全去标识化,以去除任何个人身份信息(PII)。该数据集已获得参与的各医疗中心机构审查委员会的伦理批准,监管审查委员会已免除书面知情同意要求。病例涵盖来自不同背景的个体,包括政府雇员、农民以及来自伊拉克多个省份(包括巴格达、瓦西特、迪亚拉、萨拉赫丁和巴比伦)的居民,在性别、年龄、教育水平和居住状况方面具有多样性。
由于该数据集是公开且去标识化的,因此本研究使用该数据集无需额外的伦理审批。该数据集遵守其原始贡献者及托管平台规定的条款和条件。
本研究的方法采用多阶段流程,旨在借助 IQ-OTH/NCCD 肺癌数据集21构建预测模型。该方法为以消费者为中心的医疗设备奠定了坚实基础,适用于对延迟要求较低且需要更高准确性的场景。图....
访问受限。请登录或开始试用以查看此内容。
Vision Transformer 模型在 IQ-OTH/NCCD 肺癌数据集的多种评估指标上表现出色,能够有效区分正常的、良性的和恶性的 CT 图像。在整个包含 220 张图像的测试数据集上,模型的整体性能达到了 98.18% 的高准确率。这一极高的准确率表明,该模型具有很强的泛化能力,因此可用于临床环境。
在良性病例中,该模型的精确度达到100%,召回率为89.47%,F1分数为94.44%。
在恶性病例方面,该模型的精确率为100%,召回率为98.37%,F1分数为99.18%。该模型对正常病例的预测精确率为95.12%,召回率为100%,F1分数为97.50%。结果表明,该模型在检测恶性病例方面的准确性尤为出色,这在肿瘤学中具有重要意义;从临床相关性来看,对恶性病例的判断必须高度准确,因为未能检出恶性诊断将带来严重后果。马.......
访问受限。请登录或开始试用以查看此内容。
该模型在IQ-OTH/NCCD肺癌数据集上对视觉Transformer模型的评估与应用取得了显著成果,具有很高的准确性。使用该模型对CT扫描图像分类为正常、良性与恶性的一般准确率达到98.18%。
该模型在其他关键评分指标中也表现出优异的准确性,例如在恶性病例检测中达到100%的精确度,这在早期诊断与临床管理中具有重要意义。
深入分析表明,该模型不仅在精确率方面表现良好,而且具有很高的召回率和F1分数,从而确保了极低的假阴性率——这在医学诊断中是一个非常重要的因素,因为漏诊的代价可能是致命的。该研究取得上述结果得益于实验方案中的多个组成部分。例如,预处理技术(如调整尺寸、归一化以及数据增强(随机旋转和缩放))有助于提高数据一致性,并降低过拟合风险。
采用ViT进行迁移学习,即使在中等规模数据集上也能保证模型收敛的稳定性;而使用AdamW优化器并结合早停机制,则有效避免了过度训练。总体而言,这些方法学上的决策,加上对验证集上各项性能指标的密切监控,共同积极影响了本研究模型的成功,并为临床AI流程中的最佳可复现实践提供.......
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
本工作由沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目(PNURSP2025R432)资助。 作者感谢纳吉兰大学研究生院与科学研究处于成长资助计划下为本研究提供的经费支持(资助编号:NU/GP/SERC/13/575-6)。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| A100 GPU (CUDA) | NVIDIA | CUDA 版本 11.6 | 用于模型训练和评估的 GPU 加速。 |
| AMD EPYC-7502P CPU | AMD | N/A | 用于高性能计算的处理器。 |
| 千兆以太网 | Intel | N/A | 用于信息物理系统中点对点安全通信的网络连接。 |
| Matplotlib | Python 软件基金会 | 版本 3.5 | 用于结果绘图的可视化库。 |
| Paillier 密码系统 | 开源(通过 TenSEAL 实现) | N/A | 支持对梯度进行加法同态加密。 |
| PySyft | OpenMined | 版本 0.6.0 | 差分隐私与联邦学习库。 |
| Python(Anaconda 发行版) | Anaconda 公司 | 版本 3.9 | 包含预安装包和环境管理工具,用于脚本编写和框架开发。 |
| PyTorch | Meta AI | 版本 1.12 | 用于模型训练的深度学习框架。 |
| 内存 | Corsair | 256 吉字节 (GB) | 为高强度训练提供高内存支持。 |
| Scikit-learn | Python 软件基金会 | 版本 1.1 | 用于性能评估的机器学习工具。 |
| Seaborn | Python 软件基金会 | 版本 0.11 | 统计数据分析可视化库。 |
| 固态硬盘存储 | Seagate | 1 太字节 (TB) | 用于快速数据存储与检索。 |
| TenSEAL | OpenMined | 版本 0.3 | 用于安全聚合的同态加密库。 |
| TensorFlow | 版本 2.9 | 用于扩散模型的深度学习框架。 | |
| Ubuntu 操作系统 | Canonical | 版本 20.04 LTS | 所有实验所使用的操作系统。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可