本研究旨在通过整合深度学习功能、临床元数据和可解释的人工智能技术,开发和评估一种可解释、保护隐私的多模态群形结构布置,以实现皮肤病变的准确分类,从而提升早期皮肤癌检测的诊断准确性、透明度和可靠的临床决策支持。
Research Article
本研究旨在通过整合深度学习功能、临床元数据和可解释的人工智能技术,开发和评估一种可解释、保护隐私的多模态群形结构布置,以实现皮肤病变的准确分类,从而提升早期皮肤癌检测的诊断准确性、透明度和可靠的临床决策支持。
在皮肤病中,皮肤癌是最危及生命的疾病之一。早期且准确的诊断对于改善患者的预后非常重要。然而,传统的基于人工智能的诊断方法面临诸多挑战,包括隐私问题、可解释性有限以及多类皮肤病变数据集中严重的类别不平衡。为克服这些挑战,本文提出一种隐私意识强、可解释的多模态皮肤病变分类模型,结合复杂的深度学习模型和集成建模方法,并结合可解释的人工智能方法。实验评估使用公开可用的HAM10000基准数据进行,这些数据可通过Kaggle Hub访问,该数据分布在七个临床显著病变类别(akiec、bcc、bkl、df、mel、nv、vasc)中。为了平衡数据,采用了一种阶级平衡技术来提升少数群体。EfficientNet B4、DenseNet201 和 MobileNetv2 用于提取深度特征表示,随后与显著的临床元数据结合,创建稳健的多模态特征空间。这些多模态特征用于训练XGBoost、LightGBM、深度神经分类器(DNC),分别实现了92%、90%和94%的分类准确率。采用堆叠集成策略,将XGBoost、LightGBM和深度神经分类器(DNC)的输出结合,从而使准确率提升了96%。模型可解释性技术提供了功能层面的解释,从而提高了透明度。实验结果证明了该框架在临床相关现实生活中皮肤病变分类的效率上具有实用性。
皮肤癌是全球重大的健康负担,全球发病率报告上升。人工辐射被认为是皮肤癌的主要诱因,导致基因突变,导致细胞失控增殖和皮肤细胞肿瘤的形成 1,2。 皮肤癌包括一组疾病,包括黑色素瘤、鳞状细胞癌和基底细胞癌(BCC)。这些疾病的病因、临床表现和预后因素各不相同。由于像素级的相似性,皮肤病已成为医学诊断中的障碍。2022年,全球估计有331,722例黑色素瘤病例(58,667例死亡),NMSC病例为120万例(死亡69,416例)。黑色素瘤的年龄标准化死亡率(ASR)峰值分布于大洋洲(29.78/100,000)、北美(16.3)和欧洲(10.43)。然而,非洲的死亡率与发病率比最高的地区是0.35,亚洲为0.30,而北美和大洋洲均为0.02,这可能反映了预后较差1。在皮肤科中,皮肤病变的诊断和监测主要依赖视觉检查及其他非侵入性评估。不采用侵入性方法,因为它们可能损伤病灶,并妨碍病灶的临床随访5。皮肤病变可有多种类型:黑色素瘤(MEL)、皮纤维瘤(DF)、放射性角化病及上皮内癌(AKIEC)、基底细胞癌(BCC)、良性角化病(BKL)、黑色素新病毒(NV)和血管病变(VASC),均见HAM10000数据集5。皮肤镜图像分类的主要挑战包括毛发、墨水、尺形标记、彩色斑块、闪光物、滴液、油泡、血管、色素过浓区域和/或炎症病变的存在。此前已有关于医学影像特征选择和深度学习和皮肤病变分类7,8的研究。
基于计算机视觉的皮肤癌诊断方法以及手工制作和深度特征的整合也被研究了9,以及用于提升分类性能的特征融合策略10。近期进展进一步强调机器学习在医疗系统中的集成和安全医疗数据处理框架11,12。 由先进计算算法驱动的人工智能医疗利用,有潜力提供个性化且高效的综合护理项目,尤其对远程和居家护理环境中的患者尤为有益13。通过利用大量皮肤镜图像数据集,深度学习模型——尤其是卷积神经网络(CNN)——可以被训练,准确识别和分类各种皮肤病变。多种技术在皮肤病变分割方面显示出显著效果,包括全卷积网络(FCN)、卷积神经网络(CNN)、深度卷积卷积网络(DCNNs)、全卷积残差网络(FCRNs)和U-Net架构。深度神经网络(DNN)由于其高度复杂的架构,难以被解释,因此其决策过程难以理解,14,15。医学图像分析的最新进展表明,深度卷积神经网络(CNN)显著提升了皮肤病变分类任务的效率。多项基于皮肤镜HAM10000数据集的研究显示,基于CNN的架构,包括ResNet、DenseNet和EfficientNet,通过从病变图像中学习层级特征表示,实现了强大的多类分类性能。混合特征融合方法,即多个CNN骨架的结合,通过整合互补的深度表示进一步提升了诊断准确性16。此外,现有研究还在医学图像分析中探讨了混合CNN变换器模型。配备视觉变换器和CNN特征提取器的模型已被证明在皮肤病变分类任务中效果更好,因为它们更能提取局部纹理内容以及全局上下文关系(17)。这些混合设计也被视为医学影像领域的尖端技术,因为它们具备平衡的表征学习能力。
在医学的其他领域,特征融合策略在皮肤科之外被广泛应用。基于CNN的混合系统也被应用于组织病理图像分析,以增强特征表现和空间学习动态,更好地分类肺癌和结肠癌16。同样,在眼科领域,基于融合特征表示训练的深度学习模型已在糖尿病视网膜病变眼底影像分期中取得了成功应用,在多类别评分任务中具有更好的稳健性和分类准确性18。这些领域的多模融合方法都表明,异质特征表示在不平衡医学数据中更能实现推广和分类19。
尽管已有改进,但现有做法通常仅限于多模式、缺乏整合性、不足以解决阶级不平衡问题,且对临床决策无益。为克服这些问题,本文提出了一种可解释的皮肤病变分类模型,注重隐私,并整合了两种模型可解释性方法。此类可解释方法可用于解释模型预测,显示哪些特征最重要,突出皮肤镜图像的重要区域,提升临床程序的清晰度和信心,从而提升临床透明度,建立信任,并支持人工智能系统在临床实践中的安全应用。HAM10000数据集存在显著不平衡,部分类别的样本远少于其他类别。为解决这一问题,采用合成少数过采样技术(也称为类平衡)生成代表性不足类别的合成样本。分类平衡技术平衡了数据集,使模型能够更好地从少数病变类型中学习,提高敏感度,并更可靠地预测临床意义重大但发病率较低的皮肤癌类别。 EfficientNet-B4、DenseNet201和MobileNetV2的深度功能与临床元数据结合,形成了每个皮肤病变的更具信息量的呈现。这一双重功能帮助我们提取皮肤镜图像及其他患者信息的视觉模式,进行更深入的分析。这些特征随后在不同的分类器上训练,包括XGBoost、LightGBM和深度神经网络,以增强皮肤病变分类模型的能力和能力。模型的集合结合叠加组合技术来增强模型的效果。这是一个综合模型,利用多个模型的优势,从集合中所有模型的预测中学习和受益,同时降低其局限性。
Access restricted. Please log in or start a trial to view this content.
本研究使用公开且完全匿名的皮肤镜数据集,未涉及直接的人类参与;因此,无需伦理委员会批准。 材料表 包含本研究中使用的所有材料或工具的详细信息。 表1 包含硬件和软件环境的详细信息,如处理器类型、内存、操作系统和软件框架。 表2 包含了各类皮肤病变的分类精度、回忆率、F1分数及支持度的详细信息。
拟议多模态皮肤病变分类框架的整体工作流程
本研究的总体目标是建立一个精确且易于理解的皮肤病变多分类方案。工作流程从HAM10000数据集的数据收集和预处理开始,随后通过深度学习架构进行特征提取并包含临床元数据。随后,多个机器学习分类器被训练和优化,其结果被汇总成集合策略。最后,模型的预测通过可解释性技术进行解读,并评估模型在现实临床决策支持中的有效性。
为了提高所提系统的预测准确性,采用了多模态机器学习流水线,结合了基于图像的特征和临床元数据(如 图1所示)。该模型可以将皮肤镜图像的视觉输出与患者相关信息汇总,从而识别与各种皮肤病变相关的更详细模式。通过这种组合,系统能够做出更好的预测,最终能够实现。提升皮肤病变分类的质量和实用性。通过神经网络(EfficientNet-B4、DenseNet201 和 MobileNetV2)提取三种预训练的卷积深度特征:它们能够捕捉多种互补的皮肤镜图像模式。这些架构学习皮肤病变的外观高层次模式,如颜色和质地的变化,以及其结构方式。然后,一个特征融合模块将深度特征、临床特征和人口统计数据结合起来,形成丰富的多模态特征。合并后的数据随后被分为训练、验证和测试数据,以确保模型测试的适当性。接下来,使用特征融合模块将深度特征与临床特征和人口统计学特征融合,形成丰富的多模态特征。这些数据随后被拆分为训练、测试和验证数据,用于测试模型。采用集合策略进一步提升预测准确性。这是通过平均多个模型的结果,并利用这些平均概率得出最终预测,以增强泛化性并最小化本可能由单个模型引起的方差。此外,还整合了可解释性方法,如模型可解释性技术,以进一步解释模型如何做出决策。模型可解释性方法通过量化输入变量的贡献,提供特征层面的解释,而模型可解释性方法则识别像素级皮肤镜图像中影响预测的重要区域。模型可解释性技术通过量化每个输入变量的贡献,提供特征层面的解释,而模型可解释性技术则突出影响预测的像素级像素层面重要区域。这些技术结合起来,使模型更具可理解性,帮助临床医生了解系统如何做出决策。因此,拟议的管道提供了一个易于理解且注重隐私的系统,提高了透明度和信任度,使得在现实医疗环境中更可靠的皮肤癌诊断成为可能。
数据集描述及准备
本文以HAM10000(人机对机器,含10,000张训练图像)数据集作为多类皮肤病变分类的主要数据集。该数据集包含了来自多种医学来源的1万多张皮肤镜图像。临床来源和人群,使其成为皮肤图像分析中最广泛使用的基准数据集之一。数据集中的每张图像都配有重要的临床元数据,包括图像标识符、诊断标签、患者年龄、性别以及病变的解剖位置。数据集涵盖七个诊断类别:放射性角化酶(akiec)、基底细胞癌(bcc)、良性角化病(bkl)、皮肤纤维瘤(df)、黑色素质痣(nv)、血管病变(vasc)和黑色素瘤(mel)。
临床元数据预处理
分类流程中新增的辅助功能包括临床元数据,如年龄、性别以及病灶在患者中的位置。存在缺失或未知的值,通过确定性预处理方法处理。对于年龄变量(数值变量),使用训练集计算的中位年龄来补值。选择中位数补值的原因是它能抵抗异常值和偏斜数据,这在临床数据中很常见。对于性别和病灶位置(类别变量),未排除缺失或未指定值;它们被归入一个特别类别,标注为“未知”。该方法保留所有可用样本,模型可自由判断缺失本身是否具有预测性。随后对类别变量应用了单热编码,使其与机器学习模型兼容。所有预处理,如补值、编码等,仅在训练集中完成,验证集和实验集也进行了相同的转换,以避免数据丢失。没有因缺失临床元数据而排除样本,这确保了数据的最大利用,并且方法学上保持一致。

图1:皮肤病变分类的多模态系统。 该研究方法结合了皮肤镜图像特征与患者元数据,利用集成深度学习模型对皮肤病变进行分类。该框架包括预处理、特征提取、多模态融合和分类,从而提升诊断性能和可解释性。 请点击此处查看该图的放大版本。
该工作流程基于皮肤镜图像和HAM10000皮肤病变数据集的临床元数据,展示了建议的分类流程。EfficientNet-B4、DenseNet201 和 MobileNetV2 用于预处理和提取图像中的深度特征。临床元数据被编码,并使用特征融合技术将图像特征与临床元数据结合。为了解决类不平衡问题,在融合多模态特征空间中使用类别平衡技术,取代原始图像或单个特征流,后者合成样本既保持视觉特征的结合,也不会产生不真实的样本。合并后的特征随后在XGBoost、LightGBM和深度神经分类器等分类器上进行训练。

图2:来自HAM10000数据集中七个不同诊断组的皮肤镜图像示例。图像显示了自动分类中常用的典型视觉特征。(A)鳕角化酶(akiec),表现为表面粗糙且色素不规则。(B)基底细胞癌(bcc),形状和血管不规则。(C)良性角化样病变(bkl),表现出角化特征,表面呈浅棕色。(D)皮屑瘤(df),具有中央瘢痕状外观和色素沉着。(E)黑色素母斑(nv),良性且相对对称的痣。(F)血管病变(vasc),因血管形成红紫色。(G) 黑色素瘤(mel),表现为形状不规则、不对称且多色的病变。请点击此处查看该图的放大版本。
这些皮肤镜图像揭示了皮肤病变的视觉异质性,其色素、质地和结构形态各异。这些差异对自动化分类系统构成了巨大挑战,也凸显了基于深度学习系统的重要性。能够敏感于揭示微妙诊断模式的特征提取技术。在数据集描述之后, 图2 展示了HAM10000数据集中包含的七类皮肤病变,这些病变在皮肤科诊断影像研究中常被研究。这些类别包括放射性角化酶(akiec)、基底细胞癌(bcc)、良性角化病(bkl)、皮纤维瘤(df)、黑色素细胞痣(nv)、血管病变(vasc)和黑色素瘤(mel)21。所有这些类型的病变都有独特的视觉特征,如 图3所示,包括色素分布、表面纹理、颜色分布以及病变边缘的异常。这些病变的视觉特征各不相同,特征包括色素分布、表面纹理、颜色分布以及病变边缘的异常。这些是皮肤科医生在进行临床检查时会考虑的重要特征,因此必须通过机器学习模型进行良好建模,才能获得正确的分类。尽管这些是区分特征,但许多病变几乎相同,仅通过皮肤镜图像难以区分。某些类型病变之间的区别通常非常微妙,但在临床上具有重要性,因此很难自动分类。这就是为什么迫切需要创建能够训练学习细粒度视觉图像和病灶类别间病变细微差异的强大AI模型。这些特性不仅通过适当的描述得到增强,从而提升模型对不同类型病变的辨别能力,还有助于更早诊断某些危险疾病,如黑色素瘤。最后,它能提升诊断准确性,帮助临床医生做出改善患者预后的决策,并帮助做出更好的决策。

图3:HAM10000数据集中皮肤病变的类别分布。 图中显示了本研究考虑的七类病变的分布:光线性角化酶(akiec)、基底细胞癌(bcc)、良性角化样病变(bkl)、皮屑瘤(df)、黑色素细胞性痣(nv)、血管病变(vasc)和黑色素瘤(mel)。这张图展示了病灶类别的不平衡。 请点击此处查看该图的放大版本。
数据集分析显示,不同类型病变的类别存在不平衡。最常见的黑色素细胞母斑(nv)类型约有6,705个样本,其次是黑色素瘤(1,113个)和良性角化病(1,099个)。相反,有些具有临床意义但代表性显著较低的病变,如皮纤维瘤(115例)和血管性病变(142例)。这种不成比例对机器学习模型构成威胁,因为它们可能倾向于偏向多数类别,且无法检测异常但临床意义重大的病变。为了解决这个问题并提升模型在所有类别中性能的训练,需要先进的预处理。需要策略。这些技术包括有针对性的数据增强和类平衡等。数据可以通过该技术(类别平衡技术和类别权重调整)进行平衡,鼓励模型发现代表性不足群体中的显著趋势。XGBoost和LightGBM使用的超参数主要设置为默认配置,并根据初步实验做了少量调整。对于深度神经分类器,结构和训练参数如层数、神经元数、学习率、批次大小和纪元数均通过验证数据实证选定。完整的超参数集合见 表3。总体而言,本研究共使用了10,015张皮肤镜图像。这不仅提供了大量可供训练和测试的数据,也是一个繁琐但值得的衡量标准。评估拟议皮肤病变分类系统的有效性。
数据预处理
预处理流程通过标准化图像、提取深度特征、整合临床元数据以及解决类别不平衡,为HAM10000数据集做好多模态学习准备。
图像标准化:所有皮肤镜图像均调整为224×224像素,并采用z分数归一化。
(1)
其中我表示原始图像,μ表示像素平均值,σ表示标准差。
深度特征提取:使用三种预训练卷积神经网络:Efficient-Net B4、DenseNet201 以及 MobileNetV2,提取了互补的深度特征。每个网络将归一化后的图像映射到特征矢量。
(2)
提取的特征被串接形成统一表示:
FFusion=FEffB4 ||F密度 ||FMobV2 (3)
(其中||表示连接)
临床元数据整合:临床属性,包括年龄、性别及病灶定位,均被清理、标记编码,并采用最小最大尺度进行归一化:
(4)
处理后的元数据向量M临床 与图像特征融合,构建最终多模态输入:
F组合=F融合M临床(5)
数据集拆分:采用分层拆分以保持类别分布
D列车,D测试=分裂(F comibed,0.8)( 6)
类别不平衡处理:HAM10000数据集中类别严重失衡,“nevus”(NV)样本占主导地位,因为在其他少数群体中(如DF与VASC)中代表性不足。为了减少这一问题,采用了“合成少数过采样技术”(类平衡技术)。使用:生产了新的合成样品,具体为:
x新=xi + λ(xzi - xi) (7)

其中 xi 是少数类样本,xzi 是其最近邻之一,λ 是从零到一之间的均匀分布中随机抽样的值。如 图4所示,合成样品沿连接x子i的线段生成。Xent与x、i 和x、zi连接。

图4:应用类别平衡技术前后HAM10000数据集中的类别分布。 (A)类别平衡前,病灶类别间存在不平衡。(B) 在合并特征空间中进行类平衡后,所有类别的表示相等以避免分类器训练过程中的偏见。 请点击此处查看该图的放大版本。
为解决HAM10000数据集中的类别失衡问题,采用了合成少数族裔过采样技术(类别平衡技术)。类别平衡技术通过在现有数据点间插值生成少数类的合成样本,有助于提升代表性不足病变类别的代表性。通过增加这些少数群体的例子,整体数据集在七种病变类型中更加平衡。这种平衡的表示将使分类模型在每个类别中更好地学习,并最大限度地减少多数类别的偏差。因此,该模型在分类上更为公正且敏感,尤其对罕见但临床重要的皮肤病变。
隐私保护学习框架
该建议系统提出一种多模态的皮肤自动病变分类系统,具备隐私意识且可解读性强。该系统的最终目标是提升诊断表现,同时在整个培训过程中保护敏感患者信息。患者隐私在医疗实践中至关重要,因为医疗数据隐私法律和伦理考量在医疗环境中极为重要。因此,建议的模型将包括基于联邦学习理念的去中心化学习模型。在这种去中心化环境中,模型训练是在一组分布式客户端上完成,而不是将所有患者数据集中在一个集中的地点。所有参与的客户端都基于自身数据本地训练模型,原始患者数据不会离开本地环境。作为移动敏感医疗记录的替代方案,模型更新或参数会发送到中央服务器进行聚合。这种协作式学习方法使各机构或数据源能够在不损害数据隐私的前提下参与模型训练。
设wt(k)为第k个客户端在第t次迭代时的模型参数,nk 为该客户端的样本量。全球模型的更新计算公式如下:
(8)
这种聚合策略确保拥有更大数据集的客户端对全球模型的贡献比例更高,同时仍允许较小客户端参与学习过程。通过实现协作培训而不交换原始患者数据,该框架既保持隐私,又能从数据集上的分布式知识中受益。
联邦实验装置
基于HAM10000数据集设计了一个模拟联邦学习系统,以验证所提供隐私意识框架的高效性。数据被划分为三个客户端,以模拟真实多机构环境,数据非同源分布(非IID)。每位患者病变类别的组合各异,这也反映了不同临床中心之间的差异。每个客户端本地运行相同的多模态特征提取流水线(EfficientNet-B4、DenseNet201、MobileNet V2 和临床元数据)。在训练过程中,客户端自行更新本地模型,所学参数仅与中央服务器交换,由FedAvg算法汇总。比较了联邦模型与集中训练方法之间的预测准确性与隐私权衡,以衡量各自的表现。 图5 所示的测试结果表明,联邦模型能够具备竞争力,准确率相较于集中学习仅略有下降,且数据隐私性大幅提升。

图5:HAM10000数据集的客户端分布。 该图显示了患者皮肤病变数据的分配情况,展示了数据分布的多样性。这显示了客户间数据的异质性,这是联邦学习的关键方面。 请点击此处查看该图的放大版本。
HAM10000中形成的客户的异质(非IID)分布被分为三组,以模拟真实临床状况。每个患者体内不同类别病变的分布不同,尤其是母斑(nv)类别,分布不均。这种安排反映了联邦学习在现实世界中存在的困难,即机构内的数据分布不均。
绩效比较:集中式学习与联邦式学习
为评估所提联邦学习框架的有效性,利用HAM10000数据集对集中式与联邦式训练策略进行了比较分析,如 图6所示。在集中式环境中,所有数据样本被汇总到一个训练池中。表现最好的集中式模型——堆叠集合,整体准确率达到了96%。相比之下,联邦设置将数据集分布到三个客户端,数据非相同分布(非IID),每个客户端本地训练模型,仅使用FedAvg共享模型参数。联邦模型整体准确率约为94%,与集中式方法相比性能差异约2%,如 表4所示。由于去中心化优化和数据在客户端间的异构分布,这一边际下降是预期中的。
尽管发生了这个小变化,联邦模型在预测方面仍然表现良好。在集中式训练中,按类别行为分析显示,大多数类别如nevus(nv)(F1评分=1.00)保持稳定,而少数类别如皮肤纤维瘤(df)(F1评分≈0.65–0.66)对分布不平衡更为敏感,这可能对联合表现影响更大。值得注意的是,联邦结构最大限度地减少了敏感患者信息暴露的风险,因为它不需要客户之间共享原始医疗数据。

图6:联合学习与集中式学习的比较。 本图比较了使用准确率、精度、回忆率和F1分数等性能指标的学习范式。这展示了联邦学习在保持隐私的同时,能够实现与传统学习方法相当的性能。 请点击此处查看该图的放大版本。
表4的结果表明,联邦学习模型具备竞争力,准确率仅略低于集中式模式约2%。这种略有的减少可以用去中心化优化和非IID数据分布来解释。然而,联邦模式在隐私保护方面具有巨大优势,因为敏感的患者信息不会在客户之间共享。为了公平比较联邦模型与集中堆栈集合模型,联邦模型采用相同的架构和超参数进行测试。本研究讨论的隐私保护方面具有概念性质,旨在突出未来工作中联合学习等技术的潜在整合。当前实现中未对隐私保护机制进行实验验证。
多模特征融合
皮肤病变的诊断通常包括皮肤观察和临床病史。在大多数情况下,皮肤科医生不仅会将皮肤镜图像与患者信息(年龄、性别和病变位置)进行比较,从而做出诊断判断。该系统基于该临床工作流程的灵感,采用多模态学习方法,将基于图像的数据与临床数据结合起来。CNN训练于已有的皮肤图像深度特征上。这些网络识别复杂的视觉设计,包括颜色变化、病变形态、结构异常和纹理特征。然而,图像特征可能不足以准确反映病变的临床状况。因此,每张图像相关的临床元数据也被纳入学习中。将创建一个功能融合模块,将深度图像特征与处理后的临床属性和人口统计信息集成。这种复合表现构成了一个集成的多模态特征表示,包含每个病变的视觉和上下文信息。该模型可以整合多个数据源,获得互补的模式,提升整体分类能力。多模态表示使系统能够更有效地区分视觉相似的病变,并考虑临床指标。该模型在临床上更具意义和有效性,因为它更接近皮肤科医生临床实践中研究病变的方式。
堆叠集合学习
所提出的框架采用堆叠集成学习策略,进一步提升系统的预测能力。集合学习是一种综合预测方法,利用两个或多个预测模型来增强泛化性,并最小化单个模型可能产生的预测误差。多个基学习器会独立训练多模态特征表示,而不是使用单一分类器。所有基础学习者都提供样本属于特定病灶类别的可能性估计。这些概率预测随后在元层面被汇总。每个基础学习者都会被赋予权重,以显示其对最终预测的相对重要性。使用软极大激活函数计算汇总输出,生成归一化类概率。堆叠集合法有许多优点。首先,它最大限度地减少了由于多种模型组合导致的预测方差,从而提升了推广的表现。其次,它增强了数据的强度,因为不同模型描述了数据中的不同趋势。第三,集合学习增强了少数群体病变类别的分类,尤其是在医学数据中,某些临床关注的疾病较为常见。
可解释的人工智能集成
医疗人工智能系统也应当对其选择提供清晰的解释,尽管高预测准确性至关重要。为了信任人工智能系统并在实践中高效,临床医生应能够理解模型如何与其诊断相匹配。为满足这一需求,提出的框架采用了可解释人工智能(XAI)方法,如 图7所示。

图7:多类皮肤病变分类不同分类模型的混淆矩阵。 (A) XGBoost,(B) LightGBM,(C) 深度神经分类器,(D) 堆叠集合模型。每个混淆矩阵显示了所有七种类型皮肤病变(akiec、bcc、bkl、df、mel、nv和vasc)真实类别(行)与预测类别(列)之间的关系。XGBoost和LightGBM型号在nv和bkl类别中表现良好,尽管mel和nv之间存在一些混淆。深度神经分类器改进了bkl和df的分类,并减少了非对角线的混淆。堆叠集合模型显示出最高的分类一致性,对角线逐渐占据主导地位。 请点击此处查看该图的放大版本。
该系统包含两种流行的可解释性方法(模型可解释性技术(SHapley加法解释)和模型可解释性技术(局部可解释性模型无关解释)),以提供模型预测内容的洞察。模型可解释性方法通过测量每个输入特征对整体预测的贡献程度,来解释特征层面的特征。它有助于确定哪些临床变量/视觉特征对分类结果影响最大。这使得研究人员和临床医生能够在整个数据集中看到模型的整体行为。而模型可解释性技术则处理对单个预测的局部解释。它强调了皮肤镜图像中对模型决策影响最大的区域。这些像素级的视觉解释使临床医生能够直观地检查影响分类的病变区域。该框架提供全局和局部可解释性;它是通过整合模型可解释性技术实现的。双重解释机制提升了透明度,使临床医生能够评估模型是否针对医学上重要的模式。
临床决策支持潜力
保护隐私的学习、多模态特征融合、集合建模和可解释人工智能是集成且稳健的自动皮肤病变分类系统的关键组成部分。理想情况下,系统不仅应具备高预后能力,还应具备透明和安全,这正是医疗系统中的两个关键因素,如 图8所示。

图8:堆叠集合模型的受试者操作特征(ROC)曲线。 (A–C) 显示七种皮肤病变类型的ROC曲线,具有真阳性率(敏感性)和假阳性率(1特异性)。曲线下的面积(AUC)表示堆叠集合模型在区分类别时的性能。 请点击此处查看该图的放大版本。
该系统提供可解释的预测和隐私保护。因此,它对其他皮肤科诊断系统非常有益。该系统使医疗从业者/皮肤科医生能够评估病灶的可疑性,提高诊断准确性,从而帮助他们在患者可能患有更严重疾病(如黑色素瘤)的早期阶段进行诊断。本质上,如图9所示,该系统旨在将高科技人工智能(AI)系统的技术和实际应用应用应用于实践中,帮助皮肤科医生更准确、更有信心地诊断患者,同时保障患者的隐私、安全及其舒适。

图9:采用模型可解释性技术进行多类皮肤病变分类的可解释性结果。 (A) SHAP图显示特征贡献对良性和恶性病变预测的影响。(B)对BCC预测的LIME解释,说明对分类结果有正负影响的特征。(C) 对 akiec 预测的 LIME 解释,突出模型决策过程中最有影响力的特征。这些可解释性可视化展示了显著影响模型预测的区域和提取特征,提高了皮肤病变评估分类过程的透明度和理解。 请点击此处查看该图的放大版本。
评估策略
为避免抽样偏差并保持所有皮肤病变类别的原始类别分布,数据集被划分为80:20的训练-测试比例。训练子集随后按90:10的训练:验证比例拆分,以调整超参数并优化模型。该测试集在任何培训阶段均未被使用,仅在培训结束时作为最终测试应用,以防止数据泄露并确保绩效评估公正。所有模型均在相同条件下进行预处理和训练,数据以相同方式分割和补充,评估方案也以相同方式应用和遵循,从而实现公平且可重复的比较。模型基于准确性、精度、回忆性、F1评分和AUC进行了全面评估,并对类别结果进行了详细分析,以确定其对主要和少数病变类别的稳健性。这一标准化验证工具将有助于提升拟议方法的可靠性、透明度和普遍性,并克服绩效报告中潜在的不一致之处。
Access restricted. Please log in or start a trial to view this content.
评估了四种分类方法(XGBoost、LightGBM、深度神经分类器和堆叠集合模型)用于多类皮肤病变分类。模型整体准确率分别为92%、90%、94%和96%,证明了 c
各级别表现
提供详细的类别评估,包括每个病灶类别的精度、回忆和F1评分。对于akiec类(支持度=65),堆叠集合实现了0.72的精度、0.73的召回率和0.72的F1分数,略优于XGBoost(F1=0.70)、LightGBM(F1=0.68)和深度神经分类器(F1=0.71)。 对于bcc(支持度=103),堆叠集合的精度为=0.87,回忆=0.84,F1得分=0.85,与XGBoost(F1=0.83)和LightGBM(F1=0.81)相当,且略高于深度神经分类器(F1=0.84)。 对于bkl(支持度=220),堆叠集合实现了精度 = 0.93,召回率 = 0.85,F1-scor...
Access restricted. Please log in or start a trial to view this content.
当前协议提出了一个可重复的流程,用于创建一个可解释、隐私敏感、多模态的框架,自动分类皮肤病变。该方案遵循一种系统模式,通过模型透明度提升诊断性能,结合皮肤镜图像分析、临床元数据和可解释的机器学习方法。HAM10000皮肤病变数据集公开,支持标准化评估,并促进皮肤图像研究领域后续研究的可重复性16。图像预处理和归一化步骤是该协议中最重要的步骤之一,因为它确保在提取特征和训练模型前,皮肤镜图像已得到标准化。皮肤镜图像中可能存在的伪影包括光线不均匀、头发遮挡或背景噪声,这些都会影响模型的性能。将图像调整至固定分辨率并进行归一化可以减少这些差异,模型随后可以聚焦于临床上感兴趣的病灶,如色素沉着、不规则边界和不对称。基于深度学习的皮肤科系统需要适当的预处理才能产生可靠性能,这一点在早期的自动皮肤癌分类2研究中已有证明。
基于多卷积神经网络(CNN)架构的深度特征提取工作流程也是这一过程的重要组成部分。在此过程中,EfficientNet-B4、DenseN...
Access restricted. Please log in or start a trial to view this content.
作者没有什么可透露的。我们没有利益冲突。作者声明,人工智能工具仅用于语言编辑和格式化。所有科学内容、分析和解释均由作者制定并验证。
作者感谢MVN大学帕尔瓦尔分校提供的学术指导和研究支持。作者还承认了公开可用的HAM10000皮肤病变数据集,该数据集被用于本研究的实验评估。
Access restricted. Please log in or start a trial to view this content.
```html
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| DenseNet201 CNN架构 | IBM | https://arxiv.org/abs/1608.06993 | 图像分类的深度学习模型 |
| EfficientNet-B4 CNN架构 | 谷歌 | https://arxiv.org/abs/1905.11946 | 图像分类的深度学习模型 |
| Google Colaboratory平台 | 谷歌 | https://colab.research.google.com | 基于云的计算环境 |
| HAM10000皮肤病变数据集 | 哈佛数据库 | https://doi.org/10.7910/DVN/DBW86T | 皮肤镜像数据集 |
| Keras深度学习API | 谷歌 | 2.x版本 | 神经网络API |
| LIME可解释性库 | LIME项目 | 0.x版本 | 模型可解释性技术 |
| MobileNetV2 CNN架构 | 谷歌 | https://arxiv.org/abs/1801.04381 | 图像分类的深度学习模型 |
| Matplotlib可视化库 | Matplotlib开发团队 | 3.x版本 | 用于生成图表和性能可视化 |
| NVIDIA GPU | NVIDIA | RTX系列 | 用于模型训练的计算硬件 |
| NumPy数值计算库 | NumPy开发者 | 1.x版本 | 数据分析软件 |
| OpenCV图像处理库 | OpenCV基金会 | 4.x版本 | 图像处理库 |
| Pandas数据分析库 | Pandas开发团队 | 1.x版本 | 数据分析软件 |
| Python编程环境 | Python软件基金会 | 3.9+版本 | 数据分析软件 |
| SHAP可解释性库 | SHAP项目 | 0.x版本 | 模型可解释性技术 |
| SMOTE过采样技术 | imbalanced-learn项目 | 0.x版本 | 处理不平衡数据集的类平衡技术 |
| Scikit-learn机器学习库 | scikit-learn项目 | 1.x版本 | 机器学习库 |
| TensorFlow深度学习框架 | 谷歌 | 2.x版本 | 深度学习框架 |
Request permission to reuse the text or figures of this JoVE article
Request Permission