本文提出了一种多帧多模态深度学习框架,用于利用磁共振成像序列准确分类腮腺肿瘤。
方法文章
本文提出了一种多帧多模态深度学习框架,用于利用磁共振成像序列准确分类腮腺肿瘤。
准确区分良性和恶性腮腺肿瘤对于患者的预后至关重要。然而,由于腮腺肿瘤的异质性高且影像数据有限,术前诊断仍是一项重大挑战。为解决这一问题,本研究提出了基于小样本学习的多模态深度学习框架。该框架集成了多序列MRI信息,并集成了多尺度空间注意力机制,以提升样本有限情况下的特征提取和分类性能。该模型通过回顾性收集的198名组织病理学确诊原发腮腺肿瘤患者(107例良性,91例恶性)系统评估,这些患者在本院接受了完整的术前MRI——包括T1加权、T2加权和扩散加权影像——且无针对腮腺病变的先前治疗。队列在患者层面分为训练组(70%)、验证组(15%)和测试组(15%),采用分层随机抽样保持良恶性比例,确保子集互斥并防止数据泄露。模型获得了曲线下面积(AUC)为0.9822。这一发现强调了该系统区分良性与恶性肿瘤的能力。此外,该模型在诊断准确性方面相较于经验丰富的放射科医生具有显著优势,凸显其在术前良恶性分化及腮腺肿瘤临床决策支持中的潜在应用。
流行病学数据表明,腮腺肿瘤的发病率正在上升。腮腺是人体最大的唾液腺1,是头颈部肿瘤的高发病部位之一。腮腺肿瘤相对罕见,约占头颈肿瘤的5%,良性病变远多于恶性病变,约占所有腮腺肿瘤的80% 2,3。良性和恶性腮腺肿瘤在生物学行为、治疗策略和预后上表现出显著差异。良性肿瘤通常生长缓慢,表现出扩展性生长,且极少转移。完全切除手术后效果良好。相比之下,恶性肿瘤表现出明显的侵袭性生长模式,且常侵入面部神经、皮肤和骨骼等周围组织。它们也可能发生远处转移,导致预后较差 4,5。
尽管如此,术前区分良性与恶性腮腺肿瘤仍是临床诊断上的挑战。由于缺乏特定临床表现,大多数腮腺肿瘤(无论是否为恶性肿瘤)的初始症状为无痛肿块,这使得仅凭体征或症状区分变得复杂,6,7。虽然疼痛或面部麻痹等症状常被视为恶性肿瘤的潜在信号,但在早期恶性病变中较为罕见。相反,一些良性肿瘤伴有炎症反应也可能表现出类似表现。耳垂腺肿瘤的术前评估主要通过影像学检查完成,这也是评估此类方法的主要非侵入性方法。然而,需要注意的是,每种成像方式都有其局限性。磁共振成像(MRI)因其卓越的软组织分辨率,被认为是腮腺肿瘤评估的最佳方法,研究显示在区分良性病变与恶性病灶方面最高准确率达93%。然而,传统序列在信号特性上存在显著重叠。CT主要用于评估骨骼受累情况;然而,在区分良性肿瘤和恶性肿瘤方面,其灵敏度低于MRI10,11。超声是初步评估表浅病变的有效方法;然而,其有效性取决于操作者的专业能力12。PET-CT的特点是其代谢敏感性很高;然而,其高昂的成本和假阳性率限制了其初诊的应用,使其更适合恶性肿瘤的分期和随访。因此,单一影像学方法往往无法实现精确诊断,良性与恶性病变的术前区分通常依赖于对多模态信息的全面分析。
近年来,人工智能(AI)领域,特别是以卷积神经网络(CNN)为代表的深度学习(DL)技术子集,已成为肿瘤影像诊断进步的重要推动者。这得益于这些技术提供的强大的图像特征提取和模式识别能力。深度学习模型通过多层神经网络自动提取复杂的多尺度特征,显著减少对人工特征设计的依赖,同时提升诊断性能。大量研究验证了其在多模态医学影像中的潜力。顾炯辉等人开发 了一套整合乳腺超声和MRI的多模态深度学习系统,有效预测新辅助化疗的反应,优于传统方法。Lu G等人通过整合超声、乳腺X线和MRI图像与迁移学习策略,精确区分 了良性和恶性乳腺肿瘤,得出AUC为0.947。Horasan A等人15 利用带有ResNet和Inception架构的3D CNN对前列腺多参数MRI(mpMRI)进行了融合分析,准确率约为91.3%。在腮腺成像方面,Zhang G等人构建了一个 深度学习模型,整合了超声和临床数据用于良恶性分化;胡晓和王H.17 使用基于CT图像的aResNet50模型实现了92.3%的分类准确率(AUC=0.96)。这些研究的综合证据表明,采用深度学习模型分析腮腺及其他实体肿瘤图像具有显著益处。
然而,传统的深度学习方法常常依赖大量数据集以实现最佳性能。腮腺癌作为低发病率肿瘤,其数据相对有限18。此外,腮腺肿瘤表现出高度的影像异质性,表现为信号强度、形态结构及与周围腺体组织关系的复杂变化。这些特征涵盖了多种空间尺度——例如肿瘤整体形态和边界定义,以及局部特征如内部信号异质性和浸润模式——这使得单一尺度或简单特征提取方法难以完全捕捉良性病变与恶性病变的关键区别。此外,以往的研究常常依赖单一MRI序列(例如仅结构或功能成像),这限制了获得肿瘤特征的全面表征的能力,正如先前研究19,20所报道的那样。
为应对这些挑战,我们提出一个集成多序列MRI和多尺度空间注意力机制的小样本多模态深度学习框架,可以在有限数据条件下有效区分良性和恶性腮腺肿瘤,并优于传统方法和放射科医生的评估。具体来说,该框架采用几帧学习21 策略,从有限数量的代表性良性和恶性病例中学习区分特征。该模型采用空间注意力机制,聚焦关键病灶区域,从而提高区分良性与恶性腮腺肿瘤的准确性。该模型采用了我们机构198名病理确诊腮腺肿瘤患者的回顾性队列进行评估。本研究整合了结构性(T1WI、T2WI)和功能性(DWI)MRI序列,以支持形态学和功能信息。该框架旨在促进术前区分良性和恶性腮腺肿瘤。
访问受限。请登录或开始试用以查看此内容。
本研究所用的所有患者数据均仅在无锡人民医院收集,包含198例病理确诊腮腺肿瘤病例。本研究已获得无锡人民医院机构审查委员会(IRB编号)批准。KY24068)并完全按照机构指南和国际伦理标准进行。分析前所有数据均已完全匿名化。
MRI图像采集
所有MRI序列(T1加权成像、T2加权成像和扩散加权成像)均在3.0特斯拉MRI扫描仪(西门子MAGNETOM Verio或Prisma)上使用16通道头颈线圈拍摄。采集参数如下:T1加权图像采用TR/TE = 500/15毫秒,切片厚度=3毫米,矩阵=256×256,视场=240毫米;T2加权图像的拍摄速度为TR/TE = 4000/90毫秒,切片厚度=3毫米,矩阵=320×320,视场=240毫米;在TR/TE = 5000/80毫秒、B值=0和1000 s/mm2、切片厚度=3毫米、矩阵=128×128、视场=240毫米时获得的扩散加权图像,并自动生成了表观扩散系数图。所有序列均在轴向平面内获得,且无切片间隙。
研究设计
该回顾性研究分析了198名组织病理学确诊原发腮腺肿瘤患者的术前MRI数据(其中107例良性,91例恶性)。所有患者均在本院接受了完整的腮腺MRI检查,包括T1加权成像、T2加权影像和扩散加权影像序列,且未接受耳下腺病变的事先治疗。以外科切除标本或核心活检为参考标准。纳入标准包括经组织病理学确认的原发腮腺肿瘤,术前MRI及本院所有所需序列,且无针对腮腺病变的既往手术、放疗、化疗或消融。排除标准包括膝盖腺转移性肿瘤、显著运动伪影或序列不完整导致影像无法诊断,以及既往治疗后复发的肿瘤。总体队列包括118名男性(59.6%)和80名女性(40.4%),年龄在26至89岁之间(平均±标准差53.0±12.8岁),按肿瘤类型分层的人口特征如下:良性组(n=107),男性59人(55.1%)和女性48人(44.9%),年龄范围为28至87岁(平均±标准差54.2±12.1岁), 恶性组(n=91),59名男性(64.8%)和32名女性(35.2%),年龄范围为26–89岁(平均±标准差51.6±13.4岁);采用分层随机抽样方法,将198名患者分为训练组(70%,n=138)、验证组(15%,n=30)组和测试组(15%,n=30),同时保持所有子组的良恶比(验证组和测试组各包含16例良性病例和14例恶性病例),且分割在患者层面进行,而非每片或每图像层面。 确保所有训练、验证和测试集相互排斥,患者无重叠,以防止数据泄露,并实现模型普遍性无偏评估。
数据预处理
该研究通过四个主要步骤对所有MRI图像实施了标准化预处理:图像配准与重采样、去噪、数据增强和归一化。为应对MRI协议和患者体位的差异,所有T1WI、T2WI和DWI体积首先被严格注册到T1WI序列作为参考空间,并利用三线性插值法重新采样至各向同性1毫米3分辨率。随后使用非局部均值(NLM)算法22对所有注册体积进行去噪,平滑参数自动设置为估计噪声标准差的0.8倍,搜索窗口为21×21×21个体素,相似窗口为7×7×7个体素。这种方法有效减少了随机噪声,同时保留了重要的结构细节。随后,为了扩大有效训练样本规模、改进模型泛化并减少有限数据集上的过拟合,在每个训练时期,采用了多种数据增强策略,包括随机旋转(±15°)和随机缩放(0.9–1.1)23,24,在每个训练时期的训练集图像上,所有变换均使用固定的随机种子42生成以实现完全可重复性;验证和测试集保持不扩展,以确保模型评估客观。最后,为了消除不同扫描设备和会话间信号强度的系统性变化,对每个体积应用了Z分数归一化,方法是减去平均值并除以标准差,然后将归一化后的像素值线性缩放至范围[0, 1],以满足PyTorch深度学习框架25的输入要求。
模型架构
本研究提出了基于少数样本学习的多模态深度学习框架,整合来自多条MRI序列(T1加权成像、T2加权成像和扩散加权成像)的互补信息,并结合多尺度空间注意力机制,以增强样本有限条件下的特征表示和分类性能。所有MRI体积均在同一扫描仪轴向平面上采集;在输入前,他们进行了严格配对以确保序列间的空间比对,比对质量由高级放射科医生手动验证,并将以腮腺病变为中心的完整三维体积裁剪到标准化感兴趣区域,重新采样至各向同性分辨率,并调整尺寸为一致尺寸。通过结合少数样本学习范式、多尺度空间注意力模块以及通过通道连接实现的跨模态特征融合,该框架解决了数据稀缺环境中模型泛化相关的挑战,并实现了从少量注释样本中稳健学习判别特征的能力,完整架构如 图1所示.尽管数据集包含198名患者,但采用少数样本方法是因为腮腺肿瘤表现出高度的影像异质性,且注释的体积多模态数据相对于任务复杂度相对有限,从而更好地模拟了稀少标注的真实临床场景;还评估了一种传统的监督训练方法进行比较,少量注射配置的优势在结果部分的消融研究中得到了展示。骨干网络采用R3D-1826 (一种具有完整时空卷积的3D ResNet-18变体),预训练于Kinetics-400,作为每个MRI序列的共享权重特征提取器;在适应过程中,采用一个典型的网络头进行少量分类,多尺度空间注意力模块在每个模态特定分支的卷积阶段后插入,随后进行跨模态融合和共享分类器。所提多尺度空间注意力机制的新颖之处在于其使用核大小为1×1、3×3和5×5的并行卷积路径,每条路径独立生成不同感受场的空间注意力映射,随后通过软极大值归一化,并通过加权求和与输入特征自适应融合;该设计明确捕捉了多个空间尺度上的病灶特征——从内部信号异质性等局部细节到肿瘤边缘和与周围组织界面等更广泛的情境结构——并且相较于传统注意力模块,表现更优越。微调策略分为两个阶段:最初,预训练的R3D-18骨干层被冻结以保留一般时空表征,同时仅训练注意力模块、融合层和原型头部;随后,每个骨架的最后两个残留区块(第3层和第4层)被解冻,以便对MRI特异体积特征进行端到端适应。训练使用Adam优化器进行,初始学习率为0.0001,每20个阶段通过步进衰减调度降低0.1倍;该模型经历了100个阶段的情节训练,批次规模为8集(每个包含支持集和查询集),遵循标准的几次样本协议,采用双向K-shot配置(初级元训练和评估时K=5);所有实验均在配备24GB内存的高性能GPU上进行,数据分区、权重初始化和增强过程中采用固定的随机种子42,以确保完全可重复性。
耳垂腺肿瘤分类的少数样本学习任务范式
鉴于高质量的腮腺肿瘤注释数据有限且这些病灶影像异质性较高,本研究采用基于指标的少数样本学习范式,尽管整体数据集包含198名患者。支持集-查询集任务结构用于模拟临床实践中的诊断推理过程,因为对于罕见或异质性肿瘤亚型,通常只有少数代表性实例可用。每个训练任务都以N路K-shot格式(N=2,对应良性/恶性分类)定义,使模型能够从少量样本中学习辨别特征表示。具体来说,对于每个任务,支持集包含每个类别的 K 个多模样本(T1 加权成像、T2 加权成像和扩散加权成像),用于构建类原型,而查询集则包含待分类的样本。该模型通过计算查询样本特征与嵌入空间中类原型之间的相似性,基于距离度量进行分类决策。这种学习机制以能够摆脱对大规模注释数据的依赖而著称,从而使其更适合在数据稀缺的临床环境中实际应用。为直接比较,还评估了使用全训练集且无偶发少量样本抽样的传统监督训练方法,结果部分所展示的消融研究定量展示了少量样本配置在泛化性和稳定性方面的优势。
在分类阶段,本研究采用典型网络作为分类工具。对于支撑集中的每个类别c,原型向量p_c计算为嵌入支撑样本的平均值:
(1)
其中f(·)表示嵌入函数(特征提取器),
是类别c的第i个支撑样本,K是每个类别的射击次数。
对于给定的查询样本x,属于类别c的概率通过softmax函数在负欧几里得距离上计算:
(2)
其中d(·, ·)表示欧几里得距离函数。
基于多模态特征融合的架构
为充分利用多序列MRI数据的互补价值,本研究设计了一个三分支特征融合网络,分别处理T1加权成像(T1WI)、T2加权成像(T2WI)和扩散加权成像(DWI)序列。每个序列首先使用共享权重的R3D-18模型进行特征提取,该模型在Kinetics-400数据集上预训练,权重来自官方PyTorch TorchVision实现;适应过程中采用了两阶段微调策略,即所有预训练主干的层最初保持固定以保持一般时空表征,同时仅训练多尺度空间注意力模块、跨模态融合层和典型网络头,之后解冻每个主链的最后两个残余块(第3层和第4层),以实现对MRI特异体积特征的端到端适应。 而早期的层(第一层和第二层)在整个训练过程中保持冻结状态。该网络利用跨空间和时间维度滑动的三维卷积核,有效捕捉肿瘤体积形态和空间上下文信息。在特征融合过程中,采用了基于串接的跨模态策略,将三种模态中增强注意力的特征表示沿通道维度串接,形成一个全面的多模态特征矢量。这种融合方法保留了每种模态的独特信息——T1WI的解剖学清晰度、T2WI的组织组成敏感性以及DWI的细胞密度功能——同时实现了诊断信息的有效互补,从而显著提升了特征表达的丰富性和辨别能力。
多尺度空间注意力机制
本研究采用多尺度空间注意力模块,捕捉不同空间尺度下的病变特征。如图2所示,该模块采用核大小为1×1、3×3和5×5的并行卷积路径。每条路径独立生成一个空间注意力映射,通过softmax进行归一化,然后通过加权求和与输入特征自适应融合。该设计使模型能够聚焦于更有助于区分良性与恶性病变的区域,同时减少无关背景区域的影响。由此产生的注意力地图有助于突出图像中的兴趣区域。
数据可用性:
研究队列中代表性的完全匿名多模态MRI序列子集(T1WI、T2WI、DWI)已公开存放于Zenodo数据库:https://doi.org/10.5281/zenodo.17744149(版本v1)。这些数据采用知识共享署名4.0国际许可协议(CC-BY 4.0),无访问限制。完整的匿名数据集尚未公开,将在正式发表后发布后,在机构和伦理批准下,在后续版本中发布。
访问受限。请登录或开始试用以查看此内容。
模型性能概述
为了评估模型的诊断性能,采用了一套标准指标,包括准确性、精度、召回率和F1评分。在2向5次样本配置下,基于R3D-18的多模态少数样本学习模型在腮腺肿瘤分类测试集中取得了以下结果:准确率96.88%,准确率97.50%,回忆率96.88%,F1评分96.83%。图3A所示的混淆矩阵表明,模型正确分类了测试集中93.75%的良性病例和100%的恶性病例。这对应良性病例的假阳性率为6.25%,恶性病例的假阴性率为零。97.50%的准确率反映了阳性预测中假阳性比例较低,而回忆值96.88%则表示实际阳性实例中真实阳性比例较高。F1评分为96.83%,提供了准确度和召回性能的平衡衡量。混淆矩阵的对角元素远大于非对角元素,这与观察到的整体分类准确性一致。图3B所示的ROC曲线下面积(AUC)为0.9822。该AUC值表明模型在...
访问受限。请登录或开始试用以查看此内容。
本研究假设,一个多模态的几帧深度学习框架,将多序列MRI(T1加权、T2加权和扩散加权成像)与多尺度空间注意力机制整合在一起,能够在有限的注释数据条件下准确区分良性和恶性腮腺肿瘤,并优于传统深度学习方法和经验丰富的放射科医生。
实验结果强烈支持这一假说。在独立测试集中,所提框架在2路5张配置中实现了AUC为0.9822,准确率为96.88%,精度为97.50%,召回率为96.88%,F1得分为96.83%。这些指标远超传统三维骨干网络和最先进的几次样本方法,直接展示了多模融合和多尺度注意力设计的优越性。从单次到5次的逐步性能提升进一步证实了少数次次学习范式在有限样本条件下的有效性。此外,独立AI模型表现优于初级放射科医生(AUC 0.8242)和高级放射科医生(AUC 0.8555),作为辅助工具使用时,准确率分别提升至90.62%和93.75%,恶性病例无假阴性。消融研究显示,在整合结构(T1WI、T2WI)和功能(DWI)序列时,以及应用所提议的多尺度空间注意力模块时,与现有注意力机制相比,均有持续的提升。使用...
访问受限。请登录或开始试用以查看此内容。
作者声明没有竞争的财务或非财务利益。
该研究由中国国家自然科学基金会(编号82473200)、江苏省卫生健康委员会重点医学研究项目(编号K2023061)以及江苏省卫生健康委员会老年健康项目(KLM2023019)资助至江正健康研究
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 研究生-CAM | https://github.com/jacobgil/pytorch-grad-cam | ||
| 数字派 1.25 | NumPy 开发者 | https://numpy.org/ | |
| 熊猫 2.1 | Pandas开发者 | https://pandas.pydata.org/ | |
| 派查姆 | 喷气脑 | https://www.jetbrains.com/zh-cn/pycharm/ | |
| Python 3.10 | Python 软件基础 | https://www.python.org/ | |
| PyTorch 2.1 | Meta Platforms, Inc. | https://pytorch.org/ | |
| SCIKIT-Learn 1.3 | Scikit-learn 开发者 | https://scikit-learn.org/ | |
| SHAP | https://github.com/slundberg/shap | ||
| 西门子 MAGNETOM 棱镜 3.0T 磁共振成像系统 | 西门子健康 | https://www.siemens-healthineers.cn/magnetic-resonance-imaging/3t-mri-scanner/magnetom-prisma |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可